Kritisches Denken beim KI-gestützten Testen heißt, die Ergebnisse von KI-Tools aktiv zu hinterfragen, statt sie für bare Münze zu nehmen. KI-Tools tragen Verzerrungen aus ihren Referenzdaten in sich. Tester müssen deshalb Quellen prüfen, nach Lücken suchen und ihr eigenes analytisches Urteil einbringen. Die Kernaufgabe bleibt dieselbe: Informationen aufdecken, mit denen jemand eine fundierte Entscheidung treffen kann.
Das Wichtigste in Kürze
- KI ist ein Werkzeug für Zusammenarbeit, nicht für Delegation: Wer ihre Ergebnisse übernimmt, ohne die Quelldaten zu prüfen, hat als Tester seinen Job nicht gemacht.
- Wer die analytische Arbeit an KI abgibt, riskiert, die Fähigkeit zu verlieren, ein Ergebnis zu beurteilen. Summiert sich dieser Verlust über Jahre, lässt er sich kaum wieder aufholen.
- KI-Tools tragen Verzerrungen in sich, die nicht immer sichtbar sind. Ohne unabhängige Prüfung benachteiligen diese Verzerrungen in den Referenzdaten systematisch alle, die nicht zu einer engen Bevölkerungsgruppe gehören.
- Die Kernverantwortung im Testing bleibt gleich, egal wer oder was den Code geschrieben hat: herausfinden, ob die Software liefert, was der Endnutzer erwartet.
KI ist eine Kollegin, keine Kommandozeile
Mit KI ändert sich, wie Tester mit ihren Werkzeugen arbeiten: Aus Anweisen wird Zusammenarbeiten, und kritisches Denken rückt ins Zentrum. Testautomatisierung hieß früher, sich hinzusetzen, Code in C# oder mit Selenium zu schreiben und der Maschine genau zu sagen, was sie tun soll. Heute schreiben KI-Tools diesen Code für dich und liefern ihre Einschätzung zu dem, was du fragst.
Das verlangt ein Umdenken. Du gibst nicht mehr jeden Schritt vor. Du fragst nach Input, bekommst einen Entwurf und entscheidest, was du damit machst. Steve Watson nennt das den größten Umbruch in der jüngeren Geschichte des Testens, grundsätzlich anders als die stetige Weiterentwicklung früherer Tools.
Der Umbruch ist aufregend, aber er liegt nicht jedem. Sich auf ein Werkzeug einzustellen, das widerspricht, Vorschläge macht und zusammenfasst, verlangt Testern mehr ab, als noch ein Framework zu lernen.
Kritisches Denken: Warum blindes Vertrauen in KI der blinde Fleck von Testern ist
KI-Ergebnisse sind nur so gut wie die Informationen, aus denen sie schöpfen, und diese Quelle siehst du selten. Die Zusammenfassungen und Einschätzungen der Tools wirken ausgefeilt und vollständig. Die Daten dahinter bleiben verborgen.
Genau in dieser Lücke schleichen sich Verzerrungen ein. Tools, deren Daten auf eine Gruppe zugeschnitten sind, benachteiligen still und leise alle anderen. Bildet ein System vor allem westliche Nutzer mittleren Alters aus einer engen sozioökonomischen Schicht ab, bekommen Menschen außerhalb dieser Schicht schlechtere Ergebnisse, und keiner merkt es, solange niemand nachgräbt.
Die Aufgabe von Testern war schon immer, die Informationen aufzudecken, mit denen jemand eine fundierte Entscheidung treffen kann. Diese Arbeit wird jetzt wichtiger, nicht unwichtiger. Ist die Qualität eines KI-Ergebnisses fragwürdig, sprichst du es an, fragst, woher die Quelldaten kommen, und prüfst unabhängig nach.
Eine klare Grenze lohnt sich. Gibst du der KI am Freitagnachmittag deinen eigenen Text und lässt eine E-Mail umbauen, hast du die Referenzdaten selbst geliefert, und das Risiko ist gering. Fragst du die KI nach einer Einschätzung zu etwas, wofür du keine Quelle mitgegeben hast, bist du in der Pflicht zu verstehen, woher die Antwort stammt.
“Warum solltest du etwas einfach als wahr hinnehmen, nur weil sie es dir sagt, wenn du es nicht selbst überprüft hast?”
(Steve Watson)
Tester haben die Fähigkeiten schon, sie müssen sie nur neu ausrichten
Kritisches Denken müssen Tester nicht neu lernen. Sie haben es längst und müssen es nur auf die KI richten. Tester haben schon immer gefragt, was sie erwarten, Anforderungen noch einmal gelesen und alles hinterfragt, was keinen Sinn ergibt.
Du musst nicht selbst Endnutzer sein, um zu beurteilen, ob etwas stimmig aussieht. Steve arbeitet für eine Fluggesellschaft, und sein Punkt ist einfach: Man muss kein Pilot sein, um mit gesundem Menschenverstand zu beurteilen, was ein Pilot auf seinem iPad sehen würde. Diese Fähigkeit zu hinterfragen lässt sich direkt auf KI-Ergebnisse übertragen.
Stell dir vor, du gibst einer KI ein Anforderungsdokument und bittest um einen kompletten Testansatz. Nimmst du das Ergebnis, nickst und machst weiter, hast du deinen Job nicht gemacht. Richtig ist, es als Ausgangspunkt zu nehmen und zu fragen: Auf welche Daten stützt es sich, was könnte fehlen, was ist nicht abgedeckt?
Adam Bacon, ein Kollege von Steve, bringt es auf den Punkt: Behandle KI wie ein sachkundiges Teammitglied, zu dem du gehst, wenn du Rat brauchst. Erzählt dir ein Kollege etwas Nützliches, übernimmst du das meiste und prüfst trotzdem selbst nach. KI verdient dieselbe Behandlung. Sie ist eine Datenquelle und ein Bezugspunkt, kein Urteil.
Das eigentliche Risiko: die Fähigkeit durch Nichtgebrauch verlieren
Die Gefahr ist nicht, dass KI Jobs wegnimmt. Die Gefahr ist, dass Tester ihr Urteilsvermögen so lange nicht nutzen, bis sie es nicht mehr können. Menschen nehmen Abkürzungen. Steve beschreibt das mit dem Bild eines gepflasterten Wegs, neben dem sich ein Trampelpfad quer über die Rasenecke zieht, weil es so bequemer ist.
Noch liegt das Gewicht beim menschlichen Urteil, weil Tester ihr ganzes Berufsleben lang selbst nachgedacht haben, statt es einer Maschine zu überlassen. Spul fünf oder zehn Jahre vor. Lassen dann alle nur noch die KI arbeiten und weiß niemand mehr, wie ein korrektes Ergebnis aussieht, kippt das Gleichgewicht.
Sind diese Fähigkeiten erst verloren, ist es schwer, sie zurückzuholen. Besser, man verliert sie gar nicht erst. Legt dir die KI einen ausgefeilten Entwurf vor, betrachte ihn als weitgehend fertig und frag dann, was fehlt und was du noch ergänzen musst.
Wo KI wirklich Zeit spart und wo nicht
Am meisten bringt KI, wenn du den Datensatz kontrollierst und die Aufgabe darin besteht, Muster darin zu finden. Steve wollte wissen, was die Leute in seinem Unternehmen unter Testen und Quality Engineering verstehen. Er sammelte Antworten aus zwei Nutzergruppen und ließ die KI in jeder Gruppe Gemeinsamkeiten und Unterschiede herausarbeiten und beide vergleichen.
Heraus kamen drei Analysen in einem vorzeigbaren Format, in etwa zwei Stunden statt der erwarteten Tage. Weil er genau wusste, mit welchen Daten das Tool arbeitete, musste er sich um fehlende externe Quellen keine Sorgen machen. Er musste nur prüfen, dass in seinen eigenen Daten nichts übersehen war.
Das klappt nicht immer. Beim Durcharbeiten von rund 200 Anforderungen auf Mehrdeutigkeiten gab Steve die Aufgabe spät am Tag mit ein paar Hinweisen an ein Tool ab. Das Tool meldete Dinge, mit denen er ohnehin schon einverstanden war, und übersah genau die, bei denen er Bedenken hatte.
Diese Erfahrung zeigt: Es braucht eine bewusste Abwägung. Ein Tool so nachzutrainieren, dass es findet, was du selbst schon erkennst, kann mehr kosten, als die Arbeit gleich selbst zu machen. Zur Arbeit gehört jetzt, herauszufinden, wofür KI taugt und wofür nicht, und das geht nur über Versuch und Irrtum.
| Aufgabe | Eignung für KI | Warum |
|---|---|---|
| Bekannten Datensatz nach Themen und Unterschieden zusammenfassen | Stark | Du kontrollierst die Quelle, fehlende externe Daten sind kein Thema |
| Mehrdeutigkeiten in vielen Anforderungen markieren | Gemischt | Kann übersehen, was wichtig ist, und melden, was du schon akzeptierst |
| Selbst gelieferten Text umbauen | Stark | Die Referenzdaten sind deine, das Risiko ist gering |
| Einschätzung ohne selbst gelieferte Quellen einholen | Schwach ohne Prüfung | Du kannst die Grundlage der Antwort nicht nachprüfen |
Über die Codequalität entscheidet weiter ein Mensch
Schreibt die KI sowohl den Code als auch die Tests dazu, bleibt die Validierung eine menschliche Aufgabe. Das Muster kennen wir schon: Entwickler schreiben Code, Tester schreiben Code, um ihn zu prüfen. Neu ist nur, wer oder was den Code schreibt.
Ob Code von einem Menschen oder einem Tool stammt, ist weniger wichtig als die Frage, ob er liefert, was erwartet wurde. Am Ende der Kette steht immer ein Nutzer. Richte dich an diesem Ziel aus und frag dann, wie du herausfindest, ob das Ergebnis zur Absicht passt.
Tools liefern dir viele Antworten zur Codequalität. Offen bleibt, was diese Antworten auslassen. Codequalität hört nicht auf, ein Thema zu sein, nur weil die KI den Code erzeugt hat. Der Blick des Testers bleibt also derselbe, auch wenn sich die Quelle ändert.
Die nächste Generation braucht die Skepsis, nicht nur die Tools
Wer das Handwerk vor der KI gelernt hat, trägt Verantwortung dafür, den Instinkt zum Hinterfragen weiterzugeben. Wer heute zur Schule geht oder studiert, erlebt KI als Teil des Alltags und wird mit den Tools schneller vertraut als jede Generation davor.
Dieses Tempo reißt eine Lücke. Neue Kollegen wissen, wie man KI einsetzt, haben aber nie gesehen, wie die Arbeit ohne sie lief. Die Skepsis, die frühere Tester aufgebaut haben, bringen sie deshalb nicht automatisch mit. Das Risiko: Jemand kommt ins Team, geht davon aus, dass die KI alles erledigt, und hat keinen Impuls, das Ergebnis zu hinterfragen.
Erfahrene Tester haben eine steilere Lernkurve, weil sie vertraute Arbeit auf ungewohnte Weise erledigen müssen. Die nächste Generation überspringt diesen Schritt, und genau deshalb muss die hinterfragende Haltung bewusst vermittelt werden, statt sie dem Zufall zu überlassen.
Die frei werdende Zeit in analytische Fähigkeiten stecken, nicht in mehr Programmieren
Übernimmt KI einen Teil der Programmierarbeit, die Tester heute leisten, sollte diese Zeit in analytische Fähigkeiten fließen. Steve weist auf ein altes Ungleichgewicht hin: Tester verbringen den Großteil ihrer Ausbildung, vielleicht 80 oder 90 Prozent, damit, Code schreiben zu lernen. Code schreiben macht dich aber nicht zu einem besseren Tester.
Beim Testen ging es nie nur darum, Tests zu schreiben, auszuführen und Fehler zu melden. Die Rolle war schon immer breiter, und sie wird noch breiter, wenn womöglich schon die Anforderungen von einer KI stammen. Du hinterfragst sie genauso, egal wer oder was sie geschrieben hat.
Die Aufgabe bleibt, die Methode ändert sich. Tester nutzen längst KI-Tools, ob sie es wahrhaben wollen oder nicht, denn die Tools stecken in alltäglicher Software und in jedem Smartphone. Relevant bleibst du, wenn du zeigst, dass du mit diesem Wandel Schritt hältst, und mehr Zeit, Energie und Weiterbildung in die analytischen Fähigkeiten steckst, die kein Tool ersetzt.
Häufig gestellte Fragen
Ist KI beim Testen nur ein weiteres Automatisierungstool wie die vorherigen?
Nein. Früher bedeutete Testautomatisierung, sich hinzusetzen und Code in C# oder mit Selenium zu schreiben, um der Maschine genau zu sagen, was sie tun soll. KI-Tools schreiben diesen Code für dich und geben Empfehlungen zu deinen Anfragen: Der Tester fordert also Input an, erhält einen Entwurf und entscheidet, was damit geschehen soll. Steve Watson bezeichnet dies als den größten Wandel in der jüngeren Geschichte des Testens.
Wie können Verzerrungen in einem KI-Tool die Software beeinflussen, die ein Team auf den Markt bringt?
KI-Ergebnisse sind nur so gut wie die Daten, auf denen sie basieren, und diese Daten bleiben meist verborgen. Ein Tool, das auf Informationen basiert, die auf westliche Nutzer mittleren Alters aus einer engen sozioökonomischen Schicht ausgerichtet sind, liefert still und leise schlechtere Ergebnisse für alle, die außerhalb dieser Schicht liegen, und niemand merkt es, es sei denn, jemand schaut sich die Quelle genauer an. Erst eine unabhängige Verifizierung deckt das auf.
Wann ist es akzeptabel, KI-Ergebnisse zu verwenden, ohne die Quelldaten zu überprüfen?
Wenn du die Referenzdaten selbst bereitgestellt hast. Einem Tool deinen eigenen Text zu geben und es zu bitten, eine E-Mail umzustrukturieren, birgt ein geringes Risiko, da du weißt, worauf es sich gestützt hat. Anders verhält es sich, wenn du um eine Meinung zu etwas bittest, für das du keine Quelle angegeben hast: In diesem Fall hast du die Pflicht, zu verstehen, woher die Antwort stammt, bevor du danach handelst.
Müssen Tester neue Fähigkeiten erlernen, um kritisch mit KI umzugehen?
Meistens nicht. Kritisches Denken ist eine bereits vorhandene Fähigkeit, die nur auf ein neues Ziel ausgerichtet werden muss. Tester haben schon immer gefragt, was sie erwarten, die Anforderungen noch einmal durchgesehen und alles hinterfragt, was keinen Sinn ergibt. Ein nützlicher Ansatz ist es, KI wie ein sachkundiges Teammitglied zu behandeln: Nimm die meisten Ratschläge an, aber führe trotzdem deine eigene sorgfältige Prüfung durch.
Besteht das Hauptrisiko von KI beim Testen darin, dass sie Tester ersetzt?
Nein. Das größere Risiko besteht darin, dass Tester aufhören, ihr Urteilsvermögen einzusetzen, bis sie es gar nicht mehr anwenden können. Das Gleichgewicht spricht immer noch für menschliches Urteilsvermögen, denn Tester haben ihre Karriere damit verbracht, selbst zu denken, anstatt Aufgaben abzugeben. Wenn man fünf oder zehn Jahre reiner Delegation vorspult, wissen die Leute nicht mehr, wie ein korrektes Ergebnis aussieht. Die Wiedererlangung der verlorenen Fähigkeiten ist der schwierige Teil.
Welche Testaufgaben beschleunigt KI wirklich?
KI zahlt sich am meisten aus, wenn du den Datensatz kontrollierst und die Aufgabe darin besteht, Muster darin zu finden. Das Sammeln von Antworten zweier Nutzergruppen dazu, wie sie Testen und Quality Engineering verstanden haben, lieferte drei Analysesätze in etwa ein paar Stunden statt in Tagen. Das Markieren von Unklarheiten in etwa 200 Anforderungen verlief schlechter: Das Tool zeigte an, was bereits akzeptiert war, und übersah das Wesentliche.
Wenn KI sowohl den Code als auch die Tests schreibt, wer validiert dann das Ergebnis?
Das macht immer noch ein Mensch. Das Muster spiegelt wider, was bereits geschieht: Entwickler schreiben Code, Tester schreiben Code, um ihn zu überprüfen, und nur der Autor ändert sich. Ob eine Person oder ein Tool den Code geschrieben hat, ist weniger wichtig als die Frage, ob er am Ende der Kette das liefert, was der Nutzer erwartet hat. Tools liefern viele Antworten zur Qualität des Codes; die offene Frage ist, was sie dabei auslassen.
Sollten Tester weiterhin ihre Schulungszeit darin investieren, das Programmieren zu lernen?
Nicht als Priorität. Vielleicht fließen 80 oder 90 Prozent der Tester-Fortbildung in das Schreiben von Code, und das Schreiben von Code macht dich nicht zu einem besseren Tester. Wenn KI einen Teil dieser Arbeit übernimmt, sollte die frei gewordene Zeit in analytische Fähigkeiten fließen: Anforderungen auf die gleiche Weise zu hinterfragen, unabhängig davon, ob sie von einer Person oder einem Tool erstellt wurden.


