Qualitätssicherung für KI-Agenten beginnt mit einem Perspektivwechsel. KI-Agenten sind autonome Softwarekomponenten, die Aufgaben in einer Pipeline oder einem Geschäftsprozess übernehmen und menschliche Arbeit ersetzen oder ergänzen. Getestet werden sie wie neue Mitarbeiter: mit Auswahlverfahren, Probezeit und laufender Leistungsbewertung. Weil KI-Ausgaben stochastisch sind und nie zweimal gleich ausfallen, sind gespeicherte Prompt-Logs, automatische Vergleichsprüfungen und menschliche Reviews die zentralen Qualitätskontrollen.
Das Wichtigste in Kürze
- KI-Agenten brauchen einen Einstellungsprozess und eine laufende Leistungsbewertung, so wie Menschen Auswahl, Probezeit und regelmäßige Reviews durchlaufen, bevor man ihnen Geschäftsaufgaben anvertraut.
- Wer jeden Prompt, der zu einem Ergebnis führt, protokolliert, bekommt einen Audit-Trail und kann statistisch auswerten, warum sich die Ausgabe eines Agenten mit der Zeit verändert hat.
- KI-Ergebnisse lassen sich von weiteren KI-Modellen bewerten: Hält eine klare Mehrheit das Ergebnis für gut, ist es wahrscheinlich brauchbar. Uneinigkeit zeigt ein Problem an.
- Das Wissen über die eigenen Geschäftsprozesse im Haus zu behalten, ist ein Wettbewerbsfaktor. Wer es an einen externen KI-Anbieter abgibt, verliert sein zentrales Unterscheidungsmerkmal.
KI-Agenten sind neue Kollegen, keine gewöhnliche Software
Behandle einen KI-Agenten wie einen neuen Kollegen und nicht wie eine Webseite oder ein Abrechnungssystem. Dieser Blickwechsel ist der Kern der Qualitätssicherung für KI-Agenten: Er verändert, wie du Vertrauen aufbaust, wie du Ergebnisse bewertest und wie du entscheidest, ob der Agent bleibt.
Ein neuer Mitarbeiter durchläuft Auswahl, Vorstellungsgespräche und Probezeit. Danach wird seine Leistung beobachtet, und wer nicht passt, muss wieder gehen. Menschen vertrauen wir nie blind. Das Vertrauen stützt sich auf Eingangskriterien und laufende Bewertung.
Für Szilard Szell verdient KI dieselbe Behandlung. Ein Agent braucht einen Einstellungsprozess, ein Auswahlverfahren und regelmäßige Leistungskontrollen. Lässt ein Agent nach, findest du heraus, warum, und entscheidest dich für etwas Besseres.
Es gibt auch einen finanziellen Grund, weiter zu bewerten, statt zu verwerfen. KI ist so teuer, dass Wegwerfen selten sinnvoll ist, vor allem wenn sich der Mangel beheben lässt. Oft reicht ein geänderter Prompt, ein anderes Eingabeformat oder ein prüfender Blick auf die Leitplanken, das Gedächtnis oder die Werkzeuge, auf die der Agent zugreifen kann.
Warum “Eingabe rein, erwartetes Ergebnis raus” bei KI nicht trägt
Der klassische Vertrag des Testers gilt für KI nicht. Du gibst etwas ein, erwartest ein festgelegtes Ergebnis und vergleichst. Ein stochastisches System liefert aber nie zweimal dasselbe Ergebnis, und damit fällt dieser Vertrag in sich zusammen.
Auf die direkte Frage, ob Tester garantieren können, dass eine KI gut funktioniert, antwortete Szilard knapp: Können wir nicht. Diese Ehrlichkeit ist ein Ausgangspunkt und keine Sackgasse.
An die Stelle der festen Erwartung tritt eine semantische. Ein Tester kann in Worten beschreiben, wie ein gutes Ergebnis aussieht, und KI kann diese Beschreibung sehr gut mit der tatsächlichen Ausgabe abgleichen. So validierst du die Ergebnisse einer KI: Aus dem exakten Abgleich wird die Frage, wie gut das Ergebnis passt.
Du kannst auch mehrere KIs das Ergebnis einer einzelnen prüfen lassen. Halten acht von zehn ein Ergebnis für gut, ist es vermutlich gut genug. Melden viele ein Problem, lohnt sich ein genauerer Blick.
KI-Agenten prüfen und überwachen, wenn jede Antwort anders ausfällt
Beim Testen von KI-Agenten wird jede Ausgabe geprüft und bewertet, keine gilt einfach als richtig. Verschiebt sich die Ausgabe über die Zeit, gehst du der Ursache nach, egal ob das neue Ergebnis besser oder schlechter aussieht.
Dafür gibt es mehrere mögliche Gründe. Das zugrunde liegende LLM wurde vielleicht im Hintergrund aktualisiert. Das Gedächtnis des Agenten wurde womöglich gelöscht oder verändert. Ohne Logs aus dem System kannst du nicht sagen, was davon zutrifft. Das ist das Auditproblem bei KI-Agenten.
Speichere deshalb die Prompts. Szilard ist fest überzeugt, dass jeder Prompt, der zu einem Ergebnis führt, ins Log gehört. Damit hast du einen Audit-Trail, dem du rückwärts folgen kannst, und du kannst die Prompts statistisch auswerten: wie sie sich verändert haben, was danach passiert ist, wo die Qualität besser oder schlechter wurde. Genau darüber misst du auch, ob der Einsatz eines Agenten die Qualität tatsächlich verbessert.
Qualitätssicherung für KI-Agenten mit bestehenden QS-Verfahren
Du musst die Qualitätssicherung für KI nicht neu erfinden. Was Tester heute schon wissen, lässt sich direkt auf Agenten übertragen, auch auf agentische Workflows, in denen mehrere Agenten zusammenarbeiten.
Behalte einen Menschen in der Schleife und wende deine Review-Praxis auf die Ergebnisse des Agenten an. Lass deine Low-Level-Tests und Code-Analyse-Werkzeuge über den generierten Code laufen. Ein spürbarer Anteil des KI-generierten Codes enthält Sicherheitslücken, und Schwachstellenscanner finden sie.
Der springende Punkt ist die Feedbackschleife. Gibst du die Scan-Ergebnisse an die KI zurück, erzeugt sie immer häufiger Code ohne diese Schwachstellen. Die CI/CD-Pipeline und deine bestehenden QS-Verfahren sind genau der richtige Ort, um Agenten einzubinden.
Den Agenten entwerfen wie die Einarbeitung eines neuen Mitarbeiters
Beim Bau eines KI-Agenten geht es um zwei Probleme: Kommunikation und Korrektheit.
Das Kommunikationsproblem kennst du von jedem Neuzugang. Du musst die Aufgabe klar formulieren, den Kontext geben, das erwartete Verhalten und die Arbeitsweise beschreiben und den Input liefern. Außerdem legst du fest, welches Ergebnis du erwartest. Gute Beispiele sind wichtig, denn der Agent lernt aus ihnen, ahmt sie nach und liefert mehr richtige Antworten.
Das Korrektheitsproblem ist das Orakelproblem. Woher weißt du, wie ein gutes Ergebnis aussieht, wenn das System zufällig arbeitet? Die Antwort liegt in semantischen Beschreibungen, mehreren Prüfern und laufender Bewertung statt in einer einzigen festen Assertion.
Beim Gedächtnis wird der Entwurf gefährlich. Ein Agent speichert Informationen über Sitzungen hinweg und aktualisiert sein Gedächtnis anhand von Feedback. Verstehst du nicht, wie das funktioniert, holt sich der Agent womöglich Kontext aus dem Gedächtnis, der nicht zur aktuellen Aufgabe gehört.
Du entscheidest also bewusst, wann der Agent sein Gedächtnis aktualisiert und wann er es leert. Und du legst fest, was er nie speichern darf, etwa Passwörter, Bankdaten oder Kontodaten.
Eigene KI-Agenten bauen statt von der Stange kaufen
Die Entwicklung deiner KI-Agenten solltest du selbst in der Hand behalten, denn sie arbeiten mit deinem Wissen und deinen Geschäftsprozessen. Hilfe von außen ist in Ordnung, aber der Kern deines Geschäfts bleibt bei dir.
Die europäische Bürokratie erweist sich dabei als Vorteil. Prozessbeschreibungen, Rollenbeschreibungen und Wertstromanalysen liegen längst schriftlich vor. Du kannst sie nutzen, um zu erkennen, welche Tätigkeiten sich mit einem Agenten erweitern lassen und wo der Nutzen am größten ist.
Die ergiebigere Quelle sind die Menschen. Befrage eine Handvoll Praktiker, und sie erzählen dir, wie sie die Arbeit wirklich erledigen, welche Vorgehensweisen sich bewährt haben und auf welche Kleinigkeiten sie achten. Genau das gehört in den Agenten.
Überleg dir, was schon weg ist. Deine Daten liegen in der Cloud, sie sind also teilweise schon aus der Hand gegeben. Gibst du jetzt auch noch deine Prozesse weg, stellt sich die Frage, was dein Unternehmen dann noch ausmacht.
Ein Agent von der Stange taugt als Ausgangspunkt. Nimm ihn, aber verstehe, wie er arbeitet, und entwickle ihn von dort aus weiter, statt ihn für fertig zu halten.
Vertrauen wir Menschen wirklich mehr als KI?
Die Vertrauensdebatte hat einen blinden Fleck. Wir erklären, dass wir der KI nicht trauen, und unterstellen dabei, dass wir Menschen trauen. Diese Annahme hält einer genaueren Prüfung nicht stand.
Bedingungsloses Vertrauen haben wir auch Menschen nie geschenkt. Wir haben Auswahlhürden, Probezeiten und laufende Leistungsbeurteilungen eingeführt, gerade weil man sich Vertrauen verdienen und es erhalten muss. Wenden wir dieselben Mechanismen auf KI an, wird die Vertrauensfrage beherrschbar.
Die eigentliche Sorge liegt woanders. Szilard spricht sie offen aus: Ein KI-Chef, der ihm sagt, was er zu tun hat, beunruhigt ihn mehr als ein KI-Kollege.
DevOps 2.0: Schwärme kleiner Agenten lösen große Probleme
Die nächste Phase nennt Szilard DevOps 2.0: dieselben extrem schnellen Feedbackzyklen und Arbeitsweisen, jetzt ergänzt um KI-Agenten. Er rechnet mit vielen kleinen Agenten, von denen jeder eine kleine, aber pfiffige Aufgabe erledigt und eine Art Lebenslauf mitbringt, der sagt, wofür er gut ist.
Diese Agenten bilden Schwärme, die sich zusammentun, um große Probleme zu lösen. Das Risiko ist nicht, von der Automatisierung verdrängt zu werden. Das Risiko ist, den Überblick zu verlieren, was passiert und warum, und die Kontrolle zu verlieren. Für Szilard ist das der nächste Schritt einer Entwicklung, in der wir schon viel Kontrolle abgegeben haben.
“Agenten, die sich auf kleine Aufgaben konzentrieren, aber auf clevere, schlaue Aufgaben, und die zusammen große Probleme lösen.”
(Szilard Szell)
Stell dir den ganzen Kreislauf vor. Ein Agent hört sich einen Anruf mit Kundenfeedback an und erkennt den Tonfall, sogar ob der Anrufer wütend war. Er schlägt das nächste Feature oder eine Verbesserung vor, und der Vorschlag wandert durch eine Kette weiterer Agenten.
Die Änderung durchläuft automatisierte Tests und Prüfungen und wird dann ausgerollt. Das kann ein A/B-Test sein oder ein Canary Release für eine Persona-Gruppe, die dem Anrufer ähnelt und die eine KI ausgewählt hat. Ein Agent könnte sogar Crowdtests mit Menschen fahren, die dem ursprünglichen Beschwerdeführer ähneln.
Innerhalb von Stunden oder Tagen läuft ein Vorschlag in Produktion. Kontinuierliches Monitoring, Telemetrie und Observability zeigen dir, ob die Änderung besser oder schlechter ist, genau wie bei jeder Änderung von Menschenhand. Wenn sie funktioniert, bleibt sie.
Was Tester jetzt lernen sollten, um die Kontrolle zu behalten
Fang damit an, wie Qualität von Anfang an entsteht und was sie tatsächlich beeinflusst. Lerne von dort aus, wie Agenten und agentische Workflows arbeiten und wo ihre Risiken liegen.
Setz dein Risikomanagement vor dem Deployment ein. Läuft die KI in Produktion, musst du ihre Leistung bewerten und schnell reagieren können. Werden Funktionen schlechter, musst du den Code auf die ursprüngliche Version zurücksetzen können. Bau diese Kontrollpunkte also ein.
Der persönliche Schritt zählt genauso viel wie der organisatorische. Hol dir deinen eigenen Assistenten, deinen eigenen Agenten, und verschaff dir so mehr Hände.
“Also: Bau die Kontrollpunkte ein, aber lerne, wie KI funktioniert und wie KI für dich arbeitet.”
(Szilard Szell)
Häufig gestellte Fragen
Was solltest du tun, wenn ein KI-Agent keine guten Ergebnisse mehr liefert?
Finde erst die Ursache heraus, bevor du ihn ersetzt. KI ist so teuer, dass es selten Sinn macht, sie einfach wegzuwerfen, vor allem, wenn der Fehler behoben werden kann. Typische Lösungen sind eine geänderte Eingabeaufforderung, ein anderes Eingabeformat, angepasste Leitplanken, ein Blick auf den Speicher oder die Tools, auf die der Agent zugreifen kann. Es gilt das Gleiche wie bei einem neuen Kollegen: Die Leistung wird bewertet, nicht vorausgesetzt.
Können Tester garantieren, dass ein KI-Agent korrekt funktioniert?
Nein. Szilard Szell antwortet darauf ganz unverblümt: Das können sie nicht. Ein stochastisches System liefert niemals zweimal dasselbe Ergebnis, sodass der klassische Tester-Vertrag mit fester Eingabe und einer definierten erwarteten Ausgabe hinfällig wird. Was ihn ersetzt, ist eine semantische Erwartung. Ein Tester beschreibt in Worten, wie ein gutes Ergebnis aussieht, und KI ist gut darin, diese Beschreibung mit einer tatsächlichen Ausgabe abzugleichen.
Wie kannst du die Ausgabe überprüfen, wenn es keine einzige richtige Antwort gibt?
Lass mehrere KI-Modelle das Ergebnis eines Modells bewerten. Wenn acht von zehn die Ausgabe als gut einstufen, ist sie wahrscheinlich gut genug. Wenn viele ein Problem melden, gibt es ein Problem, das es wert ist, untersucht zu werden. Verfolge die Ergebnisse auch über einen längeren Zeitraum: Wenn sich die Ausgabe verändert, ist diese Veränderung selbst ein Signal, egal ob das neue Ergebnis besser oder schlechter aussieht.
Warum lohnt es sich, jede Eingabe in einem Protokoll zu speichern?
Prompt-Protokolle bieten dir einen Prüfpfad und eine Grundlage für statistische Analysen: wie sich Prompts verändert haben, was danach geschah, wo sich die Qualität verbessert oder verschlechtert hat. Ohne Protokolle aus dem System kannst du nicht feststellen, ob sich eine Ausgabe verändert hat, weil das zugrunde liegende LLM im Hintergrund aktualisiert wurde oder weil der Speicher des Agenten gelöscht oder verändert wurde.
Kann KI-generierter Code ungeprüft in die Pipeline gelangen?
Nein. Ein beträchtlicher Anteil des KI-generierten Codes weist IT-Sicherheitslücken auf, und Tools zum Scannen von Schwachstellen erkennen diese. Führe deine Low-Level-Tests und Codeanalysen für den generierten Code durch und behalte die manuelle Überprüfung im Prozess bei. Die Rückkopplungsschleife ist der entscheidende Punkt: Gib die Scan-Ergebnisse an die KI zurück, dann erzeugt sie Code mit weniger dieser Schwachstellen.
Was sollte ein KI-Agent niemals in seinem Speicher behalten?
Passwörter, Bankdaten und Kontodetails. Ein Agent speichert Informationen zwischen den Sitzungen und aktualisiert seinen Speicher anhand von Feedback, sodass er möglicherweise Kontext abruft, der nicht zur aktuellen Aufgabe gehört. Entscheide bewusst, wann der Agent seinen Speicher aktualisiert und wann er ihn leert, anstatt dieses Verhalten ungeprüft zu lassen.
Wo findest du heraus, welche Aufgaben in einem Unternehmen es wert sind, einem Agenten übertragen zu werden?
Zwei Quellen. Schriftliche Prozessbeschreibungen, Rollenbeschreibungen und Wertstromdiagramme sind oft bereits vorhanden und zeigen, welche Aktivitäten es sich zu unterstützen lohnt und wo der Nutzen am größten ist. Die reichhaltigere Quelle sind die Menschen: Befrage ein paar Praktiker, und sie erklären dir, wie die Arbeit tatsächlich erledigt wird, einschließlich der kleinen Dinge, die ihnen wichtig sind.
Welche Kontrollpunkte sind erforderlich, sobald ein KI-Agent im Produktivbetrieb läuft?
Kontinuierliche Überwachung, Telemetrie und Beobachtbarkeit sowie die Fähigkeit, schnell zu reagieren. Beurteile die Änderungen eines Agenten genauso wie von Menschen vorgenommene: Wenn sich Funktionen verschlechtern, stellst du den Code wieder auf die ursprüngliche Version zurück. Risikomanagement gehört im Vorfeld, vor der Bereitstellung, aber die Kontrollpunkte müssen im Betrieb nutzbar bleiben und über ausreichende Gebrauchstauglichkeit verfügen.


