Zum Inhalt springen

Suchen...

Das Vertrauen in KI-Agenten lebt im System rund um das Modell

Vertrauen in KI-Agenten entsteht wie bei Kollegen: durch klare Kommunikation und Kontrollen. Ein System um das Modell fängt dessen Fehler auf.

• • Aktualisiert: • 11 Min. Lesezeit
Cover zum Expertengespräch über 'Das Vertrauen in KI-Agenten lebt im System rund um das Modell' mit Henri Terho und Richard Seidl.

Wer KI-Agenten in Softwaresystemen vertrauen will, muss sicherstellen, dass automatisierte Abläufe korrekte und gewollte Ergebnisse liefern, und zwar über Prüfungen, Leitplanken und Validierungsschichten rund um das Modell. Dafür sind zwei Kernprobleme zu lösen: Anforderungen so klar zu vermitteln, dass das System damit arbeiten kann, und zu prüfen, ob das Ergebnis wirklich dem entspricht, was gewollt war. Tester nennen Letzteres das Orakelproblem.

Das Wichtigste in Kürze

  • KI-Systeme verstärken Fehler wie Erfolge im großen Maßstab. Deshalb zählen die Prüfungen, Leitplanken und Validierungsprozesse rund um das Modell mehr als das Modell selbst.
  • KI zu testen heißt, von deterministischen Bestanden/Nicht-bestanden-Prüfungen zu Trends und Mean Time Between Failures zu wechseln, weil sich nicht deterministische Ergebnisse nicht mit einem einzigen grünen Test belegen lassen.
  • Das Kommunikationsproblem mit KI-Agenten ist dasselbe wie beim schlechten Fehlerbericht unter Menschen: Vage Eingaben erzeugen generische Ergebnisse ohne Kontext, die am eigentlichen Bedarf vorbeigehen.
  • Wird KI-generierter Code zur Blackbox, werden Testspezifikationen und Akzeptanzkriterien zur wichtigsten Quelle der Wahrheit, und die Fähigkeiten von Testern rücken ins Zentrum.
  • KI macht Softwareerstellung ohne Programmierkenntnisse möglich und legt dabei lange ignorierte Organisationsprobleme offen, etwa fehlende Versionierung von Dokumenten und keine gemeinsame Quelle der Wahrheit.

Vertrauen in KI lebt nicht im Modell, sondern im System drum herum

Beim Vertrauen in KI ist nicht das Modell die entscheidende Einheit, sondern das System, das du darum herum baust. Ein Sprachmodell sagt voraus. Es analysiert nicht, und es denkt nicht. Vertrauen entsteht aus dem Prozess, den Prüfungen und den Leitplanken, die diese Vorhersage einrahmen.

Das ist derselbe Maßstab, den du längst an Menschen anlegst. Einer Kollegin vertraust du wegen ihrer bisherigen Arbeit, weil ihr euch versteht und weil du prüfen kannst, was sie dir zurückgibt. Bei einem KI-Agenten braucht es dasselbe Gerüst: einen Prozess, Kontrollen und Validierungsschritte, die das System auffangen, wenn es abdriftet.

Trägt dieses Gerüst, gilt dieselbe Logik wie bei Software, die du extern beauftragst. Du schreibst die Spezifikation, nimmst die Lieferung ab und prüfst, ob du bekommen hast, was du bestellt hast. Henri Terho führt die ganze Vertrauensfrage auf zwei alte Probleme zurück, die Tester gut kennen.

Zwei Probleme entscheiden, ob du einem KI-Agenten vertrauen kannst

Zwei klassische Probleme aus dem Testen kommen mit KI zurück, und beide müssen gelöst sein, bevor Vertrauen möglich ist: das Kommunikationsproblem und das Orakelproblem.

Beim Kommunikationsproblem geht es darum, zu vermitteln, was du eigentlich willst. Sagt jemand zur KI “Reparier jetzt meinen Code”, wird das Ergebnis aus demselben Grund schlecht, aus dem ein Fehlerbericht mit dem Satz “Produktion ist kaputt” nichts taugt. Keine Logs, kein Kontext, keine Details. Die Leute ärgern sich über das Ergebnis und merken nicht, dass sie dem System nichts gegeben haben, womit es arbeiten könnte.

Unter Menschen überbrückt Erfahrung solche Lücken. Ein Kollege ergänzt den fehlenden Kontext aus Jahren gemeinsamer Arbeit. Ein Modell hat diese Erfahrung nicht. Prompt, Anforderungen und alles andere, was du ihm gibst, müssen deshalb konkret genug sein, um für sich allein zu stehen.

Beim Orakelproblem geht es darum, zu wissen, ob das Ergebnis stimmt. Auch wenn die KI etwas liefert, musst du entscheiden, ob es richtig ist oder nur plausibel. In einem Unternehmen wird diese Frage schnell philosophisch. “Richtig” kann heißen, dass der Chef es wollte, dass die Funktion Geld bringt oder dass sie einer echten Spezifikation entspricht. Ohne klare Antwort kannst du das Ergebnis nicht beurteilen.

Beantwortest du beide Fragen, folgt das Vertrauen, das du suchst. Lässt du sie weg, rätst du.

Warum generischer KI-Output schlechte Ergebnisse liefert

Eine generische Frage bringt eine generische Antwort, und in diese Falle tappen die meisten. Fragst du als Inhaber einer kleinen Softwarefirma einen allgemeinen Chatbot nach einer Geschäftsstrategie, bekommst du eine saubere, gut gegliederte Strategie, die zu niemandem so richtig passt.

Das Ergebnis wirkt vollständig. Alle erwarteten Punkte sind da, es liest sich gut. Nur steckt nichts von deinem Kontext darin. Die KI weiß nicht, dass du aus Finnland in ein anderes Land verkaufst oder dass deutsche Regeln gelten, solange du es nicht sagst.

Die Lösung ist unspektakulär: mehr Kontext, mehr Details, bessere Anforderungen. Warum das nervt, ist schnell erklärt. Ein präziser Prompt macht mehr Arbeit als “Reparier das”, und die meisten wollen lieber die schnelle Antwort als die richtige.

Beim Testen von KI zählt das statistische Verhalten über die Zeit, kein einzelnes bestandenes Ergebnis. Klassische Software ist deterministisch. Du gibst eine Eingabe, erwartest eine Antwort, und kommt sie nicht, hast du einen Fehler. Das macht das Testen einfach.

KI-Modelle sind nicht deterministisch, ein einzelner grüner Test sagt deshalb wenig. Du beobachtest Trends, die Mean Time Between Failures und das Verhalten über viele Durchläufe. Das ist näher daran, wie Maschinenbau und Luftfahrt über Zuverlässigkeit denken, als an eine Einzelprüfung. Wie das beim Testen von KI-Agenten konkret aussieht, ist ein eigenes Thema.

Plane mit seltenen Ausfällen. In diesen Modellen tauchen schwarze Schwäne auf, weil sich nicht jede Ausgabe vorhersagen lässt. Eine Testsuite, die nur ein einziges Mal “grün” meldet, wiegt dich in falscher Sicherheit.

Dazu kommt das Problem des beweglichen Ziels. Die Modelle ändern sich unter dir, sobald der Anbieter sie aktualisiert. Wenn sich die Bausteine deines Systems ständig verschieben, musst du Stabilität bewusst herstellen. Geschenkt bekommst du sie nicht.

Der Code wird zur Blackbox, die Spezifikation zur Wahrheit

Je mehr von der Anwendung die KI erzeugt, desto mehr werden Spezifikation und Test zur einzigen verlässlichen Quelle der Wahrheit. Besteht die Software, was du festgelegt hast, ist sie in Ordnung, und den generierten Code musst du nicht mehr lesen.

Damit rücken verhaltensgetriebene und testgetriebene Entwicklung vom netten Werkzeug in den Kern der Arbeit. Die eigentliche Frage lautet dann: Wie schreibst du auf, was du willst, und zwar so genau, dass es als Akzeptanzkriterium taugt?

Hier wartet eine Falle. Die Leute werden überkorrigieren und riesige Spezifikationen schreiben, bis es Millionen Zeilen Spezifikation gibt, so wie Teams heute Millionen Zeilen Code haben. Diese Spezifikationen widersprechen sich. Die Systeme verhalten sich merkwürdig, und du debuggst am Ende die Spezifikation statt des Codes.

Die Abstraktionsebene steigt deutlich. Eine vollständige, offene Spezifikation für ein System in der Größe einer CRM-Plattform zu schreiben, ist wirklich schwer, weil niemand allein festlegen kann, was so ein System alles tun soll.

Der Druck zur KI kommt aus dem Geschäft, nicht aus der IT

Der Schub in Richtung KI kommt von der Fachseite, nicht aus dem technischen Kern. Leute aus dem Marketing kommen heute auf die IT zu und fragen, ob KI ein konkretes Problem lösen kann, das sie haben. Solche Anfragen gab es in der klassischen Softwareentwicklung kaum.

Damit ändert sich, wer die Arbeit antreibt. Die Nachfrage kommt von Leuten, die näher an der Wertschöpfung sitzen und ein Werkzeug wollen, das Kunden nachverfolgt oder zeigt, was gerade passiert. Sie kommt nicht mehr von jemandem, dessen Selbstbild darauf beruht, der Datenbankexperte zu sein.

KI ist leicht zugänglich, weil sie keine Programmiersprache voraussetzt. Du sprichst sie in normaler Sprache an, und das öffnet das Programmieren für viele. Die Kehrseite: Die Qualität wird fragwürdig, weil fast jeder Software bauen kann, ohne dass jemand prüft, ob sie hält, was sie soll.

“KI wird dir nicht deinen Job wegnehmen. Sie wird dich nicht automatisieren, sie wird dich und deine Arbeitsweise erweitern. Und in diesem Bereich gibt es noch viel zu tun.”

(Henri Terho)

Alte Organisationsprobleme kommen hoch, und jetzt musst du sie lösen

KI spült ungelöste menschliche Probleme wieder an die Oberfläche, denn das System braucht eine gemeinsame Quelle der Wahrheit, die nie jemand festgelegt hat. Wird KI zur wichtigsten Schnittstelle zum Wissen eines Unternehmens, musst du aufschreiben, was die Organisation eigentlich tut.

Nimm einen Dokumentenspeicher mit zwanzig Versionen derselben Datei. Welche ist die richtige? Um das zu beantworten, brauchst du echten Kontext: ob eine Version an einen Kunden ging, an welchen, und ob sie danach noch überarbeitet wurde. Das klingt banal und ist es nicht.

In Softwareentscheidungen steckten schon immer versteckte Geschäftsentscheidungen. Ein Entwickler, der ein Unternehmen auf eine Cloud-Plattform festgelegt hat, hat eine weitreichende Entscheidung getroffen, die alles Weitere geprägt hat, oft ohne dass es damals jemand bemerkt hätte. KI macht solche vergrabenen Entscheidungen sichtbar und verlangt, dass man sich ihnen stellt.

Für die Verifikation gehören Leitplanken direkt in die Plattform. Eine Möglichkeit: Mehrere KI-Instanzen prüfen und diskutieren, ob ein Ergebnis wirklich gut ist. So kontrolliert sich das System selbst, statt einem einzigen Durchlauf zu vertrauen.

Warum die Fähigkeiten von Testern in die KI-Ära passen

Die Denkweise aus dem Testen passt genau zu dem, was KI-Arbeit verlangt. Kriterien festlegen, sie in Spezifikationen und Testfälle schreiben, Ergebnisse prüfen: Das ist schon heute der Job. Mit dieser Grundlage sind Tester vielen anderen IT-Rollen voraus.

Was dazukommt, ist statistisches Denken. Hör auf, dich nur dafür zu interessieren, ob ein Test grün wird, und schau, wie sich die Ergebnisse über viele Läufe entwickeln. Danach lohnt der Blick über den Tellerrand der Testerrolle.

Testen und Validierung werden Teile benachbarter Rollen übernehmen, auch Stücke von DevOps und Programmierung. Je weiter du dich in diese Bereiche ausdehnst, desto wertvoller wirst du, und je breiter dein Kontext, desto besser dein Urteil. Genau wie mehr Kontext die Ergebnisse einer KI verbessert.

Die häufigste Reaktion auf all diese Veränderungen ist Angst, und bei einem so großen Umbruch ist das nur natürlich. Die Angst, wegautomatisiert zu werden, solltest du als Erstes ablegen. Die Arbeit, die kommt, erweitert Tester, statt sie zu ersetzen, und es gibt sehr viel davon.

Häufig gestellte Fragen

Was muss vorhanden sein, bevor du dich auf die Ergebnisse eines KI-Agenten verlassen kannst?

Vertrauen entsteht durch das System, das um das Modell herum aufgebaut ist, nicht durch das Modell selbst. Ein Sprachmodell sagt Dinge voraus, es analysiert nicht und es denkt nicht. Das Gerüst, das es vertrauenswürdig macht, besteht aus einem Prozess, Abgleichen und Schritten der Validierung, die Abweichungen erkennen. Es funktioniert wie bei einer in Auftrag gegebenen Software: Du schreibst die Spezifikation, nimmst die Lieferung ab und prüfst, ob du das bekommen hast, was du verlangt hast.

Wie entscheidest du, ob die Antwort einer KI tatsächlich richtig ist?

Du brauchst eine Antwort auf das Orakelproblem: eine Definition dessen, was „richtig“ bedeutet, bevor du die Ausgabe beurteilst. In einem Unternehmen wird das schnell zu einer philosophischen Frage. „Richtig“ könnte bedeuten, dass der Chef danach gefragt hat, dass die Funktion Geld einbringt oder dass sie einer echten Spezifikation entspricht. Ohne diese Entscheidung kannst du ein korrektes Ergebnis nicht von einem bloß plausiblen unterscheiden.

Warum liefern kurze Eingabeaufforderungen wie „Repariere meinen Code“ enttäuschende Ergebnisse?

Weil die Eingabe keinen Kontext enthält. Das Problem ist strukturell identisch mit einem Fehlerbericht, der besagt: „Die Produktion ist ausgefallen“, also keine Protokolle, keine Einzelheiten, nichts, worauf man reagieren könnte. Menschen füllen solche Lücken füreinander aufgrund jahrelanger gemeinsamer Arbeit, aber ein Modell hat keine gemeinsame Geschichte. Eine allgemeine Eingabe liefert eine saubere, gut strukturierte Antwort, die zu niemandem Bestimmten passt.

Können KI-Systeme mit herkömmlichen Bestanden/Nicht bestanden-Tests überprüft werden?

Nein. Herkömmliche Software ist deterministisch, d. h.: eine Eingabe, eine erwartete Antwort, und ein roter Test bedeutet einen Fehler. KI-Modelle sind nicht deterministisch, daher beweist ein einzelner grüner Test kaum etwas. Man beobachtet Trends, Mean Time Between Failures und das Verhalten über viele Durchläufe hinweg, ähnlich wie es in Maschinenbau und Luftfahrt in Bezug auf Zuverlässigkeit gehandhabt wird. Man muss sich auf seltene, unvorhersehbare Fehlerwirkungen einstellen.

Muss noch jemand KI-generierten Code lesen?

Nicht unbedingt. Sobald die KI den Großteil der Anwendung schreibt, werden die Spezifikation und die Tests zur maßgeblichen Quelle: Wenn die Software das besteht, was du festgelegt hast, ist alles in Ordnung. Damit rücken verhaltensgetriebene und testgetriebene Entwicklung in den Mittelpunkt der Arbeit. Die Gefahr besteht in einer Überkorrektur, die zu Millionen von Zeilen widersprüchlicher Spezifikationen führt und dazu, dass man die Spezifikation statt des Codes debuggt.

Wer treibt KI in Unternehmen eigentlich voran?

Die Nachfrage kommt eher von der Geschäftsseite als aus dem technischen Kern. Marketingleute kommen mit einem konkreten Problem auf dich zu und fragen, ob KI es lösen kann, eine Art Inbound-Anfrage, die bei traditionellen Softwareprojekten selten vorkam. KI ist zugänglich, weil man keine Programmierkenntnisse braucht. Der Nachteil ist, dass die Qualität fragwürdig wird, wenn fast jeder Software erstellen kann.

Warum deckt die Einführung von KI alte organisatorische Probleme auf?

Weil das System eine einzige „Quelle der Wahrheit“ braucht, die bisher niemand definiert hat. Ein Dokumentenspeicher mit zwanzig Versionen derselben Datei ist das Standardbeispiel: Um zu entscheiden, welche davon korrekt ist, muss man wissen, ob eine Version an einen Kunden ging, welche genau und ob sie danach überarbeitet wurde. Hinter Software-Entscheidungen verbergen sich seit jeher geschäftliche Entscheidungen, und KI macht sie sichtbar.

Was sollten Tester ihrem Kompetenzspektrum für die Arbeit mit KI hinzufügen?

Zunächst einmal statistisches Denken: Hör auf, dich darum zu kümmern, ob ein einzelner Test „grün“ wird, und fang an, die Entwicklung der Ergebnisse über mehrere Durchläufe hinweg zu beobachten. Erweitere dann deinen Blickwinkel, denn das Testen und die Validierung werden Teile benachbarter Rollen übernehmen, darunter auch Aspekte von DevOps und der Programmierung. Je breiter dein Kontext ist, desto besser ist dein Urteilsvermögen, genauso wie mehr Kontext die Ergebnisse einer KI verbessert.

Diese Seite teilen