Zum Inhalt springen

Suchen...

KI-Testbeschreibung: Testfälle strukturiert wie Code

Eine KI-Testbeschreibung gliedert Testfälle in Testziel, Schritte und Akzeptanzkriterien, gestützt auf fünf Fähigkeiten und Kriterien wie Robustheit.

• • Aktualisiert: • 10 Min. Lesezeit
Cover zum Expertengespräch über 'KI-Testbeschreibung: Testfälle strukturiert wie Code' mit Taras Holoyad und Richard Seidl.

KI-Testbeschreibung bezeichnet die strukturierte Dokumentation von Testfällen für KI-Systeme, gegliedert nach Testziel, Testschritten und Akzeptanzkriterien. Grundlage sind zwei Dimensionen: die Fähigkeiten eines KI-Systems (Wahrnehmung, Verarbeitung, Handlung, Kommunikation) und methodenspezifische Qualitätskriterien wie Korrektheit, Robustheit und Schutz vor Verzerrungen.

Das Wichtigste in Kürze

  • Eine KI-Testbeschreibung ist aufgebaut wie Code: Testziel, Testschritte, ein Schwellenwert wie ein Confidence Score von 0,5 und am Ende die Akzeptanzkriterien, ab denen dem Modell Korrektheit unterstellt wird.
  • KI-Systeme lassen sich anhand von fünf Verarbeitungsfähigkeiten testen: Identifikation, Klassifizierung, Extraktion, Selektion und Generierung. Diese Fähigkeiten gelten einheitlich für Bild-, Sound- und Sprachverarbeitung.
  • Das EU-KI-Gesetz gilt seit August 2024 und verpflichtet Hersteller von Hochrisiko-KI-Systemen, Normen zu zehn Themen zu erfüllen, darunter Korrektheit, Robustheit, Cybersicherheit und Risikomanagement.
  • General Purpose AI Systems wie GPT-4 unterliegen verschärften Dokumentations- und Sicherheitspflichten, wenn ihr Trainingsaufwand den Schwellenwert von 10^25 Flops übersteigt.
  • Notifizierte Stellen für die KI-Konformitätsbewertung mussten laut europäischem Gesetz bis August 2025 benannt sein. Die europäischen Normen, die dafür Grundlage sein sollen, waren schon Ende 2024 gegenüber ihrer Deadline im April 2025 im Verzug.

Die Bundesnetzagentur reguliert KI über Normen, nicht über Verbote

Die Bundesnetzagentur ist als Regulierungsbehörde für Telekommunikation, Post, Eisenbahn, Strom und Gas zuständig. Im Bereich Telekommunikation überwacht sie den Markt für Funkanlagen wie Bluetooth-Radios oder Handys und arbeitet an der Konformitätsbewertung von Produkten für den europäischen Binnenmarkt.

Bei der KI-Regulierung verschiebt sich die Aufgabe in Richtung Normung. Seit August 2024 gilt ein europäisches Gesetz für künstliche Intelligenz, das jeder Marktzugänger umsetzen muss. Taras Holoyad, der bei der Bundesnetzagentur in der Regulierung der Telekommunikation arbeitet, ist an der Erarbeitung der Normen beteiligt, die dieses Gesetz konkretisieren.

Im Zentrum stehen sogenannte Hochrisikosysteme und General Purpose AI Systems. Für sie sollen Normen festlegen, welche Anforderungen ein Produkt erfüllen muss, bevor es auf den Markt darf. Die Europäische Kommission hat dazu einen Normungsauftrag mit zehn Themen erteilt, an denen Behörden gemeinsam mit Industrie, Consulting-Unternehmen und Zertifizierungsstellen arbeiten.

Warum KI-Normung so schwierig ist

Künstliche Intelligenz lässt sich schwer normen, weil die Technologie sich schneller bewegt als die Gremien arbeiten können. Viele beschreiben sie als alten Wein in neuen Schläuchen. Schon in den 1990er Jahren setzte die NASA bei Weltraumprogrammen auf neuronale Netze.

Bahnbrechend Neues gibt es laut Taras wenig. Die Transformer-Methode liefert im Vergleich zu älteren Ansätzen mehr Korrektheit. Trotzdem ist KI nicht mit dem Intelligenzlevel eines Menschen vergleichbar, sondern eher ein sehr aufwendig geschaltetes algorithmisches System.

Genau diese Lücke macht die Normung kniffelig. Wird zu viel Detailtiefe festgeschrieben, lassen sich neuartige Systeme womöglich nicht mehr sinnvoll testen. Bleibt die Norm zu abstrakt, hilft sie dem Tester nicht. Der entscheidende Forschungsdurchbruch fehlt aus Taras’ Sicht noch, und das prägt jede Entscheidung darüber, wie konkret eine Norm werden darf.

KI testen heißt, ihre Fähigkeiten zu prüfen

Das Funktionsspektrum eines KI-Systems lässt sich über seine Fähigkeiten testen, nicht über die Frage, ob es intelligent ist. Diese Idee bildet den Kern eines Normungsansatzes, der KI aus zwei Dimensionen beschreibt.

Die erste Dimension sind die Methoden, die in Algorithmen implementiert werden: klassische KI mit Optimierungs- und Planungsverfahren, symbolische KI mit Wissensrepräsentation, maschinelles Lernen sowie hybride Verfahren, die regelbasierte und datengetriebene Ansätze kombinieren.

Die zweite Dimension sind die Fähigkeiten, die diese Algorithmen umsetzen. Dazu zählen die Wahrnehmung von Bildern oder Gerüchen, die Verarbeitung von Wissen, die Handlung (robotisch oder softwarebasiert) und die Kommunikation, wie sie ein System à la ChatGPT leistet.

Für die Verarbeitung innerhalb von KI-Modellen lassen sich fünf grundlegende Fähigkeiten benennen: Identifikation, Klassifizierung, Extraktion, Selektion und Generierung. Für jede dieser Fähigkeiten kann man Metriken formulieren, und zwar einheitlich für Sound, Bilder oder natürliche Sprache. Wer ein Modell von Hugging Face testen will, kann das entlang dieser fünf Fähigkeiten wiederholbar und skalierbar tun.

Dieser Ansatz steckt in der internationalen Norm ISO/IEC 42102, die Taras leitet. Er wird zusammen mit Kollegen aus Frankreich, den USA und Deutschland entwickelt. Über das Vienna Agreement zwischen ISO und CEN entstehen daraus parallel ein internationaler Standard und eine europäische Norm. Inhaltlich passt diese Norm zum Thema Transparenz aus dem Normungsmandat.

Qualitätskriterien machen KI-Tests für Tester greifbar

Qualitätskriterien geben Testern einen vertrauten Hebel an die Hand, um abstrakte KI-Anforderungen messbar zu machen. Ein zweiter Standard beschreibt für einzelne Methoden, welche Kriterien gelten, sobald die Algorithmen implementiert sind.

Für überwachtes, unüberwachtes und bestärkendes Lernen lassen sich fünf Qualitätskriterien formulieren:

  • Korrektheit
  • Robustheit
  • Vermeidung unnötiger Verzerrungen
  • Schutz vor feindlichen Angriffen
  • Informationssicherheit

Zu jedem Kriterium gehören methodenabhängige Metriken. Für die Korrektheit beim überwachten Lernen und der Bilderkennung lässt sich etwa der Confidence Score nutzen. So entsteht eine Art Matrix, die du über ein KI-System legen kannst, um es konkret zu prüfen.

Zwei Standards greifen dabei ineinander. Der eine beschreibt, was künstliche Intelligenz überhaupt ist, also Methoden und Fähigkeiten. Der andere legt fest, welche Qualitätskriterien sich nachweisen lassen. Dass die Detailtiefe auf mehrere Dokumente verteilt wird, hat einen praktischen Grund: Unterschiedliche interessierte Kreise lassen es politisch nicht immer zu, jeden Detailgrad in einem einzigen Dokument auszuführen.

Eine Testbeschreibungssprache strukturiert KI-Tests wie Code

Ein Testfall für KI lässt sich in strukturiertem Text beschreiben, ähnlich wie eine Funktion im Programmcode. Daran arbeitete Taras zum Zeitpunkt des Gesprächs in einem neuen Vorschlag, während die beiden anderen Normen bereits fortgeschritten waren. Die Inspiration stammt von der Test Description Language aus dem ETSI-Gremium MTS (Methods for Testing and Specification), wo entsprechende Beschreibungen für Protokolltests im Mobilfunk und in der Automobilindustrie entstanden sind.

Die Idee: Du erkennst auf einen Blick, worum es geht. Statt einer Funktionsdefinition mit def wie in Python schreibst du die festgelegte Syntax direkt hin. Ein testcase in geschweiften Klammern, etwa Vehicle Recognition, darunter das Test Objective, die Test Activities und die Test Steps.

Ein Beispiel aus der Bilderkennung: Ein Modell liest jeden Frame eines Videos, inferiert und klassifiziert Objekte. Im strukturierten Text lässt sich ein Schwellenwert setzen, etwa ein Confidence Score von 0,5. Erst ab diesem Wert wird ein Objekt klassifiziert. Ganz unten stehen die Akzeptanzkriterien, die festlegen, ab wann dem Modell überhaupt Korrektheit unterstellt wird.

Wenn du mich mit einem Test beauftragst, nehme ich meine beiden Normen und setze daraus mit der Testbeschreibung einen strukturierten Text auf.

(Taras Holoyad)

Diese Testbeschreibung wollte Taras nach dem Gespräch bei ETSI MTS als neues Dokument initiieren, wahrscheinlich als technische Spezifikation. Der zugehörige ETSI-Bericht trägt die Nummer 103 910.

Wann das KI-Gesetz dich betrifft

Ob dich die KI-Verordnung trifft, hängt davon ab, in welche von zwei Kategorien dein Produkt fällt. Das Gesetz ist seit August 2024 in Kraft und wird schrittweise nach Zeitfenstern umgesetzt. Die Umsetzung läuft über Marktüberwachungsbehörden, die jeweils für Segmente wie Medizinprodukte, Spielzeuge oder Funkanlagen zuständig sind. Insgesamt sind rund 13 Segmente abzudecken.

Die erste Kategorie sind Hochrisiko-KI-Systeme. Das sind Systeme, die Teil einer Sicherheitskomponente sind. Taras unterscheidet dabei klar zwischen Safety und Security: Safety ist der Schutz des Menschen vor der Maschine, Security der Schutz der Maschine selbst. Wer ein Hochrisikosystem betreibt, muss die Normen aus den zehn Themen des Mandats erfüllen oder andernfalls zu einer Zertifizierungsstelle gehen.

Die zehn Themen des Normungsmandats umfassen unter anderem Korrektheit, Robustheit, Cybersicherheit, Qualitätsmanagement, Konformitätsbewertung, Transparenz und Risikomanagement. Das Mandat geht als Standardization Request an die Organisationen CEN, CENELEC und ETSI, in diesem Fall nur an CEN und CENELEC.

Die zweite Kategorie sind General Purpose AI Systems, also Systeme mit besonders breitem Funktionsspektrum wie ChatGPT. Hier gilt ein zusätzlicher Schwellenwert: Übersteigt die Hardwareleistung beim Training 10^25 Flops, gilt das System als General Purpose AI System with Systemic Risk. Diese Flops ergeben sich aus einer algorithmusspezifischen Konstanten, der Tokenlänge der Trainingsdaten und der Zahl der Parameter. GPT-4 hat diesen Wert nach Taras’ Einschätzung überschritten. Die Folge sind aufwendigere Dokumentationspflichten und zusätzliche Vorbeugemaßnahmen bei der Cybersicherheit.

Alle stehen unter Zeitdruck

Der enge Zeitplan setzt Behörden, Hersteller und Zertifizierungsstellen gleichzeitig unter Druck. Wo keine Normen vorliegen oder ihre Anwendung nicht ausreicht, müssen Hersteller zu einer Zertifizierungsstelle gehen. Diese prüft die Prüfergebnisse und gibt für den Marktzugang ein CE-Kennzeichen aus.

Eine Zertifizierungsstelle darf das aber erst, wenn sie notifiziert wurde. In jedem europäischen Mitgliedsland muss eine verantwortliche Behörde die Stelle bewerten, gemeinsam mit einem unabhängigen Experten. Erst nach dieser Bewertung wird aus der Stelle eine notifizierte Stelle, die zum Marktzugang beitragen kann.

Die Fristen waren zum Zeitpunkt des Gesprächs Ende 2024 sportlich. Bis August 2025 mussten die notifizierten Stellen benannt sein, die Bewertung durch die Behörden also abgeschlossen. Bis August 2026 sollten diese Stellen genug Kompetenz aufgebaut haben, um Hochrisikosysteme zu prüfen.

Auch die europäische Normung selbst lag im Verzug. Die Deadline war auf April 2025 gelegt, auf der offiziellen Seite von CEN und CENELEC tauchten jedoch schon damals Zeitfenster von 2026 auf. Man versuchte, einige Normen in stark beschleunigten Verfahren umzusetzen, um der Kommission rechtzeitig etwas Passendes vorzulegen.

Häufig gestellte Fragen

Ist künstliche Intelligenz technisch wirklich so neu, wie die Debatte nahelegt?

Vieles davon ist alter Wein in neuen Schläuchen. Schon in den 1990er Jahren setzte die NASA bei Weltraumprogrammen neuronale Netze ein. Die Transformer-Methode liefert im Vergleich zu älteren Ansätzen mehr Korrektheit, bleibt aber ein sehr aufwendig geschaltetes algorithmisches System und erreicht kein menschliches Intelligenzniveau. Der entscheidende Forschungsdurchbruch steht aus Sicht von Taras Holoyad noch aus.

Wie konkret darf eine Norm für KI-Systeme werden?

Sie bewegt sich zwischen zwei Fehlern. Wird zu viel Detailtiefe festgeschrieben, lassen sich neuartige Systeme womöglich nicht mehr sinnvoll testen. Bleibt die Norm zu abstrakt, hilft sie dem Tester nicht weiter. Ein praktischer Ausweg ist, die Detailtiefe auf mehrere Dokumente zu verteilen, auch weil unterschiedliche interessierte Kreise politisch nicht jeden Detailgrad in einem einzigen Dokument zulassen.

Wie lässt sich ein KI-Modell prüfen, ohne zu bewerten, ob es intelligent ist?

Über seine Fähigkeiten. Auf oberster Ebene sind das Wahrnehmung, Verarbeitung, Handlung und Kommunikation. Für die Verarbeitung innerhalb von Modellen lassen sich fünf Fähigkeiten benennen: Identifikation, Klassifizierung, Extraktion, Selektion und Generierung. Zu jeder gehören Metriken, die einheitlich für Sound, Bilder und natürliche Sprache gelten. So wird auch ein Modell von Hugging Face wiederholbar und skalierbar testbar.

Welche Qualitätskriterien lassen sich bei Systemen mit maschinellem Lernen nachweisen?

Fünf Kriterien gelten für überwachtes, unüberwachtes und bestärkendes Lernen: Korrektheit, Robustheit, Vermeidung unnötiger Verzerrungen, Schutz vor feindlichen Angriffen und Informationssicherheit. Die zugehörigen Metriken hängen von der Methode ab. Für die Korrektheit beim überwachten Lernen in der Bilderkennung eignet sich etwa der Confidence Score. Zusammen ergibt das eine Matrix, die sich über ein konkretes System legen lässt.

Was bringt es, KI-Testfälle in strukturiertem Text statt in Fließtext zu beschreiben?

Ein Testfall wird auf einen Blick lesbar, ähnlich wie eine Funktion im Programmcode: Testziel, Testaktivitäten, Testschritte und ganz unten die Akzeptanzkriterien. Schwellenwerte lassen sich direkt festhalten, etwa ein Confidence Score von 0,5, ab dem ein Objekt klassifiziert wird. Vorbild ist die Test Description Language aus dem ETSI-Gremium MTS, aus der Protokolltests für Mobilfunk und Automobilindustrie entstanden.

Wann gilt ein KI-System als Hochrisikosystem?

Wenn es Teil einer Sicherheitskomponente ist. Entscheidend ist dabei die Unterscheidung zwischen Safety und Security: Safety meint den Schutz des Menschen vor der Maschine, Security den Schutz der Maschine selbst. Wer ein solches System betreibt, muss die Normen aus den zehn Themen des Normungsmandats erfüllen, darunter Korrektheit, Robustheit, Cybersicherheit, Qualitätsmanagement, Transparenz und Risikomanagement, oder den Weg über eine Zertifizierungsstelle gehen.

Was bedeutet der Schwellenwert von 10^25 Flops im EU-KI-Gesetz?

Er trennt General Purpose AI Systems von solchen mit systemischem Risiko. Übersteigt die Hardwareleistung beim Training diesen Wert, gelten aufwendigere Dokumentationspflichten und zusätzliche Vorbeugemaßnahmen bei der Cybersicherheit. Die Flops ergeben sich aus einer algorithmusspezifischen Konstanten, der Tokenlänge der Trainingsdaten und der Zahl der Parameter. GPT-4 hat den Wert nach Einschätzung von Taras Holoyad überschritten.

Was tun Hersteller, wenn für ihr KI-Produkt keine passende Norm vorliegt?

Sie müssen zu einer Zertifizierungsstelle gehen, die die Prüfergebnisse bewertet und für den Marktzugang das CE-Kennzeichen ausgibt. Das darf die Stelle allerdings erst nach ihrer Notifizierung: Eine verantwortliche Behörde im jeweiligen Mitgliedsland bewertet sie gemeinsam mit einem unabhängigen Experten. Der Zeitplan sah die Benennung bis August 2025 vor, den Kompetenzaufbau für Hochrisikosysteme bis August 2026.

Diese Seite teilen

Ähnliche Beiträge