KI-Testing: KI-Systeme professionell testen

KI-basierte Systeme erfordern andere Teststrategien als klassische Software. Vor allem generative KI und Large Language Models liefern probabilistische Ergebnisse: Dieselbe Eingabe kann zu unterschiedlichen, jeweils plausibel wirkenden Antworten führen.

Formalisierte Testfälle mit einem einzigen festen Soll-Ergebnis reichen deshalb häufig nicht aus.

Man testing an AI software application

KI verändert das Softwaretesting

Traditionelle Testverfahren vergleichen ein tatsächliches Ergebnis mit einem eindeutig definierten Soll-Ergebnis. Bei KI-Systemen müssen darüber hinaus Ergebnisräume, Wahrscheinlichkeiten, unerwartetes Verhalten und fachliche Risiken berücksichtigt werden.
Relevant sind beispielsweise:

Risikoorientiertes Testen von KI

Nicht jeder Fehler ist gleich kritisch. Ein sprachlich ungeschicktes Ergebnis hat eine andere Bedeutung als eine falsche Empfehlung in einem Finanz-, Verwaltungs- oder Gesundheitsprozess.
Objentis richtet die Teststrategie deshalb an den tatsächlichen Risiken der Anwendung aus. Wir untersuchen nicht nur, ob ein System funktioniert, sondern auch:
in welchem Kontext es eingesetzt wird,
welche Personen von seinen Ergebnissen betroffen sind,
wie schwer mögliche Fehler wiegen,
wie Fehler erkannt und behandelt werden,
welche Kontrollen und Eskalationswege erforderlich sind.
Diese risikoorientierte Grundhaltung ist seit Langem Bestandteil des Economic Testings von Objentis und gewinnt beim Testen von KI zusätzlich an Bedeutung.

Mögliche Prüfbereiche

Je nach Anwendung können unter anderem folgende Qualitätsmerkmale untersucht werden:

Unser Vorgehen beim KI-Testing

1. Kontext und Verwendungszweck verstehen
Wir analysieren Nutzergruppen, Prozesse, Daten, Abhängigkeiten und mögliche Auswirkungen.
2. Risiken identifizieren und priorisieren
Gemeinsam bestimmen wir, welche Fehlverhalten den größten Schaden verursachen könnten.
3. Teststrategie entwickeln
Wir kombinieren formalisierte Prüfungen, exploratives Testen und probabilistische Bewertungsmethoden.
4. KI-Verhalten untersuchen
Das System wird mit typischen, kritischen, mehrdeutigen und unerwarteten Eingaben konfrontiert.
5. Ergebnisse bewerten
Ergebnisse werden nicht nur technisch, sondern auch fachlich und risikobezogen beurteilt.
6. Maßnahmen ableiten
Wir zeigen auf, wo technische Verbesserungen, Kontrollen, Monitoring oder menschliche Freigaben erforderlich sind.

Expertenerfahrung bleibt entscheidend

KI kann Testfälle erzeugen und große Ergebnismengen analysieren. Sie entscheidet jedoch nicht selbst, welche Risiken für ein Unternehmen oder seine Kundinnen und Kunden akzeptabel sind. Professionelles KI-Testing benötigt deshalb Menschen, die kritisch hinterfragen, Zusammenhänge erkennen und Verantwortung für die Bewertung übernehmen.

Möchten Sie KI-basierte Software testen oder KI sinnvoll in Ihre Qualitätssicherung integrieren?