Verlässlichkeit schlägt Intelligenz: warum neun von zehn Agenten nie in Betrieb gehen

Der Agent trifft in der Vorführung jede Antwort und liegt im Alltag mal richtig, mal falsch. Rund neun von zehn Agenten-Projekten erreichen die Produktion nie, und fast nie liegt es am Modell. Fünf Schritte, mit denen du Verlässlichkeit misst statt sie zu hoffen.

Die Vorführung läuft gut. Auf dem Bildschirm arbeitet ein Agent, also ein KI-System, das nicht nur antwortet, sondern selbst Schritte ausführt. Er beantwortet jede Frage aus dem Raum, findet die richtige Unterlage, fasst sie sauber zusammen und schlägt am Ende sogar eine Antwort an den Kunden vor. Die Runde ist beeindruckt, das Budget wird freigegeben, und jemand sagt den Satz, der später alle beschäftigt: Damit sind wir eigentlich fast fertig.

Drei Monate später steht dasselbe System im Alltag. Es liegt mal richtig und mal falsch. Manchmal übersieht es eine Unterlage, manchmal erfindet es eine Frist, manchmal ist die Antwort besser als das, was ein Mensch geschrieben hätte. Fragt jemand, wie oft es richtig liegt, gibt es keine Zahl, sondern Eindrücke. Die einen sagen, das läuft doch gut. Die anderen sagen, sie prüfen inzwischen wieder alles selbst.

Der Vorschlag, der in dieser Lage auf dem Tisch landet, lautet fast immer gleich: Lass uns das nächste Modell probieren. Es ist der bequemste Vorschlag, weil er nach Fortschritt aussieht, wenig kostet und niemandem im Haus etwas abverlangt. Er verschiebt den Zustand nur ein paar Wochen nach hinten.

Das nächste Modell löst dieses Problem nicht, weil es kein Intelligenzproblem ist. Der Sprung von der Vorführung in den Betrieb ist ein Verlässlichkeitsproblem, und Verlässlichkeit ist die eine Eigenschaft, die man nicht kaufen, sondern nur messen kann.

Woran du merkst, dass ihr Verlässlichkeit nicht messt

Eine einzige Frage entscheidet das: Wie oft liegt euer Agent richtig, und woher wisst ihr das? Kommt darauf eine Prozentzahl mit einem Test dahinter, seid ihr weiter als die meisten. Kommt eine Einschätzung, fehlt euch die Messung. Vier Anzeichen begleiten diesen Zustand fast immer.

Das erste: Jeder gemeldete Fehler wird mit einem zusätzlichen Satz im Prompt beantwortet, also in der Anweisung an das Modell. Der Satz behebt den gemeldeten Fall. Ob er an drei anderen Stellen etwas kaputt macht, prüft niemand, weil es nichts gibt, woran man das prüfen könnte.

Das zweite: Die Testfälle hat die Person ausgesucht, die den Agenten gebaut hat. Das ist kein böser Wille, sondern der natürliche Weg. Nur besteht ein System, das an selbst gewählten Fällen geprüft wird, diese Prüfung fast immer.

Das dritte: Getestet wird in einer Testumgebung mit Testdaten, produktiv laufen andere Daten. Die echten Fälle sind unordentlicher: unvollständige Angaben, veraltete Dokumente, zwei widersprüchliche Versionen derselben Unterlage. Genau daran scheitern Agenten, nicht an den sauberen Fällen.

Das vierte: Der Erfolgsbeleg ist eine Vorführung. Wenn im Haus jemand fragt, wie gut das System ist, wird es vorgeführt statt belegt. Eine Vorführung zeigt, dass etwas gelingen kann. Sie zeigt nie, wie oft es gelingt.

Warum das nächste Modell euer Problem nicht löst

Rund neun von zehn Agenten-Projekten erreichen die Produktion nie, und nur etwa ein Prozent der Führungskräfte hält die eigene KI-Umsetzung für ausgereift. Diese beiden Zahlen beschreiben denselben Befund aus zwei Richtungen, und der Grund dafür ist fast nie ein zu schwaches Modell.

Der Grund liegt in einem Unterschied, den man in der Vorführung nicht sieht. Eine Vorführung muss einmal gelingen. Der Betrieb muss jeden Tag gelingen, mit echten Daten, unter Zeitdruck und ohne dass jemand hinterher aufräumt. Einen verlässlichen Agenten zu bauen ist deshalb wirklich schwer, und zwar aus zwei Gründen: Jedes Wort im Prompt hat Wirkung, und kleine Fehler summieren sich in verketteten Schritten auf. Ein Agent, der fünf Schritte hintereinander ausführt und in jedem Schritt selten danebenliegt, liegt am Ende der Kette regelmäßig daneben.

Wie klein die Ursache dabei sein kann, zeigt ein Fall aus einem echten Kundenservice-Agenten: Ein einziges Wort an einer bestimmten Stelle im Prompt erzeugte siebzig Prozent der überflüssigen Kommentare. So etwas findest du nicht durch Nachdenken und nicht durch ein besseres Modell. So etwas findest du nur, wenn du misst.

Das Werkzeug dafür heißt Eval, also ein automatisierter Test, der vor der Ausgabe prüft, ob die Aufgabe verlässlich gelöst ist. Mehrere Evals zusammen mit der Umgebung, in der sie laufen, ergeben den Harness, also die technische Umgebung um das Modell herum, in der getestet, gemessen und abgesichert wird. Der Harness ist der Teil, den ein Anbieterwechsel dir nicht abnimmt, und er ist der Teil, der über den Betrieb entscheidet.

Kurz gesagt
Eine Vorführung muss einmal gelingen. Der Betrieb muss jeden Tag gelingen, mit echten Daten und ohne dass jemand hinterher aufräumt.

Fünf Schritte, mit denen du Verlässlichkeit misst statt hoffst

Schritt für Schritt
1

Schreib das erste Test-Set aus echten Fällen auf, bevor du den ersten Agenten baust

Ein Test-Set ist eine Sammlung von Aufgaben mit ihrer jeweils richtigen Antwort. Diese richtige Antwort heißt Ground Truth, und sie muss wirklich in eurer Quelle stehen, nicht nur plausibel klingen. Kuratiert wird das Set von den Fachleuten, die die Aufgabe heute erledigen, nicht von der IT. Ein kleines, sauber geprüftes Set schlägt ein großes, ungeprüftes deutlich, denn ein Set mit falscher Ground Truth misst nichts, es täuscht Sicherheit vor.
2

Prüf mit dem stärksten verfügbaren Modell, ob die Aufgabe überhaupt lösbar ist, und leg danach die Erfolgskriterien fest

Die Reihenfolge spart dir Wochen. Scheitert das stärkste Modell an der Aufgabe, liegt es nicht am Sparen, sondern an der Aufgabe, und du hast das an einem Nachmittag herausgefunden statt in einem Quartal. Erst wenn feststeht, dass es geht, legst du fest, was „gut genug" heißt, und optimierst danach auf ein günstigeres, schnelleres Modell herunter, ohne die gemessene Verlässlichkeit aufzugeben.
3

Lass dieselben Fälle einmal vom Fachmenschen und einmal vom Agenten bearbeiten und stell die Ergebnisse nebeneinander

Das ist die einfachste belastbare Eval, und sie braucht kein Werkzeug, das ihr nicht schon habt. In einer Vertragsprüfung sank die Bearbeitungszeit je Vertrag auf diesem Weg von sechs auf rund vier Stunden, und der Vergleich lieferte gleich den zweiten Nachweis mit, nämlich dass der Agent nichts erfunden hatte. Diese Gegenüberstellung überzeugt im Haus außerdem Leute, die eine Prozentzahl allein nicht überzeugt.
4

Lass die Prüfung über tausende Fälle laufen und miss dabei auch den Weg, nicht nur das Ergebnis

Eine einzelne gute Antwort beweist nichts über Verlässlichkeit, erst die Menge zeigt, wo ein System regelmäßig scheitert. Miss deshalb nicht nur, ob die Antwort stimmt, sondern auch, wie viele Werkzeugaufrufe der Agent gebraucht hat und ob er die richtige Quelle gefunden hat. Ein Agent, der zufällig zur richtigen Antwort stolpert, ist nicht verlässlich, auch wenn das Ergebnis passt. Damit solche Läufe keine echten Nebenwirkungen auslösen, testest du gegen einen Mock-Server, also einen Platzhalter, der jede Aktion nur in eine Datei schreibt, statt sie wirklich auszuführen.
5

Setz ein zweites Modell als Bewerter nur dort ein, wo Urteil zählt, und prüf den Bewerter selbst

Wo sich Erfolg eindeutig prüfen lässt, misst du objektiv. Wo ein Urteil nötig ist, bewertet ein zweites Sprachmodell die Ausgabe nach festen Kriterien. Dieser Bewerter braucht einen frischen, leeren Kontext, denn ein Modell, das im selben Durchgang seine eigene Arbeit prüft, hält sie für richtig. Und er wird selbst getestet: Nimm ihm den System-Prompt weg, also seine Grundanweisung, und sieh zu, wie die Bewertungen einbrechen. Bleiben sie stabil, hat er nie nach deinen Kriterien bewertet.

Was du dabei nebenbei bekommst

Der Einwand gegen dieses Vorgehen kommt zuverlässig und lautet: Das ist Zusatzaufwand vor der Produktion. Er ist kein Zusatzaufwand, er ist der Weg dorthin. Ohne gemessene Verlässlichkeit fehlt der Runde, die über den Betrieb entscheidet, jede Grundlage außer einem guten Gefühl, und ein gutes Gefühl trägt keine Entscheidung, an der Kundenkommunikation oder Geld hängt.

Dazu kommt ein Nebeneffekt, der oft übersehen wird. Wenn die Tests fest in der Auslieferungskette hängen und bei jeder Änderung mitlaufen, entstehen die Nachweise für Verlässlichkeit fast nebenbei. Du dokumentierst dann nicht extra, du liest ab. Bei allem, was unter Prüfpflichten fällt, ist das der Unterschied zwischen einem laufenden Prozess und einem Projekt, das jemand vor dem Termin nachbaut.

Und eine Grenze bleibt bestehen: Ein bewertendes Modell ersetzt die menschliche Prüfung nicht, es macht sie seltener. Am Ende zeichnet ein Mensch. Genau diese Kombination, gemessene Verlässlichkeit plus eine benannte Person, die zeichnet, ist der Unterschied zwischen einem Agenten, der vorgeführt wird, und einem, der arbeitet.

Wenn du wissen willst, wo dein Unternehmen dabei steht, mach den KIRA-Check. Er verortet dich über sechs Stufen und fünf Achsen, von der heimlichen Einzelnutzung bis zur durchgängig KI-getragenen Firma. Eine dieser Achsen heißt Governance und Verlässlichkeit, also genau die Achse, um die es hier ging. Du bekommst dein KIRA-Profil, also einen Standort je Achse statt einer Note, dazu die zwei Engpässe, die dich gerade wirklich bremsen, jeder mit genau einem ersten Schritt.

KIRA-Check

Wo steht dein Unternehmen wirklich?

Verorte deinen Reifegrad über sechs Stufen und fünf Achsen, und finde die zwei Engpässe, die euch gerade bremsen.