Verlässlichkeit schlägt Intelligenz: warum neun von zehn Agenten nie in Betrieb gehen
Der Agent trifft in der Vorführung jede Antwort und liegt im Alltag mal richtig, mal falsch. Rund neun von zehn Agenten-Projekten erreichen die Produktion nie, und fast nie liegt es am Modell. Fünf Schritte, mit denen du Verlässlichkeit misst statt sie zu hoffen.
Die Vorführung läuft gut. Auf dem Bildschirm arbeitet ein Agent, also ein KI-System, das nicht nur antwortet, sondern selbst Schritte ausführt. Er beantwortet jede Frage aus dem Raum, findet die richtige Unterlage, fasst sie sauber zusammen und schlägt am Ende sogar eine Antwort an den Kunden vor. Die Runde ist beeindruckt, das Budget wird freigegeben, und jemand sagt den Satz, der später alle beschäftigt: Damit sind wir eigentlich fast fertig.
Drei Monate später steht dasselbe System im Alltag. Es liegt mal richtig und mal falsch. Manchmal übersieht es eine Unterlage, manchmal erfindet es eine Frist, manchmal ist die Antwort besser als das, was ein Mensch geschrieben hätte. Fragt jemand, wie oft es richtig liegt, gibt es keine Zahl, sondern Eindrücke. Die einen sagen, das läuft doch gut. Die anderen sagen, sie prüfen inzwischen wieder alles selbst.
Der Vorschlag, der in dieser Lage auf dem Tisch landet, lautet fast immer gleich: Lass uns das nächste Modell probieren. Es ist der bequemste Vorschlag, weil er nach Fortschritt aussieht, wenig kostet und niemandem im Haus etwas abverlangt. Er verschiebt den Zustand nur ein paar Wochen nach hinten.
Das nächste Modell löst dieses Problem nicht, weil es kein Intelligenzproblem ist. Der Sprung von der Vorführung in den Betrieb ist ein Verlässlichkeitsproblem, und Verlässlichkeit ist die eine Eigenschaft, die man nicht kaufen, sondern nur messen kann.
Woran du merkst, dass ihr Verlässlichkeit nicht messt
Eine einzige Frage entscheidet das: Wie oft liegt euer Agent richtig, und woher wisst ihr das? Kommt darauf eine Prozentzahl mit einem Test dahinter, seid ihr weiter als die meisten. Kommt eine Einschätzung, fehlt euch die Messung. Vier Anzeichen begleiten diesen Zustand fast immer.
Das erste: Jeder gemeldete Fehler wird mit einem zusätzlichen Satz im Prompt beantwortet, also in der Anweisung an das Modell. Der Satz behebt den gemeldeten Fall. Ob er an drei anderen Stellen etwas kaputt macht, prüft niemand, weil es nichts gibt, woran man das prüfen könnte.
Das zweite: Die Testfälle hat die Person ausgesucht, die den Agenten gebaut hat. Das ist kein böser Wille, sondern der natürliche Weg. Nur besteht ein System, das an selbst gewählten Fällen geprüft wird, diese Prüfung fast immer.
Das dritte: Getestet wird in einer Testumgebung mit Testdaten, produktiv laufen andere Daten. Die echten Fälle sind unordentlicher: unvollständige Angaben, veraltete Dokumente, zwei widersprüchliche Versionen derselben Unterlage. Genau daran scheitern Agenten, nicht an den sauberen Fällen.
Das vierte: Der Erfolgsbeleg ist eine Vorführung. Wenn im Haus jemand fragt, wie gut das System ist, wird es vorgeführt statt belegt. Eine Vorführung zeigt, dass etwas gelingen kann. Sie zeigt nie, wie oft es gelingt.
Warum das nächste Modell euer Problem nicht löst
Rund neun von zehn Agenten-Projekten erreichen die Produktion nie, und nur etwa ein Prozent der Führungskräfte hält die eigene KI-Umsetzung für ausgereift. Diese beiden Zahlen beschreiben denselben Befund aus zwei Richtungen, und der Grund dafür ist fast nie ein zu schwaches Modell.
Der Grund liegt in einem Unterschied, den man in der Vorführung nicht sieht. Eine Vorführung muss einmal gelingen. Der Betrieb muss jeden Tag gelingen, mit echten Daten, unter Zeitdruck und ohne dass jemand hinterher aufräumt. Einen verlässlichen Agenten zu bauen ist deshalb wirklich schwer, und zwar aus zwei Gründen: Jedes Wort im Prompt hat Wirkung, und kleine Fehler summieren sich in verketteten Schritten auf. Ein Agent, der fünf Schritte hintereinander ausführt und in jedem Schritt selten danebenliegt, liegt am Ende der Kette regelmäßig daneben.
Wie klein die Ursache dabei sein kann, zeigt ein Fall aus einem echten Kundenservice-Agenten: Ein einziges Wort an einer bestimmten Stelle im Prompt erzeugte siebzig Prozent der überflüssigen Kommentare. So etwas findest du nicht durch Nachdenken und nicht durch ein besseres Modell. So etwas findest du nur, wenn du misst.
Das Werkzeug dafür heißt Eval, also ein automatisierter Test, der vor der Ausgabe prüft, ob die Aufgabe verlässlich gelöst ist. Mehrere Evals zusammen mit der Umgebung, in der sie laufen, ergeben den Harness, also die technische Umgebung um das Modell herum, in der getestet, gemessen und abgesichert wird. Der Harness ist der Teil, den ein Anbieterwechsel dir nicht abnimmt, und er ist der Teil, der über den Betrieb entscheidet.
Fünf Schritte, mit denen du Verlässlichkeit misst statt hoffst
Schreib das erste Test-Set aus echten Fällen auf, bevor du den ersten Agenten baust
Prüf mit dem stärksten verfügbaren Modell, ob die Aufgabe überhaupt lösbar ist, und leg danach die Erfolgskriterien fest
Lass dieselben Fälle einmal vom Fachmenschen und einmal vom Agenten bearbeiten und stell die Ergebnisse nebeneinander
Lass die Prüfung über tausende Fälle laufen und miss dabei auch den Weg, nicht nur das Ergebnis
Setz ein zweites Modell als Bewerter nur dort ein, wo Urteil zählt, und prüf den Bewerter selbst
Was du dabei nebenbei bekommst
Der Einwand gegen dieses Vorgehen kommt zuverlässig und lautet: Das ist Zusatzaufwand vor der Produktion. Er ist kein Zusatzaufwand, er ist der Weg dorthin. Ohne gemessene Verlässlichkeit fehlt der Runde, die über den Betrieb entscheidet, jede Grundlage außer einem guten Gefühl, und ein gutes Gefühl trägt keine Entscheidung, an der Kundenkommunikation oder Geld hängt.
Dazu kommt ein Nebeneffekt, der oft übersehen wird. Wenn die Tests fest in der Auslieferungskette hängen und bei jeder Änderung mitlaufen, entstehen die Nachweise für Verlässlichkeit fast nebenbei. Du dokumentierst dann nicht extra, du liest ab. Bei allem, was unter Prüfpflichten fällt, ist das der Unterschied zwischen einem laufenden Prozess und einem Projekt, das jemand vor dem Termin nachbaut.
Und eine Grenze bleibt bestehen: Ein bewertendes Modell ersetzt die menschliche Prüfung nicht, es macht sie seltener. Am Ende zeichnet ein Mensch. Genau diese Kombination, gemessene Verlässlichkeit plus eine benannte Person, die zeichnet, ist der Unterschied zwischen einem Agenten, der vorgeführt wird, und einem, der arbeitet.
Wenn du wissen willst, wo dein Unternehmen dabei steht, mach den KIRA-Check. Er verortet dich über sechs Stufen und fünf Achsen, von der heimlichen Einzelnutzung bis zur durchgängig KI-getragenen Firma. Eine dieser Achsen heißt Governance und Verlässlichkeit, also genau die Achse, um die es hier ging. Du bekommst dein KIRA-Profil, also einen Standort je Achse statt einer Note, dazu die zwei Engpässe, die dich gerade wirklich bremsen, jeder mit genau einem ersten Schritt.
