Prozess-Integration: System im KI-Reifegrad-Atlas
Prozess-Integration
Auf dieser Stufe soll der Agent nicht mehr nur im Chatfenster antworten, sondern in echten Systemen handeln: Kundendaten lesen, das Ticket anlegen, den Bescheid vorbereiten.
Hier verläuft die härteste Grenze der Reise, die zwischen Demo und Produktion. Rund neun von zehn Agenten-Projekten erreichen die Produktion nie, und der Grund ist fast nie ein zu dummes Modell, sondern fehlende Verlässlichkeit.
Was auf dieser Stufe zählt
Verlässlichkeit entscheidet, nicht Intelligenz: hier fällt die Entscheidung zwischen Demo und Produktion.
Verlässlichkeit entscheidet, nicht Intelligenz
Ein zuverlässiger Agent ist schwer zu bauen, weil jedes Wort im Prompt zählt und Fehler sich in verketteten Schritten aufsummieren. Solche Fehler findet man nur, wenn man misst.
An echte Systeme, aber sauber angebunden
Auf dieser Stufe antwortet die KI, auf dieser Stufe handelt sie über MCP und Skills. Gib dem Agenten so wenig Instruktion wie möglich und lieber gute Werkzeuge.
Human-in-the-Loop als Standard
Die KI empfiehlt, ein Mensch prüft und zeichnet den kritischen Schritt. So wird die KI vom Bedrohungsgefühl zum Teammate, das eine Vier-Stunden-Aufgabe in zwanzig Minuten erledigt.
Achtzig Prozent ist Datenaufbereitung
KI ist im Kern Statistik: die Datenaufbereitung frisst rund achtzig Prozent der Zeit. Die unsexy Fleißarbeit an Stammdaten entscheidet über Erfolg oder Scheitern.
AI-Readiness über fünf Dimensionen
Reife misst sich an IT, Daten, Organisation, Kultur und Governance, nicht am Tool. Die Kunst ist die Reihenfolge: welche Use Cases zur Organisation passen.
DSGVO als Leitplanke, nicht Verhinderer
Der Satz bei uns geht das nicht ist meist ein Totschlagargument. Mit AVV, No-Training-Zusage und Rollen-Konzept lassen sich auch handelnde Agenten sauber betreiben.
Rechne den Change mit ein, nicht nur die Technik
Früher waren Technikprojekte grob 80 Prozent Technik und 20 Prozent Organisation, heute ist es umgekehrt. Eine große Arbeitsplatz-Erhebung misst 67 Prozent Organisation gegen 32 Prozent individuelles Verhalten. Faustregel fürs Budget: pro Euro für Technik mindestens ein Euro für Menschen und Arbeitsweisen.
Deterministisch bauen, wo es geht
Ein Agent ist teurer, langsamer und schwerer zu prüfen als eine feste Regel. Jeder Schritt, den du deterministisch bauen kannst, gehört deterministisch gebaut. Das schützt vor Overengineering und macht Verlässlichkeit erst messbar, weil weniger Stellen variieren können.
Wo du auf jeder Achse stehst
Reife ist ein Profil aus fünf Werten. So sieht jede Achse auf dieser Stufe aus.
Vom Anwender zum Prozess-Designer und Agenten-Betreuer, manche nennen es HR für Agenten. Der Mittelstand braucht einen KI-Verantwortlichen mit Mandat und Draht zur Geschäftsführung. Führ die KI-Belegschaft mit demselben Lebenszyklus wie die menschliche: namentlicher Owner, Gesundheitsstatus, fester Rhythmus zum Ausmisten. Einstellen ist die eine Hälfte, Stilllegen die andere.
Die stille Hauptarbeit: Stammdaten als Golden Record, Datenpipeline in Stufen, RAG für firmenspezifische Antworten, Qualitätssicherung vor der Anbindung. Zerleg das RAG-System in seine fünf Bausteine: Wissensquellen, Zerlegung in Chunks, Vektordatenbank, semantische Suche und Berechtigungen. Der letzte wird am häufigsten vergessen und am teuersten.
Die Umgebung schlägt das Modell: Harness aus MCP, Skills, Speicher und Sandbox, ein Team spezialisierter Agenten, Modell-Routing, Least Privilege und kurzlebige Token. Behandle jeden Agenten wie einen potenziell bösartigen Akteur und begrenze seinen Blast Radius, und lies geteilte Skills wie fremde Software: im Februar 2026 kursierten 341 bösartige Skills in öffentlichen Sammlungen.
Agenten werden noch in bestehende Prozesse gesetzt. Zentraler Hebel ist das Prozess-Mapping in Einzelschritte, Vorsicht vor der Gate-Falle. Rechne damit, dass der Engpass wandert: sobald die Ausführung schnell ist, staut sich die Arbeit bei Review und Freigabe, also plan Prüfkapazität ein und begrenze die Zahl gleichzeitig laufender Vorhaben.
Die Achse dieser Stufe: Verlässlichkeit über Safety Cases und Evals ab Tag eins, LLM-as-Judge, kuratierte Ground Truth, menschliche Rechenschaft. Zwei Muster machen den Sprung praktisch: die Konfidenzschwelle und eine Kontroll-Oberfläche, mit der ein Konzern im Steuerprozess 95 Prozent Automatisierungsgrad bei gestiegener Qualität erreichte.
Woraus diese Stufe besteht
- Grounding-Schicht und RAG-Muster: Binde die KI an geprüfte Firmendaten, für Tabellen eine verlässliche Modellschicht davor, und zeig nie Dokumente ohne Berechtigung.
- Skills-Bibliothek als kodierte Hausmeinung: Kompiliere Stack und Regeln aus echten Experten-Kommentaren zu Skills, mit denen der Agent schreibt und prüft.
- Der Multi-Agenten-Bauplan: Experte, RAG-Agent, Coder, Executor und Orchestrator als wiederverwendbares Muster für Datenanalyse.
- Der Eval-Harness: Batch-Evals, LLM-as-Judge und kuratierte Ground Truth, dazu ein Mock-Server für Tests ohne echte Nebenwirkungen.
- Identity und Access für Agenten: Eigene Credentials pro Agent, Least Privilege, kurzlebige Token und lückenlose Nachvollziehbarkeit, wer gehandelt hat.
- Konfidenzschwelle als Freigabe-Gate: Der Agent meldet seine Sicherheit mit, über der Schwelle läuft der Vorgang durch, darunter geht er an einen Menschen. Du bekommst einen Regler statt einer Alles-oder-nichts-Entscheidung und öffnest ihn Stufe für Stufe, wenn die Zahlen es hergeben.
- A/B-Test gegen den Menschen: Die einfachste belastbare Eval: dieselben Fälle einmal vom Fachmenschen, einmal vom Agenten, Ergebnisse nebeneinander. In einer Vertragsprüfung sank die Bearbeitungszeit je Vertrag so von sechs auf rund vier Stunden, samt Nachweis, dass nicht halluziniert wurde.
- AI Value Equation als Business-Case-Raster: Verbinde Geschäftsprozess, KI-Lösung und finanzielles Ergebnis in einer nachvollziehbaren Rechnung und fülle sie mit echten Zahlen. Rechne die Adaptionsrate ein: nutzt nur ein Teil der Leute das System, sinkt der Effekt entsprechend.
Die ersten Schritte
Die Kennzahlen dieser Stufe
- Anteil Use Cases in Produktion: jeder produktive Fall zählt gegen die 9-von-10-scheitern-Benchmark
- Adaptionsrate: Leute nutzen das System freiwillig im Alltag
- Eval-Qualität und Fehlerrate: Rate falscher Freigaben niedrig, Konfidenzintervalle ausgewiesen
- Zeit vom POC zur Produktion: kurz, besonders wo der Entscheider am Tisch sitzt
- Durchlaufzeit statt gefühlter Zeitersparnis: in einem Order Management von 20 bis 120 Minuten auf 1 bis 2 Minuten
- Freigabestau: wie viele fertige Vorgänge auf einen Menschen warten und wie lange