Prozess-Integration: System im KI-Reifegrad-Atlas

Reifegrad-StufePhase System

Prozess-Integration

Auf dieser Stufe soll der Agent nicht mehr nur im Chatfenster antworten, sondern in echten Systemen handeln: Kundendaten lesen, das Ticket anlegen, den Bescheid vorbereiten.

Hier verläuft die härteste Grenze der Reise, die zwischen Demo und Produktion. Rund neun von zehn Agenten-Projekten erreichen die Produktion nie, und der Grund ist fast nie ein zu dummes Modell, sondern fehlende Verlässlichkeit.

Kernprinzipien

Was auf dieser Stufe zählt

Verlässlichkeit entscheidet, nicht Intelligenz: hier fällt die Entscheidung zwischen Demo und Produktion.

01

Verlässlichkeit entscheidet, nicht Intelligenz

Ein zuverlässiger Agent ist schwer zu bauen, weil jedes Wort im Prompt zählt und Fehler sich in verketteten Schritten aufsummieren. Solche Fehler findet man nur, wenn man misst.

02

An echte Systeme, aber sauber angebunden

Auf dieser Stufe antwortet die KI, auf dieser Stufe handelt sie über MCP und Skills. Gib dem Agenten so wenig Instruktion wie möglich und lieber gute Werkzeuge.

03

Human-in-the-Loop als Standard

Die KI empfiehlt, ein Mensch prüft und zeichnet den kritischen Schritt. So wird die KI vom Bedrohungsgefühl zum Teammate, das eine Vier-Stunden-Aufgabe in zwanzig Minuten erledigt.

04

Achtzig Prozent ist Datenaufbereitung

KI ist im Kern Statistik: die Datenaufbereitung frisst rund achtzig Prozent der Zeit. Die unsexy Fleißarbeit an Stammdaten entscheidet über Erfolg oder Scheitern.

05

AI-Readiness über fünf Dimensionen

Reife misst sich an IT, Daten, Organisation, Kultur und Governance, nicht am Tool. Die Kunst ist die Reihenfolge: welche Use Cases zur Organisation passen.

06

DSGVO als Leitplanke, nicht Verhinderer

Der Satz bei uns geht das nicht ist meist ein Totschlagargument. Mit AVV, No-Training-Zusage und Rollen-Konzept lassen sich auch handelnde Agenten sauber betreiben.

07

Rechne den Change mit ein, nicht nur die Technik

Früher waren Technikprojekte grob 80 Prozent Technik und 20 Prozent Organisation, heute ist es umgekehrt. Eine große Arbeitsplatz-Erhebung misst 67 Prozent Organisation gegen 32 Prozent individuelles Verhalten. Faustregel fürs Budget: pro Euro für Technik mindestens ein Euro für Menschen und Arbeitsweisen.

08

Deterministisch bauen, wo es geht

Ein Agent ist teurer, langsamer und schwerer zu prüfen als eine feste Regel. Jeder Schritt, den du deterministisch bauen kannst, gehört deterministisch gebaut. Das schützt vor Overengineering und macht Verlässlichkeit erst messbar, weil weniger Stellen variieren können.

Die 5 Achsen auf dieser Stufe

Wo du auf jeder Achse stehst

Reife ist ein Profil aus fünf Werten. So sieht jede Achse auf dieser Stufe aus.

Menschen und Rolle

Vom Anwender zum Prozess-Designer und Agenten-Betreuer, manche nennen es HR für Agenten. Der Mittelstand braucht einen KI-Verantwortlichen mit Mandat und Draht zur Geschäftsführung. Führ die KI-Belegschaft mit demselben Lebenszyklus wie die menschliche: namentlicher Owner, Gesundheitsstatus, fester Rhythmus zum Ausmisten. Einstellen ist die eine Hälfte, Stilllegen die andere.

Daten und Wissen

Die stille Hauptarbeit: Stammdaten als Golden Record, Datenpipeline in Stufen, RAG für firmenspezifische Antworten, Qualitätssicherung vor der Anbindung. Zerleg das RAG-System in seine fünf Bausteine: Wissensquellen, Zerlegung in Chunks, Vektordatenbank, semantische Suche und Berechtigungen. Der letzte wird am häufigsten vergessen und am teuersten.

Systeme und Harness

Die Umgebung schlägt das Modell: Harness aus MCP, Skills, Speicher und Sandbox, ein Team spezialisierter Agenten, Modell-Routing, Least Privilege und kurzlebige Token. Behandle jeden Agenten wie einen potenziell bösartigen Akteur und begrenze seinen Blast Radius, und lies geteilte Skills wie fremde Software: im Februar 2026 kursierten 341 bösartige Skills in öffentlichen Sammlungen.

Prozesse

Agenten werden noch in bestehende Prozesse gesetzt. Zentraler Hebel ist das Prozess-Mapping in Einzelschritte, Vorsicht vor der Gate-Falle. Rechne damit, dass der Engpass wandert: sobald die Ausführung schnell ist, staut sich die Arbeit bei Review und Freigabe, also plan Prüfkapazität ein und begrenze die Zahl gleichzeitig laufender Vorhaben.

Governance und Verlässlichkeit

Die Achse dieser Stufe: Verlässlichkeit über Safety Cases und Evals ab Tag eins, LLM-as-Judge, kuratierte Ground Truth, menschliche Rechenschaft. Zwei Muster machen den Sprung praktisch: die Konfidenzschwelle und eine Kontroll-Oberfläche, mit der ein Konzern im Steuerprozess 95 Prozent Automatisierungsgrad bei gestiegener Qualität erreichte.

Bausteine und Hebel

Woraus diese Stufe besteht

  • Grounding-Schicht und RAG-Muster: Binde die KI an geprüfte Firmendaten, für Tabellen eine verlässliche Modellschicht davor, und zeig nie Dokumente ohne Berechtigung.
  • Skills-Bibliothek als kodierte Hausmeinung: Kompiliere Stack und Regeln aus echten Experten-Kommentaren zu Skills, mit denen der Agent schreibt und prüft.
  • Der Multi-Agenten-Bauplan: Experte, RAG-Agent, Coder, Executor und Orchestrator als wiederverwendbares Muster für Datenanalyse.
  • Der Eval-Harness: Batch-Evals, LLM-as-Judge und kuratierte Ground Truth, dazu ein Mock-Server für Tests ohne echte Nebenwirkungen.
  • Identity und Access für Agenten: Eigene Credentials pro Agent, Least Privilege, kurzlebige Token und lückenlose Nachvollziehbarkeit, wer gehandelt hat.
  • Konfidenzschwelle als Freigabe-Gate: Der Agent meldet seine Sicherheit mit, über der Schwelle läuft der Vorgang durch, darunter geht er an einen Menschen. Du bekommst einen Regler statt einer Alles-oder-nichts-Entscheidung und öffnest ihn Stufe für Stufe, wenn die Zahlen es hergeben.
  • A/B-Test gegen den Menschen: Die einfachste belastbare Eval: dieselben Fälle einmal vom Fachmenschen, einmal vom Agenten, Ergebnisse nebeneinander. In einer Vertragsprüfung sank die Bearbeitungszeit je Vertrag so von sechs auf rund vier Stunden, samt Nachweis, dass nicht halluziniert wurde.
  • AI Value Equation als Business-Case-Raster: Verbinde Geschäftsprozess, KI-Lösung und finanzielles Ergebnis in einer nachvollziehbaren Rechnung und fülle sie mit echten Zahlen. Rechne die Adaptionsrate ein: nutzt nur ein Teil der Leute das System, sinkt der Effekt entsprechend.
Loslegen

Die ersten Schritte

Konkret, mit einem erkennbaren Ergebnis je Schritt.
Kernprozess und Problem benennen
Wähle einen wiederkehrenden Prozess und schreib das Problem auf, nicht die KI-Lösung. Ergebnis: ein klar benanntes Problem mit Priorität.
Prozess in Einzelschritte zerlegen
Notiere je Schritt Eingabe, Ausgabe, Entscheidungs-Gate, benötigte Daten und System. Ergebnis: eine Prozess-Map, die zeigt, wo KI Hebel hat und wo ein Gate alles aufhält.
Erste Eval vor dem ersten Agenten
Bau ein kleines Test-Set aus echten Fällen, dessen richtige Antworten wirklich in der Quelle stehen. Ergebnis: ein Maßstab, an dem du Verlässlichkeit misst statt sie zu vermuten.
Kleines Einmaleins des Datenschutzes
Prüfe AVV, kein Training auf euren Daten, Rollen- und Rechte-Konzept. Ergebnis: eine belastbare Grundlage, die die geht-nicht-Debatte beendet.
Least Privilege und HITL-Gate
Gib dem Agenten eigene Zugangsdaten mit minimalen Rechten und ein Human-in-the-Loop-Gate an der kritischen Stelle. Ergebnis: ein Agent, der handeln darf, aber nur im sicheren Rahmen.
Business Case rechnen
Setz Baseline, erwartete Zeitersparnis und eine ehrliche Adaptionsrate an. Ergebnis: eine Zahl, die du dem Management vorlegen kannst, statt einer Hoffnung.
Klein ausliefern und Adaption messen
Liefere schnell einen kleinen produktiven Ausschnitt aus und miss, wie viele Leute ihn freiwillig nutzen. Ergebnis: ein erster produktiver Use Case und die ehrliche Antwort, ob die Leute ihn wirklich nutzen.
Agenten-Liste anlegen
Trag alle laufenden Agenten und Automatisierungen mit Owner und Zweck in eine Liste ein. Ergebnis: ein erstes Agenten-Cockpit, und meistens die Überraschung, wie viel davon unbeaufsichtigt läuft.
Woran du Fortschritt misst

Die Kennzahlen dieser Stufe

  • Anteil Use Cases in Produktion: jeder produktive Fall zählt gegen die 9-von-10-scheitern-Benchmark
  • Adaptionsrate: Leute nutzen das System freiwillig im Alltag
  • Eval-Qualität und Fehlerrate: Rate falscher Freigaben niedrig, Konfidenzintervalle ausgewiesen
  • Zeit vom POC zur Produktion: kurz, besonders wo der Entscheider am Tisch sitzt
  • Durchlaufzeit statt gefühlter Zeitersparnis: in einem Order Management von 20 bis 120 Minuten auf 1 bis 2 Minuten
  • Freigabestau: wie viele fertige Vorgänge auf einen Menschen warten und wie lange

Der Engpass und der Sprung

Was den Schritt zur nächsten Stufe blockiert.
Der Engpass
Der Engpass ist nicht die Technik, sondern die Organisation: beeindruckende Demos skalieren nicht, weil sie in Altprozesse gesetzt wurden und an Datenschulden, fehlenden Rechte-Konzepten und Gates hängen bleiben. Der Kern ist schnell gesagt: der KI-Teil wird mit der Zeit unwichtig, entscheidend sind die drei Konstanten Daten, Prozesse und Systeme. Wer sie im Griff hat, den beschleunigt jedes bessere Modell automatisch.
Der Sprung zur nächsten Stufe gelingt, wenn du aufhörst, Agenten in bestehende Abläufe zu setzen, und die Abläufe um die KI herum neu baust, den Menschen aus dem Ausführen nimmst und in die Rolle von Urteil und letzter Meile bringst. Ein gutes Signal dafür: der Mensch steht nicht mehr in der Schleife, sondern über ihr, er verantwortet Kriterien, Stichproben und die Fälle, bei denen es wirklich darauf ankommt.
Steht ihr auf dieser Stufe und wollt den Sprung zur nächsten Stufe? Im Erstgespräch benennen wir den Engpass und den Fahrplan.Erstgespräch anfragen
Der nächste Schritt

Verorte deinen Reifegrad,
finde den einen Engpass.

Ein ehrliches Profil über sechs Stufen und fünf Achsen, dann der nächste konkrete Schritt.