Klassisches Systemmonitoring zeigt, ob ein Dienst erreichbar ist und wie schnell er antwortet. Bei KI kommen fachliche Abweichungen hinzu, die kein Verfügbarkeitsmesser erkennt: Antworten ohne Quelle, steigende Korrekturquoten, ungewöhnliche Werkzeugnutzung oder ein Modellupdate des Anbieters, das den Ton verändert. Ein Alarm ist dabei nur so viel wert wie die Person, die ihn bewertet, und die Maßnahme, die sicher folgt.
Zwei Arten von Signalen
| Signal | Beispiel | Erste Reaktion |
|---|---|---|
| Antwortzeit und Fehlerquote | Anfragen laufen in Zeitüberschreitungen, Werkzeugaufrufe schlagen fehl | Technischer Bereitschaftsdienst prüft Anbieter und Schnittstellen |
| Kosten je Vorgang | Verbrauch je Anfrage verdoppelt sich ohne Änderung am Prozess | Budgetgrenze greift, Ursache wird gesucht |
| Korrektur- und Ablehnungsquote | Prüfer ändern deutlich mehr Entwürfe als in den Vorwochen | Workflow-Owner startet das Testset |
| Antworten ohne Quelle | Anteil der Antworten ohne Verweis auf die Wissensbasis steigt | Retrieval und Index prüfen |
| Ungewöhnliche Werkzeugnutzung | Ein Agent ruft Werkzeuge in unerwarteter Reihenfolge oder Häufigkeit auf | Spielraum begrenzen, Protokolle sichten |
| Verschiebung der Anfragen | Neue Themen, die die Wissensbasis nicht abdeckt | Fachbereich erweitert Quellen |
Die ersten beiden Zeilen liefert jedes Betriebswerkzeug. Die übrigen entstehen nur, wenn Prüfungen, Quellenverweise und Werkzeugaufrufe von Beginn an protokolliert werden.
Schwellenwerte an Auswirkungen koppeln
Ein Schwellenwert sollte nicht aus einem Lehrbuch stammen, sondern aus der Frage, ab wann ein Fehler Kunden, Mitarbeiter oder Kosten spürbar trifft. Eine Korrekturquote, die über eine Woche deutlich über dem Durchschnitt der Vormonate liegt, löst eine Überprüfung aus. Ein Anteil an Antworten ohne Quelle, der sich verdoppelt, löst eine Retrieval-Prüfung aus. Eine Verdopplung der Kosten je Vorgang stoppt die automatische Verarbeitung, bis die Ursache bekannt ist.
Drei Schweregrade und ihre Maßnahmen
- Qualität sinkt: Beobachten, Testset ausführen, Ursache im nächsten Review klären. Der Betrieb läuft weiter.
- Fehler mit Außenwirkung: Automatik begrenzen, Freigabe vor jeder Ausgabe erzwingen, betroffene Kunden oder Mitarbeiter informieren, wenn Ergebnisse bereits versendet wurden.
- Sicherheits- oder Datenschutzvorfall, unerwünschte Aktion: System abschalten, auf den manuellen Prozess zurückfallen, Meldewege prüfen, Ursache analysieren, Wiederanlauf nur nach Freigabe.
Wer welchen Schweregrad ausruft, muss vorher feststehen. Im Zweifel gilt die höhere Stufe.
Ein Runbook auf einer Seite
- Erkennen: Welche Signale, wer sieht sie, in welchem Rhythmus.
- Bewerten: Wer entscheidet über den Schweregrad, innerhalb welcher Zeit.
- Begrenzen: Welcher Schalter stoppt die Automatik, wer darf ihn betätigen.
- Kommunizieren: Wer wird intern informiert, wann werden Betroffene informiert.
- Beheben: Testset, Rückweg auf die vorherige Version, Korrektur der Quellen oder Prompts.
- Wiederanlauf: Welche Kriterien müssen erfüllt sein, wer gibt frei.
- Lernen: Kurze Nachbesprechung, Ergänzung des Testsets, Anpassung der Schwellenwerte.
Fallback muss geübt sein
Ein Abschaltknopf, der nie betätigt wurde, ist eine Annahme. Der manuelle Prozess, auf den zurückgefallen wird, muss dokumentiert sein und von den Mitarbeitern beherrscht werden, die ihn im Ernstfall ausführen. Eine Übung pro Quartal, in der die Automatik für eine Stunde abgeschaltet wird, zeigt, ob das stimmt.
Beispiel: Ein Modellupdate des Anbieters
Nach einem Update des Anbieters werden die Antworten eines Service-Assistenten länger und enthalten ungefragte Produktempfehlungen. Die wöchentliche Auswertung zeigt eine steigende Korrekturquote, das Testset bestätigt den Unterschied zur Baseline. Das System wird auf die festgeschriebene Vorversion zurückgesetzt, der Prompt für die neue Version angepasst und erneut getestet, bevor umgestellt wird. Ohne Kennzahl und Testset wäre die Änderung über Kundenbeschwerden aufgefallen.
Ein Alarm ohne Zuständigen ist eine Benachrichtigung. Ein Alarm mit Zuständigem und sicherer Maßnahme ist Monitoring.
Monitoring gehört in den Entwurf, nicht in den Nachtrag
Signale, Protokolle und Schalter werden vor der Produktivsetzung gebaut, weil sie nachträglich teuer sind. Welche Abnahmekriterien dazugehören, beschreibt der Beitrag vom KI-Pilot zum produktiven Betrieb. Welche Komponenten neben dem Modell beobachtet werden müssen, zeigt der Beitrag zur KI-Lieferkette; wie die Kennzahlen in ein schlankes Governance-Reporting eingehen, der Beitrag zu messbarer KI-Governance.