Die Pitch-Deck-Version von "KI für SRE" verspricht autonome Behebung: der Agent erkennt, entscheidet und behebt, während die Bereitschaft schläft. Die Produktionsrealität 2026 ist nützlicher und konservativer. KI-Agenten machen Bereitschaftsdienste still leichter, indem sie die Teile der Incident Response übernehmen, die die meiste menschliche Aufmerksamkeit verschlingen, ohne tatsächlich menschliches Urteil zu erfordern — Alert-Korrelation, Runbook-Entwurf, Triage-Routing und die ersten neunzig Sekunden "was ist das und wo fange ich an". Die Behebung selbst bleibt menschen-genehmigt. Diese Balance ist der zu verstehende Teil.
Wo KI vor dem Page hilft
Die meisten Pages sollten nicht passieren. Alert-Korrelation — erkennen, dass zwölf gleichzeitige Alerts ein zugrundeliegendes Ereignis sind — ist wiederholte Arbeit, die KI gut bewältigt. Ein Agent, der den Alert-Stream beobachtet, kann:
- Korrelierte Alerts zu einem einzelnen abgeleiteten Vorfall gruppieren.
- Rauschen aus bekannten transienten Zuständen unterdrücken.
- Jeden Vorfall mit dem letzten Deploy, der Eigentümerschaft des betroffenen Services und den relevanten Dashboards anreichern.
- Entscheiden, ob der Vorfall ein Page rechtfertigt, basierend auf der von Ihnen definierten Policy.
Das Ergebnis: weniger Pages mit besserem Kontext. Die Bereitschaft, die geweckt wird, öffnet einen reicheren Vorfall als den, der vor KI-Korrelation eintraf. Das allein hat genug Schlaf in DACH-Bereitschaftsdiensten gerettet, um das beliebteste KI-SRE-Muster 2026 zu werden.
Wo KI während des Page hilft
Die ersten neunzig Sekunden eines Vorfalls sind die kognitiv teuersten. Die Bereitschaft findet heraus, was kaputt ist, wer sonst informiert werden muss und wo das relevante Runbook liegt. Ein KI-Agent, der die Hausarbeit schon gemacht hat, spart echte Zeit:
- Hypothesen-Entwurf. Basierend auf Alert-Muster, jüngsten Deploys und historischen Vorfällen schlägt der Agent zwei oder drei wahrscheinliche Ursachen geordnet nach Wahrscheinlichkeit vor.
- Runbook-Auffinden. Der Agent findet und verlinkt das relevanteste Runbook, mit den Schritten hervorgehoben, die zu den aktuellen Symptomen passen.
- Owner-Notifikations-Entwurf. Der Agent entwirft die Slack-Nachricht, die den Vorfall ankündigt, möglicherweise betroffene Kunden und die erwarteten nächsten Schritte. Der Mensch editiert und schickt.
- Diagnose-Kommando-Vorschläge. Der Agent schlägt die nächsten drei Diagnose-Queries vor, die die Bereitschaft ohnehin gefahren hätte. Sie laufen mit einem Klick — und die Ergebnisse informieren die nächsten Vorschläge des Agenten.
Keines davon nimmt dem Menschen Urteil weg. Alle entfernen die Teile der Arbeit, die kein Urteil brauchten.
Wo KI Dinge nicht autonom behebt
Die Versuchung, den Agenten direkt Behebung ausführen zu lassen, ist real. Die Produktionsweisheit 2026, hart gelernt in mehreren DACH-Unternehmen, lautet: für alles, was Produktions-State berührt, widerstehen. Das tragende Muster:
- Der Agent schlägt die Behebung in strukturierter Form vor: Kommando, erwarteter Effekt, Blast Radius, Rollback-Pfad.
- Die Bereitschaft reviewt und genehmigt mit einem Klick.
- Der Agent führt das genehmigte Kommando aus und meldet das Ergebnis.
- Der Agent beobachtet die Post-Execution-Metriken und meldet Anomalien an den Menschen.
Das ist schneller als der All-Mensch-Pfad — der Vorschlag ist bereits geschrieben — und sicherer als der All-Agent-Pfad. Die asymmetrischen Kosten einer falschen Behebung in Produktion rechtfertigen den Genehmigungs-Klick.
Was ist mit Runbook-Automatisierung?
Für wirklich gut verstandene Vorfälle — Platte voll, Zertifikat läuft ab, Queue-Tiefe überschreitet Schwellenwert — ist automatisierte Behebung seit Jahren normale SRE-Praxis. Der Agent ändert das nicht. Was der Agent hinzufügt, ist die Fähigkeit, die breitere Klasse "diesen genauen habe ich noch nicht gesehen, aber er ähnelt drei früheren Vorfällen" zu behandeln — die lange Reihe, die Automationsregeln nicht abdecken.
Vernünftige Faustregel: Klassische Runbook-Automation behandelt den Kopf der Verteilung; Agenten helfen mit der langen Reihe; Menschen behandeln das wirklich Neuartige.
Das richtige KI-SRE-Design ist nicht "der Agent behebt den Vorfall". Es ist "der Agent erledigt die dreißig Minuten Hausarbeit, die der Mensch zuerst gemacht hätte, und der Mensch entscheidet immer noch".
Die Audit-Geschichte
Regulierte DACH-Branchen können sich nicht auf "der Agent hat es getan" als Post-Mortem stützen. Das Audit-Muster, das interne und externe Reviewer zufriedenstellt:
- Jeder Agent-Vorschlag mit seiner Begründung geloggt.
- Jede menschliche Freigabe mit der Identität des Freigebers geloggt.
- Jede ausgeführte Aktion mit Zeitstempel, Ergebnis und Operator geloggt.
- Das Post-Mortem-Dokument als strukturiertes Artefakt aus dem Log erzeugt.
Das ist vollständiger als das durchschnittliche Pre-KI-Vorfallslog, weil die strukturierte Begründung des Agenten so erfasst wird, wie ad-hoc Notizen von Menschen es nie waren. Das Audit wird leichter, nicht schwerer.
Ein praktischer Startplan
Für ein SRE-Team, das ein KI-augmentiertes Incident-Response-Projekt startet:
- Mit Korrelation starten. Den Agenten als read-only Konsument an den Alert-Stream hängen. Lassen Sie ihn Vorfallsgruppierungen vorschlagen; Menschen bestätigen. Zwei Wochen davon kalibrieren den Agenten und zeigen dem Team, wie Wert aussieht.
- Anreicherung hinzufügen. Wenn ein echter Vorfall auslöst, hängt der Agent den jüngsten Deploy-Kontext, Eigentümer-Info und relevante Runbooks an. Menschen führen weiterhin.
- Hypothesen-Entwurf hinzufügen. Der Agent schlägt wahrscheinliche Ursachen vor. Mit der späteren Root-Cause-Findung der Bereitschaft vergleichen. Den Agenten an den Lücken tunen.
- Proposal-und-Approval-Behebung für risikoarme Fixes hinzufügen (Cache-Flush, Pod-Restart, Queue-Drain). Risikoreiche Fixes menschengetrieben halten.
- Mean Time to Detect, Acknowledge, Mitigate über das Projekt messen. Ehrlich sein, welche der Agent verbessert hat und welche nicht.
Was Sie tatsächlich kaufen
Die ehrliche Rahmung für Executive Sponsoren ist nicht "KI wird unseren SRE-Headcount reduzieren". Sie ist "KI lässt unser SRE-Team mehr Vorfälle mit weniger Erschöpfung und kürzerem Mean-Time-to-Mitigate behandeln". Das ist ein realer Vorteil, demonstrierbar, und die Art, die die nächste Budgetrunde verdient.
Die Teams, die mehr versprechen — voll autonome Incident Response, kein Mensch in der Schleife —, produzieren Geschichten, die schlecht enden. Die Teams, die weniger versprechen und konsistent liefern, enden mit der SRE-Rotation, an der jeder im Unternehmen teilhaben will. In einem Markt, in dem SRE-Talent knapp und teuer ist, ist das das strategischste Ergebnis, das KI produzieren kann.
