Zuletzt aktualisiert am:
Die Fähigkeit, den internen Zustand und das Verhalten eines KI-Systems durch die Erfassung und Analyse von Protokollen, Metriken und Ausgaben abzuleiten, um eine effektive Überwachung und Fehlerbehebung zu gewährleisten.
Geht über die grundlegende Überwachung hinaus, um tiefe Einblicke in den Systemzustand zu gewähren. Observability-Pipelines erfassen strukturierte Protokolle (Anfragen, Fehler), Metriken (Latenz, Ressourcennutzung) und Traces (Ausführungspfade) von Datenaufnahme-, Trainings- und Inferenzdiensten. Mithilfe von Korrelationen und Dashboards können Teams die Ursachen von Problemen präzise bestimmen, Ereignisse wiederholen und Post-Mortem-Analysen durchführen. Governance definiert, welche Signale erfasst werden, sowie Aufbewahrungsrichtlinien und Alarmschwellenwerte, um die Systemzuverlässigkeit und Compliance zu gewährleisten.
Praxisbeispiel:
Eine Plattform zur Betrugserkennung integriert OpenTelemetry, um Traces für jede Transaktionsaktivität auszugeben, protokolliert Modellentscheidungen mitsamt Konfidenzwerten und überwacht die CPU-/GPU-Auslastung. Bei Latenzspitzen analysiert das SRE-Team die Traces im Detail, identifiziert eine langsame Feature-Store-Abfrage, optimiert die Indizierung und stellt die normale Performance innerhalb von 15 Minuten wieder her.




