Klassisches Infrastrukturmonitoring erkennt nicht, ob ein AI-Dienst fachlich brauchbar, rechtzeitig und innerhalb seiner Kapazitätsgrenzen antwortet. Neben CPU und Speicher müssen Tokenfluss, Warteschlangen, Modellladezeit, Cache, Retrieval und Antwortqualität beobachtet werden.
Das Seminar entwickelt eine abgestufte Observability- und SRE-Struktur. Messwerte werden in SLOs, aussagekräftige Alarme und konkrete Runbooks überführt, damit Störungen nicht bei bunten Dashboards enden.
Einordnung und Nutzen
Zwei Tage sind passend, da ein vorhandener Cluster vorausgesetzt wird. Die Zeit reicht für Telemetrieintegration, Dashboard- und Alarmdesign sowie ein vollständiges Incident-Szenario.
Zielgruppe
- SRE, Plattform- und Kubernetes-Betrieb
- MLOps, LLMOps und technische Qualitätssicherung
- IT-Service-Management und Incident Response
Voraussetzungen
- Kubernetes-Grundkenntnisse
- Erste Erfahrung mit Metriken und Logs
- Grundverständnis von Inferenz- und RAG-Diensten
Lernziele
- Messbare Zuverlässigkeitsziele für AI-Dienste definieren
- Metriken, Logs und Traces konsistent korrelieren
- Frühwarnende und handlungsfähige Alarme entwerfen
- Störungen mit Runbooks und Fehlerbudgets steuern
Seminarinhalte
SRE-Ziele für AI-Dienste
- SLI, SLO, SLA und Fehlerbudget
- Verfügbarkeit, Latenz, Durchsatz, Qualität und Aktualität
- Dienstketten von Gateway über Retrieval bis Modellserver
Metriken und Kapazität
- Kubernetes-, Node-, Storage- und Netzwerkmetriken
- GPU-Auslastung, Speicher, Warteschlange und Batching
- Tokenraten, Time-to-first-token, Cachetreffer und Fehlerraten
Logs und Traces
- Strukturierte Logs und GenAI-Telemetrie ohne unkontrollierte Inhaltsdaten
- OpenTelemetry-Kontext und MLflow Tracing über Gateway, RAG, Tools und Inferenz
- Sampling, Redaktion sensibler Daten sowie Loki und Tempo für korrelierte Fehleranalyse
Dashboards und Alarmierung
- Golden Signals und dienstbezogene Übersichten
- Mehrfenster-Alarme, Sättigung und Abweichung
- Alarmrouting, Wartungsfenster und Unterdrückung von Folgemeldungen
Qualitäts- und Funktionsprüfung
- Synthetische Anfragen und kontrollierte Testprompts
- Retrieval-Treffer, Antwortstruktur und Sicherheitsregeln
- Drift- und Regressionssignale als Betriebsindikatoren
Incident Response
- Triage, Abhängigkeiten und sichere Degradationsmodi
- Runbooks, Eskalation und Kommunikationspunkte
- Post-Incident-Review und Verbesserungsbacklog
Praktische Übungen
- Instrumentierung eines Inferenz- und RAG-Pfads mit OpenTelemetry und MLflow Tracing
- Konfiguration von Sampling und Schutz sensibler Trace-Inhalte
- Aufbau eines SLO-Dashboards für Kubernetes, GPU und Modellserver
- Konfiguration handlungsfähiger Alarme
- Bearbeitung einer simulierten Latenz- und Kapazitätsstörung mit Runbook
Methodik
Messkonzept, Konfiguration und Störungssimulation greifen ineinander. Der Praxisanteil konzentriert sich auf Diagnosewege und betriebliche Entscheidungen.
Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 2 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 1.198 zzgl. MwSt. Inhaus: € 3.400 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | SRE, Plattform- und Kubernetes-Betrieb, MLOps, LLMOps und technische Qualitätssicherung, IT-Service-Management und Incident Response |
| Voraussetzungen: | Kubernetes-Grundkenntnisse; Erste Erfahrung mit Metriken und Logs; Grundverständnis von Inferenz- und RAG-Diensten |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
