Seminar AI-Infrastruktur für Administratoren: Monitoring, Performance und Kapazitätsplanung

Eine hohe GPU-Auslastung ist nicht automatisch ein guter Betriebszustand, und eine niedrige Auslastung ist nicht automatisch Verschwendung. Aussagekräftige Diagnose entsteht erst, wenn Host, Container, Cluster, Datenpfad und Inferenzdienst entlang desselben Lastprofils betrachtet werden. AI-Systeme benötigen daher zusätzliche Kennzahlen und eine sorgfältige Korrelation über mehrere Schichten.

Das Seminar baut eine Observability-Struktur auf, die technische Fehler, Sättigung, Kapazitätsmangel und ungeeignete Workloadparameter voneinander unterscheidbar macht. Messwerte werden in Baselines und Serviceziele überführt und für Alarmierung, Störungsanalyse und Beschaffungsplanung genutzt.

Zielgruppe

System- und Kubernetes-Administratoren, Plattform- und Observability-Teams, DevOps- und MLOps-Fachkräfte sowie Kapazitätsverantwortliche.

Voraussetzungen

Grundkenntnisse in Linux, Netzwerken und Monitoring. Erfahrung mit Containern oder Kubernetes sowie GPU- oder Inferenzsystemen ist hilfreich.

Seminarinhalte

Messmodell und Serviceziele

  • Golden Signals und Sättigungskennzahlen auf AI-Plattformen übertragen
  • Latenz, Durchsatz, Fehler, Warteschlange, Zeit bis zum ersten Token und Tokenrate definieren
  • Technische SLIs mit Verfügbarkeit, Kapazität und Nutzererfahrung verbinden
  • Labels und Kardinalität für Modell, Version, Mandant, Knoten und Endpunkt beherrschen

Host- und Beschleunigermetriken

  • CPU, RAM, NUMA, I/O, Netzwerk, Energie und thermische Drosselung überwachen
  • NVIDIA-, AMD- und weitere Telemetriepfade für VRAM, Auslastung, Temperatur und Fehler einordnen
  • Prozess-, Container- und Gerätebelegung einander zuordnen
  • Partitionierte oder geteilte Geräte ohne irreführende Aggregation auswerten

Kubernetes- und Plattformtelemetrie

  • Podstatus, Scheduling, Restarts, Ressourcenanforderungen und Knotendruck korrelieren
  • Operatoren, DRA-Claims, Gerätegesundheit, Kueue-Warteschlangen und Autoscaler überwachen
  • Prometheus-Erfassung, ServiceMonitors, Recording Rules und Dashboardvariablen strukturieren
  • Logs und Events für Pending Pods, OOM, Eviction und Gerätefehler zusammenführen

Storage- und Netzwerkdiagnose

  • Latenz, IOPS, Durchsatz, Queue Depth, Cache Hit Rate und Modellladezeit messen
  • Paketverlust, Retransmits, Puffer, RDMA-Zähler und Linkauslastung interpretieren
  • Datenengpass von Rechenengpass und Kommunikationsengpass unterscheiden
  • Topologie und Datenlokalität in Dashboards und Diagnoseabläufe einbeziehen

Inferenz-Observability

  • Anfragephase, Queueing, Prefill, Decode, KV-Cache-Transfer und Streaming getrennt beobachten
  • TTFT, Inter-Token-Latenz, Tokenrate, Batchgröße, Cache und Parallelität miteinander verbinden
  • OpenTelemetry-GenAI-Semantik für Gateway-, Modellserver- und Backend-Traces anwenden
  • Fehlerbudgets, Alarmgrenzen und Eskalation für Inferenzdienste festlegen

Lasttest und Kapazitätsplanung

  • Repräsentative Anfrageverteilungen, Warm-up, Messfenster und Wiederholungen definieren
  • Baseline, Sättigungspunkt, nutzbare Reserve und Degradationsverhalten bestimmen
  • Kapazität für Spitzenlast, Wachstum, Wartung und Ausfall eines Knotens planen
  • Trendbericht und Beschaffungsbedarf mit nachvollziehbaren Annahmen dokumentieren

Praktische Übungen

  • Ein Metrikmodell für Host, herstellerneutrale GPU-Telemetrie, DRA, Kubernetes und Inferenz erstellen
  • Eine Baseline unter definierter Last aufnehmen und Alarmgrenzen begründen
  • Einen künstlichen VRAM-, Storage- oder Netzwerkengpass erzeugen und eindeutig lokalisieren
  • Hohe Queue-Zeit, langsame Prefill-Phase und langsame Tokenausgabe anhand von Traces unterscheiden
  • Aus Messreihen eine Kapazitätsreserve und einen Erweiterungszeitpunkt ableiten

Methodik

Metriken, Logs und Traces werden an einer vorbereiteten AI-Workload erhoben. Lastparameter und Engpässe werden kontrolliert verändert. Diagnoseentscheidungen müssen durch konkrete Messwerte und reproduzierbare Vergleiche begründet werden.

Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner

Seminardetails

   
Dauer: 2 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr
Preis: Öffentlich oder Live Stream: € 1.198 zzgl. MwSt.
Inhaus: € 3.400 zzgl. MwSt.
Teilnehmeranzahl: min. 2 - max. 8
Teilnehmer: Administratoren, Plattform- und Observability-Teams
Voraussetzungen: Linux- und Monitoring-Grundkenntnisse
Standorte: Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg
Methoden: Vortrag, Demonstrationen, praktische Übungen am System
Seminararten: Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht
Durchführungsgarantie: ja, ab 2 Teilnehmern
Sprache: Deutsch - bei Firmenseminaren ist auch Englisch möglich
Seminarunterlage: Dokumentation auf Datenträger oder als Download
Teilnahmezertifikat: ja, selbstverständlich
Verpflegung: Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch)
Support: 3 Anrufe im Seminarpreis enthalten
Barrierefreier Zugang: an den meisten Standorten verfügbar
  Weitere Informationen unter + 49 (221) 74740055

Seminartermine

Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.

Seminar Startdatum Enddatum Ort Dauer
Luxemburg 2 Tage
Hannover 2 Tage
Stuttgart 2 Tage
Dresden 2 Tage
Madgeburg 2 Tage
Regensburg 2 Tage
Jena 2 Tage
Trier 2 Tage
Ulm 2 Tage
München 2 Tage
Friedrichshafen 2 Tage
Kassel 2 Tage
Wuppertal 2 Tage
Münster 2 Tage
Nürnberg 2 Tage
Köln 2 Tage
Bremen 2 Tage
Berlin 2 Tage
Mainz 2 Tage
Erfurt 2 Tage
Darmstadt 2 Tage
Frankfurt 2 Tage
Paderborn 2 Tage
Essen 2 Tage
Konstanz 2 Tage
Freiburg 2 Tage
Potsdam 2 Tage
Flensburg 2 Tage
Leipzig 2 Tage
Hamm 2 Tage
Rostock 2 Tage
Hamburg 2 Tage
Luxemburg 2 Tage
Hannover 2 Tage
Stuttgart 2 Tage
Dresden 2 Tage
Madgeburg 2 Tage
Regensburg 2 Tage
Jena 2 Tage
Trier 2 Tage
Nach oben
Seminare als Stream SRI zertifiziert
© 2026 www.seminar-experts.de All rights reserved. | Kontakt | Impressum | Nach oben