Seminar Beschleuniger und GPU-Orchestrierung mit Kubernetes

Beschleuniger sind die teuerste und betrieblich anspruchsvollste Ressource vieler AI-Plattformen. Leistung, Verfügbarkeit und Auslastung hängen nicht nur vom Modell, sondern auch von Treibern, NUMA-Topologie, Speicherpfaden, Scheduling und sauberer Mandantentrennung ab.

Das Seminar baut eine herstellerneutrale Betriebslogik auf und berücksichtigt klassische Device Plugins, die stabile Dynamic Resource Allocation sowie Kueue für Warteschlangen und faire Ressourcenzuteilung. Übungen reichen von der Knotenerkennung bis zu Multi-GPU-Workloads und belastbaren Kapazitätsregeln.

Einordnung und Nutzen

Drei Tage sind notwendig, weil Hardwareintegration, Scheduling, Performance und Störungsanalyse jeweils praktische Laborzeit erfordern. Eine kürzere Dauer würde zentrale Betriebsrisiken lediglich theoretisch behandeln.

Zielgruppe

  • Kubernetes- und Linux-Administration
  • AI-Plattformbetrieb und Rechenzentrumsplanung
  • MLOps, SRE und Performance Engineering

Voraussetzungen

  • Sichere Kubernetes-Grundkenntnisse
  • Linux-Kenntnisse zu Prozessen, Treibern und Geräten
  • Grundverständnis von AI-Inferenz oder Training

Lernziele

  • Beschleunigerknoten reproduzierbar in Kubernetes integrieren
  • Geräte sicher an Workloads zuweisen und teilen
  • Topologie- und leistungsbewusstes Scheduling umsetzen
  • Auslastung, Fehler und Engpässe systematisch analysieren

Seminarinhalte

Hardware- und Systemarchitektur

  • GPU, NPU und weitere Beschleuniger im Plattformkontext
  • PCIe, NUMA, CPU-Pinning, Arbeitsspeicher und Hochgeschwindigkeitsnetze
  • Treiber, Firmware, Kernelmodule und Container-Runtime

Geräteerkennung und Integration

  • Node Feature Discovery und Knoteninventar
  • Device Plugins, RuntimeClass und Ressourcennamen
  • Gesundheitsstatus, Wartungszustand und standardisierte Labels

Dynamic Resource Allocation

  • DeviceClass, ResourceClaim und ResourceClaimTemplate
  • Geräteattribute, Auswahlregeln und administrative Zuweisung
  • Koexistenz und Migration zwischen Plugin- und DRA-Modellen

Scheduling und Mandantenfähigkeit

  • Kueue mit LocalQueue, ClusterQueue, ResourceFlavor und Cohorts
  • Faire Quoten, Prioritäten, Preemption und all-or-nothing admission
  • Topology-Aware Scheduling, Partitionierung, zeitliches Teilen und sichere Exklusivität

Performance und Kapazität

  • Modellspeicher, KV-Cache, Batchgrößen und Parallelisierung
  • Datenlokalität und Engpässe zwischen Speicher, Netzwerk und Gerät
  • Messung von Durchsatz, Latenz, Speicherverbrauch und Auslastung

Betrieb und Fehleranalyse

  • Gerätemetriken, Temperatur, Fehlerzähler und Drosselung
  • Draining, Wartung und kontrollierte Wiederaufnahme
  • Fehlerbilder bei Treibern, Runtime, Scheduling und Workload

Praktische Übungen

  • Inventarisierung und Labeling eines Beschleunigerknotens
  • Bereitstellung von Workloads mit Device Plugin und ResourceClaim
  • Einrichtung von Kueue mit fairen Quoten, Prioritäten und Topologieregeln
  • Lasttest mit Messung von Auslastung, Latenz und Speicherengpässen

Methodik

Geführte Konfigurationen werden durch Mess- und Fehlerszenarien ergänzt. Der Schwerpunkt liegt auf reproduzierbaren Betriebsverfahren statt auf einzelnen Hardwareprodukten.

Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner

Seminardetails

   
Dauer: 3 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr
Preis: Öffentlich oder Live Stream: € 1.797 zzgl. MwSt.
Inhaus: € 5.100 zzgl. MwSt.
Teilnehmeranzahl: min. 2 - max. 8
Teilnehmer: Kubernetes- und Linux-Administration, AI-Plattformbetrieb und Rechenzentrumsplanung, MLOps, SRE und Performance Engineering
Voraussetzungen: Sichere Kubernetes-Grundkenntnisse; Linux-Kenntnisse zu Prozessen, Treibern und Geräten; Grundverständnis von AI-Inferenz oder Training
Standorte: Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg
Methoden: Vortrag, Demonstrationen, praktische Übungen am System
Seminararten: Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht
Durchführungsgarantie: ja, ab 2 Teilnehmern
Sprache: Deutsch - bei Firmenseminaren ist auch Englisch möglich
Seminarunterlage: Dokumentation auf Datenträger oder als Download
Teilnahmezertifikat: ja, selbstverständlich
Verpflegung: Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch)
Support: 3 Anrufe im Seminarpreis enthalten
Barrierefreier Zugang: an den meisten Standorten verfügbar
  Weitere Informationen unter + 49 (221) 74740055

Seminartermine

Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.

Seminar Startdatum Enddatum Ort Dauer
Leipzig 3 Tage
Hamm 3 Tage
Rostock 3 Tage
Hamburg 3 Tage
Luxemburg 3 Tage
Hannover 3 Tage
Stuttgart 3 Tage
Dresden 3 Tage
Madgeburg 3 Tage
Regensburg 3 Tage
Jena 3 Tage
Trier 3 Tage
München 3 Tage
Friedrichshafen 3 Tage
Kassel 3 Tage
Ulm 3 Tage
Münster 3 Tage
Nürnberg 3 Tage
Köln 3 Tage
Wuppertal 3 Tage
Bremen 3 Tage
Berlin 3 Tage
Mainz 3 Tage
Erfurt 3 Tage
Darmstadt 3 Tage
Frankfurt 3 Tage
Paderborn 3 Tage
Essen 3 Tage
Konstanz 3 Tage
Freiburg 3 Tage
Potsdam 3 Tage
Flensburg 3 Tage
Hamburg 3 Tage
Leipzig 3 Tage
Hamm 3 Tage
Rostock 3 Tage
Dresden 3 Tage
Luxemburg 3 Tage
Hannover 3 Tage
Stuttgart 3 Tage
Nach oben
Seminare als Stream SRI zertifiziert
© 2026 www.seminar-experts.de All rights reserved. | Kontakt | Impressum | Nach oben