Seminar AI-Infrastruktur für Administratoren: Beschleuniger- und GPU-Server unter Linux

GPU- und andere Beschleunigerknoten unterscheiden sich im Betrieb deutlich von gewöhnlichen Servern. Treiber, Firmware, Kernel, PCIe-Topologie, NUMA-Zuordnung, Gerätespeicher und Containerlaufzeit müssen als zusammenhängender Stack betrachtet werden. Fehler in nur einer Schicht führen häufig zu unklaren Symptomen wie nicht sichtbaren Geräten, Leistungseinbrüchen oder instabilen Workloads.

Das Seminar behandelt den vollständigen administrativen Lebenszyklus eines Linux-basierten Beschleunigerknotens. Im Mittelpunkt stehen reproduzierbare Installationen, kontrollierte Updates, sichere Gerätefreigabe, sinnvolle Aufteilung teurer Ressourcen und belastbare Diagnoseverfahren für Einzelserver und Clusterknoten.

Zielgruppe

Linux-Administratoren, Rechenzentrumsadministratoren, Kubernetes-Administratoren, Plattformingenieure sowie technische Verantwortliche für GPU-Server und lokale AI-Systeme.

Voraussetzungen

Sichere Linux-Grundkenntnisse, Erfahrung mit Paketverwaltung, Diensten, Protokollen und der Kommandozeile. Grundkenntnisse zu Containern sind hilfreich, werden aber nicht vorausgesetzt.

Seminarinhalte

Architektur und Dimensionierung

  • Unterschiede zwischen CPU, GPU, NPU und weiteren Beschleunigern sowie geeignete Einsatzfelder für Training, Fine-Tuning und Inferenz
  • VRAM-Bedarf, Speicherbandbreite, Rechenformate, Leistungsaufnahme, Kühlung und Rackplanung
  • PCIe-Lanes, Switches, NUMA-Domänen, IOMMU und die Auswirkungen der Hardwaretopologie auf Datentransfers
  • Auswahl zwischen Bare Metal, virtuellen Maschinen, Passthrough und containerisiertem Betrieb

Linux, Firmware und Treiber

  • Bestandsaufnahme mit Systemwerkzeugen, Gerätekennungen, Kernelmodulen, Firmwareständen und Fehlerzählern
  • Treiberpakete, Kernelabhängigkeiten, DKMS, Secure Boot, Signierung und kontrollierte Neustarts
  • Kompatibilitätsprüfung zwischen Treiber, Laufzeitbibliotheken, Containerimages und AI-Frameworks
  • Versionswechsel, Rollback, Wartungsfenster und Aufbau eines freigegebenen Softwarestandes

Containerzugriff auf Beschleuniger

  • OCI-Laufzeiten, Container Device Interface, Node Resource Interface, Gerätedateien und Berechtigungen
  • Bereitstellung für containerd, Podman und Kubernetes ohne unnötig privilegierte Container
  • Validierung mit reproduzierbaren Testcontainern und Trennung von Host- und Containerbibliotheken
  • Image-Varianten, Treiberkompatibilität, Registry-Strategien und Betrieb in Netzen ohne Internetzugang

GPU-Operatoren und Gerätelebenszyklus

  • Operatoren für unterschiedliche Beschleunigerhersteller und deren Custom Resources vergleichen
  • Node Feature Discovery, Geräteerkennung, Device Plugin und DRA-Treiber aufeinander abstimmen
  • Treiber-CRDs, heterogene Betriebssystemstände und gestaffelte Knotenupdates verwalten
  • Node Problem Detector, Zustandsbedingungen und automatisierte Node Remediation kontrolliert einsetzen

Partitionierung und gemeinsame Nutzung

  • Exklusive Zuweisung, Hardwarepartitionierung, Time-Slicing und Prozessdienste im Vergleich
  • Mehrinstanzprofile, DRA-Claims, Quoten, Isolation und Auswahl eines passenden Freigabemodells
  • Auswirkungen geteilter Geräte auf Vorhersagbarkeit, Fehlersuche, Abrechnung und Servicegüten
  • Stabile Funktionen von optionalen Alpha- oder Vorschaufunktionen beim GPU-Sharing trennen

Mehrknotenbetrieb und Datenwege

  • Interconnects innerhalb eines Servers und zwischen Servern, RDMA, RoCE und InfiniBand im Überblick
  • NUMA-nahe Platzierung von CPU, Arbeitsspeicher, Netzwerkkarte und Beschleuniger
  • GPUDirect-ähnliche RDMA- und Storage-Datenpfade, Pinned Memory und I/O-Engpässe einordnen
  • Grundlagen kollektiver Kommunikation und Anforderungen verteilter AI-Workloads

Überwachung und Fehleranalyse

  • Temperatur, Energie, Takt, Speicherauslastung, Fehlerkorrektur, Linkzustände und Prozessbelegung
  • Herstellerspezifische Telemetrie, Gesundheitsprüfungen, Burn-in und Baseline-Messungen verbinden
  • Vorgehen bei Treiberfehlern, Geräteverlust, Speicherfehlern, Reset-Ereignissen und Leistungsabfall
  • Wartungschecklisten, Ersatzteilstrategie und Nachweis eines stabilen Betriebszustands

Praktische Übungen

  • Hardware- und Topologieinventar eines Beschleunigerknotens erstellen und bewerten
  • Treiber- und Laufzeitstack installieren, prüfen und mit einem Testcontainer validieren
  • Einen GPU-Operatorzustand, DRA-Treiber und automatisierte Knotenbedingungen analysieren
  • Eine sichere Gerätefreigabe konfigurieren und unterschiedliche Zuweisungsmodelle vergleichen
  • Messwerte erfassen, eine Leistungsbaseline anlegen und einen künstlichen Engpass lokalisieren
  • Einen fehlerhaften Softwarestand analysieren und einen kontrollierten Rollback vorbereiten

Methodik

Kurze Theorieblöcke werden unmittelbar mit administrativen Laboraufgaben verbunden. Konfigurationen, Prüfkommandos und Diagnoseausgaben werden gemeinsam ausgewertet. Der Schwerpunkt liegt auf nachvollziehbaren Betriebsverfahren und nicht auf der Entwicklung von AI-Modellen.

Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner

Seminardetails

   
Dauer: 3 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr
Preis: Öffentlich oder Live Stream: € 1.797 zzgl. MwSt.
Inhaus: € 5.100 zzgl. MwSt.
Teilnehmeranzahl: min. 2 - max. 8
Teilnehmer: Linux-, Rechenzentrums- und Plattformadministratoren
Voraussetzungen:  
Standorte: Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg
Methoden: Vortrag, Demonstrationen, praktische Übungen am System
Seminararten: Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht
Durchführungsgarantie: ja, ab 2 Teilnehmern
Sprache: Deutsch - bei Firmenseminaren ist auch Englisch möglich
Seminarunterlage: Dokumentation auf Datenträger oder als Download
Teilnahmezertifikat: ja, selbstverständlich
Verpflegung: Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch)
Support: 3 Anrufe im Seminarpreis enthalten
Barrierefreier Zugang: an den meisten Standorten verfügbar
  Weitere Informationen unter + 49 (221) 74740055

Seminartermine

Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.

Seminar Startdatum Enddatum Ort Dauer
Luxemburg 3 Tage
Hannover 3 Tage
Stuttgart 3 Tage
Dresden 3 Tage
Madgeburg 3 Tage
Regensburg 3 Tage
Jena 3 Tage
Trier 3 Tage
München 3 Tage
Friedrichshafen 3 Tage
Kassel 3 Tage
Ulm 3 Tage
Münster 3 Tage
Nürnberg 3 Tage
Köln 3 Tage
Wuppertal 3 Tage
Bremen 3 Tage
Berlin 3 Tage
Mainz 3 Tage
Erfurt 3 Tage
Darmstadt 3 Tage
Frankfurt 3 Tage
Paderborn 3 Tage
Essen 3 Tage
Konstanz 3 Tage
Freiburg 3 Tage
Potsdam 3 Tage
Flensburg 3 Tage
Leipzig 3 Tage
Hamm 3 Tage
Rostock 3 Tage
Hamburg 3 Tage
Hannover 3 Tage
Stuttgart 3 Tage
Dresden 3 Tage
Luxemburg 3 Tage
Regensburg 3 Tage
Jena 3 Tage
Trier 3 Tage
Madgeburg 3 Tage
Nach oben
Seminare als Stream SRI zertifiziert
© 2026 www.seminar-experts.de All rights reserved. | Kontakt | Impressum | Nach oben