Seminar AI-Infrastruktur für Administratoren: Intensivseminar Plattform- und GPU-Betrieb

Der erste Teil des Intensivpfads führt die Themen Architektur, Beschleunigerknoten, Orchestrierung und Datenpfade in einer zusammenhängenden Plattform zusammen. Dadurch werden Schnittstellen sichtbar, die in isolierten Produktkursen leicht übersehen werden: Ein passender Treiber genügt nicht, wenn Topologie, Scheduler, Storage und Netzwerk die Geräte nicht effizient versorgen.

Im Seminar entsteht schrittweise eine administrierbare AI-Umgebung. Anforderungen werden dimensioniert, Linux-GPU-Knoten vorbereitet, Container sicher an Geräte gebunden und Kubernetes für beschleunigte Workloads eingerichtet. Storage- und Netzwerkentscheidungen werden direkt an Ladezeit, Auslastung und Mehrknotenbetrieb gespiegelt.

Zielgruppe

Erfahrene Linux-, Virtualisierungs-, Netzwerk- oder Kubernetes-Administratoren, Plattformingenieure und technische Architekten, die eine vollständige AI-Plattform aufbauen oder übernehmen.

Voraussetzungen

Sichere Linux-Administrationskenntnisse, praktische Containergrundlagen sowie Grundkenntnisse zu IP-Netzen und Speicher. Kubernetes-Grundkenntnisse sind hilfreich, aber nicht zwingend erforderlich.

Seminarinhalte

Anforderungen und Referenzarchitektur

  • Training, Fine-Tuning, RAG, Batch- und Online-Inferenz in messbare Infrastrukturprofile übersetzen
  • Compute, Management, Registry, Modellablage, Netzwerkzonen und Betriebsdienste strukturieren
  • Bare Metal, Virtualisierung und Kubernetes anhand von Isolation, Leistung und Betriebsaufwand auswählen
  • Kapazität, Reserve, Energie, Kühlung, Support und Wiederbeschaffungszeit gemeinsam planen

Linux-Beschleunigerknoten

  • PCIe-, NUMA- und Interconnect-Topologie inventarisieren und für die Platzierung auswerten
  • Firmware, Kernel, Treiber, Laufzeitbibliotheken und Containerimages kompatibel halten
  • Secure Boot, Kernelmodule, Geräteberechtigungen und reproduzierbare Installation administrieren
  • Baseline, Burn-in, Gesundheitsprüfung, Wartung und Rollback als Standardverfahren etablieren

Gerätebereitstellung und Ressourcenteilung

  • Container Device Interface, Node Resource Interface und Laufzeitintegration für containerd und Podman konfigurieren
  • GPU-Operatoren, Device Plugins und DRA-Treiber hinsichtlich Gerätelebenszyklus und Zustandsüberwachung einordnen
  • Exklusive Zuweisung, Partitionierung, Time-Slicing und Dynamic Resource Allocation bewerten
  • Isolation, Quoten, Leistungsschwankungen und Abrechnung gemeinsam berücksichtigen
  • Gerätezustand und Zuweisung über Host, Container und Cluster hinweg nachvollziehen

Kubernetes-Basis für AI

  • Clusterrollen, Worker-Pools, Containerlaufzeit, CNI, CSI und Gateway API einordnen
  • Beschleunigerknoten kennzeichnen, schützen und mit Taints, Tolerations und Affinitäten steuern
  • DeviceClass, ResourceClaim und ResourceClaimTemplate für Dynamic Resource Allocation einsetzen
  • Namespaces, RBAC, ResourceQuotas, LimitRanges und Netzwerkpolicies als Mandantengrundlage einsetzen

Scheduling und Warteschlangen

  • Requests, Limits, Extended Resources und Geräteclaims korrekt modellieren
  • Topology Manager, NUMA-Nähe und Knotenlabels für leistungsfähige Platzierung nutzen
  • Kueue, Fair Sharing, Topology-Aware Scheduling und Gang Scheduling für knappe Beschleuniger gestalten
  • Cluster Autoscaling, feste GPU-Pools und Vorhaltekapazität anhand von Startzeiten bewerten

Storage und Modellartefakte

  • Block-, Datei-, Objekt- und lokales NVMe-Storage nach Zugriffsmuster auswählen
  • Modelle versionieren, verifizieren, verteilen und mit lokalen Caches beschleunigen
  • CSI-Klassen, Volumes, Snapshots, Volume Group Snapshots, Zugriffsmodi und Kapazitätsgrenzen administrieren
  • Datenlokalität, parallele Lesevorgänge und Modellladezeiten messen und optimieren

Netzwerk und Mehrknotenbetrieb

  • Management-, Storage-, Service- und Hochleistungsverkehr segmentieren
  • MTU, Bonding, VLAN, QoS, RDMA, RoCE und InfiniBand für geeignete Lastprofile einordnen
  • CPU, Arbeitsspeicher, Netzwerkkarte und Beschleuniger topologienah platzieren
  • Paketverlust, Stau, asymmetrische Pfade und Kommunikationsengpässe diagnostizieren

Betriebsübergabe und Standardisierung

  • Deklarative Konfiguration, Versionsmatrix und freigegebene Kombinationen dokumentieren
  • Patch- und Wartungsverfahren für Knoten, Treiber, Operatoren und Cluster definieren
  • Abnahmetests für Funktion, Leistung, Isolation und Wiederholbarkeit festlegen
  • Betriebshandbuch, Zuständigkeiten, Eskalationen und Mindestüberwachung vorbereiten

Praktische Übungen

  • Aus einem AI-Anwendungsfall eine dimensionierte Zielarchitektur und Knotenrollen ableiten
  • Einen Linux-Beschleunigerknoten inventarisieren, vorbereiten und mit Testcontainern validieren
  • Kubernetes mit GPU-Operator, DRA-Geräteclaim und topologiebewusster Platzierung konfigurieren
  • Ressourcenteilung, Quoten und eine Kueue-Warteschlange mit Fair Sharing für mehrere Teams umsetzen
  • Modellartefakte über eine zentrale Ablage bereitstellen und einen lokalen Cache messen
  • Einen Storage- oder Netzwerkengpass erzeugen, Messwerte korrelieren und die Ursache eingrenzen
  • Eine Betriebsabnahme mit Versionsmatrix, Baseline und Wiederholungstest durchführen

Methodik

Eine durchgängige Laborplattform wird über die gesamte Seminarwoche erweitert. Architekturentscheidungen werden praktisch umgesetzt und anschließend mit Funktionstests, Baselines und Störungsszenarien geprüft. Der zweite Intensivteil kann unmittelbar anschließen.

Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner

Seminardetails

   
Dauer: 5 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr
Preis: Öffentlich oder Live Stream: € 2.995 zzgl. MwSt.
Inhaus: € 8.500 zzgl. MwSt.
Teilnehmeranzahl: min. 2 - max. 8
Teilnehmer: Erfahrene System-, Kubernetes- und Plattformadministratoren
Voraussetzungen: Linux, Container, IP-Netze und Speicher; Kubernetes-Grundlagen empfohlen
Standorte: Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg
Methoden: Vortrag, Demonstrationen, praktische Übungen am System
Seminararten: Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht
Durchführungsgarantie: ja, ab 2 Teilnehmern
Sprache: Deutsch - bei Firmenseminaren ist auch Englisch möglich
Seminarunterlage: Dokumentation auf Datenträger oder als Download
Teilnahmezertifikat: ja, selbstverständlich
Verpflegung: Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch)
Support: 3 Anrufe im Seminarpreis enthalten
Barrierefreier Zugang: an den meisten Standorten verfügbar
  Weitere Informationen unter + 49 (221) 74740055

Seminartermine

Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.

Seminar Startdatum Enddatum Ort Dauer
Hamm 5 Tage
Rostock 5 Tage
Hamburg 5 Tage
Leipzig 5 Tage
Hannover 5 Tage
Stuttgart 5 Tage
Dresden 5 Tage
Luxemburg 5 Tage
Regensburg 5 Tage
Jena 5 Tage
Trier 5 Tage
Madgeburg 5 Tage
München 5 Tage
Friedrichshafen 5 Tage
Kassel 5 Tage
Ulm 5 Tage
Münster 5 Tage
Nürnberg 5 Tage
Köln 5 Tage
Wuppertal 5 Tage
Berlin 5 Tage
Mainz 5 Tage
Erfurt 5 Tage
Bremen 5 Tage
Frankfurt 5 Tage
Paderborn 5 Tage
Essen 5 Tage
Darmstadt 5 Tage
Freiburg 5 Tage
Potsdam 5 Tage
Flensburg 5 Tage
Konstanz 5 Tage
Leipzig 5 Tage
Hamm 5 Tage
Rostock 5 Tage
Hamburg 5 Tage
Luxemburg 5 Tage
Hannover 5 Tage
Stuttgart 5 Tage
Dresden 5 Tage
Nach oben
Seminare als Stream SRI zertifiziert
© 2026 www.seminar-experts.de All rights reserved. | Kontakt | Impressum | Nach oben