Der erste Teil des Intensivpfads führt die Themen Architektur, Beschleunigerknoten, Orchestrierung und Datenpfade in einer zusammenhängenden Plattform zusammen. Dadurch werden Schnittstellen sichtbar, die in isolierten Produktkursen leicht übersehen werden: Ein passender Treiber genügt nicht, wenn Topologie, Scheduler, Storage und Netzwerk die Geräte nicht effizient versorgen.
Im Seminar entsteht schrittweise eine administrierbare AI-Umgebung. Anforderungen werden dimensioniert, Linux-GPU-Knoten vorbereitet, Container sicher an Geräte gebunden und Kubernetes für beschleunigte Workloads eingerichtet. Storage- und Netzwerkentscheidungen werden direkt an Ladezeit, Auslastung und Mehrknotenbetrieb gespiegelt.
Zielgruppe
Erfahrene Linux-, Virtualisierungs-, Netzwerk- oder Kubernetes-Administratoren, Plattformingenieure und technische Architekten, die eine vollständige AI-Plattform aufbauen oder übernehmen.
Voraussetzungen
Sichere Linux-Administrationskenntnisse, praktische Containergrundlagen sowie Grundkenntnisse zu IP-Netzen und Speicher. Kubernetes-Grundkenntnisse sind hilfreich, aber nicht zwingend erforderlich.
Seminarinhalte
Anforderungen und Referenzarchitektur
- Training, Fine-Tuning, RAG, Batch- und Online-Inferenz in messbare Infrastrukturprofile übersetzen
- Compute, Management, Registry, Modellablage, Netzwerkzonen und Betriebsdienste strukturieren
- Bare Metal, Virtualisierung und Kubernetes anhand von Isolation, Leistung und Betriebsaufwand auswählen
- Kapazität, Reserve, Energie, Kühlung, Support und Wiederbeschaffungszeit gemeinsam planen
Linux-Beschleunigerknoten
- PCIe-, NUMA- und Interconnect-Topologie inventarisieren und für die Platzierung auswerten
- Firmware, Kernel, Treiber, Laufzeitbibliotheken und Containerimages kompatibel halten
- Secure Boot, Kernelmodule, Geräteberechtigungen und reproduzierbare Installation administrieren
- Baseline, Burn-in, Gesundheitsprüfung, Wartung und Rollback als Standardverfahren etablieren
Gerätebereitstellung und Ressourcenteilung
- Container Device Interface, Node Resource Interface und Laufzeitintegration für containerd und Podman konfigurieren
- GPU-Operatoren, Device Plugins und DRA-Treiber hinsichtlich Gerätelebenszyklus und Zustandsüberwachung einordnen
- Exklusive Zuweisung, Partitionierung, Time-Slicing und Dynamic Resource Allocation bewerten
- Isolation, Quoten, Leistungsschwankungen und Abrechnung gemeinsam berücksichtigen
- Gerätezustand und Zuweisung über Host, Container und Cluster hinweg nachvollziehen
Kubernetes-Basis für AI
- Clusterrollen, Worker-Pools, Containerlaufzeit, CNI, CSI und Gateway API einordnen
- Beschleunigerknoten kennzeichnen, schützen und mit Taints, Tolerations und Affinitäten steuern
- DeviceClass, ResourceClaim und ResourceClaimTemplate für Dynamic Resource Allocation einsetzen
- Namespaces, RBAC, ResourceQuotas, LimitRanges und Netzwerkpolicies als Mandantengrundlage einsetzen
Scheduling und Warteschlangen
- Requests, Limits, Extended Resources und Geräteclaims korrekt modellieren
- Topology Manager, NUMA-Nähe und Knotenlabels für leistungsfähige Platzierung nutzen
- Kueue, Fair Sharing, Topology-Aware Scheduling und Gang Scheduling für knappe Beschleuniger gestalten
- Cluster Autoscaling, feste GPU-Pools und Vorhaltekapazität anhand von Startzeiten bewerten
Storage und Modellartefakte
- Block-, Datei-, Objekt- und lokales NVMe-Storage nach Zugriffsmuster auswählen
- Modelle versionieren, verifizieren, verteilen und mit lokalen Caches beschleunigen
- CSI-Klassen, Volumes, Snapshots, Volume Group Snapshots, Zugriffsmodi und Kapazitätsgrenzen administrieren
- Datenlokalität, parallele Lesevorgänge und Modellladezeiten messen und optimieren
Netzwerk und Mehrknotenbetrieb
- Management-, Storage-, Service- und Hochleistungsverkehr segmentieren
- MTU, Bonding, VLAN, QoS, RDMA, RoCE und InfiniBand für geeignete Lastprofile einordnen
- CPU, Arbeitsspeicher, Netzwerkkarte und Beschleuniger topologienah platzieren
- Paketverlust, Stau, asymmetrische Pfade und Kommunikationsengpässe diagnostizieren
Betriebsübergabe und Standardisierung
- Deklarative Konfiguration, Versionsmatrix und freigegebene Kombinationen dokumentieren
- Patch- und Wartungsverfahren für Knoten, Treiber, Operatoren und Cluster definieren
- Abnahmetests für Funktion, Leistung, Isolation und Wiederholbarkeit festlegen
- Betriebshandbuch, Zuständigkeiten, Eskalationen und Mindestüberwachung vorbereiten
Praktische Übungen
- Aus einem AI-Anwendungsfall eine dimensionierte Zielarchitektur und Knotenrollen ableiten
- Einen Linux-Beschleunigerknoten inventarisieren, vorbereiten und mit Testcontainern validieren
- Kubernetes mit GPU-Operator, DRA-Geräteclaim und topologiebewusster Platzierung konfigurieren
- Ressourcenteilung, Quoten und eine Kueue-Warteschlange mit Fair Sharing für mehrere Teams umsetzen
- Modellartefakte über eine zentrale Ablage bereitstellen und einen lokalen Cache messen
- Einen Storage- oder Netzwerkengpass erzeugen, Messwerte korrelieren und die Ursache eingrenzen
- Eine Betriebsabnahme mit Versionsmatrix, Baseline und Wiederholungstest durchführen
Methodik
Eine durchgängige Laborplattform wird über die gesamte Seminarwoche erweitert. Architekturentscheidungen werden praktisch umgesetzt und anschließend mit Funktionstests, Baselines und Störungsszenarien geprüft. Der zweite Intensivteil kann unmittelbar anschließen.
Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 5 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 2.995 zzgl. MwSt. Inhaus: € 8.500 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Erfahrene System-, Kubernetes- und Plattformadministratoren |
| Voraussetzungen: | Linux, Container, IP-Netze und Speicher; Kubernetes-Grundlagen empfohlen |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
