Das Kompaktseminar ordnet die wichtigsten Bausteine einer AI-Infrastruktur in nur einem zusammenhängenden Administrationsszenario ein. Es richtet sich an Fachkräfte, die Entscheidungen vorbereiten, einen Pilot technisch begleiten oder die Zuständigkeiten einer künftigen Plattform verstehen müssen, ohne sofort mehrere Vertiefungsseminare zu besuchen.
Die Inhalte reichen vom Lastprofil über den Linux-GPU-Knoten und Kubernetes bis zum überwachten Inferenzdienst. Sicherheit, Sicherung und Wiederanlauf werden nicht als spätere Ergänzung, sondern als feste Bestandteile der Zielarchitektur behandelt. Die fachliche Tiefe ist bewusst geringer als in den Spezialseminaren.
Zielgruppe
Erfahrene System- und Netzwerkadministratoren, IT-Architekten, Plattformteams, technische Projektleiter und IT-Verantwortliche, die in kurzer Zeit einen belastbaren Gesamtüberblick benötigen.
Voraussetzungen
Allgemeine Administrationskenntnisse zu Linux oder Windows Server, IP-Netzen und Speicher. Praktische Linux- und Containerkenntnisse erleichtern die Laboraufgaben.
Seminarinhalte
Anforderungen und Architektur
- Training, Fine-Tuning, RAG und Inferenz anhand ihrer Infrastrukturmerkmale unterscheiden
- Compute, Beschleuniger, Speicher, Netzwerk, Registry, Modellablage und Managementdienste zuordnen
- Bare Metal, Virtualisierung, Container und Kubernetes als Betriebsmodelle vergleichen
- Lastprofil, Verfügbarkeit, Datenklasse und Wachstum in eine grobe Dimensionierung überführen
GPU-Server und Container
- Hardwaretopologie, VRAM, NUMA, Energie und Kühlung administrativ bewerten
- Treiber, Kernel, Laufzeitbibliotheken und Containerimages kompatibel betreiben
- Containerzugriff auf Geräte sicher konfigurieren und mit Testworkloads validieren
- Exklusive Nutzung, Partitionierung und Time-Slicing hinsichtlich Isolation und Leistung einordnen
Kubernetes für AI-Workloads
- Beschleunigerknoten mit GPU-Operatoren, Labels, Taints, Affinitäten und Gerätebereitstellung integrieren
- Extended Resources und DRA-Claims unterscheiden sowie Quoten und Kueue-Prioritäten einordnen
- Namespaces, RBAC und Netzwerkpolicies als Grundlage der Mandantentrennung nutzen
- Storageklassen, Modellvolumes und lokale Caches für große Artefakte einsetzen
Storage, Netzwerk und Datenpfade
- Objekt-, Datei-, Block- und lokales NVMe-Storage nach Zugriffsmuster auswählen
- Modellladezeiten, Cachewirkung und parallele Zugriffe messen
- Management-, Storage- und Serviceverkehr segmentieren und Engpässe erkennen
- RDMA und Hochleistungsnetze für Mehrknotenlasten einordnen
Inferenz und LLM-Serving
- Modellserver, API, Gateway, Routing und Gesundheitsprüfungen zu einem Dienst verbinden
- Batching, Kontext, KV-Cache, Quantisierung und Parallelität als Betriebsparameter verstehen
- LLMInferenceService, Inference Gateway und modellbewusstes Routing betrieblich einordnen
- Latenz, Tokenrate, Warteschlange und Auslastung messen
- Skalierung, Quoten, Überlastschutz und kontrollierte Modellwechsel einordnen
Betrieb, Sicherheit und Resilienz
- Host-, Cluster-, GPU-, Storage- und Inferenzmetriken einschließlich OpenTelemetry-Traces verbinden
- Identitäten, Geheimnisse, Netzwerkgrenzen und Artefaktfreigaben absichern
- Vertrauliche Ausführung, Attestierung und deren Reifegrad für sensible AI-Dienste einordnen
- Sicherungsumfang für Modelle, Konfigurationen, Vektordaten und Schlüssel festlegen
- RPO, RTO, Notbetrieb und eine geordnete Wiederanlaufsequenz skizzieren
Praktische Übungen
- Ein Lastprofil erstellen und eine kompakte Zielarchitektur dimensionieren
- Einen GPU-fähigen Testcontainer prüfen und die Gerätezuweisung nachvollziehen
- Eine beschleunigte Workload in Kubernetes platzieren und mit Quoten begrenzen
- Ein Modell aus einer zentralen Ablage laden und die Cachewirkung messen
- Einen LLM-Endpunkt starten, Last erzeugen und wesentliche Kennzahlen auswerten
- Eine Sicherheits- und Wiederanlaufcheckliste für den aufgebauten Dienst erstellen
Methodik
Ein durchgängiges Labor verbindet die wichtigsten Plattformschichten. Kurze Einführungen wechseln mit kompakten Administrationsaufgaben und Messungen. Für tiefgehende Produktkonfigurationen, komplexe Mehrknotenszenarien oder umfassende Notfalltests sind die Fach- und Intensivseminare vorgesehen.
Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 3 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 1.797 zzgl. MwSt. Inhaus: € 5.100 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Administratoren, IT-Architekten und technische Verantwortliche |
| Voraussetzungen: | |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
