Eigene Inferenz löst nur einen Teil der Souveränitätsaufgabe. Sobald Modelle an interne Sprache, Prozesse oder Fachdomänen angepasst werden, benötigt die Plattform kontrollierte Trainingsruntimes, planbare GPU-Zuteilung, reproduzierbare Datensätze und belastbare Checkpoints.
Das Seminar setzt auf die einheitliche TrainJob-API von Kubeflow Trainer v2 und Kueue für Quoten, Prioritäten und Topologie. Ein Fine-Tuning wird vom kleinen Testlauf bis zur verteilten Ausführung, Wiederaufnahme und Übergabe in Registry und Serving durchgespielt.
Einordnung und Nutzen
Vier Tage sind notwendig, weil Runtime-Definitionen, verteilte Ausführung, Kueue-Scheduling, Daten- und Checkpointpfade sowie ein reales Fine-Tuning mit Wiederaufnahme und LLMOps-Übergabe praktisch aufgebaut werden. Drei Tage würden Betrieb und Fehleranalyse unangemessen verkürzen.
Zielgruppe
- AI- und Machine-Learning-Engineering
- Kubernetes-, GPU- und Plattformadministration
- MLOps-, LLMOps- und Data-Engineering-Teams
Voraussetzungen
- Sichere Kubernetes-Grundkenntnisse
- Python- und PyTorch-Grundlagen
- Grundverständnis von Sprachmodellen, Tokenisierung und GPU-Ressourcen
Lernziele
- Kubeflow Trainer v2 als Plattformdienst administrieren
- TrainJobs und wiederverwendbare Runtimes sicher definieren
- GPU-Quoten und verteilte Jobs mit Kueue steuern
- Fine-Tuning reproduzierbar ausführen, fortsetzen und in den Modelllebenszyklus übergeben
Seminarinhalte
Trainingsarchitektur auf Kubernetes
- Einzelknoten, Mehrknoten, mehrere Prozesse und verteilte Synchronisation
- GPU-, CPU-, Netzwerk-, Speicher- und Datenpfade
- JobSet, MPI-Grundlagen und Abgrenzung zu dauerhaften Inferenzdiensten
Kubeflow Trainer v2
- TrainJob als einheitliche API statt framework-spezifischer Legacy-Jobs
- ClusterTrainingRuntime für zentrale Plattformstandards
- TrainingRuntime für mandantenspezifische Konfigurationen und sichere Images
Kueue und Ressourcenzuteilung
- LocalQueue, ClusterQueue, ResourceFlavor und Cohorts
- Faire Quoten, WorkloadPriority, Preemption und all-or-nothing admission
- Topology-Aware Scheduling und MultiKueue als Architekturvariante
Verteilte Ausführung und Leistung
- PyTorch-Verteilung, TorchTune und DeepSpeed
- Prozesse je Knoten, Parallelisierung und Kommunikation
- GPU-Auslastung, Skalierungseffizienz und systematische Engpassanalyse
Daten, Cache und Checkpoints
- Versionierte Trainings- und Evaluationsdatensätze
- Objektstorage, verteiltes Datencaching und I/O-Entlastung der GPUs
- Periodische Checkpoints, konsistente Wiederaufnahme und Aufbewahrung
Effizientes LLM-Fine-Tuning
- LoRA und weitere PEFT-Verfahren
- Präzision, Speicherbedarf, Gradientenakkumulation und Batchgrößen
- Kleine Validierungsläufe vor der verteilten Skalierung
Sicherheit und Reproduzierbarkeit
- Zugelassene Images, Runtimes, Modelle und Datensätze
- Secrets, Identitäten, Egress- und Netzwerkregeln
- Parameter, Code, Daten, Umgebung und Herkunft vollständig erfassen
LLMOps-Übergabe und Betrieb
- Metriken, Logs, Ereignisse und Pending-Workloads
- Registrierung von Checkpoints und finalen Modellen in MLflow
- Evaluation, Freigabe, Übergabe an KServe und kontrollierte Aufräumverfahren
Praktische Übungen
- Installation und Prüfung von Kubeflow Trainer v2 und der Kueue-Integration
- Erstellung von ClusterTrainingRuntime, TrainingRuntime und TrainJob
- Konfiguration fairer GPU-Quoten, Prioritäten und Topology-Aware Scheduling
- Ausführung eines LoRA-Fine-Tunings mit versioniertem Datensatz
- Unterbrechung und Wiederaufnahme aus einem Checkpoint
- Registrierung und Freigabe des Modellartefakts mit anschließender Testbereitstellung
Methodik
Ein durchgängiges Labor verbindet Plattformkonfiguration, Trainingsjob, Scheduling, Messung, Checkpoint und LLMOps-Übergabe. Skalierung erfolgt erst nach erfolgreichem Kleinlauf, damit Fehlerursachen nachvollziehbar bleiben.
Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 4 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 2.396 zzgl. MwSt. Inhaus: € 6.800 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | AI- und Machine-Learning-Engineering, Kubernetes-, GPU- und Plattformadministration, MLOps-, LLMOps- und Data-Engineering-Teams |
| Voraussetzungen: | Sichere Kubernetes-Grundkenntnisse; Python- und PyTorch-Grundlagen; Grundverständnis von Sprachmodellen, Tokenisierung und GPU-Ressourcen |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
