Seminar OpenEuroLLM: Fine-Tuning und domänenspezifische Anpassung

Fine-Tuning ist sinnvoll, wenn ein Sprachmodell bestimmte Antwortmuster, Fachaufgaben oder Ausgabeformate verlässlicher bearbeiten soll. Dieses Seminar untersucht, wann eine Anpassung gerechtfertigt ist und wann eine verbesserte Eingabe oder ein Retrieval-Verfahren den Bedarf bereits erfüllt. Der Bezug zu OpenEuroLLM entsteht durch die Analyse seiner Modellartefakte und Post-Training-Verfahren sowie durch Übungen an einem technisch geeigneten, freigegebenen Modellstand.

Aus einem begrenzten, fachlich geprüften Datensatz wird ein kontrollierter Anpassungsversuch aufgebaut. Baseline und veränderter Stand werden mit denselben unabhängigen Prüfaufgaben verglichen. Die Übungen behandeln Datenaufbereitung, Tokenisierung, Verlustmaskierung, Ressourcenverbrauch und Überanpassung als zusammenhängende Entscheidungen.

Für den praktischen Lauf wird ein kleines geeignetes Referenzmodell beziehungsweise eine vorbereitete kompatible Modellvariante verwendet. Die konkrete Auswahl und der benötigte GPU-Speicher werden vorab geprüft. Ein veröffentlichtes Vollparametertraining des Projekts wird nicht mit einem LoRA-Laborversuch gleichgesetzt. Großskaliges Vortraining, umfassendes Alignment und eine produktive Modellfreigabe sind nicht Bestandteil des viertägigen Versuchs.

Lernziele

  • Fine-Tuning gegenüber Promptanpassung und Retrieval anhand überprüfbarer Kriterien auswählen.
  • Einen kleinen überwachten Anpassungslauf mit sauber getrennten Daten durchführen.
  • Adapter, Basismodell, Tokenizer und Laufzeit als reproduzierbare Einheit behandeln.
  • Verbesserungen, Verschlechterungen und Grenzen anhand unabhängiger Testfälle bewerten.

Inhaltsverzeichnis

  1. Anpassungsziel und Versuchsdesign
  2. Modell- und Werkzeugauswahl
  3. Instruktionsdaten und Tokenisierung
  4. Parameterarme Anpassung
  5. Trainingslauf und Diagnose
  6. Unabhängige Bewertung
  7. Export und Bereitstellung
  8. Dokumentation und Freigabeentscheidung

Seminarinhalte

Anpassungsziel und Versuchsdesign

  • Domänenaufgaben, Sprachabdeckung und erwartete Ausgabeformate konkretisieren.
  • Prompting, RAG, überwachtes Fine-Tuning und Präferenzoptimierung nach ihrem Zweck einordnen.
  • Baseline, Vergleichsbedingungen, Abbruchkriterien und ein begrenztes Rechenbudget festlegen.

Modell- und Werkzeugauswahl

  • OpenEuroLLM-Modellkarten und das Post-Training-Umfeld auf geeignete Ausgangsartefakte prüfen.
  • Architektur, Gewichtsformat, Tokenizer und unterstützte Anpassungsverfahren aufeinander abstimmen.
  • Die Aufgaben von Transformers, PEFT und TRL im vorbereiteten Laboraufbau unterscheiden.

Instruktionsdaten und Tokenisierung

  • Beispiele fachlich prüfen, Dopplungen entfernen und Dokumentgruppen vor der Aufteilung berücksichtigen.
  • Dialogrollen und modellspezifisches Chat-Template korrekt anwenden; Basismodelle ohne Chat-Template gesondert behandeln.
  • Sequenzlängen, Kürzungen und trainierte Tokenbereiche anhand konkreter Beispiele kontrollieren.

Parameterarme Anpassung

  • LoRA-Rang und Zielmodule für die ausgewählte Architektur festlegen und trainierbare Parameter kontrollieren.
  • Quantisierung nur bei nachgewiesener Unterstützung der konkreten Hard- und Softwarekombination einsetzen.
  • Speicherbedarf, Batchgröße und Gradientenakkumulation mit einem kurzen Probelauf prüfen.

Trainingslauf und Diagnose

  • Lernrate, Epochenzahl, Protokollierung und Zwischenspeicherung für ein kleines Experiment konfigurieren.
  • Trainings- und Validierungsverlauf auswerten und auffällige Beispiele bis zur Datenursache zurückverfolgen.
  • Überanpassung, ungültige Formate und Verschlechterungen außerhalb der Zieldomäne erkennen.

Unabhängige Bewertung

  • Baseline und Adapterversion mit zurückgehaltenen Aufgaben unter identischen Bedingungen vergleichen.
  • Domänenerfolg, allgemeine Sprachqualität und unerwünschte Antwortmuster getrennt erfassen.
  • Eine zweite begrenzte Variante anhand der ersten Messung planen und nachvollziehbar bewerten.

Export und Bereitstellung

  • Adapter mit eindeutigem Basismodellstand, Tokenizer und Konfiguration exportieren.
  • Erneutes Laden in einer frischen Umgebung prüfen; ein Zusammenführen von Gewichten nur bei unterstütztem Verfahren behandeln.
  • Versionswechsel und Rückkehr zur Baseline einschließlich der Vergleichstests durchführen.

Dokumentation und Freigabeentscheidung

  • Datenverwendung, Versuchsparameter und bekannte Grenzen in einer kompakten Modelldokumentation erfassen.
  • Die Bedingungen der verwendeten Artefakte getrennt dokumentieren und erforderliche Freigaben zuordnen.
  • Offene Aufgaben für einen weiterführenden Pilotbetrieb anhand der Messdaten priorisieren.

Praktische Übungen

  1. Eine klar abgegrenzte Fachaufgabe auswählen und die unveränderte Modellleistung messen.
  2. Den Übungsdatensatz bereinigen, gruppenweise aufteilen und die tatsächlich trainierten Token kontrollieren.
  3. Einen kurzen LoRA-Probelauf starten, Speicherverbrauch prüfen und anschließend den geplanten Kleinversuch ausführen.
  4. Den Adapter auf unabhängigen Aufgaben bewerten und eine einzelne Trainings- oder Datenentscheidung gezielt verändern.
  5. Adapter und Metadaten exportieren, in einer frischen Sitzung laden und den Vergleichstest wiederholen.
  6. Eine nachvollziehbare Entscheidung über weitere Anpassung, Verwerfung oder begrenzte Pilotierung festhalten.

Schulungsumgebung

Der Kunde stellt eine vorab getestete GPU-Trainingsumgebung mit festgelegten Softwareständen und einem passenden kleinen Modell bereit. Die Trainingsdaten werden vorab freigegeben. Längere Referenzläufe können vorbereitet vorliegen; mindestens ein kurzer Anpassungslauf wird praktisch durchgeführt.

Fachliche Ansprechpartner

Seminardetails

Dauer: 4 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr
Preis: Öffentlich oder Live Stream: € 2.396 zzgl. MwSt.
Inhaus: € 6.800 zzgl. MwSt.
Teilnehmeranzahl: min. 2 - max. 8
Teilnehmer: Machine-Learning-Engineers, NLP-Entwickler und Data Scientists mit praktischer Python- und Modellinferenzerfahrung.
Voraussetzungen: Sicherer Umgang mit Python, Grundkenntnisse in PyTorch und Erfahrung mit Trainings- und Testdatensätzen. Die Seminare Datenaufbereitung sowie Evaluation oder gleichwertige Kenntnisse werden vorausgesetzt.
Standorte: Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg
Schulungsumgebung: Wird vom Kunden gestellt und vorab technisch abgestimmt
Methoden: Vortrag, Demonstrationen, praktische Übungen am System
Seminararten: Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht
Durchführungsgarantie: ja, ab 2 Teilnehmern
Sprache: Deutsch - bei Firmenseminaren ist auch Englisch möglich
Seminarunterlage: Dokumentation auf Datenträger oder als Download
Teilnahmezertifikat: ja, selbstverständlich
Verpflegung: Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch)
Support: 3 Anrufe im Seminarpreis enthalten
Barrierefreier Zugang: an den meisten Standorten verfügbar
  Weitere Informationen unter + 49 (221) 74740055

Seminartermine

Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.

Seminar Startdatum Enddatum Ort Dauer
Essen 4 Tage
Darmstadt 4 Tage
Frankfurt 4 Tage
Paderborn 4 Tage
Flensburg 4 Tage
Konstanz 4 Tage
Freiburg 4 Tage
Potsdam 4 Tage
Rostock 4 Tage
Hamburg 4 Tage
Leipzig 4 Tage
Hamm 4 Tage
Stuttgart 4 Tage
Dresden 4 Tage
Luxemburg 4 Tage
Hannover 4 Tage
Jena 4 Tage
Trier 4 Tage
Madgeburg 4 Tage
Regensburg 4 Tage
Kassel 4 Tage
Ulm 4 Tage
München 4 Tage
Friedrichshafen 4 Tage
Köln 4 Tage
Wuppertal 4 Tage
Münster 4 Tage
Nürnberg 4 Tage
Erfurt 4 Tage
Bremen 4 Tage
Berlin 4 Tage
Mainz 4 Tage
Nach oben
Seminare als Stream SRI zertifiziert
© 2026 www.seminar-experts.de All rights reserved. | Kontakt | Impressum | Cookie-Einstellungen | Nach oben