Seminar Continued Pretraining und Tokenizer-Anpassung für domänenspezifische Sprachmodelle

Continued Pretraining passt die statistische Sprach- und Wissensrepräsentation eines vorhandenen Basismodells an umfangreiche Domänentexte an. Es ist deutlich aufwendiger als ein LoRA-basiertes Instruction Tuning und nur dann sinnvoll, wenn Terminologie, Sprachmuster oder fachliche Zusammenhänge mit Prompting, RAG und aufgabenspezifischem Fine-Tuning nicht ausreichend erfasst werden.

Das Seminar trennt drei häufig vermischte Entscheidungen: Fortsetzung des Sprachmodelltrainings, Anpassung des Tokenizers und anschließendes Instruction Tuning. Jede Maßnahme wird gegen eine unveränderte Baseline geprüft, damit Domänengewinne nicht mit dem Verlust allgemeiner Sprach-, Sicherheits- oder Instruktionsfähigkeiten erkauft werden.

Lernziele

Nach Abschluss des Seminars können die behandelten Verfahren fachlich eingeordnet, technisch angewendet und anhand nachvollziehbarer Kriterien bewertet werden.

  • Continued Pretraining von RAG, Supervised Fine-Tuning und Präferenzoptimierung fachlich abgrenzen
  • Einen ausreichend großen und ausgewogenen Domänencorpus mit Replay-Daten zusammenstellen
  • Tokenisierungseffizienz, Fachterminologie und Sequenzlängen systematisch analysieren
  • Tokenizer-Erweiterung oder Neutraining einschließlich Embedding-Anpassung risikobasiert planen
  • Causal-Language-Modeling mit reproduzierbaren Checkpoints und Speicheroptimierung ausführen
  • Domänengewinn, allgemeine Fähigkeiten und unerwünschtes Vergessen gemeinsam evaluieren

Seminarinhalte

Die Inhalte verbinden Grundlagen, Architekturentscheidungen und praktische Umsetzung in einer konsistenten Arbeitsumgebung.

Entscheidung und Trainingsziel

  • Geeignete Fälle: stark abweichende Fachsprache, seltene Terminologie, Spezialsyntax und umfangreiche Domänencorpora
  • Ungeeignete Fälle: häufig wechselnde Fakten, kleine Datensätze, reine Ausgabeformatierung und fehlende Evaluationsbasis
  • Causal-Language-Modeling, Domain-Adaptive und Task-Adaptive Continued Pretraining
  • Vollständige Gewichtsanpassung, Adapter-basiertes Continued Pretraining und abgestufte Alternativen

Corpus und Datenmischung

  • Domänenabdeckung, Zeitstände, Quellenklassen, Sprachverteilung und Qualitätsfilter
  • Deduplizierung, Sequenzbildung, Packing und Vermeidung überrepräsentierter Dokumenttypen
  • Replay- oder General-Domain-Anteile zum Erhalt vorhandener Fähigkeiten
  • Trainings-, Validierungs- und Holdout-Corpora ohne Dokument- oder Zeitüberschneidungen
  • Tokenbudget, Epochenäquivalent und Abbruchkriterien statt bloßer Dokumentanzahl

Tokenizer-Diagnose und -Anpassung

  • Fertility, Zeichen pro Token, Sequenzaufblähung und Zerlegung von Fachbegriffen
  • Auswirkungen schlechter Tokenisierung auf Kontextbudget, Latenz und Lernbarkeit
  • Erweiterung eines vorhandenen Vokabulars und Größenanpassung der Embedding-Matrizen
  • Initialisierung neuer Token-Embeddings und kontrolliertes Einlernen
  • Risiken eines vollständig neu trainierten Tokenizers für Kompatibilität und vorhandene Modellgewichte

Training und Ressourcensteuerung

  • Datentypen, Batch- und Sequenzlänge, Gradient Accumulation und Checkpointing
  • Lernrate, Warmup, Scheduler, Optimizer, Gradientennormen und stabile Fortsetzung vorhandener Gewichte
  • Verteiltes Training, Sharding, Wiederanlauf und konsistente Datenreihenfolge
  • Experimentprotokoll, Seeds, Checkpoints, Tokenizer-Version und Abhängigkeitsbindung
  • Loss-Verlauf, Validierungsperplexität, Datenfehler und Anzeichen von Überanpassung

Evaluation und nachgelagerte Anpassung

  • Perplexität auf Domänen-, Allgemein- und Sicherheitscorpora
  • Fachaufgaben, Sprachqualität, seltene Terminologie und lange Kontexte
  • Regression allgemeiner Fähigkeiten und Vergleich gegen RAG- oder SFT-Baselines
  • Erforderliches Instruction Tuning nach dem Continued Pretraining
  • Dokumentation von Basismodell, Trainingsdaten, Rechenlauf, Änderungen und bekannten Grenzen

Praktische Übungen

Die Übungen werden an einem durchgängigen, produktneutralen Beispielszenario durchgeführt und mit prüfbaren Kriterien ausgewertet.

  • Domänencorpus und Replay-Mischung anhand messbarer Kriterien planen
  • Tokenizer-Fertility und Sequenzaufblähung für Fachtexte auswerten
  • Tokenizer kontrolliert erweitern und Embedding-Größe anpassen
  • Einen begrenzten Continued-Pretraining-Lauf konfigurieren und überwachen
  • Domänenperplexität, Fachaufgabe und allgemeine Regression gemeinsam vergleichen
  • Entscheidungsvorlage für Continued Pretraining, RAG oder SFT erstellen

Zielgruppe

Das Seminar richtet sich an erfahrene technische Teams mit einem belastbaren Domänencorpus und eigenen Trainingsressourcen. Drei Tage sind erforderlich, weil Tokenizer-Diagnose, Trainingslauf und Evaluation jeweils praktisch durchgeführt werden; für umfangreiche Produktionsläufe wird anschließend zusätzliche Rechenzeit benötigt.

Methodik

Fachliche Einordnung, Trainerdemonstrationen, geführte Laborabschnitte, eigenständige Übungen und gemeinsame Auswertung wechseln einander ab. Konfigurationen und Entscheidungen werden so dokumentiert, dass sie nach dem Seminar reproduzierbar bleiben.

Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner

Seminardetails

   
Dauer: 3 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage: 09:00 Uhr
Preis: Öffentlich oder Live Stream: € 1.797 zzgl. MwSt.
Inhaus: € 5.100 zzgl. MwSt.
Teilnehmeranzahl: min. 2 - max. 8
Teilnehmer: ML Engineers, Data Scientists, NLP Engineers, KI-Forscher und technische Verantwortliche für eigene Modellanpassungen
Voraussetzungen: Gute Python- und Linux-Kenntnisse, praktische Grundlagen in PyTorch und Transformer-Modellen sowie Erfahrung mit Trainingspipelines
Standorte: Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg
Methoden: Vortrag, Demonstrationen, praktische Übungen am System
Seminararten: Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht
Durchführungsgarantie: ja, ab 2 Teilnehmern
Sprache: Deutsch - bei Firmenseminaren ist auch Englisch möglich
Seminarunterlage: Dokumentation auf Datenträger oder als Download
Teilnahmezertifikat: ja, selbstverständlich
Verpflegung: Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch)
Support: 3 Anrufe im Seminarpreis enthalten
Barrierefreier Zugang: an den meisten Standorten verfügbar
  Weitere Informationen unter + 49 (221) 74740055

Seminartermine

Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.

Seminar Startdatum Enddatum Ort Dauer
Konstanz 3 Tage
Freiburg 3 Tage
Potsdam 3 Tage
Flensburg 3 Tage
Hamburg 3 Tage
Leipzig 3 Tage
Hamm 3 Tage
Rostock 3 Tage
Dresden 3 Tage
Luxemburg 3 Tage
Hannover 3 Tage
Stuttgart 3 Tage
Trier 3 Tage
Madgeburg 3 Tage
Regensburg 3 Tage
Jena 3 Tage
Ulm 3 Tage
München 3 Tage
Friedrichshafen 3 Tage
Kassel 3 Tage
Wuppertal 3 Tage
Münster 3 Tage
Nürnberg 3 Tage
Köln 3 Tage
Bremen 3 Tage
Berlin 3 Tage
Mainz 3 Tage
Erfurt 3 Tage
Darmstadt 3 Tage
Frankfurt 3 Tage
Paderborn 3 Tage
Essen 3 Tage
Konstanz 3 Tage
Freiburg 3 Tage
Potsdam 3 Tage
Flensburg 3 Tage
Leipzig 3 Tage
Hamm 3 Tage
Rostock 3 Tage
Hamburg 3 Tage
Nach oben
Seminare als Stream SRI zertifiziert
© 2026 www.seminar-experts.de All rights reserved. | Kontakt | Impressum | Nach oben