Bei kleinen Sprachmodellen wirkt sich die Qualität der Domänendaten besonders unmittelbar aus. Unklare Rechte, Dubletten, widersprüchliche Dokumentstände, personenbezogene Informationen oder ungeeignete Trainingsbeispiele werden vom Modell nicht geheilt, sondern häufig verstärkt. Deshalb beginnt verlässliches SLM Engineering mit einem kontrollierten Corpus und nicht mit einem Trainingslauf.
Das Seminar verbindet fachliche Datenanalyse mit einer reproduzierbaren technischen Pipeline. Unstrukturierte Dokumente, Tabellen, Wissensbestände, Dialoge und Prozessdaten werden in geeignete Formate für Continued Pretraining, Supervised Fine-Tuning, Präferenzlernen, RAG und Evaluation überführt.
Lernziele
Nach Abschluss des Seminars können die behandelten Verfahren fachlich eingeordnet, technisch angewendet und anhand nachvollziehbarer Kriterien bewertet werden.
- Datenquellen inventarisieren und nach Zweck, Schutzbedarf, Rechten, Aktualität und Qualität klassifizieren
- Dokumente extrahieren, normalisieren, deduplizieren, filtern und fachlich segmentieren
- Trainings-, Validierungs- und Testsätze ohne Datenleckage aufbauen
- Instruction-, Conversational-, Tool-Calling- und Präferenzdatensätze korrekt strukturieren
- Datenprovenienz, Versionierung, Qualitätsprüfungen und Freigaben automatisierbar dokumentieren
Seminarinhalte
Die Inhalte verbinden Grundlagen, Architekturentscheidungen und praktische Umsetzung in einer konsistenten Arbeitsumgebung.
Dateninventar und Governance
- Quellsysteme, Dateiformate, Eigentümerschaft, Nutzungsrechte und Aufbewahrung
- Schutzbedarfsanalyse, personenbezogene Daten, Geschäftsgeheimnisse und Mandantentrennung
- Datenspezifikation mit Domänen, Aufgaben, Sprachen, Zeitständen und Ausschlusskriterien
- Provenienz, Lineage, Versionen und reproduzierbare Datenfreigaben
Bereinigung und Qualitätssteuerung
- Textextraktion, Zeichensatzbereinigung, Normalisierung, Sprach- und Dokumentklassifikation
- Exakte und semantische Deduplizierung, Boilerplate-Erkennung und Umgang mit widersprüchlichen Quellen
- Qualitätsheuristiken, Stichproben, fachliche Reviewverfahren und automatische Prüfregeln
- Maskierung oder Entfernung sensibler Inhalte sowie kontrollierte Pseudonymisierung
Datensätze für verschiedene Anpassungsverfahren
- Rohtext und Sequenzbildung für domänenspezifisches Continued Pretraining
- Prompt-Antwort-Paare, Chat-Templates und strukturierte Zielausgaben für SFT
- Gewählte und verworfene Antworten für Präferenzoptimierung
- Dokumente, Metadaten, Chunks und Referenzfragen für RAG und Retrieval-Evaluation
- Synthetische Daten mit Qualitätsfiltern, Diversitätskontrolle und menschlicher Prüfung
Splits und Reproduzierbarkeit
- Aufteilung nach Dokument, Kunde, Zeitraum oder Vorgang statt zufälliger Zeilenaufteilung
- Erkennung von Kontamination und Überschneidungen zwischen Training und Test
- Dataset-Schemata, Fingerprints, Manifeste und automatisierte Validierung
- Speichereffiziente Verarbeitung großer Datenbestände und Streaming-Ansätze
Praktische Übungen
Die Übungen werden an einem durchgängigen, produktneutralen Beispielszenario durchgeführt und mit prüfbaren Kriterien ausgewertet.
- Ein heterogenes Beispieldateninventar erstellen und Freigabekriterien definieren
- Eine Bereinigungs- und Deduplizierungspipeline für Dokumenttexte aufbauen
- Aus Fachinhalten einen versionierten Instruction-Datensatz mit Qualitätsprüfungen erzeugen
- Trainings-, Validierungs- und Testsplits auf Leakage und Domänenabdeckung prüfen
Zielgruppe
Geeignet für technische und fachliche Rollen, die Daten für Modellanpassung, Wissenszugriff oder Qualitätstests bereitstellen. Der Schwerpunkt liegt auf reproduzierbaren Verfahren statt auf einem einzelnen Modellprodukt.
Methodik
Fachliche Einordnung, Trainerdemonstrationen, geführte Laborabschnitte, eigenständige Übungen und gemeinsame Auswertung wechseln einander ab. Konfigurationen und Entscheidungen werden so dokumentiert, dass sie nach dem Seminar reproduzierbar bleiben.
Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 2 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, 2. Tag: 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 1.198 zzgl. MwSt. Inhaus: € 3.400 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Data Engineers, Data Scientists, ML Engineers, Fachbereichsexperten, Datenverantwortliche und KI-Governance-Teams |
| Voraussetzungen: | Grundkenntnisse in Python und Datenverarbeitung; grundlegendes Verständnis von Sprachmodellen ist hilfreich |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
