Seminar Evaluation und Qualitätssicherung für domänenspezifische Sprachmodelle

Allgemeine Bestenlisten sagen wenig darüber aus, ob ein Modell interne Fachbegriffe korrekt verwendet, verbindliche Antwortformate einhält oder bei unzureichender Evidenz zuverlässig ablehnt. Qualitätssicherung muss deshalb von den konkreten Aufgaben, Fehlerfolgen und Betriebsbedingungen der Domäne ausgehen.

Das Seminar zeigt, wie aus fachlichen Erwartungen eine wiederholbare Testsuite entsteht. Deterministische Metriken, semantische Bewertungen, menschliche Prüfung und modellgestützte Judges werden so kombiniert, dass ihre jeweiligen Schwächen sichtbar und kontrollierbar bleiben.

Lernziele

Nach Abschluss des Seminars können die behandelten Verfahren fachlich eingeordnet, technisch angewendet und anhand nachvollziehbarer Kriterien bewertet werden.

  • Aufgaben, Fehlerklassen, Akzeptanzgrenzen und Risikogewichte für eine Domäne definieren
  • Repräsentative Goldensets und kontrollierte Challenge-Sets ohne Trainingskontamination erstellen
  • Passende Metriken für Klassifikation, Extraktion, Generierung, RAG und strukturierte Ausgaben auswählen
  • LLM-Judges mit menschlichen Bewertungen kalibrieren und auf Verzerrungen prüfen
  • Qualitäts-, Sicherheits- und Leistungsregressionen in Freigabeprozesse integrieren

Seminarinhalte

Die Inhalte verbinden Grundlagen, Architekturentscheidungen und praktische Umsetzung in einer konsistenten Arbeitsumgebung.

Evaluationsdesign

  • Task Taxonomy, Nutzergruppen, Fehlerkosten und risikobasierte Gewichtung
  • Goldenset, Holdout, Challenge-Set, adversariale Fälle und zeitbasierte Tests
  • Stichprobengröße, Konfidenz, Varianz durch Sampling und reproduzierbare Generationsparameter
  • Kontamination, Doppelungen und unbeabsichtigte Hinweise in Testdaten

Metriken und Bewertungsverfahren

  • Exact Match, Precision, Recall, F1, Edit-Distanz und schema-basierte Validierung
  • Semantische Ähnlichkeit, Faktentreue, Vollständigkeit, Relevanz und Ablehnungsverhalten
  • Retrieval-Metriken, Kontexttreue und Antwortqualität bei RAG-Systemen
  • Rubrics, paarweiser Vergleich, Blind Review und Inter-Rater-Übereinstimmung
  • LLM-as-Judge, Positions- und Längenbias, Kalibrierung und menschliche Kontrollstichproben

Robustheit, Sicherheit und Leistung

  • Promptvarianten, Tippfehler, Mehrsprachigkeit, lange Eingaben und fachliche Grenzfälle
  • Prompt Injection, sensible Daten, unerlaubte Inhalte, unsichere Code- oder Tool-Ausgaben
  • Latenz, Time to First Token, Tokens pro Sekunde, Durchsatz und Ressourcenverbrauch
  • Qualitätsvergleich vor und nach Fine-Tuning, Quantisierung oder Modellwechsel

Kontinuierliche Qualitätssicherung

  • Versionierte Testfälle, Schwellenwerte, Freigabegates und Fehlerbudgets
  • CI-Ausführung, Ergebnisprotokoll, Vergleichsberichte und Ursachenanalyse
  • Produktionsstichproben, Nutzerfeedback, Driftindikatoren und Datenschutz bei Logs
  • Canary, A/B-Vergleich, Rollback und erneute fachliche Freigabe

Praktische Übungen

Die Übungen werden an einem durchgängigen, produktneutralen Beispielszenario durchgeführt und mit prüfbaren Kriterien ausgewertet.

  • Aus einem Fachprozess Fehlerklassen und eine gewichtete Scorecard ableiten
  • Eine kleine domänenspezifische Testsuite mit automatischen Prüfern implementieren
  • Einen Judge gegen menschliche Bewertungen kalibrieren und Abweichungen analysieren
  • Zwei Modell- oder Quantisierungsvarianten einschließlich Leistungswerten vergleichen
  • Freigabeschwellen und Regressionstest für eine Modellpipeline definieren

Zielgruppe

Geeignet für Teams, die Modellqualität nicht durch Einzelprompts, sondern anhand nachvollziehbarer Prüfverfahren bewerten müssen. Fachprüfer und technische Rollen arbeiten dabei mit derselben Scorecard.

Methodik

Fachliche Einordnung, Trainerdemonstrationen, geführte Laborabschnitte, eigenständige Übungen und gemeinsame Auswertung wechseln einander ab. Konfigurationen und Entscheidungen werden so dokumentiert, dass sie nach dem Seminar reproduzierbar bleiben.

Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner

Seminardetails

   
Dauer: 2 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, 2. Tag: 09:00 Uhr
Preis: Öffentlich oder Live Stream: € 1.198 zzgl. MwSt.
Inhaus: € 3.400 zzgl. MwSt.
Teilnehmeranzahl: min. 2 - max. 8
Teilnehmer: Data Scientists, ML Engineers, QA Engineers, Fachprüfer, Product Owner, MLOps- und KI-Governance-Teams
Voraussetzungen: Grundkenntnisse zu Sprachmodellen; Python-Grundkenntnisse sind für die Übungen hilfreich
Standorte: Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg
Methoden: Vortrag, Demonstrationen, praktische Übungen am System
Seminararten: Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht
Durchführungsgarantie: ja, ab 2 Teilnehmern
Sprache: Deutsch - bei Firmenseminaren ist auch Englisch möglich
Seminarunterlage: Dokumentation auf Datenträger oder als Download
Teilnahmezertifikat: ja, selbstverständlich
Verpflegung: Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch)
Support: 3 Anrufe im Seminarpreis enthalten
Barrierefreier Zugang: an den meisten Standorten verfügbar
  Weitere Informationen unter + 49 (221) 74740055

Seminartermine

Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.

Seminar Startdatum Enddatum Ort Dauer
Leipzig 2 Tage
Hamm 2 Tage
Rostock 2 Tage
Hamburg 2 Tage
Luxemburg 2 Tage
Hannover 2 Tage
Stuttgart 2 Tage
Dresden 2 Tage
Madgeburg 2 Tage
Regensburg 2 Tage
Jena 2 Tage
Trier 2 Tage
München 2 Tage
Friedrichshafen 2 Tage
Kassel 2 Tage
Ulm 2 Tage
Münster 2 Tage
Nürnberg 2 Tage
Köln 2 Tage
Wuppertal 2 Tage
Bremen 2 Tage
Berlin 2 Tage
Mainz 2 Tage
Erfurt 2 Tage
Darmstadt 2 Tage
Frankfurt 2 Tage
Paderborn 2 Tage
Essen 2 Tage
Konstanz 2 Tage
Freiburg 2 Tage
Potsdam 2 Tage
Flensburg 2 Tage
Hamm 2 Tage
Rostock 2 Tage
Hamburg 2 Tage
Leipzig 2 Tage
Hannover 2 Tage
Stuttgart 2 Tage
Dresden 2 Tage
Luxemburg 2 Tage
Nach oben
Seminare als Stream SRI zertifiziert
© 2026 www.seminar-experts.de All rights reserved. | Kontakt | Impressum | Nach oben