Seminar OpenEuroLLM: Evaluation, Benchmarking und Qualitätssicherung

Ein einzelner Benchmarkwert reicht für die Entscheidung über eine KI-Anwendung selten aus. Dieses Seminar entwickelt ein mehrstufiges Bewertungsverfahren, das technische Lauffähigkeit, Sprachleistung, Aufgabenqualität und betriebliche Anforderungen getrennt untersucht. Im OpenEuroLLM-Kontext werden Forschungsmodelle und experimentelle Instruktionsvarianten anhand ihrer dokumentierten Zwecke eingeordnet.

Die Übungen verbinden standardisierte Aufgaben mit einem kleinen, selbst entworfenen Abnahmekatalog. Identische Testfälle werden unter kontrollierten Bedingungen auf verschiedenen Modellständen oder Konfigurationen ausgeführt. Neben Mittelwerten werden Unterschiede zwischen Sprachen, kritische Einzelfehler und die Stabilität der Beurteilung betrachtet.

Das Projektwerkzeug oellm-eval dient insbesondere der Planung und Sammlung von Evaluationen auf HPC-Systemen. Seine Aufgaben und Konfigurationen werden analysiert; lokale Übungen nutzen eine dafür geeignete vorbereitete Ausführungsumgebung. Clusteraufträge werden nur bei entsprechend bereitgestelltem Zugang ausgeführt. Ein vollständiger HPC-Benchmarklauf ist keine Voraussetzung für den Lernerfolg.

Lernziele

  • Einen fachlichen Testkatalog mit eindeutigen Bewertungskriterien erstellen.
  • Modellvergleiche einschließlich Versionen, Parametern und Datensplits reproduzierbar ausführen.
  • Unterschiede zwischen Sprachen und Fehlertypen bewerten, ohne aus kleinen Stichproben unbelegte Garantien abzuleiten.
  • Freigabegrenzen und Regressionstests für Modell- und Anwendungsänderungen festlegen.

Inhaltsverzeichnis

  1. Bewertungsziele und Modellrollen
  2. Mehrsprachige Testdaten
  3. Werkzeuge und reproduzierbare Messung
  4. Bewertung und Fehleranalyse
  5. Langkontext und Anwendungsqualität
  6. Freigabe und Regression

Seminarinhalte

Bewertungsziele und Modellrollen

  • Basismodell, Instruktionsmodell und vollständige Anwendung anhand unterschiedlicher Aufgaben bewerten.
  • Einfache Funktionstests, Forschungsbenchmarks und fachliche Abnahmeprüfungen voneinander abgrenzen.
  • Messziele für Textverständnis, Antwortformat, Aufgabenlösung und Laufzeit festlegen.

Mehrsprachige Testdaten

  • Ein Testset mit festgelegten Sprachen, Fachbegriffen und Schwierigkeitsstufen entwerfen.
  • Übersetzungseffekte, kulturelle Besonderheiten und unterschiedliche Tokenlängen berücksichtigen.
  • Testdaten von Trainings- und Abstimmungsdaten trennen und Herkunft sowie Version dokumentieren.

Werkzeuge und reproduzierbare Messung

  • Aufgabenfamilien wie Belebele oder Global MMLU anhand einer kleinen freigegebenen Auswahl einordnen.
  • Die Rollen von oellm-eval, lokalen Evaluationswerkzeugen, Containerumgebungen und Slurm verstehen.
  • Checkpoint, Tokenizer, Eingabeformat, Decodierungsparameter und Rohantworten für jeden Lauf speichern.

Bewertung und Fehleranalyse

  • Korrektheit, Vollständigkeit, Formatkonformität und unbelegte Aussagen getrennt bewerten.
  • Menschliche Bewertung mit einem Kriterienraster durchführen und Abweichungen zwischen Prüfern klären.
  • Modellgestützte Bewertung auf Positions-, Stil- und Sprachverzerrungen untersuchen.

Langkontext und Anwendungsqualität

  • Konfigurierte Kontextlänge, tatsächlich verarbeitete Länge und zuverlässige Informationsnutzung getrennt messen.
  • Abruf einfacher Textstellen von der Zusammenführung mehrerer widersprüchlicher Dokumente unterscheiden.
  • Bei Wissensassistenten Fehler im Retrieval und Fehler in der Antwortgenerierung getrennt diagnostizieren.

Freigabe und Regression

  • Mindestwerte, kritische Ausschlussfehler und Regeln für unzureichende Stichproben festlegen.
  • Zwei Modellstände anhand identischer Daten vergleichen und Messstreuung transparent darstellen.
  • Eine wiederholbare Abnahme für Änderungen an Modell, Prompt, Adapter oder Wissensbestand einrichten.

Praktische Übungen

  1. Für eine fiktive interne Auskunftsanwendung einen Abnahmekatalog mit drei Sprachen erstellen.
  2. Einen Baseline-Lauf mit festgehaltener Modellrevision und unveränderten Decodierungsparametern durchführen.
  3. Rohantworten unabhängig bewerten, Abweichungen abgleichen und das Kriterienraster verbessern.
  4. Eine Modell- oder Promptänderung einführen und dieselben Aufgaben erneut ausführen.
  5. Fehler nach Ursache und Sprache aufschlüsseln und eine begründete Freigabe- oder Rückstellungsentscheidung dokumentieren.

Schulungsumgebung

Der Kunde stellt Python-Arbeitsplätze und einen geprüften Modellzugang bereit. Für lokale Übungen genügen begrenzte Datenausschnitte und abgestimmte Kontextlängen. Ein optionaler Slurm-Zugang wird separat vorbereitet; aus der Teilnahme ergibt sich kein Zugang zu EuroHPC-Ressourcen.

Fachliche Ansprechpartner

Seminardetails

Dauer: 3 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr
Preis: Öffentlich oder Live Stream: € 1.797 zzgl. MwSt.
Inhaus: € 5.100 zzgl. MwSt.
Teilnehmeranzahl: min. 2 - max. 8
Teilnehmer: KI-Entwickler, Data Scientists, Qualitätssicherungsverantwortliche, technische Produktverantwortliche und Fachprüfer für KI-Anwendungen.
Voraussetzungen: Grundlagen von Sprachmodellen, erste Python-Erfahrung und die Fähigkeit, einen vorhandenen Inferenzendpunkt oder eine vorbereitete Modelllaufzeit zu verwenden. Grundbegriffe der deskriptiven Statistik sind hilfreich.
Standorte: Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg
Schulungsumgebung: Wird vom Kunden gestellt und vorab technisch abgestimmt
Methoden: Vortrag, Demonstrationen, praktische Übungen am System
Seminararten: Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht
Durchführungsgarantie: ja, ab 2 Teilnehmern
Sprache: Deutsch - bei Firmenseminaren ist auch Englisch möglich
Seminarunterlage: Dokumentation auf Datenträger oder als Download
Teilnahmezertifikat: ja, selbstverständlich
Verpflegung: Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch)
Support: 3 Anrufe im Seminarpreis enthalten
Barrierefreier Zugang: an den meisten Standorten verfügbar
  Weitere Informationen unter + 49 (221) 74740055

Seminartermine

Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.

Seminar Startdatum Enddatum Ort Dauer
Berlin 3 Tage
Mainz 3 Tage
Erfurt 3 Tage
Bremen 3 Tage
Frankfurt 3 Tage
Paderborn 3 Tage
Essen 3 Tage
Darmstadt 3 Tage
Freiburg 3 Tage
Potsdam 3 Tage
Flensburg 3 Tage
Konstanz 3 Tage
Leipzig 3 Tage
Hamm 3 Tage
Rostock 3 Tage
Hamburg 3 Tage
Luxemburg 3 Tage
Hannover 3 Tage
Stuttgart 3 Tage
Dresden 3 Tage
Madgeburg 3 Tage
Regensburg 3 Tage
Jena 3 Tage
Trier 3 Tage
München 3 Tage
Friedrichshafen 3 Tage
Kassel 3 Tage
Ulm 3 Tage
Münster 3 Tage
Nürnberg 3 Tage
Köln 3 Tage
Wuppertal 3 Tage
Nach oben
Seminare als Stream SRI zertifiziert
© 2026 www.seminar-experts.de All rights reserved. | Kontakt | Impressum | Cookie-Einstellungen | Nach oben