Ein einzelner Benchmarkwert reicht für die Entscheidung über eine KI-Anwendung selten aus. Dieses Seminar entwickelt ein mehrstufiges Bewertungsverfahren, das technische Lauffähigkeit, Sprachleistung, Aufgabenqualität und betriebliche Anforderungen getrennt untersucht. Im OpenEuroLLM-Kontext werden Forschungsmodelle und experimentelle Instruktionsvarianten anhand ihrer dokumentierten Zwecke eingeordnet.
Die Übungen verbinden standardisierte Aufgaben mit einem kleinen, selbst entworfenen Abnahmekatalog. Identische Testfälle werden unter kontrollierten Bedingungen auf verschiedenen Modellständen oder Konfigurationen ausgeführt. Neben Mittelwerten werden Unterschiede zwischen Sprachen, kritische Einzelfehler und die Stabilität der Beurteilung betrachtet.
Das Projektwerkzeug oellm-eval dient insbesondere der Planung und Sammlung von Evaluationen auf HPC-Systemen. Seine Aufgaben und Konfigurationen werden analysiert; lokale Übungen nutzen eine dafür geeignete vorbereitete Ausführungsumgebung. Clusteraufträge werden nur bei entsprechend bereitgestelltem Zugang ausgeführt. Ein vollständiger HPC-Benchmarklauf ist keine Voraussetzung für den Lernerfolg.
Lernziele
- Einen fachlichen Testkatalog mit eindeutigen Bewertungskriterien erstellen.
- Modellvergleiche einschließlich Versionen, Parametern und Datensplits reproduzierbar ausführen.
- Unterschiede zwischen Sprachen und Fehlertypen bewerten, ohne aus kleinen Stichproben unbelegte Garantien abzuleiten.
- Freigabegrenzen und Regressionstests für Modell- und Anwendungsänderungen festlegen.
Inhaltsverzeichnis
- Bewertungsziele und Modellrollen
- Mehrsprachige Testdaten
- Werkzeuge und reproduzierbare Messung
- Bewertung und Fehleranalyse
- Langkontext und Anwendungsqualität
- Freigabe und Regression
Seminarinhalte
Bewertungsziele und Modellrollen
- Basismodell, Instruktionsmodell und vollständige Anwendung anhand unterschiedlicher Aufgaben bewerten.
- Einfache Funktionstests, Forschungsbenchmarks und fachliche Abnahmeprüfungen voneinander abgrenzen.
- Messziele für Textverständnis, Antwortformat, Aufgabenlösung und Laufzeit festlegen.
Mehrsprachige Testdaten
- Ein Testset mit festgelegten Sprachen, Fachbegriffen und Schwierigkeitsstufen entwerfen.
- Übersetzungseffekte, kulturelle Besonderheiten und unterschiedliche Tokenlängen berücksichtigen.
- Testdaten von Trainings- und Abstimmungsdaten trennen und Herkunft sowie Version dokumentieren.
Werkzeuge und reproduzierbare Messung
- Aufgabenfamilien wie Belebele oder Global MMLU anhand einer kleinen freigegebenen Auswahl einordnen.
- Die Rollen von oellm-eval, lokalen Evaluationswerkzeugen, Containerumgebungen und Slurm verstehen.
- Checkpoint, Tokenizer, Eingabeformat, Decodierungsparameter und Rohantworten für jeden Lauf speichern.
Bewertung und Fehleranalyse
- Korrektheit, Vollständigkeit, Formatkonformität und unbelegte Aussagen getrennt bewerten.
- Menschliche Bewertung mit einem Kriterienraster durchführen und Abweichungen zwischen Prüfern klären.
- Modellgestützte Bewertung auf Positions-, Stil- und Sprachverzerrungen untersuchen.
Langkontext und Anwendungsqualität
- Konfigurierte Kontextlänge, tatsächlich verarbeitete Länge und zuverlässige Informationsnutzung getrennt messen.
- Abruf einfacher Textstellen von der Zusammenführung mehrerer widersprüchlicher Dokumente unterscheiden.
- Bei Wissensassistenten Fehler im Retrieval und Fehler in der Antwortgenerierung getrennt diagnostizieren.
Freigabe und Regression
- Mindestwerte, kritische Ausschlussfehler und Regeln für unzureichende Stichproben festlegen.
- Zwei Modellstände anhand identischer Daten vergleichen und Messstreuung transparent darstellen.
- Eine wiederholbare Abnahme für Änderungen an Modell, Prompt, Adapter oder Wissensbestand einrichten.
Praktische Übungen
- Für eine fiktive interne Auskunftsanwendung einen Abnahmekatalog mit drei Sprachen erstellen.
- Einen Baseline-Lauf mit festgehaltener Modellrevision und unveränderten Decodierungsparametern durchführen.
- Rohantworten unabhängig bewerten, Abweichungen abgleichen und das Kriterienraster verbessern.
- Eine Modell- oder Promptänderung einführen und dieselben Aufgaben erneut ausführen.
- Fehler nach Ursache und Sprache aufschlüsseln und eine begründete Freigabe- oder Rückstellungsentscheidung dokumentieren.
Schulungsumgebung
Der Kunde stellt Python-Arbeitsplätze und einen geprüften Modellzugang bereit. Für lokale Übungen genügen begrenzte Datenausschnitte und abgestimmte Kontextlängen. Ein optionaler Slurm-Zugang wird separat vorbereitet; aus der Teilnahme ergibt sich kein Zugang zu EuroHPC-Ressourcen.
Fachliche Ansprechpartner
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 3 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr |
|---|---|
| Preis: |
Öffentlich oder Live Stream: € 1.797 zzgl. MwSt. Inhaus: € 5.100 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | KI-Entwickler, Data Scientists, Qualitätssicherungsverantwortliche, technische Produktverantwortliche und Fachprüfer für KI-Anwendungen. |
| Voraussetzungen: | Grundlagen von Sprachmodellen, erste Python-Erfahrung und die Fähigkeit, einen vorhandenen Inferenzendpunkt oder eine vorbereitete Modelllaufzeit zu verwenden. Grundbegriffe der deskriptiven Statistik sind hilfreich. |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Schulungsumgebung: | Wird vom Kunden gestellt und vorab technisch abgestimmt |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
