Bei Agenten genügt es nicht, nur die letzte Textantwort zu bewerten. Auch Werkzeugauswahl, Argumente, Reihenfolge, Zustandsänderungen, Abbruchverhalten und Ressourceneinsatz entscheiden über Qualität. Das Seminar entwickelt daraus eine mehrdimensionale Evaluationsstrategie.
Nutzen
Teilnehmende können messbare Qualitätsziele definieren, geeignete Evaluatoren auswählen und Ergebnisse statistisch wie fachlich einordnen. Ein vollständiger Ablauf von der Datensatzpflege über Experimente bis zur Online-Überwachung wird praktisch aufgebaut.
Lernziele
- fachliche, technische, sicherheitsbezogene und wirtschaftliche Qualitätsdimensionen operationalisieren
- textuelle und multimodale Datensätze mit Referenzantworten, Rubriken, Metadaten und Schwierigkeitsklassen erstellen
- deterministische, modellgestützte und menschliche Bewertungen kombinieren
- Evaluatoren kalibrieren und Regressionen mit belastbaren Freigabeschwellen erkennen
- Offline- und Online-Evaluation in einen kontinuierlichen Verbesserungsprozess integrieren
Für wen ist das Seminar geeignet?
AI Engineers, Data Scientists, QA-Fachkräfte, Fachverantwortliche, Product Owner, Prompt Engineers und Teams für AI Governance.
Voraussetzungen
Grundkenntnisse in generativer KI und agentischen Abläufen; grundlegende Python-Kenntnisse sind für die Übungen hilfreich.
Seminarinhalte
Evaluationsarchitektur
- Outcome-, Trajectory-, Step-, State- und Systembewertung
- Fachliche Korrektheit, Vollständigkeit, Relevanz, Sicherheit, Latenz und Kosten
- Task-Erfolg, Tool-Erfolg, Eskalation und kontrollierter Abbruch
- RAG-Groundedness, Retrieval-Qualität, Memory-Korrektheit und Zustandskonsistenz
Datensätze und Ground Truth
- Golden Set, Grenzfälle, Fehlersammlung und adversariale Fälle
- Text-, Bild-, Audio-, Datei- und strukturierte Eingaben
- Produktionsbeispiele, Datenschutz, Anonymisierung und Datenleckage
- Versionierung, Splits, Schwierigkeitsgrade und Abdeckungsmatrix
Evaluatoren
- Exakte Assertions, Schema- und Vertragstests
- Heuristiken, domänenspezifische Regeln und externe Prüffunktionen
- LLM-as-a-Judge mit Rubrik, strukturierter Ausgabe und Begründung
- Paarvergleich, Ranking und zusammengesetzte Scores
Kalibrierung und Statistik
- Human Review und Richtlinien für Annotierende
- Inter-Rater-Übereinstimmung und Konfliktklärung
- Judge-Bias, Positionseffekte, Selbstbevorzugung und Kontamination
- Konfidenzintervalle, Varianz und sinnvolle Schwellenwerte
Experimente und Regression
- Baseline-Vergleich für Modell-, Prompt-, Tool- und Retriever-Änderungen
- Fehlercluster, Segmentierung und Ursachenanalyse
- Qualitätsgates und gewichtete Risikoklassen
Online-Evaluation
- Stichproben, gezielte Trigger und kontinuierliche Bewertung
- Nutzerfeedback, operative Signale, Verhaltens- und Daten-Drift
- Bewertung mehrturniger Sitzungen und langlaufender Tasks
- Rückführung geeigneter Produktionsfälle in kuratierte Tests
Praxisanteil
Ein Evaluationspaket für einen mehrstufigen Serviceagenten wird erstellt: Qualitätsrubrik, Golden Set, deterministische Prüfer, ein kalibrierter Judge, Vergleich zweier Varianten und ein Freigabebericht mit Fehlerclustern.
Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 3 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 1.797 zzgl. MwSt. Inhaus: € 5.100 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | AI Engineers, Data Scientists, QA-Fachkräfte, Fachverantwortliche, Product Owner, Prompt Engineers und Teams für AI Governance. |
| Voraussetzungen: | Grundkenntnisse in generativer KI und agentischen Abläufen; grundlegende Python-Kenntnisse sind für die Übungen hilfreich. |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, Gruppenarbeit und praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhouse, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
