Seminar / Training
Text Mining verbindet kontrollierte Wissensmodelle mit unstrukturierten Dokumenten. Das Seminar zeigt, wie ein belastbares Corpus vorbereitet, der Extractor konfiguriert, Scoring kalibriert und Auto-Tagging in nachgelagerte Prozesse eingebunden wird. Die Bewertung erfolgt anhand fachlich geprüfter Dokumente statt ausschließlich technischer Erfolgsanzeigen.
Inhaltsverzeichnis
- Zielsetzung
- Kompetenzziele
- Seminarinhalte
- Praxisübungen
- Zielgruppe und Voraussetzungen
- Methodik und Qualitätssicherung
Zielsetzung
Ziel ist eine nachvollziehbare Extraktions- und Tagging-Konfiguration, deren Qualität gemessen und iterativ verbessert werden kann. Taxonomiequalität, Dokumentqualität und technische Parameter werden als getrennte Stellhebel behandelt.
Kompetenzziele
- Repräsentative Corpora und Teststichproben aufbauen.
- Extractor-Regeln, Sprachen und Taxonomien konfigurieren.
- Scoring und Disambiguierung anhand von Precision und Recall kalibrieren.
- Auto-Tagging samt Fehlerpfad in Content-Prozesse integrieren.
Seminarinhalte
3.1 Use-Case-Auswahl und Anforderungsanalyse
- Geschäftsproblem, Nutzergruppen, Informationsobjekte und gewünschte Entscheidungen präzise beschreiben.
- Such-, Tagging-, Integrations-, Governance- und KI-Anforderungen getrennt priorisieren.
- Messbare Qualitätskriterien für Abdeckung, Präzision, Aktualität und Nachvollziehbarkeit definieren.
- Einen abgegrenzten Pilotumfang mit Datenquellen, Verantwortlichkeiten und Abnahmekriterien festlegen.
3.2 Corpus Management und Dokumentvorbereitung
- Repräsentative Dokumente, Formate, Sprachen und Metadaten für das Corpus auswählen.
- Dokumente bereinigen, Dubletten behandeln und fachlich ungeeignete Inhalte aussortieren.
- Corpus mit nachvollziehbarer Struktur und versioniertem Datenstand anlegen.
- Stichprobe auf Textqualität, Zeichensatz, Metadaten und Extraktionsfähigkeit prüfen.
3.3 Extractor-Konfiguration
- Relevante Taxonomien, Sprachen und Dokumentfelder für die Extraktion auswählen.
- Regeln für Begriffserkennung, zusammengesetzte Begriffe und Kontext festlegen.
- Testdokumente verarbeiten und erkannte Konzepte samt Fundstellen untersuchen.
- Konfiguration iterativ anpassen und Änderungen mit Vergleichsdokumenten verifizieren.
3.4 Scoring, Schwellenwerte und Disambiguierung
- Scores für Relevanz, Häufigkeit, Position und semantischen Kontext unterscheiden.
- Schwellenwerte anhand positiver und negativer Beispieldokumente kalibrieren.
- Mehrdeutige Begriffe über Kontext, Hierarchie und Ausschlussregeln behandeln.
- Precision und Recall stichprobenbasiert vergleichen und Entscheidung dokumentieren.
3.5 Auto-Tagging und Metadatenanreicherung
- Zielmetadaten, Tagging-Tiefe und zulässige Konzepte definieren.
- Extraktionsergebnisse in das gewünschte Austausch- oder Indexformat überführen.
- Tagging in einen Beispielprozess für CMS, DMS, DAM oder Suchindex integrieren.
- Fehlerfälle, leere Ergebnisse und veraltete Taxonomiestände kontrolliert behandeln.
3.6 Evaluation und kontinuierliche Verbesserung
- Goldstandard oder fachlich geprüfte Stichprobe für die Bewertung erstellen.
- Fehlende, falsche und zu allgemeine Tags getrennt erfassen.
- Ursache Taxonomie, Textqualität, Konfiguration oder Schwellenwert zuordnen.
- Verbesserungszyklus mit Änderung, Retest und Freigabe etablieren.
3.7 Mehrsprachige Modellierung
- Sprachumfang, Referenzsprache und Übersetzungsverantwortung pro Projekt festlegen.
- Bevorzugte und alternative Benennungen sprachspezifisch pflegen und Sprach-Tags kontrollieren.
- Nicht deckungsgleiche Begriffe über Scope Notes statt erzwungener Eins-zu-eins-Übersetzungen behandeln.
- Sprachabdeckung prüfen und fehlende oder widersprüchliche Benennungen priorisieren.
3.8 API-Tests und Fehlerbehandlung
- Vertragstests für Pflichtfelder, Datentypen, Statuscodes und Antwortschema definieren.
- Last-, Paging- und Größenlimits mit realistischen Testdaten prüfen.
- Retry, Timeout, Circuit Breaker und idempotente Verarbeitung passend zum Aufruf festlegen.
- Technische Protokolle und fachliche Auditdaten ohne sensible Inhalte strukturieren.
Praxisübungen
4.1 Corpus und Goldstandard vorbereiten
- Dokumente nach Sprache und Fachbereich auswählen.
- Dubletten und ungeeignete Inhalte entfernen.
- Erwartete Tags für eine Prüfstichprobe festlegen.
4.2 Extractor kalibrieren
- Taxonomie und Dokumentfelder konfigurieren.
- Testextraktion ausführen.
- Scores und Fehlzuordnungen analysieren und Schwellenwerte anpassen.
4.3 Auto-Tagging integrieren
- Zielmetadaten und Austauschformat definieren.
- Tags in einen Beispielindex oder Content-Prozess übertragen.
- Leere Ergebnisse und veralteten Taxonomiestand als Fehlerfälle testen.
Zielgruppe und Voraussetzungen
Zielgruppe: Content Management, Wissensmanagement, Search Engineering, Data Science, technische Redaktion und Informationsarchitektur.
Voraussetzungen: Grundkenntnisse in Taxonomien, Dokumentmetadaten und Content-Prozessen. Technische API-Kenntnisse sind für die Integrationsübung hilfreich, aber nicht zwingend.
Methodik und Qualitätssicherung
Die Vermittlung kombiniert strukturierte Fachimpulse, Demonstrationen, moderierte Modellierungs- oder Konfigurationsschritte und praktische Übungen. Jeder Arbeitsblock endet mit einer prüfbaren Zwischenkontrolle.
- Ausgangszustand und Lernziel werden vor jedem Arbeitsauftrag festgelegt.
- Konfigurationen und Modelle werden schrittweise aufgebaut und dokumentiert.
- Positiv-, Negativ- und Grenzfälle werden anhand definierter Kriterien geprüft.
- Abweichungen werden analysiert, korrigiert und in einer erneuten Prüfung bestätigt.
Fachbereichsleitung, Trainerteam und Ansprechpersonen
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 3 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 1.797 zzgl. MwSt. Inhaus: € 5.100 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Content Management, Wissensmanagement, Search Engineering, Data Science, technische Redaktion und Informationsarchitektur. |
| Voraussetzungen: | Grundkenntnisse in Taxonomien, Dokumentmetadaten und Content-Prozessen. Technische API-Kenntnisse sind für die Integrationsübung hilfreich, aber nicht zwingend. |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, moderierte Fallarbeit und praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhouse und Workshop |
| Durchführungsgarantie: | ja, ab 2 Teilnehmenden |
| Sprache: | Deutsch; bei Firmenseminaren ist Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
