Seminar / Training
Datenintegration für Wissensgraphen umfasst Quellenanalyse, Modellabbildung, Transformation, Verknüpfung, Validierung und wiederholbaren Betrieb. Werden diese Schritte isoliert behandelt, entstehen schwer wartbare Pipelines und unklare Qualitätsverantwortung.
Dieses Intensivseminar verdichtet Build-Grundlagen, tabellarische und hierarchische Quellen, Datenbanken, Web-APIs, Mapping, Entity Resolution und Datenqualität in ein fünftägiges End-to-End-Projekt. Ergebnis ist eine dokumentierte und automatisierbare Knowledge-Graph-Pipeline.
Inhaltsübersicht
- Seminarziel
- Zielgruppe
- Voraussetzungen
- Seminarinhalte
- Schritt 1: Zielgraph, Kompetenzfragen und Quellenkatalog
- Schritt 2: Build-Projekt und Dataset-Architektur
- Schritt 3: Tabellarische Quellen und Datenbanken
- Schritt 4: Hierarchische Quellen und Web-APIs
- Schritt 5: Mapping und URI-Bildung
- Schritt 6: Transformation und Datenbereinigung
- Schritt 7: Entity Resolution und Linking
- Schritt 8: SHACL-, OWL- und Workflowvalidierung
- Schritt 9: Workflow, Berichte und Wiederanlauf
- Schritt 10: Abnahme, Dokumentation und Automatisierung
- Praxisübungen
- Arbeitsweise
Seminarziel
- heterogene Datenquellen systematisch profilieren und als Datasets anbinden
- Mapping- und Transformationsregeln auf ein belastbares Zielmodell ausrichten
- Entity Resolution, Linking und Qualitätsprüfung in den Datenfluss integrieren
- einen modularen Workflow einschließlich Fehlerpfaden, Berichten und Übergabe erstellen
Zielgruppe
Data Engineers, Datenintegratoren, Knowledge Engineers, MDM-Spezialisten und technische Consultants mit Verantwortung für komplexe Datenpipelines.
Voraussetzungen
Grundkenntnisse in Datenformaten, Datenbanken und RDF. Praktische Erfahrung mit Datenintegration oder ETL-Prozessen wird vorausgesetzt.
Seminarinhalte
Schritt 1: Zielgraph, Kompetenzfragen und Quellenkatalog
Der Integrationsfall wird anhand fachlicher Fragen und eines begrenzten Zielmodells definiert. Quellsysteme werden nach Inhalt, Qualität, Änderungsfrequenz und Verantwortlichkeit katalogisiert.
- Kompetenzfragen
- Kernklassen und Beziehungen
- Quellen- und Verantwortungsmatrix
Schritt 2: Build-Projekt und Dataset-Architektur
Projektstruktur, Benennung, Umgebungsparameter und Dataset-Typen werden festgelegt. Quellen, Zwischenergebnisse, Referenzdaten und Zielgraphen bleiben klar getrennt.
- Projektkonventionen
- Dataset-Typen und Ressourcen
- Parameter und Umgebungen
Schritt 3: Tabellarische Quellen und Datenbanken
CSV-, Tabellen- und relationale Daten werden mit Schema, Datentypen, Kodierung und Abfragen angebunden. Profiling und Stichproben decken Qualitätsprobleme vor dem Mapping auf.
- CSV und Tabellen
- JDBC und SQL
- Schema-, Mengen- und Nullwertprüfung
Schritt 4: Hierarchische Quellen und Web-APIs
JSON, XML und API-Antworten werden über Pfade und Wiederholstrukturen erschlossen. Pagination, Authentisierung, Fehlerantworten und Änderungsstände werden berücksichtigt.
- JSON- und XML-Pfade
- REST- und Web-API-Zugriff
- Pagination, Rate Limits und Fehlerfälle
Schritt 5: Mapping und URI-Bildung
Quelldaten werden auf Klassen, Literale und Beziehungen abgebildet. URI-Regeln, Namespaces, Sprache und Datentypen sichern stabile Identitäten und interoperable Aussagen.
- Root Mapping und Value Mappings
- Object Mappings
- URI-, Datentyp- und Sprachregeln
Schritt 6: Transformation und Datenbereinigung
Werte werden normalisiert, zerlegt, zusammengeführt und fachlich angereichert. Wiederverwendbare Transformatoren und Referenzdaten vermeiden uneinheitliche Einzelregeln.
- String-, Datums- und Zahlentransformation
- Lookup und bedingte Regeln
- Testdaten und Regelwiederverwendung
Schritt 7: Entity Resolution und Linking
Mehrere Quellen werden über Vergleichsmerkmale und Distanzmaße zusammengeführt. Goldstandard, Schwellenwerte und Active Learning unterstützen eine messbare Regelqualität.
- Vergleichspfade und Normalisierung
- Gewichtung und Schwellen
- Active Learning und Stichproben
Schritt 8: SHACL-, OWL- und Workflowvalidierung
Struktur- und Geschäftsregeln werden in Shapes und Validierungsaufgaben umgesetzt. Fehler, Warnungen und Quarantänedaten steuern Freigabe und Nachbearbeitung.
- SHACL-Shapes
- OWL-Konsistenz
- Qualitäts-Gates und Fehlerausgabe
Schritt 9: Workflow, Berichte und Wiederanlauf
Alle Aufgaben werden in einen modularen Workflow überführt. Abhängigkeiten, Variablen, Berichte und Wiederanlaufpunkte machen den Prozess nachvollziehbar und betrieblich beherrschbar.
- Workflowdesign
- variable Eingaben
- Status, Reports und Recovery
Schritt 10: Abnahme, Dokumentation und Automatisierung
Die Pipeline wird anhand fachlicher und technischer Kriterien abgenommen. Mappingkatalog, Datenvertrag, Qualitätsbericht und Übergabepaket bilden die Grundlage für Scheduling und CI/CD.
- Test- und Abnahmekriterien
- Mapping- und Qualitätsdokumentation
- Export, Versionierung und Übergabe
Praxisübungen
- Anbindung einer tabellarischen und einer hierarchischen Quelle an ein gemeinsames Zielmodell
- Implementierung von Mapping, Bereinigung, Linking und SHACL-Validierung
- Aufbau eines vollständigen Workflows mit Fehlerpfad, Berichten und reproduzierbarer Übergabe
Arbeitsweise
Die Themen werden in aufeinander aufbauenden Arbeitsschritten vermittelt. Fachliche Einordnung, Demonstration, angeleitete Konfiguration und selbstständige Übungen wechseln sich ab. Jeder größere Arbeitsschritt wird mit einer Prüfung des erzeugten Ergebnisses und einer kurzen technischen Dokumentation abgeschlossen.
Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 5 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 2.995 zzgl. MwSt. Inhaus: € 8.500 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Data Engineers, Datenintegratoren, Knowledge Engineers, MDM-Spezialisten und technische Consultants mit Verantwortung für komplexe Datenpipelines. |
| Voraussetzungen: | Grundkenntnisse in Datenformaten, Datenbanken und RDF. Praktische Erfahrung mit Datenintegration oder ETL-Prozessen wird vorausgesetzt. |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhouse, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
