Verlässliche Suche setzt aktuelle, vollständige und reproduzierbar geladene Metadaten voraus.
Das Seminar behandelt DataBuilder-Pipelines, vorhandene Extractoren, Transformationen, Loader, Suchindexaufbau, Orchestrierung, inkrementelle Läufe und Datenqualitätskontrollen.
Inhaltsübersicht
- Seminarprofil
- Zielgruppe
- Voraussetzungen
- Lernziele
- Inhalte und Schritt-für-Schritt-Anleitungen
- Praxisaufgaben
- Arbeitsweise und Qualitätssicherung
Seminarprofil
Der Schwerpunkt liegt auf das Seminar behandelt DataBuilder-Pipelines, vorhandene Extractoren, Transformationen, Loader, Suchindexaufbau, Orchestrierung, inkrementelle Läufe und Datenqualitätskontrollen. Die Inhalte werden über nachvollziehbare Entscheidungen, reproduzierbare Arbeitsschritte und dokumentierte Kontrollen vermittelt.
Zielgruppe
Data Engineers, Analytics Engineers, Plattformteams und technische Data-Governance-Verantwortliche.
Voraussetzungen
Python- und SQL-Grundkenntnisse, Erfahrung mit Datenpipelines sowie Basiswissen zu Datenbanken, APIs und Job-Orchestrierung.
Lernziele
- DataBuilder-Pipelines für typische Quellen konfigurieren und ausführen.
- Extraktion, Transformation, Graph-Laden und Suchindexierung nachvollziehen.
- inkrementelle und idempotente Läufe mit Qualitätskontrollen umsetzen.
- Jobs mit Parametern, Monitoring und Wiederanlauf produktionsnah betreiben.
Inhalte und Schritt-für-Schritt-Anleitungen
Pipeline-Architektur und Laufmodell
DataBuilder wird als Verarbeitungskette mit klaren Verträgen und Zuständen verstanden.
- Schritt 1: Extractor, Transformer, Loader und Publisher im Laufmodell zuordnen.
- Schritt 2: Konfiguration, Secrets und Laufparameter voneinander trennen.
- Schritt 3: Datenflüsse zu Metadatenhaltung und Suchindex skizzieren.
- Schritt 4: Fehler- und Wiederanlaufpunkte der Pipeline markieren.
Kontrolle: Der Arbeitsschritt gilt als abgeschlossen, wenn Ausgangslage, Änderung beziehungsweise Entscheidung und überprüfter Zielzustand nachvollziehbar dokumentiert sind.
Standardquellen und Extractoren
Vorhandene Konnektoren werden anhand der tatsächlichen Quellsysteme ausgewählt und begrenzt.
- Schritt 1: Quelltypen und benötigte Metadatenobjekte inventarisieren.
- Schritt 2: passenden Extractor und Verbindungsparameter auswählen.
- Schritt 3: Filter für Kataloge, Schemas, Tabellen oder Dashboards konfigurieren.
- Schritt 4: Berechtigungen und Leselast gegen die Quelle prüfen.
Kontrolle: Der Arbeitsschritt gilt als abgeschlossen, wenn Ausgangslage, Änderung beziehungsweise Entscheidung und überprüfter Zielzustand nachvollziehbar dokumentiert sind.
Transformation und Metadatenqualität
Rohmetadaten werden normalisiert, ergänzt und vor dem Laden validiert.
- Schritt 1: Benennung, Typen, Beschreibungen und Zeitangaben vereinheitlichen.
- Schritt 2: Owner, Tags, Nutzungs- und Qualitätsinformationen anreichern.
- Schritt 3: Pflichtfelder und Referenzintegrität mit Validierungsregeln prüfen.
- Schritt 4: fehlerhafte Datensätze protokollieren und kontrolliert behandeln.
Kontrolle: Der Arbeitsschritt gilt als abgeschlossen, wenn Ausgangslage, Änderung beziehungsweise Entscheidung und überprüfter Zielzustand nachvollziehbar dokumentiert sind.
Graph-Laden und Suchindexaufbau
Persistenz und Suche werden als getrennte, aber konsistente Ziele behandelt.
- Schritt 1: Schlüssel und Beziehungen für idempotente Schreibvorgänge festlegen.
- Schritt 2: Batch- und Transaktionsparameter für das Metadatenziel konfigurieren.
- Schritt 3: Suchdokumente und relevante Ranking-Felder erzeugen.
- Schritt 4: Index-Neuaufbau und Konsistenzprüfung zwischen Zielsystemen durchführen.
Kontrolle: Der Arbeitsschritt gilt als abgeschlossen, wenn Ausgangslage, Änderung beziehungsweise Entscheidung und überprüfter Zielzustand nachvollziehbar dokumentiert sind.
Inkrementelle Läufe und Löschungen
Regelmäßige Jobs benötigen eine belastbare Strategie für Änderungen und veraltete Objekte.
- Schritt 1: Snapshot-, Zeitstempel- oder Wasserzeichenverfahren auswählen.
- Schritt 2: Änderungen, Umbenennungen und Löschungen eindeutig erkennen.
- Schritt 3: Teil- und Vollläufe voneinander abgrenzen.
- Schritt 4: Wiederholung ohne Duplikate und mit nachvollziehbarem Endzustand testen.
Kontrolle: Der Arbeitsschritt gilt als abgeschlossen, wenn Ausgangslage, Änderung beziehungsweise Entscheidung und überprüfter Zielzustand nachvollziehbar dokumentiert sind.
Orchestrierung und Parameterisierung
Pipelines werden planbar, wiederholbar und umgebungsabhängig ausführbar gemacht.
- Schritt 1: Jobdefinition, Zeitplan und Abhängigkeiten festlegen.
- Schritt 2: Umgebungs-, Quellen- und Mandantenparameter strukturieren.
- Schritt 3: Retries, Timeouts, Parallelität und Abbruchbedingungen konfigurieren.
- Schritt 4: manuellen Wiederanlauf und kontrollierten Backfill erproben.
Kontrolle: Der Arbeitsschritt gilt als abgeschlossen, wenn Ausgangslage, Änderung beziehungsweise Entscheidung und überprüfter Zielzustand nachvollziehbar dokumentiert sind.
Monitoring und Betriebsabnahme
Ingestion wird über Aktualität, Volumen, Fehler und Qualitätswerte überwacht.
- Schritt 1: Laufmetriken und technische Qualitätsindikatoren definieren.
- Schritt 2: Abweichungen gegen Baseline und erwartete Quellvolumen erkennen.
- Schritt 3: Alarme und Diagnoseinformationen je Fehlerklasse festlegen.
- Schritt 4: Betriebscheckliste mit Ownership und Reaktionswegen erstellen.
Kontrolle: Der Arbeitsschritt gilt als abgeschlossen, wenn Ausgangslage, Änderung beziehungsweise Entscheidung und überprüfter Zielzustand nachvollziehbar dokumentiert sind.
Praxisaufgaben
- Praxisaufgabe 1: Pipeline für eine relationale Beispielquelle konfigurieren.
- Praxisaufgabe 2: Owner-, Tag- und Beschreibungsmetadaten transformieren und validieren.
- Praxisaufgabe 3: Graph und Suchindex laden und auf Konsistenz prüfen.
- Praxisaufgabe 4: inkrementellen Folgelauf mit Änderung und Löschung durchführen.
- Praxisaufgabe 5: Orchestrierungsparameter, Retry und Backfill testen.
- Praxisaufgabe 6: Monitoring- und Abnahmeprotokoll für den produktiven Betrieb erstellen.
Arbeitsweise und Qualitätssicherung
Jeder Themenblock folgt demselben Muster: Ausgangszustand erfassen, Zielzustand festlegen, Änderung oder Analyse in kleinen Schritten durchführen, Resultat kontrollieren und den Ablauf für Wiederholung oder Übergabe dokumentieren. Demonstrationen werden durch Übungen, Prüflisten, Fehlerfälle und gemeinsame Reviews ergänzt.
Die Übungen verwenden eine isolierte Labor- oder Plansituation. Produktive Änderungen werden erst nach technischer Prüfung, Freigabe, Sicherung, Rückfallplanung und dokumentierter Nachkontrolle vorgesehen.
Fachbereichsleitung und Trainerteam
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 3 Tage, jeweils ca. 6 Stunden; Beginn am 1. Tag 10:00 Uhr, an den Folgetagen 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 1.797 zzgl. MwSt. Inhaus: € 5.100 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Data Engineers, Analytics Engineers, Plattformteams und technische Data-Governance-Verantwortliche. |
| Voraussetzungen: | Python- und SQL-Grundkenntnisse, Erfahrung mit Datenpipelines sowie Basiswissen zu Datenbanken, APIs und Job-Orchestrierung. |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, Schritt-für-Schritt-Anleitungen, praktische Übungen und Reviews |
| Seminararten: | Öffentlich, Webinar, Inhaus, Workshop – alle Seminare mit Trainer vor Ort; Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch – bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation als Download oder auf Datenträger |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- und Warmgetränke, Mittagessen wahlweise vegetarisch |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
