Seminar Amundsen – DataBuilder und automatisierte Metadaten-Ingestion

Verlässliche Suche setzt aktuelle, vollständige und reproduzierbar geladene Metadaten voraus.

Das Seminar behandelt DataBuilder-Pipelines, vorhandene Extractoren, Transformationen, Loader, Suchindexaufbau, Orchestrierung, inkrementelle Läufe und Datenqualitätskontrollen.

Inhaltsübersicht

  • Seminarprofil
  • Zielgruppe
  • Voraussetzungen
  • Lernziele
  • Inhalte und Schritt-für-Schritt-Anleitungen
  • Praxisaufgaben
  • Arbeitsweise und Qualitätssicherung

Seminarprofil

Der Schwerpunkt liegt auf das Seminar behandelt DataBuilder-Pipelines, vorhandene Extractoren, Transformationen, Loader, Suchindexaufbau, Orchestrierung, inkrementelle Läufe und Datenqualitätskontrollen. Die Inhalte werden über nachvollziehbare Entscheidungen, reproduzierbare Arbeitsschritte und dokumentierte Kontrollen vermittelt.

Zielgruppe

Data Engineers, Analytics Engineers, Plattformteams und technische Data-Governance-Verantwortliche.

Voraussetzungen

Python- und SQL-Grundkenntnisse, Erfahrung mit Datenpipelines sowie Basiswissen zu Datenbanken, APIs und Job-Orchestrierung.

Lernziele

  • DataBuilder-Pipelines für typische Quellen konfigurieren und ausführen.
  • Extraktion, Transformation, Graph-Laden und Suchindexierung nachvollziehen.
  • inkrementelle und idempotente Läufe mit Qualitätskontrollen umsetzen.
  • Jobs mit Parametern, Monitoring und Wiederanlauf produktionsnah betreiben.

Inhalte und Schritt-für-Schritt-Anleitungen

Pipeline-Architektur und Laufmodell

DataBuilder wird als Verarbeitungskette mit klaren Verträgen und Zuständen verstanden.

  1. Schritt 1: Extractor, Transformer, Loader und Publisher im Laufmodell zuordnen.
  2. Schritt 2: Konfiguration, Secrets und Laufparameter voneinander trennen.
  3. Schritt 3: Datenflüsse zu Metadatenhaltung und Suchindex skizzieren.
  4. Schritt 4: Fehler- und Wiederanlaufpunkte der Pipeline markieren.

Kontrolle: Der Arbeitsschritt gilt als abgeschlossen, wenn Ausgangslage, Änderung beziehungsweise Entscheidung und überprüfter Zielzustand nachvollziehbar dokumentiert sind.

Standardquellen und Extractoren

Vorhandene Konnektoren werden anhand der tatsächlichen Quellsysteme ausgewählt und begrenzt.

  1. Schritt 1: Quelltypen und benötigte Metadatenobjekte inventarisieren.
  2. Schritt 2: passenden Extractor und Verbindungsparameter auswählen.
  3. Schritt 3: Filter für Kataloge, Schemas, Tabellen oder Dashboards konfigurieren.
  4. Schritt 4: Berechtigungen und Leselast gegen die Quelle prüfen.

Kontrolle: Der Arbeitsschritt gilt als abgeschlossen, wenn Ausgangslage, Änderung beziehungsweise Entscheidung und überprüfter Zielzustand nachvollziehbar dokumentiert sind.

Transformation und Metadatenqualität

Rohmetadaten werden normalisiert, ergänzt und vor dem Laden validiert.

  1. Schritt 1: Benennung, Typen, Beschreibungen und Zeitangaben vereinheitlichen.
  2. Schritt 2: Owner, Tags, Nutzungs- und Qualitätsinformationen anreichern.
  3. Schritt 3: Pflichtfelder und Referenzintegrität mit Validierungsregeln prüfen.
  4. Schritt 4: fehlerhafte Datensätze protokollieren und kontrolliert behandeln.

Kontrolle: Der Arbeitsschritt gilt als abgeschlossen, wenn Ausgangslage, Änderung beziehungsweise Entscheidung und überprüfter Zielzustand nachvollziehbar dokumentiert sind.

Graph-Laden und Suchindexaufbau

Persistenz und Suche werden als getrennte, aber konsistente Ziele behandelt.

  1. Schritt 1: Schlüssel und Beziehungen für idempotente Schreibvorgänge festlegen.
  2. Schritt 2: Batch- und Transaktionsparameter für das Metadatenziel konfigurieren.
  3. Schritt 3: Suchdokumente und relevante Ranking-Felder erzeugen.
  4. Schritt 4: Index-Neuaufbau und Konsistenzprüfung zwischen Zielsystemen durchführen.

Kontrolle: Der Arbeitsschritt gilt als abgeschlossen, wenn Ausgangslage, Änderung beziehungsweise Entscheidung und überprüfter Zielzustand nachvollziehbar dokumentiert sind.

Inkrementelle Läufe und Löschungen

Regelmäßige Jobs benötigen eine belastbare Strategie für Änderungen und veraltete Objekte.

  1. Schritt 1: Snapshot-, Zeitstempel- oder Wasserzeichenverfahren auswählen.
  2. Schritt 2: Änderungen, Umbenennungen und Löschungen eindeutig erkennen.
  3. Schritt 3: Teil- und Vollläufe voneinander abgrenzen.
  4. Schritt 4: Wiederholung ohne Duplikate und mit nachvollziehbarem Endzustand testen.

Kontrolle: Der Arbeitsschritt gilt als abgeschlossen, wenn Ausgangslage, Änderung beziehungsweise Entscheidung und überprüfter Zielzustand nachvollziehbar dokumentiert sind.

Orchestrierung und Parameterisierung

Pipelines werden planbar, wiederholbar und umgebungsabhängig ausführbar gemacht.

  1. Schritt 1: Jobdefinition, Zeitplan und Abhängigkeiten festlegen.
  2. Schritt 2: Umgebungs-, Quellen- und Mandantenparameter strukturieren.
  3. Schritt 3: Retries, Timeouts, Parallelität und Abbruchbedingungen konfigurieren.
  4. Schritt 4: manuellen Wiederanlauf und kontrollierten Backfill erproben.

Kontrolle: Der Arbeitsschritt gilt als abgeschlossen, wenn Ausgangslage, Änderung beziehungsweise Entscheidung und überprüfter Zielzustand nachvollziehbar dokumentiert sind.

Monitoring und Betriebsabnahme

Ingestion wird über Aktualität, Volumen, Fehler und Qualitätswerte überwacht.

  1. Schritt 1: Laufmetriken und technische Qualitätsindikatoren definieren.
  2. Schritt 2: Abweichungen gegen Baseline und erwartete Quellvolumen erkennen.
  3. Schritt 3: Alarme und Diagnoseinformationen je Fehlerklasse festlegen.
  4. Schritt 4: Betriebscheckliste mit Ownership und Reaktionswegen erstellen.

Kontrolle: Der Arbeitsschritt gilt als abgeschlossen, wenn Ausgangslage, Änderung beziehungsweise Entscheidung und überprüfter Zielzustand nachvollziehbar dokumentiert sind.

Praxisaufgaben

  1. Praxisaufgabe 1: Pipeline für eine relationale Beispielquelle konfigurieren.
  2. Praxisaufgabe 2: Owner-, Tag- und Beschreibungsmetadaten transformieren und validieren.
  3. Praxisaufgabe 3: Graph und Suchindex laden und auf Konsistenz prüfen.
  4. Praxisaufgabe 4: inkrementellen Folgelauf mit Änderung und Löschung durchführen.
  5. Praxisaufgabe 5: Orchestrierungsparameter, Retry und Backfill testen.
  6. Praxisaufgabe 6: Monitoring- und Abnahmeprotokoll für den produktiven Betrieb erstellen.

Arbeitsweise und Qualitätssicherung

Jeder Themenblock folgt demselben Muster: Ausgangszustand erfassen, Zielzustand festlegen, Änderung oder Analyse in kleinen Schritten durchführen, Resultat kontrollieren und den Ablauf für Wiederholung oder Übergabe dokumentieren. Demonstrationen werden durch Übungen, Prüflisten, Fehlerfälle und gemeinsame Reviews ergänzt.

Die Übungen verwenden eine isolierte Labor- oder Plansituation. Produktive Änderungen werden erst nach technischer Prüfung, Freigabe, Sicherung, Rückfallplanung und dokumentierter Nachkontrolle vorgesehen.

Fachbereichsleitung und Trainerteam

Seminardetails

   
Dauer: 3 Tage, jeweils ca. 6 Stunden; Beginn am 1. Tag 10:00 Uhr, an den Folgetagen 09:00 Uhr
Preis: Öffentlich oder Live Stream: € 1.797 zzgl. MwSt.
Inhaus: € 5.100 zzgl. MwSt.
Teilnehmeranzahl: min. 2 - max. 8
Teilnehmer: Data Engineers, Analytics Engineers, Plattformteams und technische Data-Governance-Verantwortliche.
Voraussetzungen: Python- und SQL-Grundkenntnisse, Erfahrung mit Datenpipelines sowie Basiswissen zu Datenbanken, APIs und Job-Orchestrierung.
Standorte: Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg
Methoden: Vortrag, Demonstrationen, Schritt-für-Schritt-Anleitungen, praktische Übungen und Reviews
Seminararten: Öffentlich, Webinar, Inhaus, Workshop – alle Seminare mit Trainer vor Ort; Webinar nur wenn ausdrücklich gewünscht
Durchführungsgarantie: ja, ab 2 Teilnehmern
Sprache: Deutsch – bei Firmenseminaren ist auch Englisch möglich
Seminarunterlage: Dokumentation als Download oder auf Datenträger
Teilnahmezertifikat: ja, selbstverständlich
Verpflegung: Kalt- und Warmgetränke, Mittagessen wahlweise vegetarisch
Support: 3 Anrufe im Seminarpreis enthalten
Barrierefreier Zugang: an den meisten Standorten verfügbar
  Weitere Informationen unter + 49 (221) 74740055

Seminartermine

Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.

Seminar Startdatum Enddatum Ort Dauer
Potsdam 3 Tage
Flensburg 3 Tage
Konstanz 3 Tage
Freiburg 3 Tage
Rostock 3 Tage
Hamburg 3 Tage
Leipzig 3 Tage
Hamm 3 Tage
Hannover 3 Tage
Stuttgart 3 Tage
Dresden 3 Tage
Luxemburg 3 Tage
Regensburg 3 Tage
Jena 3 Tage
Trier 3 Tage
Madgeburg 3 Tage
Friedrichshafen 3 Tage
Kassel 3 Tage
Ulm 3 Tage
München 3 Tage
Nürnberg 3 Tage
Köln 3 Tage
Wuppertal 3 Tage
Münster 3 Tage
Mainz 3 Tage
Erfurt 3 Tage
Bremen 3 Tage
Berlin 3 Tage
Paderborn 3 Tage
Essen 3 Tage
Darmstadt 3 Tage
Frankfurt 3 Tage
Konstanz 3 Tage
Freiburg 3 Tage
Potsdam 3 Tage
Flensburg 3 Tage
Leipzig 3 Tage
Hamm 3 Tage
Rostock 3 Tage
Hamburg 3 Tage
Nach oben
Seminare als Stream SRI zertifiziert
© 2026 www.seminar-experts.de All rights reserved. | Kontakt | Impressum | Nach oben