Seminar / Training
Zielsetzung
Das Intensivseminar bündelt die Inhalte der Einzelseminare in einem fünftägigen Gesamtprogramm. Behandelt werden Grundlagen, Architektur, OpenLineage-Datenmodell, Marquez-Betrieb, Integrationen mit Airflow, Spark, dbt und SQL-Plattformen, Governance, Observability, Sicherheit, Troubleshooting und Rollout-Planung.
Inhaltsübersicht
- Vollständiger Einstieg in Data Lineage, OpenLineage und Marquez
- Architektur, Datenmodell, Events, Facets und Namenskonventionen
- Marquez-Installation, Administration, API und Automatisierung
- Integrationen für Airflow, Spark, dbt und SQL-basierte Plattformen
- Governance, Observability, Produktionsbetrieb, Sicherheit und Rollout
Seminarinhalte
- Schritt 1: Grundlagen und Zielbild
Data-Lineage-Anwendungsfälle, Grundbegriffe, OpenLineage-Objekte und Marquez-Rolle werden eingeführt. Daraus entsteht ein gemeinsames Zielbild für technische Transparenz und Governance. - Schritt 2: Architektur und Datenmodell
Jobs, Runs, Datasets, Namespaces, Facets und Event-Typen werden modelliert. Namenskonventionen, Mindestfelder und Modellierungsregeln bilden den roten Faden für alle weiteren Übungen. - Schritt 3: Marquez installieren und administrieren
Eine Marquez-Umgebung wird aufgebaut, geprüft und mit ersten Ereignissen gefüllt. API, UI, Datenbank, Konfiguration, Logs und grundlegende Betriebsaufgaben werden praktisch behandelt. - Schritt 4: Orchestrierung mit Airflow integrieren
DAGs, Tasks, Runs und Datasets werden Lineage-fähig betrachtet. Konfiguration, Event-Prüfung, Marquez-Anzeige und typische Fehler bei Wiederholungsläufen werden bearbeitet. - Schritt 5: Spark- und Batch-Verarbeitung anbinden
Spark-basierte Verarbeitungen werden für OpenLineage-Ereignisse vorbereitet. SQL-, DataFrame- und dateibasierte Zugriffsmuster werden verglichen und in Marquez ausgewertet. - Schritt 6: dbt und SQL-Transformationen einordnen
Analytische Modelle, Quellen, Transformationen und Datenproduktabhängigkeiten werden als Lineage dargestellt. Impact-Analyse und Modelländerungen werden geübt. - Schritt 7: Observability und Governance verbinden
Laufzeitmetadaten, Fehler, Qualitätshinweise, Verantwortlichkeiten und Governance-Regeln werden verbunden. Daraus entsteht ein verwertbares Betriebs- und Steuerungsmodell. - Schritt 8: Sicherheit und Produktionsbetrieb absichern
Zielarchitektur, Zugriffe, Netzwerkgrenzen, Monitoring, Backup, Restore, Kapazität und Troubleshooting werden für produktionsnahe Umgebungen strukturiert. - Schritt 9: PoC und Rollout planen
Ein Proof of Concept wird in Pilot- und Rollout-Wellen überführt. Erfolgskriterien, Verantwortlichkeiten, Dokumentation und Übergabe an den Regelbetrieb werden festgelegt. - Schritt 10: Gesamtszenario konsolidieren
Alle Bausteine werden in einem End-to-End-Szenario zusammengeführt: Event-Erzeugung, Marquez-Anzeige, Fehleranalyse, Governance-Bewertung und Betriebscheck.
Praktische Übungen
- End-to-End-Aufbau einer OpenLineage- und Marquez-Testumgebung
- Modellierung mehrstufiger Datenflüsse mit Jobs, Runs und Datasets
- Prüfung von Lineage aus Airflow-, Spark- und SQL-orientierten Beispielen
- Durchführung einer Impact- und Root-Cause-Analyse
- Erstellung eines PoC-, Betriebs- und Rollout-Konzepts
Zielgruppe
Data Engineers, Plattformteams, Data Architects, Governance-Verantwortliche, Administratoren und technische Projektleitungen, die ein Gesamtverständnis für OpenLineage und Marquez benötigen.
Voraussetzungen
Solide Grundlagen in Datenpipelines, SQL, HTTP/JSON, Container- oder Plattformbetrieb. Erfahrung mit Airflow, Spark oder dbt ist hilfreich.
Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 5 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 2.995 zzgl. MwSt. Inhaus: € 8.500 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Data Engineers, Plattformteams, Architekten, Governance, Administratoren |
| Voraussetzungen: | Solide Grundlagen in Datenpipelines, SQL, HTTP/JSON und Containerbetrieb |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
