Das Seminar führt in die lokale, codebasierte Datenqualitätsprüfung mit Soda Core ein. Von der Installation über die Datenquellenkonfiguration bis zur ersten Vertragsverifikation entsteht eine reproduzierbare Arbeitsumgebung.
Die Übungen legen Wert auf sichere Zugangsdaten, klare Dateistrukturen und verständliche Fehlerdiagnose. Vorkenntnisse in Soda sind nicht erforderlich.
Lernziele
- Soda Core und das passende Datenquellenpaket sicher installieren
- Datenquellen- und Cloud-Konfigurationen strukturiert verwalten
- CLI-Befehle für Verbindung, Vertrag und Verifikation anwenden
- Ergebnisse, Exitcodes und Logs korrekt interpretieren und Fehler eingrenzen
Inhaltsübersicht
- Soda Core und Arbeitsmodell einordnen
- Python-Umgebung und Pakete installieren
- Datenquelle konfigurieren
- Cloud-Verbindung optional vorbereiten
- Ersten Data Contract erstellen
- Verifikation ausführen und Ergebnisse lesen
- Grundlegende Fehlersuche standardisieren
Seminarinhalte
1. Soda Core und Arbeitsmodell einordnen
- Schritt 1: Lokale Ausführung, Soda Cloud und Soda Runner voneinander abgrenzen.
- Schritt 2: Data Contract, Verifikation, Check und Ergebnis als Grundobjekte erklären.
- Schritt 3: Geeignete Anwendungsfälle in Entwicklung, Pipeline und Betrieb auswählen.
- Schritt 4: Laborverzeichnis und sichere Arbeitsregeln vorbereiten.
2. Python-Umgebung und Pakete installieren
- Schritt 1: Virtuelle Umgebung erstellen und aktivieren.
- Schritt 2: Soda-Basispaket und passendes Datenquellenpaket installieren.
- Schritt 3: Versionen und Kommandozeilenaufruf verifizieren.
- Schritt 4: Abhängigkeiten für reproduzierbare Wiederinstallation festhalten.
3. Datenquelle konfigurieren
- Schritt 1: Erforderliche Verbindungsparameter aus dem Zielsystem ableiten.
- Schritt 2: YAML-Konfiguration mit getrennten Secret-Werten erstellen.
- Schritt 3: Verbindung über CLI testen und Treiberfehler auswerten.
- Schritt 4: Rechte auf benötigte Schemas und Tabellen begrenzen.
4. Cloud-Verbindung optional vorbereiten
- Schritt 1: API-Schlüssel mit geeignetem technischen Konto bereitstellen.
- Schritt 2: Cloud-Konfiguration ohne Klartextgeheimnisse strukturieren.
- Schritt 3: Authentifizierung und Erreichbarkeit testen.
- Schritt 4: Lokale und veröffentlichte Ergebnisse klar voneinander unterscheiden.
5. Ersten Data Contract erstellen
- Schritt 1: Dataset vollständig qualifiziert benennen.
- Schritt 2: Schema und kritische Spalten in YAML abbilden.
- Schritt 3: Einfache Checks für Missing Values, Eindeutigkeit und Zeilenzahl ergänzen.
- Schritt 4: Vertrag syntaktisch testen und typische Einrückungsfehler beheben.
6. Verifikation ausführen und Ergebnisse lesen
- Schritt 1: Vertrag lokal gegen die konfigurierte Datenquelle verifizieren.
- Schritt 2: Pass-, Warn-, Fehler- und Ausführungszustände unterscheiden.
- Schritt 3: Exitcode, Konsolenausgabe und detaillierte Logs gemeinsam auswerten.
- Schritt 4: Fehlerdaten korrigieren und dieselbe Verifikation wiederholen.
7. Grundlegende Fehlersuche standardisieren
- Schritt 1: Paket-, Pfad-, YAML-, Berechtigungs- und Netzwerkfehler klassifizieren.
- Schritt 2: Verbose-Ausgabe gezielt statt dauerhaft aktivieren.
- Schritt 3: Minimalen Reproduktionstest aus Konfiguration und einem Check bilden.
- Schritt 4: Befund, Korrektur und erneuten Test in einem kurzen Runbook dokumentieren.
Praxislabor
Eine vorbereitete Datenquelle wird angebunden, ein erster Data Contract geschrieben und mit mehreren Fehlerzuständen verifiziert. Abschließend wird die Umgebung aus dokumentierten Abhängigkeiten erneut aufgebaut und mit einem Smoke-Test bestätigt.
Zielgruppe und Voraussetzungen
Zielgruppe: Data Engineering, Analytics Engineering, Datenbankentwicklung, technische Datenanalyse und Personen mit Einstieg in Data Quality Engineering.
Voraussetzungen: Grundkenntnisse in SQL, YAML und Kommandozeile; grundlegende Python-Paketverwaltung ist hilfreich.
Didaktik und Arbeitsweise
Kurze Fachimpulse werden unmittelbar durch Demonstrationen, strukturierte Konfigurationsschritte, Praxisübungen und kontrollierte Fehlerfälle vertieft. Jede Übung verwendet definierte Ausgangswerte, Prüfpunkte und Dokumentationsanforderungen, damit die erarbeiteten Abläufe als Betriebsstandard wiederholbar bleiben.
Fachbereichsleitung und Trainerteam
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de
Seminardetails
| Dauer: | 2 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 1.198 zzgl. MwSt. Inhaus: € 3.400 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Data Engineering, Analytics Engineering, Datenbankentwicklung, technische Datenanalyse und Personen mit Einstieg in Data Quality Engineering |
| Voraussetzungen: | Grundkenntnisse in SQL, YAML und Kommandozeile; grundlegende Python-Paketverwaltung ist hilfreich |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhouse, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
