Das Seminar vermittelt den klassischen Data-Lake-Zugriff mit Hive Metastore und Object Storage. Catalog-Konfiguration, Dateiformate, externe Tabellen, Partitionierung, Metadaten, Schreibprozesse, Credentials, Autorisierung, Wartung und Abfrageoptimierung werden in einer vollständigen Laborumgebung umgesetzt.
Inhaltsübersicht
- Lernziele und fachliche Einordnung
- Schrittweise Seminarinhalte
- Praxisübungen und Laborszenarien
- Zielgruppe und Voraussetzungen
- Didaktik und Arbeitsweise
Lernziele
- Daten-, Metadaten- und Ausführungskomponenten des Hive-Connectors einordnen.
- Metastore und Object Storage sicher und hoch belastbar anbinden.
- Tabellen, Partitionen und Dateiformate für analytische Abfragen gestalten.
- Lese- und Schreibvorgänge connectorgerecht testen.
- Sicherheits-, Wartungs- und Performancekontrollen operationalisieren.
Schrittweise Seminarinhalte
1. Hive-Connector-Architektur
Schwerpunkt: Datenfiles, Metastore, Catalog, Connector, HDFS und Object Storage, Dateiformate, Partitionen und Abgrenzung zur Hive-Ausführungsengine.
- Ausgangslage, fachliche Ziele, technische Abhängigkeiten und Abnahmekriterien für den Themenblock „Hive-Connector-Architektur“ erfassen.
- Relevante Komponenten, Datenobjekte, Rollen und Konfigurationsparameter anhand von Datenfiles, Metastore, Catalog, Connector, HDFS und Object Storage, Dateiformate, Partitionen und Abgrenzung zur Hive-Ausführungsengine. modellieren.
- Die erforderliche Konfiguration, SQL-Abfrage oder Prozessfolge im Laborsystem schrittweise umsetzen und jeden Zwischenstand dokumentieren.
- Funktion, Ausführungsplan, Datenzugriff, Berechtigungen, Ressourcenverbrauch und Fehlerverhalten mit definierten Positiv- und Negativfällen prüfen.
- Als Arbeitsergebnis ein klares Data-Lake-Komponentenmodell dokumentieren, fachlich abnehmen und in einen wiederholbaren Standard überführen.
2. Metastore-Anbindung
Schwerpunkt: Hive Metastore Service, Glue-kompatible Metastores, Thrift, Datenbankbackend, Berechtigungen, TLS, Hochverfügbarkeit und Verbindungstests.
- Ausgangslage, fachliche Ziele, technische Abhängigkeiten und Abnahmekriterien für den Themenblock „Metastore-Anbindung“ erfassen.
- Relevante Komponenten, Datenobjekte, Rollen und Konfigurationsparameter anhand von Hive Metastore Service, Glue-kompatible Metastores, Thrift, Datenbankbackend, Berechtigungen, TLS, Hochverfügbarkeit und Verbindungstests. modellieren.
- Die erforderliche Konfiguration, SQL-Abfrage oder Prozessfolge im Laborsystem schrittweise umsetzen und jeden Zwischenstand dokumentieren.
- Funktion, Ausführungsplan, Datenzugriff, Berechtigungen, Ressourcenverbrauch und Fehlerverhalten mit definierten Positiv- und Negativfällen prüfen.
- Als Arbeitsergebnis eine sichere und getestete Metastore-Verbindung dokumentieren, fachlich abnehmen und in einen wiederholbaren Standard überführen.
3. Object Storage und Credentials
Schwerpunkt: S3-kompatibler Speicher, Azure und Google Cloud, Endpunkte, Regionen, Rollen, Schlüssel, Verschlüsselung, Pfade und Netzwerk.
- Ausgangslage, fachliche Ziele, technische Abhängigkeiten und Abnahmekriterien für den Themenblock „Object Storage und Credentials“ erfassen.
- Relevante Komponenten, Datenobjekte, Rollen und Konfigurationsparameter anhand von S3-kompatibler Speicher, Azure und Google Cloud, Endpunkte, Regionen, Rollen, Schlüssel, Verschlüsselung, Pfade und Netzwerk. modellieren.
- Die erforderliche Konfiguration, SQL-Abfrage oder Prozessfolge im Laborsystem schrittweise umsetzen und jeden Zwischenstand dokumentieren.
- Funktion, Ausführungsplan, Datenzugriff, Berechtigungen, Ressourcenverbrauch und Fehlerverhalten mit definierten Positiv- und Negativfällen prüfen.
- Als Arbeitsergebnis ein belastbares Speicher- und Credential-Modell dokumentieren, fachlich abnehmen und in einen wiederholbaren Standard überführen.
4. Dateiformate und Tabellenentwurf
Schwerpunkt: Parquet, ORC, Avro, Kompression, Datentypen, externe und verwaltete Tabellen, SerDe-Einordnung und Tabellenproperties.
- Ausgangslage, fachliche Ziele, technische Abhängigkeiten und Abnahmekriterien für den Themenblock „Dateiformate und Tabellenentwurf“ erfassen.
- Relevante Komponenten, Datenobjekte, Rollen und Konfigurationsparameter anhand von Parquet, ORC, Avro, Kompression, Datentypen, externe und verwaltete Tabellen, SerDe-Einordnung und Tabellenproperties. modellieren.
- Die erforderliche Konfiguration, SQL-Abfrage oder Prozessfolge im Laborsystem schrittweise umsetzen und jeden Zwischenstand dokumentieren.
- Funktion, Ausführungsplan, Datenzugriff, Berechtigungen, Ressourcenverbrauch und Fehlerverhalten mit definierten Positiv- und Negativfällen prüfen.
- Als Arbeitsergebnis ein begründetes Datei- und Tabellenlayout dokumentieren, fachlich abnehmen und in einen wiederholbaren Standard überführen.
5. Partitionierung und Metadaten
Schwerpunkt: Partition Keys, Verzeichnislayout, Partition Discovery, Projection, Metadatenmengen, kleine Dateien und Schemaänderungen.
- Ausgangslage, fachliche Ziele, technische Abhängigkeiten und Abnahmekriterien für den Themenblock „Partitionierung und Metadaten“ erfassen.
- Relevante Komponenten, Datenobjekte, Rollen und Konfigurationsparameter anhand von Partition Keys, Verzeichnislayout, Partition Discovery, Projection, Metadatenmengen, kleine Dateien und Schemaänderungen. modellieren.
- Die erforderliche Konfiguration, SQL-Abfrage oder Prozessfolge im Laborsystem schrittweise umsetzen und jeden Zwischenstand dokumentieren.
- Funktion, Ausführungsplan, Datenzugriff, Berechtigungen, Ressourcenverbrauch und Fehlerverhalten mit definierten Positiv- und Negativfällen prüfen.
- Als Arbeitsergebnis eine skalierbare Partitionierungs- und Metadatenstrategie dokumentieren, fachlich abnehmen und in einen wiederholbaren Standard überführen.
6. Schreiben und Datenpflege
Schwerpunkt: CREATE TABLE AS, INSERT, UPDATE, DELETE, MERGE, temporäre Pfade, Staging, Writer Scaling, Fehlerfälle und connectorabhängige Grenzen.
- Ausgangslage, fachliche Ziele, technische Abhängigkeiten und Abnahmekriterien für den Themenblock „Schreiben und Datenpflege“ erfassen.
- Relevante Komponenten, Datenobjekte, Rollen und Konfigurationsparameter anhand von CREATE TABLE AS, INSERT, UPDATE, DELETE, MERGE, temporäre Pfade, Staging, Writer Scaling, Fehlerfälle und connectorabhängige Grenzen. modellieren.
- Die erforderliche Konfiguration, SQL-Abfrage oder Prozessfolge im Laborsystem schrittweise umsetzen und jeden Zwischenstand dokumentieren.
- Funktion, Ausführungsplan, Datenzugriff, Berechtigungen, Ressourcenverbrauch und Fehlerverhalten mit definierten Positiv- und Negativfällen prüfen.
- Als Arbeitsergebnis einen getesteten Schreib- und Pflegeprozess dokumentieren, fachlich abnehmen und in einen wiederholbaren Standard überführen.
7. Sicherheit, Wartung und Performance
Schwerpunkt: Catalog-Rechte, Dateisystemrechte, Statistiken, Caching, Dynamic Filtering, Partition Pruning, Monitoring und Runbooks.
- Ausgangslage, fachliche Ziele, technische Abhängigkeiten und Abnahmekriterien für den Themenblock „Sicherheit, Wartung und Performance“ erfassen.
- Relevante Komponenten, Datenobjekte, Rollen und Konfigurationsparameter anhand von Catalog-Rechte, Dateisystemrechte, Statistiken, Caching, Dynamic Filtering, Partition Pruning, Monitoring und Runbooks. modellieren.
- Die erforderliche Konfiguration, SQL-Abfrage oder Prozessfolge im Laborsystem schrittweise umsetzen und jeden Zwischenstand dokumentieren.
- Funktion, Ausführungsplan, Datenzugriff, Berechtigungen, Ressourcenverbrauch und Fehlerverhalten mit definierten Positiv- und Negativfällen prüfen.
- Als Arbeitsergebnis ein vollständiges Data-Lake-Betriebsmodell dokumentieren, fachlich abnehmen und in einen wiederholbaren Standard überführen.
Praxisübungen und Laborszenarien
- Konfiguration eines Hive-Catalogs mit Metastore und Object Storage.
- Anlage partitionierter Parquet-Tabellen und Prüfung von Partition Pruning.
- Analyse von kleinen Dateien, Metadatenlast und Pushdown-Verhalten.
Zielgruppe und Voraussetzungen
Zielgruppe: Data Engineering, Data-Lake- und Cloud-Teams, Plattformbetrieb, Datenbankadministration und technische Architektur.
Voraussetzungen: Gute SQL-Kenntnisse sowie Grundlagen in Object Storage, Dateiformaten und Metadatenkatalogen.
Didaktik und Arbeitsweise
Kurze Fachimpulse werden unmittelbar durch Demonstrationen, strukturierte Konfigurations- oder SQL-Schritte, praktische Übungen und kontrollierte Fehlerfälle vertieft. Jede Übung verwendet definierte Ausgangswerte, Prüfpunkte und Dokumentationsanforderungen, damit die erarbeiteten Abläufe als technischer Standard wiederholbar bleiben.
Fachbereichsleitung und Trainerteam
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de
Seminardetails
| Dauer: | 2 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 1.198 zzgl. MwSt. Inhaus: € 3.400 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Data Engineering, Data-Lake- und Cloud-Teams, Plattformbetrieb, Datenbankadministration und technische Architektur |
| Voraussetzungen: | Gute SQL-Kenntnisse sowie Grundlagen in Object Storage, Dateiformaten und Metadatenkatalogen |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhouse, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
