Seminar Trino – Hive, Metastore und Object Storage

Das Seminar vermittelt den klassischen Data-Lake-Zugriff mit Hive Metastore und Object Storage. Catalog-Konfiguration, Dateiformate, externe Tabellen, Partitionierung, Metadaten, Schreibprozesse, Credentials, Autorisierung, Wartung und Abfrageoptimierung werden in einer vollständigen Laborumgebung umgesetzt.

Inhaltsübersicht

  • Lernziele und fachliche Einordnung
  • Schrittweise Seminarinhalte
  • Praxisübungen und Laborszenarien
  • Zielgruppe und Voraussetzungen
  • Didaktik und Arbeitsweise

Lernziele

  • Daten-, Metadaten- und Ausführungskomponenten des Hive-Connectors einordnen.
  • Metastore und Object Storage sicher und hoch belastbar anbinden.
  • Tabellen, Partitionen und Dateiformate für analytische Abfragen gestalten.
  • Lese- und Schreibvorgänge connectorgerecht testen.
  • Sicherheits-, Wartungs- und Performancekontrollen operationalisieren.

Schrittweise Seminarinhalte

1. Hive-Connector-Architektur

Schwerpunkt: Datenfiles, Metastore, Catalog, Connector, HDFS und Object Storage, Dateiformate, Partitionen und Abgrenzung zur Hive-Ausführungsengine.

  1. Ausgangslage, fachliche Ziele, technische Abhängigkeiten und Abnahmekriterien für den Themenblock „Hive-Connector-Architektur“ erfassen.
  2. Relevante Komponenten, Datenobjekte, Rollen und Konfigurationsparameter anhand von Datenfiles, Metastore, Catalog, Connector, HDFS und Object Storage, Dateiformate, Partitionen und Abgrenzung zur Hive-Ausführungsengine. modellieren.
  3. Die erforderliche Konfiguration, SQL-Abfrage oder Prozessfolge im Laborsystem schrittweise umsetzen und jeden Zwischenstand dokumentieren.
  4. Funktion, Ausführungsplan, Datenzugriff, Berechtigungen, Ressourcenverbrauch und Fehlerverhalten mit definierten Positiv- und Negativfällen prüfen.
  5. Als Arbeitsergebnis ein klares Data-Lake-Komponentenmodell dokumentieren, fachlich abnehmen und in einen wiederholbaren Standard überführen.

2. Metastore-Anbindung

Schwerpunkt: Hive Metastore Service, Glue-kompatible Metastores, Thrift, Datenbankbackend, Berechtigungen, TLS, Hochverfügbarkeit und Verbindungstests.

  1. Ausgangslage, fachliche Ziele, technische Abhängigkeiten und Abnahmekriterien für den Themenblock „Metastore-Anbindung“ erfassen.
  2. Relevante Komponenten, Datenobjekte, Rollen und Konfigurationsparameter anhand von Hive Metastore Service, Glue-kompatible Metastores, Thrift, Datenbankbackend, Berechtigungen, TLS, Hochverfügbarkeit und Verbindungstests. modellieren.
  3. Die erforderliche Konfiguration, SQL-Abfrage oder Prozessfolge im Laborsystem schrittweise umsetzen und jeden Zwischenstand dokumentieren.
  4. Funktion, Ausführungsplan, Datenzugriff, Berechtigungen, Ressourcenverbrauch und Fehlerverhalten mit definierten Positiv- und Negativfällen prüfen.
  5. Als Arbeitsergebnis eine sichere und getestete Metastore-Verbindung dokumentieren, fachlich abnehmen und in einen wiederholbaren Standard überführen.

3. Object Storage und Credentials

Schwerpunkt: S3-kompatibler Speicher, Azure und Google Cloud, Endpunkte, Regionen, Rollen, Schlüssel, Verschlüsselung, Pfade und Netzwerk.

  1. Ausgangslage, fachliche Ziele, technische Abhängigkeiten und Abnahmekriterien für den Themenblock „Object Storage und Credentials“ erfassen.
  2. Relevante Komponenten, Datenobjekte, Rollen und Konfigurationsparameter anhand von S3-kompatibler Speicher, Azure und Google Cloud, Endpunkte, Regionen, Rollen, Schlüssel, Verschlüsselung, Pfade und Netzwerk. modellieren.
  3. Die erforderliche Konfiguration, SQL-Abfrage oder Prozessfolge im Laborsystem schrittweise umsetzen und jeden Zwischenstand dokumentieren.
  4. Funktion, Ausführungsplan, Datenzugriff, Berechtigungen, Ressourcenverbrauch und Fehlerverhalten mit definierten Positiv- und Negativfällen prüfen.
  5. Als Arbeitsergebnis ein belastbares Speicher- und Credential-Modell dokumentieren, fachlich abnehmen und in einen wiederholbaren Standard überführen.

4. Dateiformate und Tabellenentwurf

Schwerpunkt: Parquet, ORC, Avro, Kompression, Datentypen, externe und verwaltete Tabellen, SerDe-Einordnung und Tabellenproperties.

  1. Ausgangslage, fachliche Ziele, technische Abhängigkeiten und Abnahmekriterien für den Themenblock „Dateiformate und Tabellenentwurf“ erfassen.
  2. Relevante Komponenten, Datenobjekte, Rollen und Konfigurationsparameter anhand von Parquet, ORC, Avro, Kompression, Datentypen, externe und verwaltete Tabellen, SerDe-Einordnung und Tabellenproperties. modellieren.
  3. Die erforderliche Konfiguration, SQL-Abfrage oder Prozessfolge im Laborsystem schrittweise umsetzen und jeden Zwischenstand dokumentieren.
  4. Funktion, Ausführungsplan, Datenzugriff, Berechtigungen, Ressourcenverbrauch und Fehlerverhalten mit definierten Positiv- und Negativfällen prüfen.
  5. Als Arbeitsergebnis ein begründetes Datei- und Tabellenlayout dokumentieren, fachlich abnehmen und in einen wiederholbaren Standard überführen.

5. Partitionierung und Metadaten

Schwerpunkt: Partition Keys, Verzeichnislayout, Partition Discovery, Projection, Metadatenmengen, kleine Dateien und Schemaänderungen.

  1. Ausgangslage, fachliche Ziele, technische Abhängigkeiten und Abnahmekriterien für den Themenblock „Partitionierung und Metadaten“ erfassen.
  2. Relevante Komponenten, Datenobjekte, Rollen und Konfigurationsparameter anhand von Partition Keys, Verzeichnislayout, Partition Discovery, Projection, Metadatenmengen, kleine Dateien und Schemaänderungen. modellieren.
  3. Die erforderliche Konfiguration, SQL-Abfrage oder Prozessfolge im Laborsystem schrittweise umsetzen und jeden Zwischenstand dokumentieren.
  4. Funktion, Ausführungsplan, Datenzugriff, Berechtigungen, Ressourcenverbrauch und Fehlerverhalten mit definierten Positiv- und Negativfällen prüfen.
  5. Als Arbeitsergebnis eine skalierbare Partitionierungs- und Metadatenstrategie dokumentieren, fachlich abnehmen und in einen wiederholbaren Standard überführen.

6. Schreiben und Datenpflege

Schwerpunkt: CREATE TABLE AS, INSERT, UPDATE, DELETE, MERGE, temporäre Pfade, Staging, Writer Scaling, Fehlerfälle und connectorabhängige Grenzen.

  1. Ausgangslage, fachliche Ziele, technische Abhängigkeiten und Abnahmekriterien für den Themenblock „Schreiben und Datenpflege“ erfassen.
  2. Relevante Komponenten, Datenobjekte, Rollen und Konfigurationsparameter anhand von CREATE TABLE AS, INSERT, UPDATE, DELETE, MERGE, temporäre Pfade, Staging, Writer Scaling, Fehlerfälle und connectorabhängige Grenzen. modellieren.
  3. Die erforderliche Konfiguration, SQL-Abfrage oder Prozessfolge im Laborsystem schrittweise umsetzen und jeden Zwischenstand dokumentieren.
  4. Funktion, Ausführungsplan, Datenzugriff, Berechtigungen, Ressourcenverbrauch und Fehlerverhalten mit definierten Positiv- und Negativfällen prüfen.
  5. Als Arbeitsergebnis einen getesteten Schreib- und Pflegeprozess dokumentieren, fachlich abnehmen und in einen wiederholbaren Standard überführen.

7. Sicherheit, Wartung und Performance

Schwerpunkt: Catalog-Rechte, Dateisystemrechte, Statistiken, Caching, Dynamic Filtering, Partition Pruning, Monitoring und Runbooks.

  1. Ausgangslage, fachliche Ziele, technische Abhängigkeiten und Abnahmekriterien für den Themenblock „Sicherheit, Wartung und Performance“ erfassen.
  2. Relevante Komponenten, Datenobjekte, Rollen und Konfigurationsparameter anhand von Catalog-Rechte, Dateisystemrechte, Statistiken, Caching, Dynamic Filtering, Partition Pruning, Monitoring und Runbooks. modellieren.
  3. Die erforderliche Konfiguration, SQL-Abfrage oder Prozessfolge im Laborsystem schrittweise umsetzen und jeden Zwischenstand dokumentieren.
  4. Funktion, Ausführungsplan, Datenzugriff, Berechtigungen, Ressourcenverbrauch und Fehlerverhalten mit definierten Positiv- und Negativfällen prüfen.
  5. Als Arbeitsergebnis ein vollständiges Data-Lake-Betriebsmodell dokumentieren, fachlich abnehmen und in einen wiederholbaren Standard überführen.

Praxisübungen und Laborszenarien

  • Konfiguration eines Hive-Catalogs mit Metastore und Object Storage.
  • Anlage partitionierter Parquet-Tabellen und Prüfung von Partition Pruning.
  • Analyse von kleinen Dateien, Metadatenlast und Pushdown-Verhalten.

Zielgruppe und Voraussetzungen

Zielgruppe: Data Engineering, Data-Lake- und Cloud-Teams, Plattformbetrieb, Datenbankadministration und technische Architektur.

Voraussetzungen: Gute SQL-Kenntnisse sowie Grundlagen in Object Storage, Dateiformaten und Metadatenkatalogen.

Didaktik und Arbeitsweise

Kurze Fachimpulse werden unmittelbar durch Demonstrationen, strukturierte Konfigurations- oder SQL-Schritte, praktische Übungen und kontrollierte Fehlerfälle vertieft. Jede Übung verwendet definierte Ausgangswerte, Prüfpunkte und Dokumentationsanforderungen, damit die erarbeiteten Abläufe als technischer Standard wiederholbar bleiben.

Fachbereichsleitung und Trainerteam

Seminardetails

   
Dauer: 2 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr
Preis: Öffentlich oder Live Stream: € 1.198 zzgl. MwSt.
Inhaus: € 3.400 zzgl. MwSt.
Teilnehmeranzahl: min. 2 - max. 8
Teilnehmer: Data Engineering, Data-Lake- und Cloud-Teams, Plattformbetrieb, Datenbankadministration und technische Architektur
Voraussetzungen: Gute SQL-Kenntnisse sowie Grundlagen in Object Storage, Dateiformaten und Metadatenkatalogen
Standorte: Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg
Methoden: Vortrag, Demonstrationen, praktische Übungen am System
Seminararten: Öffentlich, Webinar, Inhouse, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht
Durchführungsgarantie: ja, ab 2 Teilnehmern
Sprache: Deutsch - bei Firmenseminaren ist auch Englisch möglich
Seminarunterlage: Dokumentation auf Datenträger oder als Download
Teilnahmezertifikat: ja, selbstverständlich
Verpflegung: Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch)
Support: 3 Anrufe im Seminarpreis enthalten
Barrierefreier Zugang: an den meisten Standorten verfügbar
  Weitere Informationen unter + 49 (221) 74740055

Seminartermine

Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.

Seminar Startdatum Enddatum Ort Dauer
Münster 2 Tage
Nürnberg 2 Tage
Köln 2 Tage
Wuppertal 2 Tage
Bremen 2 Tage
Berlin 2 Tage
Mainz 2 Tage
Erfurt 2 Tage
Darmstadt 2 Tage
Frankfurt 2 Tage
Paderborn 2 Tage
Essen 2 Tage
Konstanz 2 Tage
Freiburg 2 Tage
Potsdam 2 Tage
Flensburg 2 Tage
Leipzig 2 Tage
Hamm 2 Tage
Rostock 2 Tage
Hamburg 2 Tage
Luxemburg 2 Tage
Hannover 2 Tage
Stuttgart 2 Tage
Dresden 2 Tage
Madgeburg 2 Tage
Regensburg 2 Tage
Jena 2 Tage
Trier 2 Tage
München 2 Tage
Friedrichshafen 2 Tage
Kassel 2 Tage
Ulm 2 Tage
Münster 2 Tage
Nürnberg 2 Tage
Köln 2 Tage
Wuppertal 2 Tage
Berlin 2 Tage
Mainz 2 Tage
Erfurt 2 Tage
Bremen 2 Tage
Nach oben
Seminare als Stream SRI zertifiziert
© 2026 www.seminar-experts.de All rights reserved. | Kontakt | Impressum | Nach oben