Das Seminar behandelt Apache Iceberg als offenes Tabellenformat für analytische Daten auf Object Storage. Von Catalog- und Speicheranbindung über Tabellenentwurf und DML bis zu Snapshots, Evolution, Wartung und Optimierung wird ein vollständiger, kontrollierter Tabellenlebenszyklus umgesetzt.
Inhaltsübersicht
- Lernziele und fachliche Einordnung
- Schrittweise Seminarinhalte
- Praxisübungen und Laborszenarien
- Zielgruppe und Voraussetzungen
- Didaktik und Arbeitsweise
Lernziele
- Iceberg-Architektur, Metadaten und Catalog-Varianten sicher einordnen.
- Iceberg-Tabellen mit geeigneten Datei- und Partitionseigenschaften anlegen.
- Schema-, Partition- und Snapshot-Funktionen kontrolliert verwenden.
- INSERT, UPDATE, DELETE und MERGE connectorgerecht testen.
- Wartungs-, Sicherheits- und Performanceverfahren für den Regelbetrieb definieren.
Schrittweise Seminarinhalte
1. Iceberg-Architektur und Catalog-Auswahl
Schwerpunkt: Metadatendateien, Manifeste, Snapshots, Data Files, Hive Metastore, REST-, JDBC-, Glue-, Nessie- und weitere Catalog-Varianten.
- Ausgangslage, fachliche Ziele, technische Abhängigkeiten und Abnahmekriterien für den Themenblock „Iceberg-Architektur und Catalog-Auswahl“ erfassen.
- Relevante Komponenten, Datenobjekte, Rollen und Konfigurationsparameter anhand von Metadatendateien, Manifeste, Snapshots, Data Files, Hive Metastore, REST-, JDBC-, Glue-, Nessie- und weitere Catalog-Varianten. modellieren.
- Die erforderliche Konfiguration, SQL-Abfrage oder Prozessfolge im Laborsystem schrittweise umsetzen und jeden Zwischenstand dokumentieren.
- Funktion, Ausführungsplan, Datenzugriff, Berechtigungen, Ressourcenverbrauch und Fehlerverhalten mit definierten Positiv- und Negativfällen prüfen.
- Als Arbeitsergebnis eine begründete Catalog- und Metadatenarchitektur dokumentieren, fachlich abnehmen und in einen wiederholbaren Standard überführen.
2. Object Storage und Dateiformate
Schwerpunkt: S3-kompatibler Speicher, Azure und Google Cloud, Parquet, ORC, Avro, Credentials, Pfade, Verschlüsselung und Zugriffstests.
- Ausgangslage, fachliche Ziele, technische Abhängigkeiten und Abnahmekriterien für den Themenblock „Object Storage und Dateiformate“ erfassen.
- Relevante Komponenten, Datenobjekte, Rollen und Konfigurationsparameter anhand von S3-kompatibler Speicher, Azure und Google Cloud, Parquet, ORC, Avro, Credentials, Pfade, Verschlüsselung und Zugriffstests. modellieren.
- Die erforderliche Konfiguration, SQL-Abfrage oder Prozessfolge im Laborsystem schrittweise umsetzen und jeden Zwischenstand dokumentieren.
- Funktion, Ausführungsplan, Datenzugriff, Berechtigungen, Ressourcenverbrauch und Fehlerverhalten mit definierten Positiv- und Negativfällen prüfen.
- Als Arbeitsergebnis eine sichere Speicher- und Dateiformatkonfiguration dokumentieren, fachlich abnehmen und in einen wiederholbaren Standard überführen.
3. Tabellenanlage und Partitionierungsdesign
Schwerpunkt: CREATE SCHEMA, CREATE TABLE, Tabellenproperties, Hidden Partitioning, Partition Transforms, Sortierung und Dateigrößen.
- Ausgangslage, fachliche Ziele, technische Abhängigkeiten und Abnahmekriterien für den Themenblock „Tabellenanlage und Partitionierungsdesign“ erfassen.
- Relevante Komponenten, Datenobjekte, Rollen und Konfigurationsparameter anhand von CREATE SCHEMA, CREATE TABLE, Tabellenproperties, Hidden Partitioning, Partition Transforms, Sortierung und Dateigrößen. modellieren.
- Die erforderliche Konfiguration, SQL-Abfrage oder Prozessfolge im Laborsystem schrittweise umsetzen und jeden Zwischenstand dokumentieren.
- Funktion, Ausführungsplan, Datenzugriff, Berechtigungen, Ressourcenverbrauch und Fehlerverhalten mit definierten Positiv- und Negativfällen prüfen.
- Als Arbeitsergebnis ein belastbares Tabellen- und Partitionierungsdesign dokumentieren, fachlich abnehmen und in einen wiederholbaren Standard überführen.
4. Schema- und Partitionsevolution
Schwerpunkt: Spaltenänderungen, Typentwicklung, Umbenennung, Partitionsevolution, Kompatibilität und Auswirkungen auf Abfragen.
- Ausgangslage, fachliche Ziele, technische Abhängigkeiten und Abnahmekriterien für den Themenblock „Schema- und Partitionsevolution“ erfassen.
- Relevante Komponenten, Datenobjekte, Rollen und Konfigurationsparameter anhand von Spaltenänderungen, Typentwicklung, Umbenennung, Partitionsevolution, Kompatibilität und Auswirkungen auf Abfragen. modellieren.
- Die erforderliche Konfiguration, SQL-Abfrage oder Prozessfolge im Laborsystem schrittweise umsetzen und jeden Zwischenstand dokumentieren.
- Funktion, Ausführungsplan, Datenzugriff, Berechtigungen, Ressourcenverbrauch und Fehlerverhalten mit definierten Positiv- und Negativfällen prüfen.
- Als Arbeitsergebnis einen getesteten Evolutionsprozess ohne Datenneuschreiben dokumentieren, fachlich abnehmen und in einen wiederholbaren Standard überführen.
5. Snapshots, Time Travel und Branches
Schwerpunkt: Snapshot-Historie, zeitbezogene Abfragen, Rollback, Branches, Tags, Auditierbarkeit und Aufbewahrung.
- Ausgangslage, fachliche Ziele, technische Abhängigkeiten und Abnahmekriterien für den Themenblock „Snapshots, Time Travel und Branches“ erfassen.
- Relevante Komponenten, Datenobjekte, Rollen und Konfigurationsparameter anhand von Snapshot-Historie, zeitbezogene Abfragen, Rollback, Branches, Tags, Auditierbarkeit und Aufbewahrung. modellieren.
- Die erforderliche Konfiguration, SQL-Abfrage oder Prozessfolge im Laborsystem schrittweise umsetzen und jeden Zwischenstand dokumentieren.
- Funktion, Ausführungsplan, Datenzugriff, Berechtigungen, Ressourcenverbrauch und Fehlerverhalten mit definierten Positiv- und Negativfällen prüfen.
- Als Arbeitsergebnis einen kontrollierten Versions- und Wiederherstellungsprozess dokumentieren, fachlich abnehmen und in einen wiederholbaren Standard überführen.
6. DML und transaktionale Änderungen
Schwerpunkt: INSERT, UPDATE, DELETE, MERGE, konkurrierende Änderungen, Commit-Verhalten, Fehlerfälle und Abnahme.
- Ausgangslage, fachliche Ziele, technische Abhängigkeiten und Abnahmekriterien für den Themenblock „DML und transaktionale Änderungen“ erfassen.
- Relevante Komponenten, Datenobjekte, Rollen und Konfigurationsparameter anhand von INSERT, UPDATE, DELETE, MERGE, konkurrierende Änderungen, Commit-Verhalten, Fehlerfälle und Abnahme. modellieren.
- Die erforderliche Konfiguration, SQL-Abfrage oder Prozessfolge im Laborsystem schrittweise umsetzen und jeden Zwischenstand dokumentieren.
- Funktion, Ausführungsplan, Datenzugriff, Berechtigungen, Ressourcenverbrauch und Fehlerverhalten mit definierten Positiv- und Negativfällen prüfen.
- Als Arbeitsergebnis einen vollständigen DML- und Commit-Testkatalog dokumentieren, fachlich abnehmen und in einen wiederholbaren Standard überführen.
7. Wartung, Sicherheit und Performance
Schwerpunkt: Optimize, Manifestpflege, Snapshot-Ablauf, verwaiste Dateien, Statistiken, Autorisierung, Monitoring und Betriebsgrenzen.
- Ausgangslage, fachliche Ziele, technische Abhängigkeiten und Abnahmekriterien für den Themenblock „Wartung, Sicherheit und Performance“ erfassen.
- Relevante Komponenten, Datenobjekte, Rollen und Konfigurationsparameter anhand von Optimize, Manifestpflege, Snapshot-Ablauf, verwaiste Dateien, Statistiken, Autorisierung, Monitoring und Betriebsgrenzen. modellieren.
- Die erforderliche Konfiguration, SQL-Abfrage oder Prozessfolge im Laborsystem schrittweise umsetzen und jeden Zwischenstand dokumentieren.
- Funktion, Ausführungsplan, Datenzugriff, Berechtigungen, Ressourcenverbrauch und Fehlerverhalten mit definierten Positiv- und Negativfällen prüfen.
- Als Arbeitsergebnis ein ausführbares Wartungs- und Betriebsrunbook dokumentieren, fachlich abnehmen und in einen wiederholbaren Standard überführen.
Praxisübungen und Laborszenarien
- Konfiguration eines Iceberg-Catalogs mit Object Storage.
- Anlage einer partitionierten Tabelle mit Schema- und Partitionsevolution.
- Durchspielen von MERGE, Time Travel, Rollback und Wartungsprozeduren.
Zielgruppe und Voraussetzungen
Zielgruppe: Data Engineering, Lakehouse-Architektur, Data-Platform-Betrieb, Cloud Engineering und Datenbankadministration.
Voraussetzungen: Gute SQL-Kenntnisse, Grundverständnis von Object Storage und spaltenorientierten Dateiformaten sowie Trino-Grundlagen.
Didaktik und Arbeitsweise
Kurze Fachimpulse werden unmittelbar durch Demonstrationen, strukturierte Konfigurations- oder SQL-Schritte, praktische Übungen und kontrollierte Fehlerfälle vertieft. Jede Übung verwendet definierte Ausgangswerte, Prüfpunkte und Dokumentationsanforderungen, damit die erarbeiteten Abläufe als technischer Standard wiederholbar bleiben.
Fachbereichsleitung und Trainerteam
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de
Seminardetails
| Dauer: | 2 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 1.198 zzgl. MwSt. Inhaus: € 3.400 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Data Engineering, Lakehouse-Architektur, Data-Platform-Betrieb, Cloud Engineering und Datenbankadministration |
| Voraussetzungen: | Gute SQL-Kenntnisse, Grundverständnis von Object Storage und spaltenorientierten Dateiformaten sowie Trino-Grundlagen |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhouse, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
