Seminar SAP Datasphere – Object Store, File Spaces und Spark-Transformationen

Dieses Seminar behandelt datei- und objektbasierte Datenverarbeitung in SAP Datasphere. File Spaces, Object-Store-Strukturen, offene Dateiformate und Spark-basierte Transformationen werden für großvolumige, schemaflexible und analytisch nutzbare Datenbestände eingesetzt.

Inhaltsverzeichnis

  1. Zielsetzung
  2. Lernziele
  3. Zielgruppe
  4. Voraussetzungen
  5. Seminarinhalte
  6. Praxisübungen

Zielsetzung

Inhaltsverzeichnis: fachliches Ziel · technisches Ziel · Qualität und Betriebsfähigkeit

Ziel ist ein kontrollierter Datenweg von der Dateiablage über skalierbare Transformationen bis zur katalogisierten und für relationale oder analytische Nutzung bereitgestellten Datenbasis.

Lernziele

Inhaltsverzeichnis: Einordnung · Umsetzung · Prüfung · Dokumentation

  • die fachlichen und technischen Grundlagen zu Architektur objektbasierter Daten, File Spaces administrieren, Dateiformate und Schema sicher einordnen
  • Anforderungen in nachvollziehbare Konfigurations-, Integrations- oder Modellierungsschritte überführen
  • einen durchgängigen Praxisfall mit kontrollierten Zwischenschritten umsetzen
  • Datenqualität, Berechtigungen, Abhängigkeiten und Laufverhalten mit festgelegten Prüfkriterien bewerten
  • die Lösung dokumentieren, deployen und für einen geregelten Betrieb beziehungsweise die weitere Nutzung vorbereiten

Zielgruppe

Inhaltsverzeichnis: Rollen · Aufgabenbereiche · Projektbezug

Data Engineers, Datenplattform-Architekten, Datasphere-Entwickler, Cloud-Spezialisten und technische Administratoren

Voraussetzungen

Inhaltsverzeichnis: Fachkenntnisse · technische Grundlagen · empfohlene Praxiserfahrung

Grundkenntnisse zu Datenintegration, Dateiformaten und Datenmodellierung; erste Erfahrungen mit verteilten Datenverarbeitungsprinzipien sind hilfreich

Seminarinhalte

Inhaltsverzeichnis: Architektur objektbasierter Daten · File Spaces administrieren · Dateiformate und Schema · Datenaufnahme in den Object Store · Spark-Transformationskonzept · Bereinigung und Standardisierung · Anreicherung und Aggregation · Bereitstellung für Datasphere-Modelle · Performance und Betrieb

  1. Architektur objektbasierter Daten
  2. File Spaces administrieren
  3. Dateiformate und Schema
  4. Datenaufnahme in den Object Store
  5. Spark-Transformationskonzept
  6. Bereinigung und Standardisierung
  7. Anreicherung und Aggregation
  8. Bereitstellung für Datasphere-Modelle
  9. Performance und Betrieb

Modul 1: Architektur objektbasierter Daten

Inhaltsverzeichnis: relationale Tabellen und dateibasierte Datenbestände voneinander abgrenzen · Object Store, File Space, Rechenebene und Konsumschicht einordnen · geeignete Szenarien nach Volumen, Struktur und Verarbeitungsart bestimmen · Datenzonen für Roh-, bereinigte und kuratierte Dateien definieren

  1. Schritt 1: relationale Tabellen und dateibasierte Datenbestände voneinander abgrenzen
  2. Schritt 2: Object Store, File Space, Rechenebene und Konsumschicht einordnen
  3. Schritt 3: geeignete Szenarien nach Volumen, Struktur und Verarbeitungsart bestimmen
  4. Schritt 4: Datenzonen für Roh-, bereinigte und kuratierte Dateien definieren

Praxis: Eine Lakehouse-nahe Zielarchitektur für Sensordaten entwerfen

Modul 2: File Spaces administrieren

Inhaltsverzeichnis: Zweck, Eigentümer und Namenskonvention eines File Space festlegen · Ressourcen und Zugriffsrollen passend zu Teams und Datenklassen zuweisen · Ordner- und Objektstruktur für Datenlebenszyklen planen · administrative Kontrollen und Verantwortlichkeiten dokumentieren

  1. Schritt 1: Zweck, Eigentümer und Namenskonvention eines File Space festlegen
  2. Schritt 2: Ressourcen und Zugriffsrollen passend zu Teams und Datenklassen zuweisen
  3. Schritt 3: Ordner- und Objektstruktur für Datenlebenszyklen planen
  4. Schritt 4: administrative Kontrollen und Verantwortlichkeiten dokumentieren

Praxis: Einen File Space mit Zonen, Rollen und Ablageregeln konzipieren

Modul 3: Dateiformate und Schema

Inhaltsverzeichnis: strukturierte und semistrukturierte Formate nach Verarbeitungseigenschaften vergleichen · Datentypen, Nullwerte und Zeichencodierung prüfen · Schemaentwicklung und zusätzliche Spalten kontrolliert behandeln · Partitionierung und Dateigröße an Zugriffs- und Ladeverhalten ausrichten

  1. Schritt 1: strukturierte und semistrukturierte Formate nach Verarbeitungseigenschaften vergleichen
  2. Schritt 2: Datentypen, Nullwerte und Zeichencodierung prüfen
  3. Schritt 3: Schemaentwicklung und zusätzliche Spalten kontrolliert behandeln
  4. Schritt 4: Partitionierung und Dateigröße an Zugriffs- und Ladeverhalten ausrichten

Praxis: Mehrere Beispieldateien auf Format-, Schema- und Partitionierungsqualität untersuchen

Modul 4: Datenaufnahme in den Object Store

Inhaltsverzeichnis: Quell- und Zielpfade eindeutig festlegen · Dateien kontrolliert übertragen oder aus einer Pipeline bereitstellen · Vollständigkeit mit Dateianzahl, Größe und Prüfinformationen validieren · fehlerhafte oder unvollständige Lieferungen isolieren

  1. Schritt 1: Quell- und Zielpfade eindeutig festlegen
  2. Schritt 2: Dateien kontrolliert übertragen oder aus einer Pipeline bereitstellen
  3. Schritt 3: Vollständigkeit mit Dateianzahl, Größe und Prüfinformationen validieren
  4. Schritt 4: fehlerhafte oder unvollständige Lieferungen isolieren

Praxis: Eine mehrteilige Datenlieferung mit Manifest und Fehlerbereich übernehmen

Modul 5: Spark-Transformationskonzept

Inhaltsverzeichnis: verteilte Verarbeitung und Partitionen fachlich einordnen · Quell- und Zielbestände für eine Transformation auswählen · Transformationsschritte in lesbare und testbare Einheiten zerlegen · Ressourcenbedarf und Wiederholbarkeit vor der Ausführung bewerten

  1. Schritt 1: verteilte Verarbeitung und Partitionen fachlich einordnen
  2. Schritt 2: Quell- und Zielbestände für eine Transformation auswählen
  3. Schritt 3: Transformationsschritte in lesbare und testbare Einheiten zerlegen
  4. Schritt 4: Ressourcenbedarf und Wiederholbarkeit vor der Ausführung bewerten

Praxis: Einen Transformationsentwurf für großvolumige Ereignisdaten erstellen

Modul 6: Bereinigung und Standardisierung

Inhaltsverzeichnis: Datentypen, Zeitstempel und Codes vereinheitlichen · ungültige, fehlende und doppelte Datensätze behandeln · fachliche Qualitätsregeln auf große Datenmengen anwenden · gültige und fehlerhafte Ergebnisse getrennt persistieren

  1. Schritt 1: Datentypen, Zeitstempel und Codes vereinheitlichen
  2. Schritt 2: ungültige, fehlende und doppelte Datensätze behandeln
  3. Schritt 3: fachliche Qualitätsregeln auf große Datenmengen anwenden
  4. Schritt 4: gültige und fehlerhafte Ergebnisse getrennt persistieren

Praxis: Rohdaten bereinigen und Qualitätsfehler in einem separaten Bestand ausgeben

Modul 7: Anreicherung und Aggregation

Inhaltsverzeichnis: Dateidaten mit Referenz- oder Stammdaten verbinden · Partitionierung und Join-Strategie auf Datenverteilung abstimmen · Kennzahlen auf geeigneter Granularität aggregieren · Zwischen- und Endergebnisse mit Kontrollsummen vergleichen

  1. Schritt 1: Dateidaten mit Referenz- oder Stammdaten verbinden
  2. Schritt 2: Partitionierung und Join-Strategie auf Datenverteilung abstimmen
  3. Schritt 3: Kennzahlen auf geeigneter Granularität aggregieren
  4. Schritt 4: Zwischen- und Endergebnisse mit Kontrollsummen vergleichen

Praxis: Ereignisdaten mit Geräteinformationen anreichern und tagesweise verdichten

Modul 8: Bereitstellung für Datasphere-Modelle

Inhaltsverzeichnis: kuratierte Dateien als konsumierbare Datenbasis registrieren · Schema, Schlüssel und Semantik für nachgelagerte Modelle ergänzen · relationale und analytische Zugriffspfade nach Nutzung auswählen · Lineage und Datenproduktbeschreibung vervollständigen

  1. Schritt 1: kuratierte Dateien als konsumierbare Datenbasis registrieren
  2. Schritt 2: Schema, Schlüssel und Semantik für nachgelagerte Modelle ergänzen
  3. Schritt 3: relationale und analytische Zugriffspfade nach Nutzung auswählen
  4. Schritt 4: Lineage und Datenproduktbeschreibung vervollständigen

Praxis: Einen kuratierten Dateibestand für ein analytisches Modell bereitstellen

Modul 9: Performance und Betrieb

Inhaltsverzeichnis: kleine Dateien, Datenverteilung und unnötige Scans als Kostentreiber erkennen · Partitionierung und Dateigröße anhand von Messwerten optimieren · Läufe, Datenmengen und Fehler automatisiert überwachen · Aufbewahrung, Bereinigung und Wiederanlauf im Runbook dokumentieren

  1. Schritt 1: kleine Dateien, Datenverteilung und unnötige Scans als Kostentreiber erkennen
  2. Schritt 2: Partitionierung und Dateigröße anhand von Messwerten optimieren
  3. Schritt 3: Läufe, Datenmengen und Fehler automatisiert überwachen
  4. Schritt 4: Aufbewahrung, Bereinigung und Wiederanlauf im Runbook dokumentieren

Praxis: Eine langsame Verarbeitung analysieren und mit geänderter Ablagestruktur verbessern

Praxisübungen

Inhaltsverzeichnis: File-Space- und Datenzonenmodell mit Zugriffsregeln erstellen · Dateilieferung validieren und Spark-basiert bereinigen sowie anreichern · Kuratierten Bestand für Modellierung, Katalog und Betrieb bereitstellen

  • File-Space- und Datenzonenmodell mit Zugriffsregeln erstellen
  • Dateilieferung validieren und Spark-basiert bereinigen sowie anreichern
  • Kuratierten Bestand für Modellierung, Katalog und Betrieb bereitstellen

Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner

Seminardetails

   
Dauer: 3 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr
Preis: Öffentlich oder Live Stream: € 1.797 zzgl. MwSt.
Inhaus: € 5.100 zzgl. MwSt.
Teilnehmeranzahl: min. 2 - max. 8
Teilnehmer: Data Engineers, Datenplattform-Architekten, Datasphere-Entwickler, Cloud-Spezialisten und technische Administratoren
Voraussetzungen: Grundkenntnisse zu Datenintegration, Dateiformaten und Datenmodellierung; erste Erfahrungen mit verteilten Datenverarbeitungsprinzipien sind hilfreich
Standorte: Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg
Methoden: Vortrag, Demonstrationen, praktische Übungen am System
Seminararten: Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht
Durchführungsgarantie: ja, ab 2 Teilnehmern
Sprache: Deutsch - bei Firmenseminaren ist auch Englisch möglich
Seminarunterlage: Dokumentation auf Datenträger oder als Download
Teilnahmezertifikat: ja, selbstverständlich
Verpflegung: Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch)
Support: 3 Anrufe im Seminarpreis enthalten
Barrierefreier Zugang: an den meisten Standorten verfügbar
  Weitere Informationen unter + 49 (221) 74740055

Seminartermine

Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.

Seminar Startdatum Enddatum Ort Dauer
Trier 3 Tage
Madgeburg 3 Tage
Regensburg 3 Tage
Jena 3 Tage
Ulm 3 Tage
München 3 Tage
Friedrichshafen 3 Tage
Kassel 3 Tage
Wuppertal 3 Tage
Münster 3 Tage
Nürnberg 3 Tage
Köln 3 Tage
Bremen 3 Tage
Berlin 3 Tage
Mainz 3 Tage
Erfurt 3 Tage
Essen 3 Tage
Darmstadt 3 Tage
Frankfurt 3 Tage
Paderborn 3 Tage
Flensburg 3 Tage
Konstanz 3 Tage
Freiburg 3 Tage
Potsdam 3 Tage
Hamburg 3 Tage
Leipzig 3 Tage
Hamm 3 Tage
Rostock 3 Tage
Dresden 3 Tage
Luxemburg 3 Tage
Hannover 3 Tage
Stuttgart 3 Tage
Madgeburg 3 Tage
Regensburg 3 Tage
Jena 3 Tage
Trier 3 Tage
München 3 Tage
Friedrichshafen 3 Tage
Kassel 3 Tage
Ulm 3 Tage
Nach oben
Seminare als Stream SRI zertifiziert
© 2026 www.seminar-experts.de All rights reserved. | Kontakt | Impressum | Nach oben