Kontakt aufnehmen
 Dauer 35 Stunden

Schulungsübersicht

Einführung, Ziele und Migrationsstrategie

  • Kursziele, Anpassung an das Teilnehmerprofil und Erfolgskriterien
  • Überblick über Migrationsansätze und Risiken
  • Einrichtung von Arbeitsbereichen, Repositories und Lab-Datensätzen

Tag 1 — Grundlagen der Migration und Architektur

  • Lakehouse-Konzepte, Überblick über Delta Lake und Databricks-Architektur
  • Unterschiede zwischen SMP und MPP sowie deren Auswirkungen auf die Migration
  • Gestaltung des Medallion- (Bronze→Silver→Gold-)Modells und Überblick über Unity Catalog

Tag 1 Lab — Übertragung einer gespeicherten Prozedur

  • Praktische Migration einer Beispiel-Speicherverfahren in ein Notebook
  • Überführung von temporären Tabellen und Cursors in DataFrame-Transformationen
  • Validierung und Abgleich mit dem ursprünglichen Ergebnis

Tag 2 — Fortgeschrittenes Delta Lake & inkrementelle Ladevorgänge

  • ACID-Transaktionen, Commit-Logs, Versionierung und Time Travel
  • Auto Loader, MERGE INTO-Muster, Upserts und Schemaabwicklung
  • OPTIMIZE, VACUUM, Z-ORDER, Partitionierung und Speicher-Tuning

Tag 2 Lab — Inkrementelle Ingestion & Optimierung

  • Implementierung von Auto Loader-Ingestion und MERGE-Workflows
  • Anwendung von OPTIMIZE, Z-ORDER und VACUUM; Validierung der Ergebnisse
  • Messung von Verbesserungen bei der Lese- und Schreibleistung

Tag 3 — SQL in Databricks, Leistung & Fehlersuche

  • Analysen-SQL-Funktionen: Fensterfunktionen, höhere Funktionen, JSON-/Array-Verarbeitung
  • Lektüre des Spark UI, DAGs, Shuffles, Stages, Tasks und Diagnose von Engpässen
  • Muster zur Abfrageoptimierung: Broadcast-Joins, Hints, Caching und Reduzierung von Spill

Tag 3 Lab — SQL-Refactorisierung & Performance-Tuning

  • Refactorisierung eines aufwendigen SQL-Prozesses in optimiertes Spark SQL
  • Nutzung von Spark-UI-Spuren zur Identifizierung und Behebung von Skew- und Shuffle-Problemen
  • Benchmarking vor und nach der Optimierung sowie Dokumentation der Tuning-Schritte

Tag 4 — Taktisches PySpark: Ersetzung prozeduraler Logik

  • Executionsmodell von Spark: Driver, Executors, Lazy Evaluation und Partitionierungsstrategien
  • Umwandlung von Schleifen und Cursors in vektorisierte DataFrame-Operationen
  • Modularisierung, UDFs/pandas UDFs, Widgets und wiederverwendbare Bibliotheken

Tag 4 Lab — Refactorisierung prozeduraler Skripte

  • Refactorisierung eines prozeduralen ETL-Skripts in modulare PySpark-Notebooks
  • Einführung von Parametrisierung, unit-artigen Tests und wiederverwendbaren Funktionen
  • Code-Review und Anwendung der Best-Practice-Checkliste

Tag 5 — Orchestrierung, End-to-End-Pipeline & Best Practices

  • Databricks Workflows: Job-Design, Task-Abhängigkeiten, Trigger und Fehlerbehandlung
  • Gestaltung inkrementeller Medallion-Pipelines mit Qualitätsregeln und Schemavalidierung
  • Integration mit Git (GitHub/Azure DevOps), CI und Teststrategien für PySpark-Logik

Tag 5 Lab — Aufbau einer vollständigen End-to-End-Pipeline

  • Zusammenbau einer Bronze→Silver→Gold-Pipeline, orchestriert mit Workflows
  • Implementierung von Protokollierung, Auditierung, Wiederholungsversuchen und automatisierten Validierungen
  • Ausführen der Gesamtpipeline, Validierung der Ausgaben und Vorbereitung der Bereitstellungshinweise

Operationalisierung, Governance und Produktionsreife

  • Unity Catalog Governance, Stammbaum (Lineage) und Best Practices für Zugriffskontrollen
  • Kosten, Clustergrößen, Autoscaling und Muster für Job-Konkurrenz
  • Checklisten zur Bereitstellung, Rollback-Strategien und Erstellung von Runbooks

Finale Überprüfung, Wissenstransfer und nächste Schritte

  • Vorträge der Teilnehmer zu ihren Migrationsarbeiten und den gewonnenen Erfahrungen
  • Lückenschlussanalyse, empfohlene Folgetätigkeiten und Übergabe des Schulungsmaterials
  • Referenzen, weitere Lernpfade und Support-Optionen

Voraussetzungen

  • Grundlegendes Verständnis von Konzepten im Data Engineering
  • Praxiserfahrung mit SQL und gespeicherten Prozeduren (Synapse / SQL Server)
  • Vertrautheit mit Konzepten zur ETL-Orchestrierung (ADF oder ähnlich)

Zielgruppe

  • Technologie-Manager mit Data-Engineering-Hintergrund
  • Data-Engineers, die prozedurale OLAP-Logik in Lakehouse-Muster überführen
  • Plattform-Engineers, die für die Einführung von Databricks verantwortlich sind

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien