Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Dauer 35 Stunden
Schulungsübersicht
Einführung, Ziele und Migrationsstrategie
- Kursziele, Anpassung an das Teilnehmerprofil und Erfolgskriterien
- Überblick über Migrationsansätze und Risiken
- Einrichtung von Arbeitsbereichen, Repositories und Lab-Datensätzen
Tag 1 — Grundlagen der Migration und Architektur
- Lakehouse-Konzepte, Überblick über Delta Lake und Databricks-Architektur
- Unterschiede zwischen SMP und MPP sowie deren Auswirkungen auf die Migration
- Gestaltung des Medallion- (Bronze→Silver→Gold-)Modells und Überblick über Unity Catalog
Tag 1 Lab — Übertragung einer gespeicherten Prozedur
- Praktische Migration einer Beispiel-Speicherverfahren in ein Notebook
- Überführung von temporären Tabellen und Cursors in DataFrame-Transformationen
- Validierung und Abgleich mit dem ursprünglichen Ergebnis
Tag 2 — Fortgeschrittenes Delta Lake & inkrementelle Ladevorgänge
- ACID-Transaktionen, Commit-Logs, Versionierung und Time Travel
- Auto Loader, MERGE INTO-Muster, Upserts und Schemaabwicklung
- OPTIMIZE, VACUUM, Z-ORDER, Partitionierung und Speicher-Tuning
Tag 2 Lab — Inkrementelle Ingestion & Optimierung
- Implementierung von Auto Loader-Ingestion und MERGE-Workflows
- Anwendung von OPTIMIZE, Z-ORDER und VACUUM; Validierung der Ergebnisse
- Messung von Verbesserungen bei der Lese- und Schreibleistung
Tag 3 — SQL in Databricks, Leistung & Fehlersuche
- Analysen-SQL-Funktionen: Fensterfunktionen, höhere Funktionen, JSON-/Array-Verarbeitung
- Lektüre des Spark UI, DAGs, Shuffles, Stages, Tasks und Diagnose von Engpässen
- Muster zur Abfrageoptimierung: Broadcast-Joins, Hints, Caching und Reduzierung von Spill
Tag 3 Lab — SQL-Refactorisierung & Performance-Tuning
- Refactorisierung eines aufwendigen SQL-Prozesses in optimiertes Spark SQL
- Nutzung von Spark-UI-Spuren zur Identifizierung und Behebung von Skew- und Shuffle-Problemen
- Benchmarking vor und nach der Optimierung sowie Dokumentation der Tuning-Schritte
Tag 4 — Taktisches PySpark: Ersetzung prozeduraler Logik
- Executionsmodell von Spark: Driver, Executors, Lazy Evaluation und Partitionierungsstrategien
- Umwandlung von Schleifen und Cursors in vektorisierte DataFrame-Operationen
- Modularisierung, UDFs/pandas UDFs, Widgets und wiederverwendbare Bibliotheken
Tag 4 Lab — Refactorisierung prozeduraler Skripte
- Refactorisierung eines prozeduralen ETL-Skripts in modulare PySpark-Notebooks
- Einführung von Parametrisierung, unit-artigen Tests und wiederverwendbaren Funktionen
- Code-Review und Anwendung der Best-Practice-Checkliste
Tag 5 — Orchestrierung, End-to-End-Pipeline & Best Practices
- Databricks Workflows: Job-Design, Task-Abhängigkeiten, Trigger und Fehlerbehandlung
- Gestaltung inkrementeller Medallion-Pipelines mit Qualitätsregeln und Schemavalidierung
- Integration mit Git (GitHub/Azure DevOps), CI und Teststrategien für PySpark-Logik
Tag 5 Lab — Aufbau einer vollständigen End-to-End-Pipeline
- Zusammenbau einer Bronze→Silver→Gold-Pipeline, orchestriert mit Workflows
- Implementierung von Protokollierung, Auditierung, Wiederholungsversuchen und automatisierten Validierungen
- Ausführen der Gesamtpipeline, Validierung der Ausgaben und Vorbereitung der Bereitstellungshinweise
Operationalisierung, Governance und Produktionsreife
- Unity Catalog Governance, Stammbaum (Lineage) und Best Practices für Zugriffskontrollen
- Kosten, Clustergrößen, Autoscaling und Muster für Job-Konkurrenz
- Checklisten zur Bereitstellung, Rollback-Strategien und Erstellung von Runbooks
Finale Überprüfung, Wissenstransfer und nächste Schritte
- Vorträge der Teilnehmer zu ihren Migrationsarbeiten und den gewonnenen Erfahrungen
- Lückenschlussanalyse, empfohlene Folgetätigkeiten und Übergabe des Schulungsmaterials
- Referenzen, weitere Lernpfade und Support-Optionen
Voraussetzungen
- Grundlegendes Verständnis von Konzepten im Data Engineering
- Praxiserfahrung mit SQL und gespeicherten Prozeduren (Synapse / SQL Server)
- Vertrautheit mit Konzepten zur ETL-Orchestrierung (ADF oder ähnlich)
Zielgruppe
- Technologie-Manager mit Data-Engineering-Hintergrund
- Data-Engineers, die prozedurale OLAP-Logik in Lakehouse-Muster überführen
- Plattform-Engineers, die für die Einführung von Databricks verantwortlich sind