Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Schulungsübersicht
Einführung, Ziele und Migrationsstrategie
- Kursziele, Alignment mit dem Teilnehmerprofil und Erfolgskriterien
- Übersichtliche Migrationsansätze und Risikobewertung
- Einrichtung von Workspaces, Repositories und Lab-Datensätzen
Tag 1 — Migrationsgrundlagen und Architektur
- Lakehouse-Konzepte, Delta Lake Überblick und Databricks-Architektur
- Unterschiede zwischen SMP und MPP sowie deren Auswirkungen auf die Migration
- Medallion-Design (Bronze→Silver→Gold) und Überblick über Unity Catalog
Tag 1 Lab — Übertragung einer gespeicherten Prozedur
- Praktische Migration einer Beispielspeichervorgabe in ein Notebook
- Zuordnung von Temp-Tabellen und Cursoren zu DataFrame-Transformationen
- Validierung und Vergleich mit der Originalausgabe
Tag 2 — Fortgeschrittenes Delta Lake & inkrementelles Laden
- ACID-Transaktionen, Commit-Logs, Versionierung und Time Travel
- Auto Loader, MERGE INTO-Muster, Upserts und Schema-Evolution
- OPTIMIZE, VACUUM, Z-ORDER, Partitionierung und Storage-Tuning
Tag 2 Lab — Inkrementelle Ingestion & Optimierung
- Implementierung von Auto Loader-Ingestion und MERGE-Workflows
- Anwendung von OPTIMIZE, Z-ORDER und VACUUM; Validierung der Ergebnisse
- Messung der Verbesserungen bei Lese- und Schreibperformance
Tag 3 — SQL in Databricks, Performance & Debugging
- Analytische SQL-Funktionen: Fensterfunktionen, Higher-Order-Funktionen, JSON-/Array-Verarbeitung
- Lesen der Spark UI, DAGs, Shuffles, Stages, Tasks und Diagnose von Engpässen
- Muster zur Query-Optimierung: Broadcast Joins, Hints, Caching und Reduzierung von Spills
Tag 3 Lab — SQL-Refactoring & Performance-Tuning
- Refactoring eines aufwändigen SQL-Prozesses in optimiertes Spark SQL
- Nutzung von Spark UI-Traces zur Identifizierung und Behebung von Skew- und Shuffle-Problemen
- Benchmarking vor und nach der Optimierung und Dokumentation der Tuning-Schritte
Tag 4 — Taktisches PySpark: Ersetzen prozeduraler Logik
- Spark-Ausführungsmodell: Driver, Executors, Lazy Evaluation und Partitionierungsstrategien
- Transformation von Schleifen und Cursoren in vektorisierte DataFrame-Operationen
- Modularisierung, UDFs/pandas UDFs, Widgets und wiederverwendbare Bibliotheken
Tag 4 Lab — Refactoring prozeduraler Skripte
- Refactoring eines prozeduralen ETL-Skripts in modulare PySpark-Notebooks
- Einführung von Parametrisierung, unit-stilisierten Tests und wiederverwendbaren Funktionen
- Code-Review und Anwendung einer Best-Practice-Checkliste
Tag 5 — Orchestrierung, End-to-End-Pipeline & Best Practices
- Databricks Workflows: Job-Design, Task-Abhängigkeiten, Trigger und Fehlerbehandlung
- Design inkrementeller Medallion-Pipelines mit Qualitätsregeln und Schema-Validierung
- Integration mit Git (GitHub/Azure DevOps), CI und Teststrategien für PySpark-Logik
Tag 5 Lab — Aufbau einer vollständigen End-to-End-Pipeline
- Zusammensetzen einer Bronze→Silver→Gold-Pipeline, orchestriert mit Workflows
- Implementierung von Logging, Auditing, Retries und automatisierten Validierungen
- Ausführung der gesamten Pipeline, Validierung der Ausgaben und Vorbereitung von Deploymentsnotizen
Operationalisierung, Governance und Produktionsreife
- Unity Catalog Governance, Lineage und Best Practices für Zugriffskontrollen
- Kosten, Cluster-Sizing, Autoscaling und Job-Konkurrenzmuster
- Deployments-Checklisten, Rollback-Strategien und Erstellung von Runbooks
Finale Überprüfung, Wissenstransfer und nächste Schritte
- Präsentationen der Teilnehmer zu Migrationsarbeiten und gewonnenen Erkenntnissen
- Lückenanalyse, empfohlene Folgemaßnahmen und Übergabe des Schulungsmaterials
- Referenzen, weiterführende Lernpfade und Support-Optionen
Voraussetzungen
- Grundlegendes Verständnis der Konzepte im Data Engineering
- Erfahrung mit SQL und gespeicherten Prozeduren (Synapse / SQL Server)
- Vertrautheit mit Konzepten der ETL-Orchestrierung (ADF oder vergleichbare Tools)
Zielgruppe
- Technologie-Manager mit Schwerpunkt Data Engineering
- Data Engineers, die prozedurale OLAP-Logik in Lakehouse-Muster überführen
- Plattform-Ingenieure, die für die Einführung von Databricks verantwortlich sind
35 Stunden