Kontakt aufnehmen

Schulungsübersicht

Einführung, Ziele und Migrationsstrategie

  • Kursziele, Alignment mit dem Teilnehmerprofil und Erfolgskriterien
  • Übersichtliche Migrationsansätze und Risikobewertung
  • Einrichtung von Workspaces, Repositories und Lab-Datensätzen

Tag 1 — Migrationsgrundlagen und Architektur

  • Lakehouse-Konzepte, Delta Lake Überblick und Databricks-Architektur
  • Unterschiede zwischen SMP und MPP sowie deren Auswirkungen auf die Migration
  • Medallion-Design (Bronze→Silver→Gold) und Überblick über Unity Catalog

Tag 1 Lab — Übertragung einer gespeicherten Prozedur

  • Praktische Migration einer Beispielspeichervorgabe in ein Notebook
  • Zuordnung von Temp-Tabellen und Cursoren zu DataFrame-Transformationen
  • Validierung und Vergleich mit der Originalausgabe

Tag 2 — Fortgeschrittenes Delta Lake & inkrementelles Laden

  • ACID-Transaktionen, Commit-Logs, Versionierung und Time Travel
  • Auto Loader, MERGE INTO-Muster, Upserts und Schema-Evolution
  • OPTIMIZE, VACUUM, Z-ORDER, Partitionierung und Storage-Tuning

Tag 2 Lab — Inkrementelle Ingestion & Optimierung

  • Implementierung von Auto Loader-Ingestion und MERGE-Workflows
  • Anwendung von OPTIMIZE, Z-ORDER und VACUUM; Validierung der Ergebnisse
  • Messung der Verbesserungen bei Lese- und Schreibperformance

Tag 3 — SQL in Databricks, Performance & Debugging

  • Analytische SQL-Funktionen: Fensterfunktionen, Higher-Order-Funktionen, JSON-/Array-Verarbeitung
  • Lesen der Spark UI, DAGs, Shuffles, Stages, Tasks und Diagnose von Engpässen
  • Muster zur Query-Optimierung: Broadcast Joins, Hints, Caching und Reduzierung von Spills

Tag 3 Lab — SQL-Refactoring & Performance-Tuning

  • Refactoring eines aufwändigen SQL-Prozesses in optimiertes Spark SQL
  • Nutzung von Spark UI-Traces zur Identifizierung und Behebung von Skew- und Shuffle-Problemen
  • Benchmarking vor und nach der Optimierung und Dokumentation der Tuning-Schritte

Tag 4 — Taktisches PySpark: Ersetzen prozeduraler Logik

  • Spark-Ausführungsmodell: Driver, Executors, Lazy Evaluation und Partitionierungsstrategien
  • Transformation von Schleifen und Cursoren in vektorisierte DataFrame-Operationen
  • Modularisierung, UDFs/pandas UDFs, Widgets und wiederverwendbare Bibliotheken

Tag 4 Lab — Refactoring prozeduraler Skripte

  • Refactoring eines prozeduralen ETL-Skripts in modulare PySpark-Notebooks
  • Einführung von Parametrisierung, unit-stilisierten Tests und wiederverwendbaren Funktionen
  • Code-Review und Anwendung einer Best-Practice-Checkliste

Tag 5 — Orchestrierung, End-to-End-Pipeline & Best Practices

  • Databricks Workflows: Job-Design, Task-Abhängigkeiten, Trigger und Fehlerbehandlung
  • Design inkrementeller Medallion-Pipelines mit Qualitätsregeln und Schema-Validierung
  • Integration mit Git (GitHub/Azure DevOps), CI und Teststrategien für PySpark-Logik

Tag 5 Lab — Aufbau einer vollständigen End-to-End-Pipeline

  • Zusammensetzen einer Bronze→Silver→Gold-Pipeline, orchestriert mit Workflows
  • Implementierung von Logging, Auditing, Retries und automatisierten Validierungen
  • Ausführung der gesamten Pipeline, Validierung der Ausgaben und Vorbereitung von Deploymentsnotizen

Operationalisierung, Governance und Produktionsreife

  • Unity Catalog Governance, Lineage und Best Practices für Zugriffskontrollen
  • Kosten, Cluster-Sizing, Autoscaling und Job-Konkurrenzmuster
  • Deployments-Checklisten, Rollback-Strategien und Erstellung von Runbooks

Finale Überprüfung, Wissenstransfer und nächste Schritte

  • Präsentationen der Teilnehmer zu Migrationsarbeiten und gewonnenen Erkenntnissen
  • Lückenanalyse, empfohlene Folgemaßnahmen und Übergabe des Schulungsmaterials
  • Referenzen, weiterführende Lernpfade und Support-Optionen

Voraussetzungen

  • Grundlegendes Verständnis der Konzepte im Data Engineering
  • Erfahrung mit SQL und gespeicherten Prozeduren (Synapse / SQL Server)
  • Vertrautheit mit Konzepten der ETL-Orchestrierung (ADF oder vergleichbare Tools)

Zielgruppe

  • Technologie-Manager mit Schwerpunkt Data Engineering
  • Data Engineers, die prozedurale OLAP-Logik in Lakehouse-Muster überführen
  • Plattform-Ingenieure, die für die Einführung von Databricks verantwortlich sind
 35 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien