Kontakt aufnehmen
 Dauer 35 Stunden

Schulungsübersicht

Databricks Platform und Lakehouse-Grundlagen

  • Databricks Lakehouse-Architektur und Komponenten
  • Organisation von Arbeitsbereichen und Katalogen

Databricks-Arbeitsbereich und Notebooks

  • Navigieren im Arbeitsbereich und notebookbasierte Entwicklung
  • Code in wiederverwendbare Notebooks strukturieren

Apache Spark-Architektur und Ausführung

  • Spark-Laufzeitarchitektur und Ausführungsmodell
  • Laziale Auswertung und der Job-DAG

PySpark DataFrames und die DataFrame-API

  • DataFrame-Abstraktionen und Schemata
  • Kern-DataFrame-Operationen und Spaltenausdrücke

Übersetzen von SQL in PySpark DataFrames

  • Übersetzung von SQL-Kernklauseln in DataFrame-Operationen
  • Fensterfunktionen und Aggregationen in PySpark

Lesen und Schreiben von Daten in Databricks

  • Von gängigen Datei- und Datenbankquellen lesen
  • Daten im Lakehouse schreiben und partitionieren

Delta Lake und Tabellenmanagement

  • Delta-Tabellen und ACID-Transaktionen
  • Zeitreise (Time Travel) und Schemaevolution

Muster für Datenbereinigung und -transformation

  • Datenbereinigung und Typkonvertierung
  • Erstellen wiederverwendbarer Transformationslogik

Benutzerdefinierte Funktionen und modulärer Code

  • Python UDFs und Pandas UDFs
  • Prozedurale Logik in Funktionen modularisieren

Performance-Tuning und Optimierung

  • Partitionierungs- und Caching-Strategien
  • Durch die Spark UI auftretende Engpässe diagnostizieren

Grundlagen des Strukturierten Streamings

  • Batch- versus Streaming-Verarbeitungsmodelle
  • Streaming DataFrames und grundlegende Aggregationen

Databricks-Jobs und Workflow-Orchestrierung

  • Notebooks als Jobs und Aufgaben planen
  • Mehrstufige Workflows mit Abhängigkeiten erstellen

Unity Catalog und Daten-Governance

  • Unity-Catalog-Architektur und Namespaces
  • Zugriffskontrolle und Daten-Lineage

Tests, Debugging und Produktionspraktiken

  • Unit-Testing von PySpark-Logik
  • Debugging und Code-Qualitätsstandards

Ganzheitliche Use Cases in den Finanzdienstleistungen

  • Aufbauen einer durchgehenden Banking-ETL-Pipeline
  • Migration legacy SQL-Prozesse zu PySpark

Migrieren von SQL-Arbeitslasten zu PySpark

  • Migrationsstrategie und Planungsmodelle
  • Inkrementelle Konvertierung von SQL-Workflows zu PySpark

Voraussetzungen

  • Erfahrung mit Python-Programmierung, einschließlich Funktionen und Datentypen
  • Verständnis von SQL, einschließlich Joins, Aggregationen und Subqueries
  • Keine Vorkenntnisse in Databricks oder PySpark erforderlich

Zielgruppe

  • Data Engineers, Data Analysts und Data Professionals
  • Teams, die bestehende SQL-basierte Workflows zu Databricks und PySpark migrieren

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Erfahrungsberichte (1)

Kommende Kurse

Verwandte Kategorien