Schulungsübersicht
Databricks Platform und Lakehouse-Grundlagen
- Databricks Lakehouse-Architektur und Komponenten
- Organisation von Arbeitsbereichen und Katalogen
Databricks-Arbeitsbereich und Notebooks
- Navigieren im Arbeitsbereich und notebookbasierte Entwicklung
- Code in wiederverwendbare Notebooks strukturieren
Apache Spark-Architektur und Ausführung
- Spark-Laufzeitarchitektur und Ausführungsmodell
- Laziale Auswertung und der Job-DAG
PySpark DataFrames und die DataFrame-API
- DataFrame-Abstraktionen und Schemata
- Kern-DataFrame-Operationen und Spaltenausdrücke
Übersetzen von SQL in PySpark DataFrames
- Übersetzung von SQL-Kernklauseln in DataFrame-Operationen
- Fensterfunktionen und Aggregationen in PySpark
Lesen und Schreiben von Daten in Databricks
- Von gängigen Datei- und Datenbankquellen lesen
- Daten im Lakehouse schreiben und partitionieren
Delta Lake und Tabellenmanagement
- Delta-Tabellen und ACID-Transaktionen
- Zeitreise (Time Travel) und Schemaevolution
Muster für Datenbereinigung und -transformation
- Datenbereinigung und Typkonvertierung
- Erstellen wiederverwendbarer Transformationslogik
Benutzerdefinierte Funktionen und modulärer Code
- Python UDFs und Pandas UDFs
- Prozedurale Logik in Funktionen modularisieren
Performance-Tuning und Optimierung
- Partitionierungs- und Caching-Strategien
- Durch die Spark UI auftretende Engpässe diagnostizieren
Grundlagen des Strukturierten Streamings
- Batch- versus Streaming-Verarbeitungsmodelle
- Streaming DataFrames und grundlegende Aggregationen
Databricks-Jobs und Workflow-Orchestrierung
- Notebooks als Jobs und Aufgaben planen
- Mehrstufige Workflows mit Abhängigkeiten erstellen
Unity Catalog und Daten-Governance
- Unity-Catalog-Architektur und Namespaces
- Zugriffskontrolle und Daten-Lineage
Tests, Debugging und Produktionspraktiken
- Unit-Testing von PySpark-Logik
- Debugging und Code-Qualitätsstandards
Ganzheitliche Use Cases in den Finanzdienstleistungen
- Aufbauen einer durchgehenden Banking-ETL-Pipeline
- Migration legacy SQL-Prozesse zu PySpark
Migrieren von SQL-Arbeitslasten zu PySpark
- Migrationsstrategie und Planungsmodelle
- Inkrementelle Konvertierung von SQL-Workflows zu PySpark
Voraussetzungen
- Erfahrung mit Python-Programmierung, einschließlich Funktionen und Datentypen
- Verständnis von SQL, einschließlich Joins, Aggregationen und Subqueries
- Keine Vorkenntnisse in Databricks oder PySpark erforderlich
Zielgruppe
- Data Engineers, Data Analysts und Data Professionals
- Teams, die bestehende SQL-basierte Workflows zu Databricks und PySpark migrieren
Erfahrungsberichte (1)
Ich mochte es, dass es praktisch war. Ich liebte es, die theoretischen Kenntnisse mit praktischen Beispielen anzuwenden.
Aurelia-Adriana - Allianz Services Romania
Kurs - Python and Spark for Big Data (PySpark)
Maschinelle Übersetzung