Kontakt aufnehmen

Schulungsübersicht

PySpark & Machine Learning 

Modul 1: Grundlagen von Big Data & Spark

  • Überblick über das Big-Data-Ökosystem und die Rolle von Spark in modernen Datenplattformen
  • Verständnis der Spark-Architektur: Driver, Executor, Cluster Manager, verzögerte Auswertung (lazy evaluation), DAG und Ausführungsplanung
  • Unterschiede zwischen RDD- und DataFrame-APIs sowie Wann die jeweilige Herangehensweise zum Einsatz kommt
  • Erstellung und Konfiguration von SparkSession sowie Verständnis der Grundlagen der Anwendungskonfiguration

Modul 2: PySpark DataFrames

  • Lesen und Schreiben von Daten aus Unternehmensquellen und -formaten (CSV, JSON, Parquet, Delta)
  • Arbeiten mit PySpark DataFrames: Transformationen, Aktionen, Spaltenausdrücke, Filterung, Joins und Aggregationen
  • Implementierung fortgeschrittener Operationen wie Fensterfunktionen, Umgang mit Zeitstempeln und Arbeit mit verschachtelten Daten
  • Durchführung von Datenqualitätsprüfungen und Schreiben wiederverwendbaren, wartbaren PySpark-Codes

Modul 3: Effiziente Verarbeitung großer Datensätze

  • Verständnis der Leistungsfundamente: Partitionierungsstrategien, Shuffle-Verhalten, Caching und Persistenz
  • Einsatz von Optimierungstechniken einschließlich Broadcast-Joins und Analyse des Ausführungsplans
  • Effiziente Verarbeitung großer Datensätze und bewährte Praktiken für skalierbare Datenarbeitsabläufe
  • Verständnis der Schemaevolution und moderner Speicherformate, die in Unternehmensumgebungen verwendet werden

Modul 4: Feature-Engineering in großem Maßstab

  • Durchführung von Feature-Engineering mit Spark MLlib: Umgang mit fehlenden Werten, Codierung kategorischer Variablen und Feature-Skalierung
  • Entwurf wiederverwendbarer Vorverarbeitungsschritte und Vorbereitung von Datensätzen für Machine-Learning-Pipelines
  • Einführung in die Feature-Auswahl und den Umgang mit unausgeglichenen Datensätzen

Modul 5: Maschinelles Lernen mit Spark MLlib

  • Verständnis der MLlib-Architektur und des Estimator-/Transformer-Musters
  • Skalierbares Training von Regressions- und Klassifikationsmodellen (Lineare Regression, Logistische Regression, Entscheidungsbäume, Random Forest)
  • Vergleich von Modellen und Interpretation der Ergebnisse in verteilten Machine-Learning-Arbeitsabläufen

Modul 6: Durchgehende ML-Pipelines

  • Aufbau durchgehender Machine-Learning-Pipelines, die Vorverarbeitung, Feature-Engineering und Modellierung kombinieren
  • Anwendung von Strategien zur Aufteilung in Trainings-/Validierungs-/Testdaten
  • Durchführung der Kreuzvalidierung und Hyperparameter-Tuning mittels Grid Search und Random Search
  • Strukturierung reproduzierbarer Machine-Learning-Experimente

Modul 7: Modellbewertung & praktische ML-Entscheidungsfindung

  • Anwendung geeigneter Bewertungsmetriken für Regressions- und Klassifikationsprobleme
  • Erkennen von Überanpassung (Overfitting) und Unteranpassung (Underfitting) sowie Treffen praktischer Entscheidungen zur Modellauswahl
  • Interpretation der Feature-Wichtigkeit und Verständnis des Modellverhaltens

Modul 8: Produktion & Unternehmenspraktiken

  • Speichern und Laden von Modellen in Spark
  • Implementierung von Batch-Inference-Arbeitsabläufen auf großen Datensätzen
  • Verständnis des Machine-Learning-Lebenszyklus in Unternehmensumgebungen
  • Einführung in Versionierung, Konzepte zur Experimentnachverfolgung und grundlegende Teststrategien

 

Praktisches Ergebnis

  • Fähigkeit zum autonomen Arbeiten mit PySpark
  • Fähigkeit zur effizienten Verarbeitung großer Datensätze
  • Fähigkeit zum skalierbaren Feature-Engineering
  • Fähigkeit zum Aufbau skalierbarer Machine-Learning-Pipelines

Voraussetzungen

Die Teilnehmenden sollten über folgende Vorkenntnisse verfügen:

Grundlegende Python-Programmierkenntnisse, einschließlich des Umgangs mit Funktionen, Datenstrukturen und Bibliotheken
Grundlegendes Verständnis von Datenanalysekonzepten wie Datensätzen, Transformationen und Aggregationen
Grundkenntnisse in SQL und relationalen Datenkonzepten
Erste Kenntnisse zu Konzepten des Maschinellen Lernens, wie Trainingsdatensätze, Features und Bewertungsmetriken
Für den Umgang mit der Befehlszeilenumgebung und grundlegende Praxiskenntnisse in der Softwareentwicklung werden empfohlen

Erfahrung mit Pandas, NumPy oder ähnlichen Datenverarbeitungsbibliotheken ist hilfreich, aber nicht zwingend erforderlich.

 21 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Erfahrungsberichte (1)

Kommende Kurse

Verwandte Kategorien