Kontakt aufnehmen

Schulungsübersicht

Einführung

Verständnis von Big Data

Übersicht über Spark

Übersicht über Python

Übersicht über PySpark

  • Datenverteilung mittels Resilient Distributed Datasets (RDD)
  • Bereitungsverteilung mit Spark-API-Operatoren

Einrichtung von Python mit Spark

Einrichtung von PySpark

Nutzung von Amazon Web Services (AWS) EC2-Instanzen für Spark

Einrichtung von Databricks

Einrichten des AWS EMR-Clusters

Lernen der Grundlagen der Python-Programmierung

  • Erste Schritte mit Python
  • Nutzung des Jupyter Notebooks
  • Umgang mit Variablen und einfachen Datentypen
  • Arbeiten mit Listen
  • Anwendung von if-Anweisungen
  • Eingabe von Benutzerdaten
  • Umgang mit while-Schleifen
  • Implementierung von Funktionen
  • Arbeiten mit Klassen
  • Umgang mit Dateien und Ausnahmen
  • Projektarbeit mit Daten und APIs

Lernen der Grundlagen von Spark DataFrames

  • Erste Schritte mit Spark DataFrames
  • Durchführen grundlegender Operationen mit Spark
  • Nutzung von Groupby- und Aggregationsoperationen
  • Umgang mit Zeitstempeln und Daten

Praktische Übung: Spark DataFrame Projekt

Verständnis von Machine Learning mit MLlib

Anwendung von MLlib, Spark und Python im Machine Learning Kontext

Verständnis von Regressionen

  • Lernen der Theorie der linearen Regression
  • Implementierung eines Codes zur Regressionsauswertung
  • Durchführung einer exemplarischen linearen Regressionsübung
  • Lernen der Theorie der logistischen Regression
  • Implementierung eines Codes für die logistische Regression
  • Durchführung einer exemplarischen logistischen Regressionsübung

Verständnis von Random Forests und Decision Trees

  • Lernen der Theorie über Entscheidungsbaum-Methoden
  • Implementierung von Code für Decision Trees und Random Forests
  • Durchführung einer exemplarischen Random Forest Klassifikationsübung

Arbeiten mit K-means Clustering

  • Verständnis der Theorie des K-means Clusterings
  • Implementierung eines Codes für K-means Clustering
  • Durchführung einer exemplarischen Clustering-Übung

Anwendung von Recommendation Systems

Implementierung von Natural Language Processing

  • Verständnis von Natural Language Processing (NLP)
  • Übersicht über NLP-Tools
  • Durchführung einer exemplarischen NLP-Übung

Streaming mit Spark in Python

  • Übersicht über Streaming mit Spark
  • Exemplarische Spark Streaming Übung

Schlussbemerkungen

Voraussetzungen

  • Allgemeine Programmierkenntnisse

Zielgruppe

  • Entwickler
  • IT-Fachkräfte
  • Data Scientists
 21 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Erfahrungsberichte (6)

Kommende Kurse

Verwandte Kategorien