Kontakt aufnehmen

Schulungsübersicht

Einführung:

  • Apache Spark im Hadoop-Ökosystem
  • Kurze Einführung in Python und Scala

Grundlagen (Theorie):

  • Architektur
  • RDD
  • Transformationen und Aktionen
  • Stages, Tasks, Abhängigkeiten

Verständnis der Grundlagen in der Databricks-Umgebung (praktisches Workshop-Training):

  • Übungen mit der RDD-API
  • Grundlegende Aktions- und Transformationsfunktionen
  • PairRDD
  • Join
  • Caching-Strategien
  • Übungen mit der DataFrame-API
  • SparkSQL
  • DataFrame: select, filter, group, sort
  • UDF (User Defined Function / benutzerdefinierte Funktion)
  • Einführung in die DataSet-API
  • Streaming

Verständnis der Bereitstellung in der AWS-Umgebung (praktisches Workshop-Training):

  • Grundlagen von AWS Glue
  • Unterschiede zwischen AWS EMR und AWS Glue verstehen
  • Beispielaufgaben in beiden Umgebungen
  • Vorteile und Nachteile verstehen

Zusätzlich:

  • Einführung in die Apache Airflow-Orchestrierung

Voraussetzungen

Programmierungserfahrung (vorzugsweise in Python und Scala)

Grundkenntnisse in SQL

 21 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Erfahrungsberichte (3)

Kommende Kurse

Verwandte Kategorien