Data Streaming und Echtzeit-Datenverarbeitung Schulung
Kursübersicht
Dieser Kurs bietet eine praktische und strukturierte Einführung in den Aufbau von Echtzeit-Datenstromsystemen. Er behandelt Kernkonzepte, Architekturmethoden und branchenübliche Tools zur Verarbeitung kontinuierlicher Daten in großem Maßstab. Die Teilnehmer lernen, wie man Streaming-Pipelines entwirft, implementiert und optimiert, indem sie moderne Frameworks einsetzen. Der Kurs entwickelt sich von grundlegenden Ideen hin zu praktischen Anwendungen und ermöglicht es den Teilnehmern, mit Sicherheit produktionsreale Echtzeitsolutions aufzubauen.
Format der Schulung
• Dozentengestützte Sitzungen mit geführten Erklärungen
• Konzeptdurchgänge mit Praxisbeispielen
• Praktische Demonstrationsübungen und Coding-Exercises
• Progressive Labs, die sich an den täglichen Themen orientieren
• Interaktive Diskussionen und Fragen & Antworten
Kursziele
• Echtzeit-Datenstromkonzepte und Systemarchitektur verstehen
• Batch- und Streaming-Datenverarbeitungsmodelle voneinander abgrenzen
• Skalierbare und fehlerresistente Streaming-Pipelines entwerfen
• Mit verteilten Streaming-Tools und Frameworks arbeiten
• Event-Time-Verarbeitung, Windowing und zustandsbehaftete Operationen anwenden
Echtzeit-Lösungen für Geschäftsanforderungen aufbauen und optimieren
Schulungsübersicht
Kursplan Tag 1
• Einführung in die Konzepte des Datenstreamings
• Grundlagen der Batch- und Echtzeitverarbeitung
• Grundlagen der ereignisgesteuerten Architektur
• Übliche Anwendungsfälle in der Industrie
• Überblick über das Streaming-Ökosystem
Tag 2
• Entwurfsmuster für Streaming-Architekturen
• Grundlagen verteilter Nachrichtensysteme
• Produzenten und Konsumenten
• Themen, Partitionen und Datenfluss
• Strategien der Datenerfassung
Tag 3
• Streaming-Verarbeitungskonzepte und Frameworks
• Event-Zeit vs. Verarbeitungszeit
• Windowing-Techniken und Anwendungsfälle
• Zustandsbehaftete Streaming-Verarbeitung
• Grundlagen der Fehlerresistenz und Checkpointing
Tag 4
• Datenveränderungen in Streaming-Pipelines
• ETL und ELT in Echtzeit-Systemen
• Schema-Management und -Evolution
• Stream-Joins und Anreicherung
• Einführung in Cloud-basierte Streaming-Dienste
Tag 5
• Überwachung und Beobachtbarkeit in Streaming-Systemen
• Grundlagen von Sicherheit und Zugriffskontrolle
• Leistungsoptimierung und Feineinstellung
• Gesamtüberprüfung des Pipeline-Entwurfs
• Praxisbeispiele wie Betrugsbekämpfung und IoT-Datenverarbeitung
Offene Schulungskurse erfordern mindestens 5 Teilnehmer.
Data Streaming und Echtzeit-Datenverarbeitung Schulung - Buchung
Data Streaming und Echtzeit-Datenverarbeitung Schulung - Anfrage
Data Streaming und Echtzeit-Datenverarbeitung - Beratungsanfrage
Erfahrungsberichte (2)
Eine Reise durch die Spark-Welt: ein sehr intensiver Kurs. DSL, Spark SQL, Partitionierung versus Bucketing für mich.
Georgiana Elisabeta
Kurs - Apache Spark Fundamentals
Maschinelle Übersetzung
Praktische Übungen. Die Kursdauer sollte eigentlich fünf Tage betragen, aber die drei Tage halfen dabei, viele Fragen zu klären, die ich bei der Arbeit mit NiFi bereits hatte.
James - BHG Financial
Kurs - Apache NiFi for Administrators
Maschinelle Übersetzung
Kommende Kurse
Kombinierte Kurse
Advanced Apache Iceberg
21 StundenDiese instructor-led Live-Schulung in Österreich (online oder vor Ort) richtet sich an fortgeschrittene Datenfachkräfte, die ihre Datenverarbeitungs-Workflows optimieren, die Datenintegrität sicherstellen und robuste Lakehouse-Lösungen implementieren möchten, die den Komplexitäten moderner Big-Data-Anwendungen gewachsen sind.
Am Ende dieser Schulung werden die Teilnehmer in der Lage sein:
- Ein tiefgreifendes Verständnis von Icebergs Architektur zu gewinnen, einschließlich Metadatenmanagement und Dateistruktur.
- Iceberg für optimale Leistung in verschiedenen Umgebungen zu konfigurieren und es mit mehreren Datenverarbeitungs-Engines zu integrieren.
- Große Iceberg-Tabellen zu verwalten, komplexe Schemaänderungen vorzunehmen und Partition-Evolution zu handhaben.
- Techniken zur Optimierung der Abfrageleistung und Effizienz des Datenscannings für große Datensätze zu meistern.
- Mechanismen zur Sicherstellung der Datenkonsistenz zu implementieren, Transaktionsgarantien zu verwalten und Ausfälle in verteilten Umgebungen zu behandeln.
Grundlagen von Apache Iceberg
14 StundenDiese instruktionsgeleitete Live-Schulung in Österreich (online oder vor Ort) richtet sich an Anfänger im Bereich der Datenverarbeitung, die das nötige Wissen und die Fähigkeiten erwerben möchten, um Apache Iceberg effizient zum Management großer Datensätze einzusetzen, die Datenintegrität zu gewährleisten und Datenverarbeitungsprozesse zu optimieren.
Am Ende dieser Schulung werden die Teilnehmer in der Lage sein:
- Ein umfassendes Verständnis von Architektur, Funktionen und Vorteilen von Apache Iceberg zu erlangen.
- Kenntnisse über Tabellenformate, Partitionierung, Schemaentwicklung und Zeitreise-Fähigkeiten (Time Travel) zu erwerben.
- Apache Iceberg in verschiedenen Umgebungen zu installieren und zu konfigurieren.
- Iceberg-Tabellen zu erstellen, zu verwalten und damit zu arbeiten.
- Den Prozess der Migration von Daten aus anderen Tabellenformaten nach Iceberg zu verstehen.
Big Data Analytics mit Google Colab und Apache Spark
14 StundenDiese Dozentengestützte, Live-Schulung in Österreich (online oder vor Ort) richtet sich an Data Scientists und Ingenieure mit mittlerem Kenntnisstand, die Google Colab und Apache Spark für Big-Data-Verarbeitung und -Analyse nutzen möchten.
Am Ende dieser Schulung werden die Teilnehmer in der Lage sein:
- Eine Big-Data-Umgebung mit Google Colab und Spark einzurichten.
- Große Datensätze effizient mit Apache Spark zu verarbeiten und zu analysieren.
- Big Data in einer kollaborativen Umgebung zu visualisieren.
- Apache Spark mit Cloud-basierten Tools zu integrieren.
Big Data Business Intelligence for Govt. Agencies
35 StundenDurch technologische Fortschritte und die steigende Menge an Informationen verändert sich die Art und Weise, wie in vielen Branchen, einschließlich des öffentlichen Sektors, Geschäftsprozesse abgewickelt werden. Die Raten der Datenerzeugung und der digitalen Archivierung durch Regierungsstellen steigen aufgrund des raschen Wachstums mobiler Geräte und Anwendungen, intelligenter Sensoren und Geräte, Cloud-Computing-Lösungen sowie Citizen-facing-Portale an. Während digitale Informationen zunehmen und komplexer werden, werden auch das Information Management, die Verarbeitung, Speicherung, Sicherheit und Löschung schwieriger. Neue Werkzeuge zur Erfassung, Suche, Entdeckung und Analyse helfen Organisationen dabei, Erkenntnisse aus ihren unstrukturierten Daten zu gewinnen. Der Regierungsmarkt befindet sich an einem Wendepunkt; es wird erkannt, dass Informationen ein strategischer Vermögenswert sind, und Regierungsstellen müssen sowohl strukturierte als auch unstrukturierte Informationen schützen, nutzen und analysieren, um den Missionserfordernissen besser gerecht zu werden. Während Führungskräfte im öffentlichen Sektor bestrebt sind, datengesteuerte Organisationen weiterzuentwickeln, um ihre Mission erfolgreich zu erfüllen, legen sie das Fundament, um Abhängigkeiten zwischen Ereignissen, Personen, Prozessen und Informationen zu korrelieren.
Wertvolle Lösungen für den Regierungsbereich werden aus einer Mischform der disruptivsten Technologien erstellt:
- Mobile Geräte und Anwendungen
- Cloud-Dienste
- Social Business Technologien und Networking
- Big Data und Analysen
Big Data ist eine intelligente Branchenlösung und ermöglicht es Regierungsstellen, bessere Entscheidungen zu treffen, indem sie auf der Grundlage von Mustern agieren, die durch die Analyse großer Datenmengen – sowohl verknüpft als auch unabhängig, strukturiert als auch unstrukturiert – offenbart werden.
Die Bewältigung dieser Leistungen erfordert jedoch weit mehr als nur das Ansammeln riesiger Datenmengen. "Um einen Sinn aus diesen großen Mengen an Big Data zu machen, sind modernste Tools und Technologien erforderlich, die in der Lage sind, nützliche Erkenntnisse aus weiten und vielfältigen Informationsströmen zu analysieren und herauszufiltern", schrieben Tom Kalil und Fen Zhao vom Office of Science and Technology Policy des Weißen Hauses in einem Beitrag im OSTP-Blog.
Das Weiße Haus unternahm einen Schritt in Richtung Hilfestellung für Behörden, diese Technologien zu finden, als es 2012 die nationale Big Data Research and Development Initiative ins Leben rief. Die Initiative umfasste mehr als 200 Millionen US-Dollar, um das Potenzial der Explosion von Big Data und der dafür notwendigen Analysetools bestmöglich zu nutzen.
Die Herausforderungen, die Big Data mit sich bringt, sind fast ebenso beeindruckend wie seine Versprechen ermutigend sind. Die effiziente Speicherung von Daten ist eine dieser Herausforderungen. Wie immer sind Budgets knapp, daher müssen Behörden den Preis pro Megabyte für die Speicherung minimieren und die Daten in einfacher Reichweite halten, damit Benutzer darauf zugreifen können, wenn sie es benötigen. Das Sichern riesiger Datenmengen verschärft diese Herausforderung noch.
Die effektive Analyse der Daten ist eine weitere große Herausforderung. Viele Behörden setzen kommerzielle Tools ein, die es ihnen ermöglichen, durch die Berge von Daten zu stöbern und Trends zu erkennen, die dazu beitragen können, effizienter zu operieren. (Eine kürzlich durchgeführte Studie von MeriTalk ergab, dass US-amerikanische IT-Führungskräfte der Bundesregierung glauben, Big Data könnte den Behörden mehr als 500 Milliarden Dollar sparen helfen, während gleichzeitig die Missionsziele erfüllt werden).
Individuell entwickelte Big Data Tools ermöglichen es den Behörden auch, der Notwendigkeit gerecht zu werden, ihre Daten zu analysieren. So hat beispielsweise die Computational Data Analytics Group des Oak Ridge National Laboratory ihr Piranha-Datenanalysesystem anderen Behörden zur Verfügung gestellt. Das System hat medizinischen Forschern dabei geholfen, einen Zusammenhang zu finden, der Ärzte auf Aortenaneurysmen aufmerksam machen kann, bevor diese auftreten. Es wird auch für weniger spektakuläre Aufgaben eingesetzt, wie etwa das Durchsuchen von Lebensläufen, um Arbeitsbewerber mit den Einstellungsmanagern in Verbindung zu bringen.
Eine praktische Einführung in Datenanalyse und Big Data – 3 Tage
21 StundenTeilnehmer, die dieses live geleitete Training in Österreich abschließen, gewinnen ein praktisches, praxisnahes Verständnis von Big Data sowie den damit verbundenen Technologien, Methoden und Werkzeugen.
Die Teilnehmer haben die Möglichkeit, ihr Wissen durch praktische Übungen direkt umzusetzen. Gruppenarbeiten und Feedback vom Dozenten bilden einen wichtigen Bestandteil des Kurses.
Der Kurs beginnt mit einer Einführung in die grundlegenden Konzepte von Big Data und führt anschließend zu den Programmiersprachen und Methoden ein, die für die Datenanalyse verwendet werden. Abschließend werden die Tools und Infrastrukturen behandelt, die Speicherlösungen für Big Data, verteilte Verarbeitung und Skalierbarkeit ermöglichen.
Big Data und fortgeschrittene Analytik
42 StundenBig Data und fortgeschrittene Analytik bezeichnet die Anwendung ausgefeilter Techniken und Tools zur Analyse großer, komplexer Datensätze, um handlungsrelevante Erkenntnisse und strategische Entscheidungsgrundlagen zu gewinnen.
Dieses von Instruktoren geleitete Live-Training (online oder vor Ort) richtet sich an Data Professionals auf fortgeschrittenem Niveau, die modernste analytische Methoden und Big-Data-Technologien für prädiktive, präskriptive und Echtzeit-Analysen nutzen möchten.
Nach Abschluss dieses Trainings sind die Teilnehmer in der Lage:
- Großmaßstab-Datenverarbeitungs-Pipelines für strukturierte und unstrukturierte Daten zu entwerfen und umzusetzen.
- Fortschrittliche Machine-Learning- und Deep-Learning-Techniken auf massive Datensätze anzuwenden.
- Verteilte Computing-Frameworks für Echtzeit-Analysen und Daten-Streaming zu nutzen.
- Big-Data-Analytics in Business-Intelligence- und Entscheidungsunterstützungssysteme zu integrieren.
Kursformat
- Interaktive Vorträge und Diskussionen.
- Viele Übungen und praktische Anwendungen.
- Praxisnahe Umsetzung in einer Live-Lab-Umgebung.
Möglichkeiten zur Kursanpassung
- Falls Sie ein maßgeschneidertes Training für diesen Kurs wünschen, kontaktieren Sie uns bitte, um die Details zu vereinbaren.
Apache NiFi für Administratoren
21 StundenApache NiFi ist eine Open-Source-Plattform für datenflussbasierte Datenintegration und Ereignisverarbeitung. Sie ermöglicht die automatisierte, Echtzeit-Datenweiterleitung, -transformation und Systemvermittlung zwischen unterschiedlichen Systemen, unterstützt durch eine webbasierte Benutzeroberfläche und feingranulare Kontrollmöglichkeiten.
Dieses vom Kursleiter geleitete Live-Training (vor Ort oder remote) richtet sich an Administratoren und Ingenieure mit mittlerem Kenntnisstand, die NiFi-Datenflüsse in Produktionsumgebungen bereitstellen, verwalten, absichern und optimieren möchten.
Nach Abschluss dieser Schulung sind die Teilnehmer in der Lage:
- Apache-NiFi-Cluster zu installieren, zu konfigurieren und zu warten.
- Datenflüsse aus verschiedenen Quellen und Senken zu entwerfen und zu verwalten.
- Logik für die Flussautomatisierung, Weiterleitung und Transformation zu implementieren.
- Die Leistung zu optimieren, den Betrieb zu überwachen und Probleme zu beheben.
Kursformat
- Interaktive Vorträge mit Diskussionen zu realen Architekturen.
- Praxisübungen: Erstellen, Bereitstellen und Verwalten von Flüssen.
- Szenariobasierte Übungen in einer Live-Laborumgebung.
Möglichkeiten zur Kursanpassung
- Um eine maßgeschneiderte Schulung für diesen Kurs anzufordern, kontaktieren Sie uns bitte zur Vereinbarung.
PySpark und Maschinelles Lernen
21 StundenDieses Schulung bietet eine praktische Einführung in den Aufbau skalierbarer Datenverarbeitungs- und Machine-Learning-Arbeitsabläufe mit PySpark. Die Teilnehmenden lernen, wie Apache Spark in modernen Big-Data-Ökosystemen funktioniert und wie große Datensätze effizient mithilfe von Prinzipien der verteilten Datenverarbeitung verarbeitet werden können.
Apache Spark-Grundlagen
21 StundenDieses von Dozenten geleitete Live-Training in Österreich (online oder vor Ort) richtet sich an Ingenieure, die ein Apache Spark-System zur Verarbeitung sehr großer Datenmengen einrichten und bereitstellen möchten.
Am Ende dieses Trainings können die Teilnehmer:
- Apache Spark installieren und konfigurieren.
- Sehr große Datensätze schnell verarbeiten und analysieren.
- Den Unterschied zwischen Apache Spark und Hadoop MapReduce verstehen und wissen, wann sie welches einsetzen sollten.
- Apache Spark mit anderen Machine-Learning-Tools integrieren.
Verwaltung von Apache Spark
35 StundenDiese dozentengeleitete Live-Schulung in Österreich (online oder vor Ort) richtet sich an Systemadministratoren mit grundlegenden bis mittleren Kenntnissen, die Spark-Cluster bereitstellen, warten und optimieren möchten.
Nach Abschluss dieser Schulung können die Teilnehmer:
- Apache Spark in verschiedenen Umgebungen installieren und konfigurieren.
- Cluster-Ressourcen verwalten und Spark-Anwendungen überwachen.
- Die Leistung von Spark-Clustern optimieren.
- Sicherheitsmaßnahmen implementieren und Hochverfügbarkeit sicherstellen.
- Häufige Spark-Probleme debuggen und lösen.
Apache Spark in der Cloud
21 StundenDie Lernkurve von Apache Spark ist anfangs steil und erfordert viel Aufwand, bis erste Ergebnisse erzielt werden können. Dieser Kurs soll genau diese anfängliche Hürde nehmen. Nach Abschluss des Kurses verstehen die Teilnehmer die Grundlagen von Apache Spark, können RDDs klar von DataFrames unterscheiden, lernen die Python- und Scala-APIs kennen und begreifen Konzepte wie Executor und Task. Zudem legt der Kurs gemäß den Best Practices einen starken Fokus auf Cloud-Deployment sowie auf Databricks und AWS. Die Teilnehmer erfahren außerdem die Unterschiede zwischen AWS EMR und AWS Glue, einem der neuesten Spark-Services von AWS.
ZIELGRUPPE:
Data Engineers, DevOps-Engineer, Data Scientists
Python und Spark für Big Data (PySpark)
21 StundenIn diesem dozentengeleiteten Live-Training in Österreich lernen die Teilnehmer, wie sie Python und Spark gemeinsam nutzen können, um Big Data in der Praxis durch Übungen zu analysieren.
Nach Abschluss dieses Trainings werden die Teilnehmer in der Lage sein:
- Zu verstehen, wie man Spark mit Python zur Analyse von Big Data einsetzt.
- Übungen durchzuführen, die reale Anwendungsfälle nachahmen.
- Verschiedene Tools und Techniken für die Big-Data-Analyse mit PySpark zu nutzen.
Python, Spark und Hadoop für Big Data
21 StundenDiese instructor-gestützte, live Schulung in Österreich (online oder vor Ort) richtet sich an Entwickler, die Spark, Hadoop und Python nutzen und integrieren möchten, um große und komplexe Datensätze zu verarbeiten, zu analysieren und zu transformieren.
Am Ende dieser Schulung werden die Teilnehmer in der Lage sein:
- Die notwendige Umgebung für den Einstieg in die Big-Data-Verarbeitung mit Spark, Hadoop und Python einzurichten.
- Die Funktionen, Kernkomponenten und die Architektur von Spark und Hadoop zu verstehen.
- Lernen, wie Spark, Hadoop und Python für die Big-Data-Verarbeitung integriert werden.
- Die Tools im Spark-Ökosystem erkunden (Spark MLlib, Spark Streaming, Kafka, Sqoop, Kafka und Flume).
- Kooperative Filter-Empfehlungssysteme ähnlich denen von Netflix, YouTube, Amazon, Spotify und Google aufbauen.
- Apache Mahout zur Skalierung von Machine-Learning-Algorithmen einsetzen.
Stratio: Rocket- und Intelligence-Module mit PySpark
14 StundenStratio ist eine datenzentrierte Plattform, die Big Data, KI und Governance in einer einzigen Lösung integriert. Die Module Rocket und Intelligence ermöglichen schnelle Datenexploration, Transformationen und fortschrittliche Analysen in Unternehmensumgebungen.
Diese dozentengeführte Live-Schulung (online oder vor Ort) richtet sich an erfahrene Datenprofis, die die Rocket- und Intelligence-Module in Stratio effektiv mit PySpark nutzen möchten, wobei der Schwerpunkt auf Schleifenstrukturen, benutzerdefinierten Funktionen und fortgeschrittener Datenlogik liegt.
Nach Abschluss dieser Schulung werden die Teilnehmer in der Lage sein:
- Sich im Stratio-Plattform mit den Modulen Rocket und Intelligence zurechtzufinden und darin zu arbeiten.
- PySpark im Kontext der Datenaufnahme, Transformation und Analyse einzusetzen.
- Schleifen und bedingte Logik zur Steuerung von Datenworkflows und Feature-Engineering-Aufgaben zu verwenden.
- Benutzerdefinierte Funktionen (UDFs) für wiederverwendbare Datenoperationen in PySpark zu erstellen und zu verwalten.
Kursformat
- Interaktiver Vortrag und Diskussion.
- Viele Übungen und Praxisbeispiele.
- Praktische Umsetzung in einer Live-Lab-Umgebung.
Möglichkeiten zur Anpassung des Kurses
- Um eine maßgeschneiderte Schulung für diesen Kurs anzufordern, kontaktieren Sie uns bitte zur Vereinbarung.