Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Schulungsübersicht
Jede Sitzung dauert 2 Stunden
Tag 1: Sitzung 1: Geschäftlicher Überblick über die Gründe für Big Data Business Intelligence in Regierungsbehörden
- Fallstudien von NIH, DoE
- Anpassungsrate von Big Data in Regierungsbehörden und wie diese ihre zukünftigen Operationen um Big Data Predictive Analytics ausrichten
- Anwendungsbereiche im großen Maßstab bei DoD, NSA, IRS, USDA usw.
- Anbindung von Big Data an Legacy-Daten
- Grundlegendes Verständnis der ermöglichenden Technologien in Predictive Analytics
- Datenintegration & Dashboard-Visualisierung
- Betrugsbekämpfung
- Erstellung von Geschäftsregeln / Betrugsdetektion
- Gefahrenerkennung und Profilbildung
- Kosten-Nutzen-Analyse für die Implementierung von Big Data
Tag 1: Sitzung 2: Einführung in Big Data-1
- Hauptmerkmale von Big Data: Volumen, Vielfalt, Geschwindigkeit und Veracity. MPP-Architektur für das Volumen.
- Daten-Warehouse – statisches Schema, langsam sich ändernde Datensätze
- MPP-Datenbanken wie Greenplum, Exadata, Teradata, Netezza, Vertica usw.
- Hadoop-basierte Lösungen – keine Bedingungen bezüglich der Struktur des Datensatzes.
- Typisches Muster: HDFS, MapReduce (crunch), Abrufen von HDFS
- Batch – geeignet für analytische / nicht-interaktive Aufgaben
- Volumen: CEP-Streaming-Daten
- Typische Produkte – CEP-Produkte (z. B. Infostreams, Apama, MarkLogic usw.)
- Weniger produktionsreif – Storm/S4
- NoSQL-Datenbanken – (spaltenorientiert und key-value): Am besten geeignet als analytisches Add-on zum Daten-Warehouse / Datenbank
Tag 1: Sitzung 3: Einführung in Big Data-2
NoSQL-Lösungen
- KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
- KV Store (Hierarchisch) - GT.m, Cache
- KV Store (Sortiert) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
- Tuple Store - Gigaspaces, Coord, Apache River
- Object Database - ZopeDB, DB40, Shoal
- Document Store - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Datenbanken, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
- Wide Columnar Store - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
Vielfalt der Daten: Einführung in das Problem der Datenbereinigung bei Big Data
- RDBMS – statische Struktur / Schema, fördert keine agile, erkundende Umgebung.
- NoSQL – semi-strukturiert, genug Struktur, um Daten zu speichern, ohne ein genaues Schema vor dem Speichern zu haben.
- Probleme bei der Datenbereinigung
Tag 1: Sitzung 4: Big Data Einführung-3 : Hadoop
- Wann ist Hadoop die richtige Wahl?
- STRUKTURIERT – Enterprise-Daten-Warehouses / Datenbanken können massive Datenmengen speichern (zu einem Kostenfaktor), aber sie erzwingen Struktur (nicht gut für aktive Erkundung)
- SEMI-STRUKTURIERTE Daten – schwierig mit traditionellen Lösungen zu bewerkstelligen (DW / DB)
- Daten im Warehouse = enormer Aufwand und auch nach der Implementierung statisch
- Für die Vielfalt & das Volumen von Daten, verarbeitet auf Kommodity-Hardware – HADOOP
- Commodity-Hardware wird benötigt, um einen Hadoop-Cluster zu erstellen
Einführung in Map Reduce /HDFS
- MapReduce – verteilte Berechnung über mehrere Server
- HDFS – macht Daten für den Berechnungsprozess lokal verfügbar (mit Redundanz)
- Daten – können unstrukturiert / schema-frei sein (im Gegensatz zu RDBMS)
- Entwickler sind dafür verantwortlich, einen Sinn in den Daten zu erkennen
- Programmierung von MapReduce = Arbeit mit Java (Vor- und Nachteile), manuelles Laden der Daten in HDFS
Tag 2: Sitzung 1: Big Data Ökosystem – Aufbau des Big Data ETL: Universum der Big Data Tools – welches wann zu verwenden?
- Hadoop im Vergleich zu anderen NoSQL-Lösungen
- Für interaktiven, zufälligen Zugriff auf Daten
- Hbase (spaltenorientierte Datenbank) auf Hadoop
- Zufälliger Zugriff auf Daten, aber mit Einschränkungen (max. 1 PB)
- Nicht gut für ad-hoc Analysen, gut für Logging, Zählungen, Zeitreihen
- Sqoop – Import von Datenbanken in Hive oder HDFS (JDBC / ODBC-Zugriff)
- Flume – Streaming-Daten (z. B. Protokolldaten) in HDFS
Tag 2: Sitzung 2: Big Data Management System
- Bewegliche Teile, Compute Nodes starten / fallen aus: ZooKeeper – für Konfiguration / Koordinierung / Naming Services
- Komplexe Pipeline / Workflow: Oozie – Workflow-Verwaltung, Abhängigkeiten, Kettenschaltung
- Bereitstellung, Konfiguration, Cluster-Verwaltung, Upgrades usw. (Systemadministrator): Ambari
- In der Cloud : Whirr
Tag 2: Sitzung 3: Predictive Analytics in Business Intelligence -1: Grundlegende Techniken & maschinelles Lernen-basierte BI :
- Einführung in Machine Learning
- Lernen von Klassifizierungstechniken
- Bayesian Prediction – Vorbereiten der Trainingsdatei
- Support Vector Machine
- KNN p-Tree Algebra & vertikales Mining
- Neuronale Netzwerke
- Big Data großes Variablenproblem -Random Forest (RF)
- Big Data Automatisierungsproblem – Multi-Model Ensemble RF
- Automatisierung durch Soft10-M
- Textanalysetool-Treeminer
- Agiles Lernen
- Agentenbasiertes Lernen
- Verteiltes Lernen
- Einführung in Open-Source-Tools für Predictive Analytics : R, Rapidminer, Mahout
Tag 2: Sitzung 4 Predictive analytics Ökosystem-2: Gemeinsame Predictive Analytic-Probleme in Regierungsbehörden
- Insight Analysis
- Visualisierungsanalyse
- Strukturierte Predictive Analytics
- Unstrukturierte Predictive Analytics
- Gefahren- / Betrugsstar- / Lieferantenprofilbildung
- Empfehlungsmotor
- Mustererkennung
- Regel-Szenario-Erkennung – Fehler, Betrug, Optimierung
- Ursachenermittlung
- Sentiment-Analyse
- CRM-Analytik
- Netzwerkanalytik
- Textanalysen
- Technologieunterstützte Überprüfung
- Betrugsanalytik
- Echtzeitanalyse
Tag 3: Sitzung 1 : Echtzeit- und skalierbare Analytik über Hadoop
- Warum scheitern gängige analytische Algorithmen in Hadoop / HDFS?
- Apache Hama - für Bulk Synchronous verteiltes Computing
- Apache SPARK – für Cluster-Computing für Echtzeit-Analytik
- CMU Graphics Lab2 – graphbasierte asynchrone Herangehensweise an verteiltes Computing
- KNN p-Algebra-basierte Herangehensweise von Treeminer für reduzierte Hardwarekosten des Betriebs
Tag 3: Sitzung 2: Tools für eDiscovery und Forensik
- eDiscovery über Big Data im Vergleich zu Legacy-Daten – ein Kosten- und Leistungsvergleich
- Predictive Coding und technologieunterstützte Überprüfung (TAR)
- Live-Demo eines TAR-Produkts (vMiner), um zu verstehen, wie TAR für eine schnellere Entdeckung funktioniert
- Schnellere Indizierung durch HDFS – Geschwindigkeit der Daten
- NLP oder Natural Language Processing – verschiedene Techniken und Open-Source-Produkte
- eDiscovery in Fremdsprachen – Technologie zur Verarbeitung von Fremdsprachen
Tag 3: Sitzung 3: Big Data BI für Cybersicherheit – Verständnis der gesamten 360-Grad-Ansicht von schneller Datensammlung bis zur Bedrohungserkennung
- Grundlagen des Security Analytics verstehen-Angriffsfläche, Sicherheitskonfigurationsfehler, Host-Abwehr
- Netzwerkinfrastruktur / großer Datenpipe / Response ETL für Echtzeit-Analytik
- Vorschreibend vs. vorhersagend – Festgelegte regelbasierte vs. automatische Entdeckung von Bedrohungsregeln aus Metadaten
Tag 3: Sitzung 4: Big Data im USDA: Anwendung in der Landwirtschaft
- Einführung in IoT (Internet of Things) für die Landwirtschaft – sensorbasierte Big Data und Steuerung
- Einführung in Satellitenbilderstellung und deren Anwendung in der Landwirtschaft
- Integration von Sensor- und Bilddaten für Bodenfruchtbarkeit, Anbauempfehlungen und Prognosen
- Landwirtschaftsversicherung und Big Data
- Prognose von Ernteausfällen
Tag 4: Sitzung 1: Betrugsschutz-BI aus Big Data in Regierungsbehörden – Betrugsanalytik:
- Basics-Klassifizierung der Betrugsanalytik - regelbasiert vs. predictive Analytics
- Überwacht vs. unüberwacht Machine Learning zur Mustererkennung bei Betrug
- Lieferantenschummel / Überladung von Projekten
- Medicare und Medicaid Betrug – Techniken zur Betrugserkennung für die Abrechnungsprüfung
- Betrug bei Reisekostenabrechnungen
- IRS Rückerstattungsbsbetrug
- Fallstudien und Live-Demos werden dort angeboten, wo Daten verfügbar sind.
Tag 4: Sitzung 2: Social Media Analytik – Informationsbeschaffung und Analyse
- Big Data ETL API zur Extraktion von Social-Media-Daten
- Text, Bild, Meta-Daten und Video
- Sentiment-Analyse aus Social-Media-Feeds
- Kontextbezogene und kontextfreie Filterung von Social-Media-Feeds
- Social Media Dashboard zur Integration unterschiedlicher Social-Media-Kanäle
- Automatisierte Profilbildung sozialer Medien
- Live-Demo jeder Analytik wird über das Tool Treeminer bereitgestellt.
Tag 4: Sitzung 3: Big Data Analytik in der Bildverarbeitung und Videodatenströme
- Bildspeichertechniken in Big Data – Speicherlösung für Daten, die Petabytes überschreiten
- LTFS und LTO
- GPFS-LTFS (Geschichtete Speicherlösung für große Bilddaten)
- Grundlagen der Bildanalytik
- Objekterkennung
- Bildsegmentierung
- Bewegungsverfolgung
- 3-D-Bildrekonstruktion
Tag 4: Sitzung 4: Big Data Anwendungen in NIH:
- Aufstrebende Bereiche der Bioinformatik
- Metagenomik und Probleme beim Big Data Mining
- Big Data Predictive Analytik für Pharmakogenomik, Metabolomics und Proteomics
- Big Data in nachgelagerten Genomikprozessen
- Anwendung von Big-Data-Predictive-Analytics in der öffentlichen Gesundheit
Big Data Dashboard für schnellen Zugriff auf diverse Daten und Anzeige :
- Integration bestehender Anwendungsplattformen mit Big Data Dashboard
- Big Data Management
- Fallstudie zum Big Data Dashboard: Tableau und Pentaho
- Nutzung von Big Data Apps zur Bereitstellung standortbasierter Dienste in Regierungsbehörden
- Verfolgungssystem und Management
Tag 5 : Sitzung 1: Wie rechtfertigt man die Implementierung von Big Data BI innerhalb einer Organisation?
- Definition des ROI für die Big-Data-Implementierung
- Fallstudien zur Einsparung der Analystenzeit für Sammlung und Aufbereitung von Daten – Steigerung der Produktivität
- Fallstudien zu Einnahmegewinnen durch Einsparungen bei lizenzierten Datenbankkosten
- Einnahmegewinne durch standortbasierte Dienste
- Einsparungen durch Betrugsschutz
- Ein integrierter Tabellenkalkulationsansatz zur Berechnung der ca. Kosten vs. Einnahmegewinn / Einsparungen aus der Big-Data-Implementierung.
Tag 5 : Sitzung 2: Schritt-für-Schritt-Verfahren zum Ersetzen von Legacy-Datensystemen durch Big Data Systeme:
- Verständnis einer praktischen Big-Data-Migrations-Roadmap
- Welche wichtigen Informationen werden vor der Architektur eines Big-Data-Projekts benötigt?
- Wie berechnet man Volumen, Geschwindigkeit, Vielfalt und Veracity der Daten auf unterschiedliche Weise?
- Wie schätzt man das Datenwachstum ein?
- Fallstudien
Tag 5: Sitzung 4: Überprüfung der Big-Data-Hersteller und Review ihrer Produkte. Q/A-Sitzung:
- Accenture
- APTEAN (ehemals CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (ehemals 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG / Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (Teil von EMC)
Voraussetzungen
- Grundlegende Kenntnisse der Geschäftsabläufe und Datensysteme in Regierungsbehörden innerhalb ihres Fachgebiets
- Grundlegendes Verständnis von SQL/Oracle oder relationalen Datenbanken
- Grundlegendes Verständnis von Statistik (auf Tabellenkalkulationsebene)
35 Stunden
Erfahrungsberichte (1)
Die Fähigkeit des Trainers, den Kurs den Anforderungen der Organisation anzupassen, anstatt ihn nur zur Erbringung zu geben.
Masilonyane - Revenue Services Lesotho
Kurs - Big Data Business Intelligence for Govt. Agencies
Maschinelle Übersetzung