Kontakt aufnehmen

Schulungsübersicht

Jede Sitzung dauert 2 Stunden

Tag 1: Sitzung 1: Geschäftlicher Überblick über die Gründe für Big Data Business Intelligence in Regierungsbehörden

  • Fallstudien von NIH, DoE
  • Anpassungsrate von Big Data in Regierungsbehörden und wie diese ihre zukünftigen Operationen um Big Data Predictive Analytics ausrichten
  • Anwendungsbereiche im großen Maßstab bei DoD, NSA, IRS, USDA usw.
  • Anbindung von Big Data an Legacy-Daten
  • Grundlegendes Verständnis der ermöglichenden Technologien in Predictive Analytics
  • Datenintegration & Dashboard-Visualisierung
  • Betrugsbekämpfung
  • Erstellung von Geschäftsregeln / Betrugsdetektion
  • Gefahrenerkennung und Profilbildung
  • Kosten-Nutzen-Analyse für die Implementierung von Big Data

Tag 1: Sitzung 2: Einführung in Big Data-1

  • Hauptmerkmale von Big Data: Volumen, Vielfalt, Geschwindigkeit und Veracity. MPP-Architektur für das Volumen.
  • Daten-Warehouse – statisches Schema, langsam sich ändernde Datensätze
  • MPP-Datenbanken wie Greenplum, Exadata, Teradata, Netezza, Vertica usw.
  • Hadoop-basierte Lösungen – keine Bedingungen bezüglich der Struktur des Datensatzes.
  • Typisches Muster: HDFS, MapReduce (crunch), Abrufen von HDFS
  • Batch – geeignet für analytische / nicht-interaktive Aufgaben
  • Volumen: CEP-Streaming-Daten
  • Typische Produkte – CEP-Produkte (z. B. Infostreams, Apama, MarkLogic usw.)
  • Weniger produktionsreif – Storm/S4
  • NoSQL-Datenbanken – (spaltenorientiert und key-value): Am besten geeignet als analytisches Add-on zum Daten-Warehouse / Datenbank

Tag 1: Sitzung 3: Einführung in Big Data-2

NoSQL-Lösungen

  • KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • KV Store (Hierarchisch) - GT.m, Cache
  • KV Store (Sortiert) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • Tuple Store - Gigaspaces, Coord, Apache River
  • Object Database - ZopeDB, DB40, Shoal
  • Document Store - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Datenbanken, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • Wide Columnar Store - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

Vielfalt der Daten: Einführung in das Problem der Datenbereinigung bei Big Data

  • RDBMS – statische Struktur / Schema, fördert keine agile, erkundende Umgebung.
  • NoSQL – semi-strukturiert, genug Struktur, um Daten zu speichern, ohne ein genaues Schema vor dem Speichern zu haben.
  • Probleme bei der Datenbereinigung

Tag 1: Sitzung 4: Big Data Einführung-3 : Hadoop

  • Wann ist Hadoop die richtige Wahl?
  • STRUKTURIERT – Enterprise-Daten-Warehouses / Datenbanken können massive Datenmengen speichern (zu einem Kostenfaktor), aber sie erzwingen Struktur (nicht gut für aktive Erkundung)
  • SEMI-STRUKTURIERTE Daten – schwierig mit traditionellen Lösungen zu bewerkstelligen (DW / DB)
  • Daten im Warehouse = enormer Aufwand und auch nach der Implementierung statisch
  • Für die Vielfalt & das Volumen von Daten, verarbeitet auf Kommodity-Hardware – HADOOP
  • Commodity-Hardware wird benötigt, um einen Hadoop-Cluster zu erstellen

Einführung in Map Reduce /HDFS

  • MapReduce – verteilte Berechnung über mehrere Server
  • HDFS – macht Daten für den Berechnungsprozess lokal verfügbar (mit Redundanz)
  • Daten – können unstrukturiert / schema-frei sein (im Gegensatz zu RDBMS)
  • Entwickler sind dafür verantwortlich, einen Sinn in den Daten zu erkennen
  • Programmierung von MapReduce = Arbeit mit Java (Vor- und Nachteile), manuelles Laden der Daten in HDFS

Tag 2: Sitzung 1: Big Data Ökosystem – Aufbau des Big Data ETL: Universum der Big Data Tools – welches wann zu verwenden?

  • Hadoop im Vergleich zu anderen NoSQL-Lösungen
  • Für interaktiven, zufälligen Zugriff auf Daten
  • Hbase (spaltenorientierte Datenbank) auf Hadoop
  • Zufälliger Zugriff auf Daten, aber mit Einschränkungen (max. 1 PB)
  • Nicht gut für ad-hoc Analysen, gut für Logging, Zählungen, Zeitreihen
  • Sqoop – Import von Datenbanken in Hive oder HDFS (JDBC / ODBC-Zugriff)
  • Flume – Streaming-Daten (z. B. Protokolldaten) in HDFS

Tag 2: Sitzung 2: Big Data Management System

  • Bewegliche Teile, Compute Nodes starten / fallen aus: ZooKeeper – für Konfiguration / Koordinierung / Naming Services
  • Komplexe Pipeline / Workflow: Oozie – Workflow-Verwaltung, Abhängigkeiten, Kettenschaltung
  • Bereitstellung, Konfiguration, Cluster-Verwaltung, Upgrades usw. (Systemadministrator): Ambari
  • In der Cloud : Whirr

Tag 2: Sitzung 3: Predictive Analytics in Business Intelligence -1: Grundlegende Techniken & maschinelles Lernen-basierte BI :

  • Einführung in Machine Learning
  • Lernen von Klassifizierungstechniken
  • Bayesian Prediction – Vorbereiten der Trainingsdatei
  • Support Vector Machine
  • KNN p-Tree Algebra & vertikales Mining
  • Neuronale Netzwerke
  • Big Data großes Variablenproblem -Random Forest (RF)
  • Big Data Automatisierungsproblem – Multi-Model Ensemble RF
  • Automatisierung durch Soft10-M
  • Textanalysetool-Treeminer
  • Agiles Lernen
  • Agentenbasiertes Lernen
  • Verteiltes Lernen
  • Einführung in Open-Source-Tools für Predictive Analytics : R, Rapidminer, Mahout

Tag 2: Sitzung 4 Predictive analytics Ökosystem-2: Gemeinsame Predictive Analytic-Probleme in Regierungsbehörden

  • Insight Analysis
  • Visualisierungsanalyse
  • Strukturierte Predictive Analytics
  • Unstrukturierte Predictive Analytics
  • Gefahren- / Betrugsstar- / Lieferantenprofilbildung
  • Empfehlungsmotor
  • Mustererkennung
  • Regel-Szenario-Erkennung – Fehler, Betrug, Optimierung
  • Ursachenermittlung
  • Sentiment-Analyse
  • CRM-Analytik
  • Netzwerkanalytik
  • Textanalysen
  • Technologieunterstützte Überprüfung
  • Betrugsanalytik
  • Echtzeitanalyse

Tag 3: Sitzung 1 : Echtzeit- und skalierbare Analytik über Hadoop

  • Warum scheitern gängige analytische Algorithmen in Hadoop / HDFS?
  • Apache Hama - für Bulk Synchronous verteiltes Computing
  • Apache SPARK – für Cluster-Computing für Echtzeit-Analytik
  • CMU Graphics Lab2 – graphbasierte asynchrone Herangehensweise an verteiltes Computing
  • KNN p-Algebra-basierte Herangehensweise von Treeminer für reduzierte Hardwarekosten des Betriebs

Tag 3: Sitzung 2: Tools für eDiscovery und Forensik

  • eDiscovery über Big Data im Vergleich zu Legacy-Daten – ein Kosten- und Leistungsvergleich
  • Predictive Coding und technologieunterstützte Überprüfung (TAR)
  • Live-Demo eines TAR-Produkts (vMiner), um zu verstehen, wie TAR für eine schnellere Entdeckung funktioniert
  • Schnellere Indizierung durch HDFS – Geschwindigkeit der Daten
  • NLP oder Natural Language Processing – verschiedene Techniken und Open-Source-Produkte
  • eDiscovery in Fremdsprachen – Technologie zur Verarbeitung von Fremdsprachen

Tag 3: Sitzung 3: Big Data BI für Cybersicherheit – Verständnis der gesamten 360-Grad-Ansicht von schneller Datensammlung bis zur Bedrohungserkennung

  • Grundlagen des Security Analytics verstehen-Angriffsfläche, Sicherheitskonfigurationsfehler, Host-Abwehr
  • Netzwerkinfrastruktur / großer Datenpipe / Response ETL für Echtzeit-Analytik
  • Vorschreibend vs. vorhersagend – Festgelegte regelbasierte vs. automatische Entdeckung von Bedrohungsregeln aus Metadaten

Tag 3: Sitzung 4: Big Data im USDA: Anwendung in der Landwirtschaft

  • Einführung in IoT (Internet of Things) für die Landwirtschaft – sensorbasierte Big Data und Steuerung
  • Einführung in Satellitenbilderstellung und deren Anwendung in der Landwirtschaft
  • Integration von Sensor- und Bilddaten für Bodenfruchtbarkeit, Anbauempfehlungen und Prognosen
  • Landwirtschaftsversicherung und Big Data
  • Prognose von Ernteausfällen

Tag 4: Sitzung 1: Betrugsschutz-BI aus Big Data in Regierungsbehörden – Betrugsanalytik:

  • Basics-Klassifizierung der Betrugsanalytik - regelbasiert vs. predictive Analytics
  • Überwacht vs. unüberwacht Machine Learning zur Mustererkennung bei Betrug
  • Lieferantenschummel / Überladung von Projekten
  • Medicare und Medicaid Betrug – Techniken zur Betrugserkennung für die Abrechnungsprüfung
  • Betrug bei Reisekostenabrechnungen
  • IRS Rückerstattungsbsbetrug
  • Fallstudien und Live-Demos werden dort angeboten, wo Daten verfügbar sind.

Tag 4: Sitzung 2: Social Media Analytik – Informationsbeschaffung und Analyse

  • Big Data ETL API zur Extraktion von Social-Media-Daten
  • Text, Bild, Meta-Daten und Video
  • Sentiment-Analyse aus Social-Media-Feeds
  • Kontextbezogene und kontextfreie Filterung von Social-Media-Feeds
  • Social Media Dashboard zur Integration unterschiedlicher Social-Media-Kanäle
  • Automatisierte Profilbildung sozialer Medien
  • Live-Demo jeder Analytik wird über das Tool Treeminer bereitgestellt.

Tag 4: Sitzung 3: Big Data Analytik in der Bildverarbeitung und Videodatenströme

  • Bildspeichertechniken in Big Data – Speicherlösung für Daten, die Petabytes überschreiten
  • LTFS und LTO
  • GPFS-LTFS (Geschichtete Speicherlösung für große Bilddaten)
  • Grundlagen der Bildanalytik
  • Objekterkennung
  • Bildsegmentierung
  • Bewegungsverfolgung
  • 3-D-Bildrekonstruktion

Tag 4: Sitzung 4: Big Data Anwendungen in NIH:

  • Aufstrebende Bereiche der Bioinformatik
  • Metagenomik und Probleme beim Big Data Mining
  • Big Data Predictive Analytik für Pharmakogenomik, Metabolomics und Proteomics
  • Big Data in nachgelagerten Genomikprozessen
  • Anwendung von Big-Data-Predictive-Analytics in der öffentlichen Gesundheit

Big Data Dashboard für schnellen Zugriff auf diverse Daten und Anzeige :

  • Integration bestehender Anwendungsplattformen mit Big Data Dashboard
  • Big Data Management
  • Fallstudie zum Big Data Dashboard: Tableau und Pentaho
  • Nutzung von Big Data Apps zur Bereitstellung standortbasierter Dienste in Regierungsbehörden
  • Verfolgungssystem und Management

Tag 5 : Sitzung 1: Wie rechtfertigt man die Implementierung von Big Data BI innerhalb einer Organisation?

  • Definition des ROI für die Big-Data-Implementierung
  • Fallstudien zur Einsparung der Analystenzeit für Sammlung und Aufbereitung von Daten – Steigerung der Produktivität
  • Fallstudien zu Einnahmegewinnen durch Einsparungen bei lizenzierten Datenbankkosten
  • Einnahmegewinne durch standortbasierte Dienste
  • Einsparungen durch Betrugsschutz
  • Ein integrierter Tabellenkalkulationsansatz zur Berechnung der ca. Kosten vs. Einnahmegewinn / Einsparungen aus der Big-Data-Implementierung.

Tag 5 : Sitzung 2: Schritt-für-Schritt-Verfahren zum Ersetzen von Legacy-Datensystemen durch Big Data Systeme:

  • Verständnis einer praktischen Big-Data-Migrations-Roadmap
  • Welche wichtigen Informationen werden vor der Architektur eines Big-Data-Projekts benötigt?
  • Wie berechnet man Volumen, Geschwindigkeit, Vielfalt und Veracity der Daten auf unterschiedliche Weise?
  • Wie schätzt man das Datenwachstum ein?
  • Fallstudien

Tag 5: Sitzung 4: Überprüfung der Big-Data-Hersteller und Review ihrer Produkte. Q/A-Sitzung:

  • Accenture
  • APTEAN (ehemals CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (ehemals 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG / Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (Teil von EMC)

Voraussetzungen

  • Grundlegende Kenntnisse der Geschäftsabläufe und Datensysteme in Regierungsbehörden innerhalb ihres Fachgebiets
  • Grundlegendes Verständnis von SQL/Oracle oder relationalen Datenbanken
  • Grundlegendes Verständnis von Statistik (auf Tabellenkalkulationsebene)
 35 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Erfahrungsberichte (1)

Kommende Kurse

Verwandte Kategorien