Schulungsübersicht
Tag 01
Übersicht über Big-Data-Business-Intelligence für die Analyse strafrechtlicher Informationen
- Fallbeispiele aus der Strafverfolgung - Predictive Policing
- Big-Data-Einführungsrate bei Strafverfolgungsbehörden und wie sie ihre zukünftige Operation um Big-Data-Predictive-Analytics anpassen
- Aufkommende Technologielösungen wie Schusswaffensensoren, Überwachungsvideos und soziale Medien
- Big-Data-Technologie zur Bewältigung der Informationsflut nutzen
- Schnittstellen von Big Data mit Legacy-Daten
- Grundlegendes Verständnis der ermöglichenden Technologien im Predictive Analytics
- Datenintegration & Dashboard-Visualisierung
- Betrugserfassung
- Geschäftsregeln und Betrugserkennung
- Drohungserkennung und Profilierung
- Cost-Benefit-Analyse für die Big-Data-Implementierung
Einführung in Big Data
- Hauptmerkmale von Big Data -- Volumen, Vielfalt, Geschwindigkeit und Wahrhaftigkeit.
- MPP-Architektur (Massively Parallel Processing)
- Data Warehouses – statisches Schema, langsam sich verändernder Datensatz
- MPP-Datenbanken: Greenplum, Exadata, Teradata, Netezza, Vertica usw.
- Hadoop-basierte Lösungen – keine Bedingungen bzgl. der Struktur des Datensatzes.
- Typisches Muster: HDFS, MapReduce (crunch), Abruf von HDFS
- Apache Spark für Stream Processing
- Batch – geeignet für analytische/nicht-interaktive Zwecke
- Volumen: CEP-Streaming-Daten
- Typische Auswahlmöglichkeiten – CEP-Produkte (z. B. Infostreams, Apama, MarkLogic usw.)
- Weniger produktionsreif – Storm/S4
- NoSQL-Datenbanken – (spaltenorientiert und key-value): am besten geeignet als analytisches Adjunkt zu Data Warehouse/Datenbank
NoSQL-Lösungen
- KV-Speicher - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- KV-Speicher - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
- KV-Speicher (hierarchisch) - GT.m, Cache
- KV-Speicher (geordnet) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- KV-Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
- Tuple Store - Gigaspaces, Coord, Apache River
- Objekt-Datenbank - ZopeDB, DB40, Shoal
- Dokumentenspeicher - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Datenbanken, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
- Breiter spaltenorientierter Speicher - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
Arten von Daten: Einführung in die Bereinigungsprobleme bei Big Data
- RDBMS – statische Struktur/Schema, fördert keine agile, explorative Umgebung.
- NoSQL – halbstrukturiert, genug Struktur, um Daten ohne exaktes Schema vor der Speicherung zu speichern
- Probleme bei der Datenbereinigung
Hadoop
- Wann sollte Hadoop gewählt werden?
- STRUKTURIERT - Enterprise Data Warehouses/Datenbanken können massive Daten (gegen Gebühr) speichern, aber Struktur auferlegen (nicht gut für aktive Exploration)
- HALBSTRUKTURIERTE DATEN – schwierig mit traditionellen Lösungen (DW/DB) durchzuführen
- Data-Warehousing von Daten = ENORMER Aufwand und statisch selbst nach der Implementierung
- Für Vielfalt & Volumen an Daten, verarbeitet auf Standard-Hardware – HADOOP
- Standard-H/W erforderlich, um einen Hadoop-Cluster zu erstellen
Einführung in MapReduce/HDFS
- MapReduce – verteilte Berechnung über mehrere Server
- HDFS – Daten für den Berechnungsprozess lokal verfügbar machen (mit Redundanz)
- Daten – können unstrukturiert/schemalos sein (im Gegensatz zu RDBMS)
- Verantwortung des Entwicklers, Sinn aus den Daten zu machen
- MapReduce programmieren = mit Java arbeiten (Vor-/Nachteile), manuelles Laden von Daten in HDFS
Tag 02
Big-Data-Ökosystem – Aufbau von Big-Data-ETL (Extract, Transform, Load) – Welche Big-Data-Tools wann einsetzen?
- Hadoop vs. andere NoSQL-Lösungen
- Für interaktiven, zufälligen Datenzugriff
- Hbase (spaltenorientierte Datenbank) auf Hadoop aufbauend
- Zufälliger Zugriff auf Daten, aber eingeschränkt (max 1 PB)
- Nicht gut für Ad-hoc-Analytics, gut für Logging, Zählen, Zeitreihen
- Sqoop - Import von Datenbanken in Hive oder HDFS (JDBC/ODBC-Zugriff)
- Flume – Streaming-Daten (z. B. Log-Daten) in HDFS streamen
Big-Data-Management-System
- Bewegliche Teile, Compute-Knoten starten/fallen aus: ZooKeeper - Für Konfigurations-/Koordinierungs-/Namensdienste
- Komplexe Pipeline/Workflow: Oozie – Workflow, Abhängigkeiten, Daisy-Chain verwalten
- Bereitstellung, Konfiguration, Cluster-Management, Upgrade usw. (Sys Admin) :Ambari
- In der Cloud : Whirr
Predictive Analytics -- Grundlagen Techniken und maschinenlernenbasierte Business Intelligence
- Einführung in Machine Learning
- Lernen von Klassifikationstechniken
- Bayesian Prediction – Vorbereitung einer Trainingsdatei
- Support Vector Machine
- KNN p-Tree Algebra & vertikales Mining
- Neyurale Netzwerke
- Big Data-Problem großer Variablen – Random Forest (RF)
- Big-Data-Automatisierungsproblem – Multi-Model Ensemble RF
- Automatisierung durch Soft10-M
- Textanalysetool-Treeminer
- Agiles Lernen
- Agentenbasiertes Lernen
- Verteiltes Lernen
- Einführung in Open-Source-Tools für Predictive Analytics : R, Python, Rapidminer, Mahut
Predictive-Analytics-Ökosystem und seine Anwendung bei der Analyse strafrechtlicher Informationen
- Technologie und der Ermittlungsprozess
- Insight-Analytik
- Visualisierung-Analytik
- Strukturierte Predictive Analytics
- Unstrukturierte Predictive Analytics
- Drohung-/Betrüger-/Vendor-Profilierung
- Recommendation Engine
- Mustererkennung
- Regel/Szenario-Erkennung – Fehler, Betrug, Optimierung
- Root Cause Discovery
- Sentiment-Analyse
- CRM-Analytics
- Netzwerk-Analytics
- Textanalyse zur Gewinnung von Einsichten aus Transkripten, Zeugenberichten, Internet-Chat usw.
- Technologieunterstützte Überprüfung
- Betrugsanalytik
- Echtzeit-Analytik
Tag 03
Echtzeit und skalierbare Analytik über Hadoop
- Warum gängige analytische Algorithmen bei Hadoop/HDFS fehlschlagen
- Apache Hama – für Bulk Synchronous distributed computing
- Apache SPARK – für Cluster Computing und Echtzeit-Analytik
- CMU Graphics Lab2 – graphenbasierter asynchroner Ansatz zum verteilten Computing
- KNN p – algebraischer Ansatz von Treeminer zur Reduzierung der Betriebskosten der Hardware
Tools für eDiscovery und Forensik
- eDiscovery über Big Data im Vergleich zu Legacy-Daten – ein Vergleich von Kosten und Leistung
- Predictive Coding und Technologieunterstützte Überprüfung (TAR)
- Live-Demo von vMiner zum Verständnis, wie TAR schnellere Entdeckung ermöglicht
- Schnellere Indizierung durch HDFS – Geschwindigkeit der Daten
- NLP (Natural Language Processing) – Open-Source-Produkte und Techniken
- eDiscovery in Fremdsprachen – Technologie zur Verarbeitung fremdsprachiger Daten
Big Data BI für Cybersicherheit – 360-Grad-Blick, schnelle Datenerfassung und Drohungserkennung
- Grundlagen der Sicherheitsanalytik verstehen – Angriffsfläche, Fehlkonfiguration der Sicherheit, Host-Verteidigungen
- Netzwerkinfrastruktur / großer Datenpipeline / Antwort ETL für Echtzeit-Analytik
- Präskriptiv vs. prädiktiv – feste regelbasiert vs. automatische Entdeckung von Drohungsregeln aus Metadaten
Gatherung unterschiedlicher Daten für die Analyse strafrechtlicher Informationen
- Nutzung von IoT (Internet of Things) als Sensoren zur Datenerfassung
- Nutzung von Satellitenbildern für innerstaatliche Überwachung
- Nutzung von Überwachungs- und Bilddaten zur Identifizierung von Straftätern
- Weitere Datenerfassungstechnologien – Drohnen, Bodycams, GPS-Tagging-Systeme und Wärmebildtechnologie
- Kombinieren automatisierter Datenabfrage mit Daten von Informanten, Vernehmungen und Forschung
- Prognose krimineller Aktivitäten
Tag 04
Betrugserfassungs-BI aus Big Data in der Betrugsanalytik
- Basis-Klassifikation der Betrugsanalytik – regelbasiert vs. prädiktive Analytik
- Überwacht vs. unüberwacht Machine Learning zur Mustererkennung bei Betrug
- Geschäft-zu-Geschäft-Betrug, Krankenversicherungs-Anspruchsbetrug, Versicherungsbetrug, Steuerhinterziehung und Geldwäsche
Social-Media-Analytik – Informationsgewinnung und Analyse
- Wie Social Media von Straftätern zur Organisation, Rekrutierung und Planung genutzt wird
- Big-Data-ETL-API zur Extraktion von Social-Media-Daten
- Text, Bild, Meta-Daten und Video
- Sentiment-Analyse aus Social-Media-Feed
- Kontextuelle und nicht-kontextuelle Filterung des Social-Media-Feeds
- Social-Media-Dashboard zur Integration diverser sozialer Medien
- Automatisierte Profilierung von Social-Media-Profilen
- Jede Analytik wird in einer Live-Demo über das Treeminer Tool gegeben
Big-Data-Analytik in der Bildverarbeitung und Video-Feeds
- Bildspeicherungstechniken in Big Data – Speicherlösungen für Daten, die Petabytes überschreiten
- LTFS (Linear Tape File System) und LTO (Linear Tape Open)
- GPFS-LTFS (General Parallel File System - Linear Tape File System) – geschichtete Speicherlösung für große Bilddaten
- Grundlagen der Bildanalytik
- Gegenstandserkennung
- Bildsegmentierung
- Bewegungserfassung
- 3-D-Bildrekonstruktion
Biometrie, DNA und Next-Generation-Identification-Programme
- Jenseits der Fingerabdruck- und Gesichtserkennung
- Spracherkennung, Tastenanschlag (Analyse des Tippmusters eines Benutzers) und CODIS (Combined DNA Index System)
- Jenseits der DNA-Vergleichung: Verwendung forensischer DNA-Phänotypisierung zur Konstruktion eines Gesichts aus DNA-Proben
Big-Data-Dashboard für schnellen Zugriff auf diverse Daten und Anzeige :
- Integration bestehender Anwendungsplattform mit Big Data Dashboard
- Big-Data-Management
- Fallstudie des Big Data Dashboards: Tableau und Pentaho
- Nutzung der Big Data App zur Bereitstellung von standortbasierten Diensten in der Regierung.
- Verfolgungssystem und -management
Tag 05
Wie die Implementierung von Big-Data-BI innerhalb einer Organisation gerechtfertigt werden kann:
- Definition des ROI (Return on Investment) für die Implementierung von Big Data
- Fallstudien zur Einsparung von Analystenzeit bei der Sammlung und Vorbereitung von Daten – Steigerung der Produktivität
- Einnahmengewinn durch niedrigere Datenbank-Lizenzkosten
- Einnahmengewinn durch standortbasierte Dienste
- Kosteneinsparungen durch Betrugsverhinderung
- Ein integrierter Spreadsheet-Ansatz zur Berechnung der ungefähren Ausgaben im Vergleich zum Einnahmengewinn/Savings von der Big-Data-Implementierung.
Schritt-für-Schritt-Verfahren zum Ersetzen eines Legacy-Datensystems durch ein Big-Data-System
- Big Data Migrationspfad
- Welche kritischen Informationen werden benötigt, bevor ein Big-Data-System entworfen wird?
- Wie können Volumen, Geschwindigkeit, Vielfalt und Wahrhaftigkeit der Daten auf unterschiedliche Weise berechnet werden?
- Wie schätzt man das Datenwachstum?
- Fallstudien
Überblick über Big-Data-Anbieter und Übersicht ihrer Produkte.
- Accenture
- APTEAN (ehemals CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (ehemals 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (Teil von EMC)
F/A-Sitzung
Voraussetzungen
- Kenntnisse der Prozesse und Datensysteme der Strafverfolgung
- Grundlegendes Verständnis von SQL/Oracle oder relationaler Datenbank
- Grundlegende Kenntnisse in Statistik (auf Spreadsheet-Ebene)
Zielgruppe
- Strafverfolgungsspezialisten mit technischem Hintergrund
Erfahrungsberichte (3)
Refactoring Übung und Graph Visualisierung
Tiago Kocevar - Lang Energie AG / Osterwalder Zurich AG
Kurs - Business Intelligence and Data Analysis with Metabase
Grundlagen und hat die vorbereiteten Dokumente und Übungen geliebt
Rekha Nallam - GE Medical Systems Polska Sp. z o.o.
Kurs - Introduction to Predictive AI
Maschinelle Übersetzung
Deepthi war sehr empfänglich für meine Bedürfnisse, sie konnte erkennen, wann sie zusätzliche Komplexität hinzufügen und wann sie zurückhaltend sein und einen strukturierteren Ansatz verfolgen sollte. Deepthi hat wirklich in meinem Tempo gearbeitet und sicher gestellt, dass ich die neuen Funktionen/Tools selbstständig einsetzen kann, indem sie mir zunächst gezeigt hat, wie es geht, und mich dann selbst nachbauen ließ. Dies half enorm bei der Vertiefung des Trainings. Ich bin extrem zufrieden mit den Ergebnissen dieses Trainings und mit Deepthis Fachwissen!
Deepthi - Invest Northern Ireland
Kurs - IBM Cognos Analytics
Maschinelle Übersetzung