Kontakt aufnehmen

Schulungsübersicht

Tag 01

Übersicht über Big-Data-Business-Intelligence für die Analyse strafrechtlicher Informationen

  • Fallbeispiele aus der Strafverfolgung - Predictive Policing
  • Big-Data-Einführungsrate bei Strafverfolgungsbehörden und wie sie ihre zukünftige Operation um Big-Data-Predictive-Analytics anpassen
  • Aufkommende Technologielösungen wie Schusswaffensensoren, Überwachungsvideos und soziale Medien
  • Big-Data-Technologie zur Bewältigung der Informationsflut nutzen
  • Schnittstellen von Big Data mit Legacy-Daten
  • Grundlegendes Verständnis der ermöglichenden Technologien im Predictive Analytics
  • Datenintegration & Dashboard-Visualisierung
  • Betrugserfassung
  • Geschäftsregeln und Betrugserkennung
  • Drohungserkennung und Profilierung
  • Cost-Benefit-Analyse für die Big-Data-Implementierung

Einführung in Big Data

  • Hauptmerkmale von Big Data -- Volumen, Vielfalt, Geschwindigkeit und Wahrhaftigkeit.
  • MPP-Architektur (Massively Parallel Processing)
  • Data Warehouses – statisches Schema, langsam sich verändernder Datensatz
  • MPP-Datenbanken: Greenplum, Exadata, Teradata, Netezza, Vertica usw.
  • Hadoop-basierte Lösungen – keine Bedingungen bzgl. der Struktur des Datensatzes.
  • Typisches Muster: HDFS, MapReduce (crunch), Abruf von HDFS
  • Apache Spark für Stream Processing
  • Batch – geeignet für analytische/nicht-interaktive Zwecke
  • Volumen: CEP-Streaming-Daten
  • Typische Auswahlmöglichkeiten – CEP-Produkte (z. B. Infostreams, Apama, MarkLogic usw.)
  • Weniger produktionsreif – Storm/S4
  • NoSQL-Datenbanken – (spaltenorientiert und key-value): am besten geeignet als analytisches Adjunkt zu Data Warehouse/Datenbank

NoSQL-Lösungen

  • KV-Speicher - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • KV-Speicher - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • KV-Speicher (hierarchisch) - GT.m, Cache
  • KV-Speicher (geordnet) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • KV-Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • Tuple Store - Gigaspaces, Coord, Apache River
  • Objekt-Datenbank - ZopeDB, DB40, Shoal
  • Dokumentenspeicher - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Datenbanken, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • Breiter spaltenorientierter Speicher - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

Arten von Daten: Einführung in die Bereinigungsprobleme bei Big Data

  • RDBMS – statische Struktur/Schema, fördert keine agile, explorative Umgebung.
  • NoSQL – halbstrukturiert, genug Struktur, um Daten ohne exaktes Schema vor der Speicherung zu speichern
  • Probleme bei der Datenbereinigung

Hadoop

  • Wann sollte Hadoop gewählt werden?
  • STRUKTURIERT - Enterprise Data Warehouses/Datenbanken können massive Daten (gegen Gebühr) speichern, aber Struktur auferlegen (nicht gut für aktive Exploration)
  • HALBSTRUKTURIERTE DATEN – schwierig mit traditionellen Lösungen (DW/DB) durchzuführen
  • Data-Warehousing von Daten = ENORMER Aufwand und statisch selbst nach der Implementierung
  • Für Vielfalt & Volumen an Daten, verarbeitet auf Standard-Hardware – HADOOP
  • Standard-H/W erforderlich, um einen Hadoop-Cluster zu erstellen

Einführung in MapReduce/HDFS

  • MapReduce – verteilte Berechnung über mehrere Server
  • HDFS – Daten für den Berechnungsprozess lokal verfügbar machen (mit Redundanz)
  • Daten – können unstrukturiert/schemalos sein (im Gegensatz zu RDBMS)
  • Verantwortung des Entwicklers, Sinn aus den Daten zu machen
  • MapReduce programmieren = mit Java arbeiten (Vor-/Nachteile), manuelles Laden von Daten in HDFS

Tag 02

Big-Data-Ökosystem – Aufbau von Big-Data-ETL (Extract, Transform, Load) – Welche Big-Data-Tools wann einsetzen?

  • Hadoop vs. andere NoSQL-Lösungen
  • Für interaktiven, zufälligen Datenzugriff
  • Hbase (spaltenorientierte Datenbank) auf Hadoop aufbauend
  • Zufälliger Zugriff auf Daten, aber eingeschränkt (max 1 PB)
  • Nicht gut für Ad-hoc-Analytics, gut für Logging, Zählen, Zeitreihen
  • Sqoop - Import von Datenbanken in Hive oder HDFS (JDBC/ODBC-Zugriff)
  • Flume – Streaming-Daten (z. B. Log-Daten) in HDFS streamen

Big-Data-Management-System

  • Bewegliche Teile, Compute-Knoten starten/fallen aus: ZooKeeper - Für Konfigurations-/Koordinierungs-/Namensdienste
  • Komplexe Pipeline/Workflow: Oozie – Workflow, Abhängigkeiten, Daisy-Chain verwalten
  • Bereitstellung, Konfiguration, Cluster-Management, Upgrade usw. (Sys Admin) :Ambari
  • In der Cloud : Whirr

Predictive Analytics -- Grundlagen Techniken und maschinenlernenbasierte Business Intelligence

  • Einführung in Machine Learning
  • Lernen von Klassifikationstechniken
  • Bayesian Prediction – Vorbereitung einer Trainingsdatei
  • Support Vector Machine
  • KNN p-Tree Algebra & vertikales Mining
  • Neyurale Netzwerke
  • Big Data-Problem großer Variablen – Random Forest (RF)
  • Big-Data-Automatisierungsproblem – Multi-Model Ensemble RF
  • Automatisierung durch Soft10-M
  • Textanalysetool-Treeminer
  • Agiles Lernen
  • Agentenbasiertes Lernen
  • Verteiltes Lernen
  • Einführung in Open-Source-Tools für Predictive Analytics : R, Python, Rapidminer, Mahut

Predictive-Analytics-Ökosystem und seine Anwendung bei der Analyse strafrechtlicher Informationen

  • Technologie und der Ermittlungsprozess
  • Insight-Analytik
  • Visualisierung-Analytik
  • Strukturierte Predictive Analytics
  • Unstrukturierte Predictive Analytics
  • Drohung-/Betrüger-/Vendor-Profilierung
  • Recommendation Engine
  • Mustererkennung
  • Regel/Szenario-Erkennung – Fehler, Betrug, Optimierung
  • Root Cause Discovery
  • Sentiment-Analyse
  • CRM-Analytics
  • Netzwerk-Analytics
  • Textanalyse zur Gewinnung von Einsichten aus Transkripten, Zeugenberichten, Internet-Chat usw.
  • Technologieunterstützte Überprüfung
  • Betrugsanalytik
  • Echtzeit-Analytik

Tag 03

Echtzeit und skalierbare Analytik über Hadoop

  • Warum gängige analytische Algorithmen bei Hadoop/HDFS fehlschlagen
  • Apache Hama – für Bulk Synchronous distributed computing
  • Apache SPARK – für Cluster Computing und Echtzeit-Analytik
  • CMU Graphics Lab2 – graphenbasierter asynchroner Ansatz zum verteilten Computing
  • KNN p – algebraischer Ansatz von Treeminer zur Reduzierung der Betriebskosten der Hardware

Tools für eDiscovery und Forensik

  • eDiscovery über Big Data im Vergleich zu Legacy-Daten – ein Vergleich von Kosten und Leistung
  • Predictive Coding und Technologieunterstützte Überprüfung (TAR)
  • Live-Demo von vMiner zum Verständnis, wie TAR schnellere Entdeckung ermöglicht
  • Schnellere Indizierung durch HDFS – Geschwindigkeit der Daten
  • NLP (Natural Language Processing) – Open-Source-Produkte und Techniken
  • eDiscovery in Fremdsprachen – Technologie zur Verarbeitung fremdsprachiger Daten

Big Data BI für Cybersicherheit – 360-Grad-Blick, schnelle Datenerfassung und Drohungserkennung

  • Grundlagen der Sicherheitsanalytik verstehen – Angriffsfläche, Fehlkonfiguration der Sicherheit, Host-Verteidigungen
  • Netzwerkinfrastruktur / großer Datenpipeline / Antwort ETL für Echtzeit-Analytik
  • Präskriptiv vs. prädiktiv – feste regelbasiert vs. automatische Entdeckung von Drohungsregeln aus Metadaten

Gatherung unterschiedlicher Daten für die Analyse strafrechtlicher Informationen

  • Nutzung von IoT (Internet of Things) als Sensoren zur Datenerfassung
  • Nutzung von Satellitenbildern für innerstaatliche Überwachung
  • Nutzung von Überwachungs- und Bilddaten zur Identifizierung von Straftätern
  • Weitere Datenerfassungstechnologien – Drohnen, Bodycams, GPS-Tagging-Systeme und Wärmebildtechnologie
  • Kombinieren automatisierter Datenabfrage mit Daten von Informanten, Vernehmungen und Forschung
  • Prognose krimineller Aktivitäten

Tag 04

Betrugserfassungs-BI aus Big Data in der Betrugsanalytik

  • Basis-Klassifikation der Betrugsanalytik – regelbasiert vs. prädiktive Analytik
  • Überwacht vs. unüberwacht Machine Learning zur Mustererkennung bei Betrug
  • Geschäft-zu-Geschäft-Betrug, Krankenversicherungs-Anspruchsbetrug, Versicherungsbetrug, Steuerhinterziehung und Geldwäsche

Social-Media-Analytik – Informationsgewinnung und Analyse

  • Wie Social Media von Straftätern zur Organisation, Rekrutierung und Planung genutzt wird
  • Big-Data-ETL-API zur Extraktion von Social-Media-Daten
  • Text, Bild, Meta-Daten und Video
  • Sentiment-Analyse aus Social-Media-Feed
  • Kontextuelle und nicht-kontextuelle Filterung des Social-Media-Feeds
  • Social-Media-Dashboard zur Integration diverser sozialer Medien
  • Automatisierte Profilierung von Social-Media-Profilen
  • Jede Analytik wird in einer Live-Demo über das Treeminer Tool gegeben

Big-Data-Analytik in der Bildverarbeitung und Video-Feeds

  • Bildspeicherungstechniken in Big Data – Speicherlösungen für Daten, die Petabytes überschreiten
  • LTFS (Linear Tape File System) und LTO (Linear Tape Open)
  • GPFS-LTFS (General Parallel File System - Linear Tape File System) – geschichtete Speicherlösung für große Bilddaten
  • Grundlagen der Bildanalytik
  • Gegenstandserkennung
  • Bildsegmentierung
  • Bewegungserfassung
  • 3-D-Bildrekonstruktion

Biometrie, DNA und Next-Generation-Identification-Programme

  • Jenseits der Fingerabdruck- und Gesichtserkennung
  • Spracherkennung, Tastenanschlag (Analyse des Tippmusters eines Benutzers) und CODIS (Combined DNA Index System)
  • Jenseits der DNA-Vergleichung: Verwendung forensischer DNA-Phänotypisierung zur Konstruktion eines Gesichts aus DNA-Proben

Big-Data-Dashboard für schnellen Zugriff auf diverse Daten und Anzeige :

  • Integration bestehender Anwendungsplattform mit Big Data Dashboard
  • Big-Data-Management
  • Fallstudie des Big Data Dashboards: Tableau und Pentaho
  • Nutzung der Big Data App zur Bereitstellung von standortbasierten Diensten in der Regierung.
  • Verfolgungssystem und -management

Tag 05

Wie die Implementierung von Big-Data-BI innerhalb einer Organisation gerechtfertigt werden kann:

  • Definition des ROI (Return on Investment) für die Implementierung von Big Data
  • Fallstudien zur Einsparung von Analystenzeit bei der Sammlung und Vorbereitung von Daten – Steigerung der Produktivität
  • Einnahmengewinn durch niedrigere Datenbank-Lizenzkosten
  • Einnahmengewinn durch standortbasierte Dienste
  • Kosteneinsparungen durch Betrugsverhinderung
  • Ein integrierter Spreadsheet-Ansatz zur Berechnung der ungefähren Ausgaben im Vergleich zum Einnahmengewinn/Savings von der Big-Data-Implementierung.

Schritt-für-Schritt-Verfahren zum Ersetzen eines Legacy-Datensystems durch ein Big-Data-System

  • Big Data Migrationspfad
  • Welche kritischen Informationen werden benötigt, bevor ein Big-Data-System entworfen wird?
  • Wie können Volumen, Geschwindigkeit, Vielfalt und Wahrhaftigkeit der Daten auf unterschiedliche Weise berechnet werden?
  • Wie schätzt man das Datenwachstum?
  • Fallstudien

Überblick über Big-Data-Anbieter und Übersicht ihrer Produkte.

  • Accenture
  • APTEAN (ehemals CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (ehemals 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (Teil von EMC)

F/A-Sitzung

Voraussetzungen

  • Kenntnisse der Prozesse und Datensysteme der Strafverfolgung
  • Grundlegendes Verständnis von SQL/Oracle oder relationaler Datenbank
  • Grundlegende Kenntnisse in Statistik (auf Spreadsheet-Ebene)

Zielgruppe

  • Strafverfolgungsspezialisten mit technischem Hintergrund
 35 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Erfahrungsberichte (3)

Kommende Kurse

Verwandte Kategorien