Kontakt aufnehmen

Schulungsübersicht

Einführung

Dieser Abschnitt bietet einen allgemeinen Überblick darüber, wann 'Machine Learning' eingesetzt wird, welche Aspekte zu beachten sind und was alles dahintersteht – inklusive Vor- und Nachteilen. Datentypen (strukturiert/unstrukturiert/statisch/streamed), Datenvalidität und -volumen, datengetriebene vs. nutzergetriebene Analytik, statistische Modelle im Vergleich zu ML-Modellen, Herausforderungen des unüberwachten Lernens, Bias-Varianz-Trade-off, Iteration und Evaluation, Cross-Validation-Ansätze sowie überwachtes, unüberwachtes und bestärkendes Lernen.

HAUPTTHEMEN

1. Naive Bayes verstehen

  • Grundlegende Konzepte bayesscher Methoden
  • Wahrscheinlichkeit
  • Gemeinsame Wahrscheinlichkeit
  • Konditionale Wahrscheinlichkeit mit dem Satz von Bayes
  • Der Naive-Bayes-Algorithmus
  • Naive-Bayes-Klassifizierung
  • Der Laplace-Schätzer
  • Einsatz numerischer Merkmale mit Naive Bayes

2. Entscheidungsbäume verstehen

  • Teile und herrsche
  • Der C5.0-Algorithmus für Entscheidungsbäume
  • Auswahl der optimalen Trennung
  • Beschneiden des Entscheidungsbaums

3. Neuronale Netze verstehen

  • Von biologischen zu künstlichen Neuronen
  • Aktivierungsfunktionen
  • Netzwerktopologie
  • Anzahl der Schichten
  • Richtung des Informationsflusses
  • Anzahl der Knoten pro Schicht
  • Training neuronaler Netze mittels Backpropagation
  • Deep Learning

4. Support Vector Machines verstehen

  • Klassifizierung mit Hyperflächen
  • Finden des maximalen Margins
  • Fall linear trennbarer Daten
  • Fall nicht-linear trennbarer Daten
  • Einsatz von Kernels für nicht-lineare Räume

5. Clustering verstehen

  • Clustering als ML-Aufgabe
  • Der k-Means-Algorithmus zum Clustern
  • Einsatz von Distanzen zur Zuweisung und Aktualisierung von Clustern
  • Auswahl der passenden Anzahl an Clustern

6. Leistungsmessung für Klassifizierung

  • Arbeiten mit Klassifizierungs-Vorhersagedaten
  • Konfusionsmatrizen im Detail
  • Nutzung von Konfusionsmatrizen zur Leistungs messung
  • Über die Genauigkeit hinaus – weitere Leistungsmetriken
  • Der Kappa-Statistikwert
  • Sensitivität und Spezifität
  • Präzision und Recall
  • F-Maß
  • Visualisierung von Leistungstrade-offs
  • ROC-Kurven
  • Schätzung der zukünftigen Leistung
  • Holdout-Verfahren
  • Cross-Validation
  • Bootstrap-Stichproben

7. Standardmodelle zur Leistungssteigerung abstimmen

  • Einsatz von caret zur automatischen Parameterabstimmung
  • Erstellen eines einfach abgestimmten Modells
  • Anpassen des Abstimmungsprozesses
  • Leistungssteigerung durch Meta-Learning
  • Verständnis von Ensembles
  • Bagging
  • Boosting
  • Zufällige Wälder (Random Forests)
  • Training zufälliger Wälder
  • Bewertung der Leistung zufälliger Wälder

NEBENTHEMEN

8. Klassifizierung mittels k-Nächster-Nachbarn verstehen

  • Der kNN-Algorithmus
  • Berechnung der Distanz
  • Auswahl eines angemessenen k
  • Vorbereitung der Daten für die Nutzung mit kNN
  • Warum ist der kNN-Algorithmus "faul"?

9. Klassifizierungsregeln verstehen

  • Trennen und erobern
  • Der One-Rule-Algorithmus
  • Der RIPPER-Algorithmus
  • Regeln aus Entscheidungsbäumen

10. Regression verstehen

  • Einfache lineare Regression
  • Schätzung mittels kleinster Quadrate
  • Korrelationen
  • Mehrfache lineare Regression

11. Regressionsbäume und Modellbäume verstehen

  • Regression zu Bäumen hinzufügen

12. Assoziationsregeln verstehen

  • Der Apriori-Algorithmus zum Erlernen von Assoziationsregeln
  • Messung der Regelrelevanz – Support und Konfidenz
  • Aufbau eines Regelsatzes mit dem Apriori-Prinzip

Zusatzthemen

  • Spark/PySpark/MLlib und Multi-Armed Bandits

Voraussetzungen

Python-Kenntnisse

 21 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Erfahrungsberichte (7)

Kommende Kurse

Verwandte Kategorien