Kontakt aufnehmen

Schulungsübersicht

Einführung in Maschinelles Lernen

  • Arten des maschinellen Lernens – überwacht vs. unüberwacht
  • Von statistischem Lernen zu maschinellem Lernen
  • Der Data-Mining-Arbeitsfluss: Geschäftsverständnis, Datenvorbereitung, Modellierung, Bereitstellung
  • Die richtige Wahl des Algorithmus für die Aufgabe
  • Overfitting und der Bias-Variance-Tradeoff

Übersicht über Python und ML-Bibliotheken

  • Warum Programmiersprachen für ML verwenden?
  • Entscheidung zwischen R und Python
  • Python-Kurzlehrgang und Jupyter Notebooks
  • Python-Bibliotheken: pandas, NumPy, scikit-learn, matplotlib, seaborn

Testen und Bewerten von ML-Algorithmen

  • Allgemeinerisation, Overfitting und Modellvalidierung
  • Bewertungsstrategien: Holdout, Cross-Validation, Bootstrapping
  • Metriken für Regression: ME, MSE, RMSE, MAPE
  • Metriken für Klassifizierung: Genauigkeit, Konfusionsmatrix, unausgewogene Klassen
  • Visualisierung der Modellleistung: Gewinnkurve, ROC-Kurve, Lift-Kurve
  • Modellauswahl und Grid-Search zur Feinabstimmung

Datenvorbereitung

  • Datenimport und -speicherung in Python
  • Explorative Analyse und statistische Kennzahlen
  • Umgang mit fehlenden Werten und Ausreißern
  • Standardisierung, Normalisierung und Transformation
  • Umkodierung qualitativer Daten und Data Wrangling mit pandas

Klassifizierungsalgorithmen

  • Binäres vs. multiklasses Klassifizierung
  • Logistische Regression und Diskriminanzfunktionen
  • Naive Bayes, k-nächste-Nachbarn-Algorithmen
  • Entscheidungsbäume: CART, Random Forests, Bagging, Boosting, XGBoost
  • Support Vector Machines und Kernel
  • Ensemble-Lernverfahren

Regression und numerische Vorhersage

  • Methode der kleinsten Quadrate und Variablenselektion
  • Regularisierungsmethoden: L1, L2
  • Polyonomiale Regression und nichtlineare Modelle
  • Regressionsbäume und Splines

Unüberwachtes Lernen

  • Clustering-Techniken: k-means, k-medoids, hierarchisches Clustering, SOMs
  • Dimensionalitätsreduktion: PCA, Faktorenanalyse, SVD
  • Multidimensionale Skalierung

Text Mining

  • Textvorverarbeitung und Tokenisierung
  • Bag-of-Words, Stemming und Lemmatisierung
  • Sentiment-Analyse und Wortfrequenz
  • Visualisierung von Textdaten mit Word Clouds

Empfehlungssysteme

  • Nutzerbasierte und item-basierte kollaborative Filterung
  • Design und Bewertung von Empfehlungsmotoren

Von Assoziationsmustern lernen

  • Häufige Itemsets und Apriori-Algorithmus
  • Market-Basket-Analyse und Lift-Ratio

Erkennung von Ausreißern

  • Analyse extremer Werte
  • Abstandsbasierte und dichte-basierte Methoden
  • Ausreißererkennung in hochdimensionalen Daten

Maschinelles Lernen Fallstudie

  • Verständnis des Geschäftsproblems
  • Datenvorverarbeitung und Feature-Engineering
  • Modellauswahl und Parametertuning
  • Evaluation und Präsentation der Ergebnisse
  • Bereitstellung (Deployment)

Zusammenfassung und nächste Schritte

Voraussetzungen

  • Grundlegendes Verständnis von Statistik und linearer Algebra
  • Bekanntschaft mit Konzepten der Datenanalyse oder Business Intelligence
  • Eine gewisse Erfahrung in der Programmierung (vorzugsweise Python oder R) wird empfohlen
  • Interesse am Erlernen von angewandtem maschinellen Lernen für datengesteuerte Projekte

Zielgruppe

  • Datenanalysten und Data Scientists
  • Statistiker und Forschungsexperten
  • Entwickler und IT-Fachleute, die sich mit Werkzeugen des maschinellen Lernens beschäftigen wollen
  • Jeder, der an Data-Science- oder Predictive-Analytics-Projekten beteiligt ist
 21 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Erfahrungsberichte (3)

Kommende Kurse

Verwandte Kategorien