Kontakt aufnehmen

Schulungsübersicht

Einführung in Verstärkendes Lernen aus menschlichem Feedback (RLHF)

  • Was ist RLHF und warum ist es wichtig?
  • Vergleich mit Methoden des überwachtem Feintunings
  • RLHF-Anwendungen in modernen KI-Systemen

Belohnungsmodellierung mit menschlichem Feedback

  • Sammlung und Strukturierung von menschlichem Feedback
  • Erstellung und Schulung von Belohnungsmodellen
  • Bewertung der Effektivität von Belohnungsmodellen

Schulung mit Proximal Policy Optimization (PPO)

  • Überblick über PPO-Algorithmen für RLHF
  • Implementierung von PPO mit Belohnungsmodellen
  • Iteratives und sicheres Feintuning von Modellen

Praktisches Feintuning von Sprachmodellen

  • Vorbereitung von Datensätzen für RLHF-Arbeitsabläufe
  • Hands-on-Feintuning eines kleinen LLMs mit RLHF
  • Herausforderungen und Strategien zu deren Bewältigung

Skalierung von RLHF auf Produktionssysteme

  • Infrastruktur- und Rechenressourcen-Überlegungen
  • Qualitätssicherung und kontinuierliche Feedbackschleifen
  • Bewährte Praktiken für Bereitstellung und Wartung

Ethische Überlegungen und Bias-Minderung

  • Umgang mit ethischen Risiken im menschlichen Feedback
  • Strategien zur Erkennung und Korrektur von Verzerrungen
  • Sicherstellung der Ausrichtung und sicherer Ausgaben

Fallstudien und reale Beispiele

  • Fallstudie: Feintuning von ChatGPT mit RLHF
  • Erfolgreiche RLHF-Implementierungen im Überblick
  • Gewonnene Erkenntnisse und Branchenwissen

Zusammenfassung und nächste Schritte

Voraussetzungen

  • Verständnis der Grundlagen des überwachtem und verstärkenden Lernens
  • Erfahrung mit der Feinabstimmung von Modellen und neuronalen Netzarchitekturen
  • Kenntnisse in Python-Programmierung und Deep-Learning-Frameworks (z. B. TensorFlow, PyTorch)

Zielgruppe

  • Machine-Learning-Ingenieure
  • KI-Forscher
 14 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien