Kontakt aufnehmen
 Dauer 14 Stunden

Schulungsübersicht

Überblick über Spracherkennungstechnologien

  • Geschichte und Entwicklung der Spracherkennung
  • Akustische Modelle, Sprachmodelle und Decodierung
  • Moderne Architekturen: RNNs, Transformer und Whisper

Audiovorverarbeitung und Grundlagen der Transkription

  • Bereinigen, Schneiden und Segmentieren von Audio
  • Textgenerierung aus Audio: Echtzeit vs. Stapelverarbeitung

Praxis mit Whisper und anderen APIs

  • Installation und Nutzung von OpenAI Whisper
  • Aufruf von Cloud-APIs (Google, Azure) für die Transkription
  • Vergleich von Leistung, Latenz und Kosten

Sprache, Akzente und Domänenanpassung

  • Arbeit mit mehreren Sprachen und Akzenten
  • Benutzerdefinierte Vokabulare und Rauschtoleranz
  • Verarbeitung juristischer, medizinischer oder technischer Sprache

Ausgabeformatierung und Integration

  • Hinzufügen von Zeitstempeln, Satzzeichen und Sprecheretiketten
  • Export in Text-, SRT- oder JSON-Formate
  • Integration von Transkripten in Apps oder Datenbanken

Praxislabor zur Umsetzung von Anwendungsfällen

  • Transkription von Meetings, Interviews oder Podcasts
  • Sprachsteuerungssysteme
  • Echtzeit-Untertitelung für Video- oder Audiostreams

Bewertung, Grenzen und Ethik

  • Genauigkeitsmetriken und Modell-Benchmarking
  • Verzerrung und Fairness in Sprachmodellen
  • Erwägungen hinsichtlich Datenschutz und Compliance

Zusammenfassung und nächste Schritte

Voraussetzungen

  • Grundlegendes Verständnis von allgemeinen KI- und Machine-Learning-Konzepten
  • Vertrautheit mit Audio- oder Mediendateiformaten und -werkzeugen

Zielgruppe

  • Data Scientists und KI-Ingenieure, die mit Sprachdaten arbeiten
  • Softwareentwickler, die transkriptionsbasierte Anwendungen erstellen
  • Organisationen, die Spracherkennung für die Automatisierung untersuchen

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien