Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Dauer 14 Stunden
Schulungsübersicht
Überblick über Spracherkennungstechnologien
- Geschichte und Entwicklung der Spracherkennung
- Akustische Modelle, Sprachmodelle und Decodierung
- Moderne Architekturen: RNNs, Transformer und Whisper
Audiovorverarbeitung und Grundlagen der Transkription
- Bereinigen, Schneiden und Segmentieren von Audio
- Textgenerierung aus Audio: Echtzeit vs. Stapelverarbeitung
Praxis mit Whisper und anderen APIs
- Installation und Nutzung von OpenAI Whisper
- Aufruf von Cloud-APIs (Google, Azure) für die Transkription
- Vergleich von Leistung, Latenz und Kosten
Sprache, Akzente und Domänenanpassung
- Arbeit mit mehreren Sprachen und Akzenten
- Benutzerdefinierte Vokabulare und Rauschtoleranz
- Verarbeitung juristischer, medizinischer oder technischer Sprache
Ausgabeformatierung und Integration
- Hinzufügen von Zeitstempeln, Satzzeichen und Sprecheretiketten
- Export in Text-, SRT- oder JSON-Formate
- Integration von Transkripten in Apps oder Datenbanken
Praxislabor zur Umsetzung von Anwendungsfällen
- Transkription von Meetings, Interviews oder Podcasts
- Sprachsteuerungssysteme
- Echtzeit-Untertitelung für Video- oder Audiostreams
Bewertung, Grenzen und Ethik
- Genauigkeitsmetriken und Modell-Benchmarking
- Verzerrung und Fairness in Sprachmodellen
- Erwägungen hinsichtlich Datenschutz und Compliance
Zusammenfassung und nächste Schritte
Voraussetzungen
- Grundlegendes Verständnis von allgemeinen KI- und Machine-Learning-Konzepten
- Vertrautheit mit Audio- oder Mediendateiformaten und -werkzeugen
Zielgruppe
- Data Scientists und KI-Ingenieure, die mit Sprachdaten arbeiten
- Softwareentwickler, die transkriptionsbasierte Anwendungen erstellen
- Organisationen, die Spracherkennung für die Automatisierung untersuchen