Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Dauer 14 Stunden (2 Tage)
Schulungsübersicht
Einführung in die Sprechsynthese und Stimmklonung
- Überblick über Text-to-Speech (TTS) und neuronale Stimm-Synthese
- Stimmklonung vs. Sprachgenerierung: Anwendungsfälle und Grenzen
- Wichtige Modelle: Tacotron, WaveNet, FastSpeech, VITS
Arbeit mit kommerziellen Plattformen
- Nutzung von ElevenLabs und Resemble AI
- Erstellung, Klonung und Bearbeitung von Stimmen
- API-Zugriff und Text-to-Speech-Workflows
Entwicklung mit Open-Source-Werkzeugen
- Installation und Konfiguration von Coqui TTS
- Training von benutzerdefinierten Stimmen und Verwaltung von Datensätzen
- Sprachgenerierung mit feiner Steuerung (Tonhöhe, Geschwindigkeit, Emotion)
Datenaufbereitung und Verwaltung von Stimm-Datensätzen
- Erfassung und Bereinigung von Stimmproben
- Segmentierung, Beschriftung und Ausrichtung von Transkripten
- Ethische Beschaffung und Einholung der Stimmkonsens
Anwendungintegration
- Einbettung von TTS in Websites und Anwendungen
- Erstellung von IVR-Systemen und interaktiven Bots
- Generierung synthetischer Dialoge für Video und Spiele
Bewertung von Qualität und Realismus
- MOS (Mean Opinion Score) und Verständlichkeitstests
- Steuerung von Expressivität und Prosodie
- Vergleich von Latenz, Treuegrad und Realismus
Ethische, rechtliche und governancebezogene Überlegungen
- Risiken von Deepfakes und verantwortungsvolle Nutzung
- Einverständnis, Zuschreibung und urheberrechtliche Implikationen
- Vorschriften und organisatorische Richtlinien
Zusammenfassung und nächste Schritte
Voraussetzungen
- Grundlegendes Verständnis von Machine-Learning-Grundlagen
- Vertrautheit mit Audio-Dateiformaten und Bearbeitungswerkzeugen
- Grundlegende Python-Programmierungsfähigkeiten
Zielgruppe
- KI-Entwickler und Ingenieure, die sich für Sprechsynthese interessieren
- Content-Creator und Medienfachleute, die Stimmgenerierung erkunden
- F&E-Teams, die personalisierte oder dynamische Audiosysteme entwickeln