Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Schulungsübersicht
Einführung in Mistral Multimodal Models
- Überblick über Mistral Medium und multimodale Fähigkeiten
- OCR-/Dokumentenmodelle und Anwendungsfälle
- Integration in Open-Source-Ökosysteme
OCR- und Bildverarbeitungspipelines
- Grundlagen der OCR mit Mistral-Modellen
- Vorbereitung von Bildern und gescannten Dokumenten
- Extrahieren strukturierten Texts aus Bildern
Dokumentenverständnis
- Entwerfen von NLP-Pipelines für Dokumente
- Erkennung von Entitäten, Zusammenfassung und Klassifizierung
- Vernetzung von Text- und Bilddaten über Modalitäten hinweg
Suche und Wissensanwendungen
- Bild-Text-Suchsysteme
- Erstellung semantischer Suche mit OCR-Ausgaben
- Enterprise-Dokumentenarchive
Assistive und interaktive Anwendungen
- UI-Design für multimodale Assistenten
- Barrierefreiheitsanwendungen (z. B. Bild-zu-Text)
- Produktivitätswerkzeuge in der Praxis
Performance und Optimierung
- Skalierung multimodaler Pipelines
- Tuning der Inferenzleistung
- Bewertung von Abwägungen zwischen Genauigkeit und Effizienz
Fallstudien und zukünftige Entwicklungen
- Industrie-Anwendungen multimodaler KI
- Forschungstrends in OCR und Dokument-KI
- Ethische Aspekte verantwortungsvoller KI bei Bild-Text-Aufgaben
Zusammenfassung und nächste Schritte
Voraussetzungen
- Verständnis von Konzepten der natürlichen Sprachverarbeitung (NLP)
- Erfahrung mit Python und ML-Frameworks
- Kenntnisse in den Grundlagen der Bildverarbeitung
Zielgruppe
- Produktteams
- ML-Forschende
- Gewerbliche ML-Ingenieurinnen und -Ingenieure
14 Stunden