Kontakt aufnehmen

Schulungsübersicht

Einführung in Mistral Multimodal Models

  • Überblick über Mistral Medium und multimodale Fähigkeiten
  • OCR-/Dokumentenmodelle und Anwendungsfälle
  • Integration in Open-Source-Ökosysteme

OCR- und Bildverarbeitungspipelines

  • Grundlagen der OCR mit Mistral-Modellen
  • Vorbereitung von Bildern und gescannten Dokumenten
  • Extrahieren strukturierten Texts aus Bildern

Dokumentenverständnis

  • Entwerfen von NLP-Pipelines für Dokumente
  • Erkennung von Entitäten, Zusammenfassung und Klassifizierung
  • Vernetzung von Text- und Bilddaten über Modalitäten hinweg

Suche und Wissensanwendungen

  • Bild-Text-Suchsysteme
  • Erstellung semantischer Suche mit OCR-Ausgaben
  • Enterprise-Dokumentenarchive

Assistive und interaktive Anwendungen

  • UI-Design für multimodale Assistenten
  • Barrierefreiheitsanwendungen (z. B. Bild-zu-Text)
  • Produktivitätswerkzeuge in der Praxis

Performance und Optimierung

  • Skalierung multimodaler Pipelines
  • Tuning der Inferenzleistung
  • Bewertung von Abwägungen zwischen Genauigkeit und Effizienz

Fallstudien und zukünftige Entwicklungen

  • Industrie-Anwendungen multimodaler KI
  • Forschungstrends in OCR und Dokument-KI
  • Ethische Aspekte verantwortungsvoller KI bei Bild-Text-Aufgaben

Zusammenfassung und nächste Schritte

Voraussetzungen

  • Verständnis von Konzepten der natürlichen Sprachverarbeitung (NLP)
  • Erfahrung mit Python und ML-Frameworks
  • Kenntnisse in den Grundlagen der Bildverarbeitung

Zielgruppe

  • Produktteams
  • ML-Forschende
  • Gewerbliche ML-Ingenieurinnen und -Ingenieure
 14 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien