Kontakt aufnehmen

Schulungsübersicht

Einführung in Mistral Multimodale Modelle

  • Überblick über Mistral Medium und multimodale Fähigkeiten
  • OCR- und Dokumentenmodelle sowie Anwendungsfälle
  • Integration in Open-Source-Ökosysteme

OCR- und Vision-Pipelines

  • OCR-Grundlagen mit Mistral-Modellen
  • Vorverarbeitung von Bildern und gescannten Dokumenten
  • Extraktion strukturierter Textdaten aus Bildern

Dokumentenverständnis

  • Entwurf von NLP-Pipelines für Dokumente
  • Entity-Erkennung, Zusammenfassung und Klassifizierung
  • Quermodale Verknüpfung von Text- und Vision-Daten

Such- und Wissensanwendungen

  • Vision-Text-Suchsysteme
  • Aufbau semantischer Suche mit OCR-Ausgaben
  • Enterprise-Dokumentenrepositories

Assistive und interaktive Anwendungen

  • UI-Design für multimodale Assistenten
  • Anwendungen zur Barrierefreiheit (z. B. Vision-to-Text)
  • Praxistaugliche Produktivitätswerkzeuge

Leistung und Optimierung

  • Skalierung multimodaler Pipelines
  • Optimierung der Inferenzleistung
  • Bewertung des Ausgleichs zwischen Genauigkeit und Effizienz

Fallstudien und zukünftige Entwicklungen

  • Branchenanwendungen der multimodalen KI
  • Forschungstrends in OCR und Dokumenten-KI
  • Gesprächsfähige KI-Überlegungen in Vision-Text-Aufgaben

Zusammenfassung und nächste Schritte

Voraussetzungen

  • Verständnis der Konzepte der Natural Language Processing (NLP)
  • Erfahrung mit Python und ML-Frameworks
  • Grundkenntnisse in Computer Vision

Zielgruppe

  • Produktteams
  • ML-Forscher
  • Ange wandte ML-Ingenieure
 14 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien