Kontakt aufnehmen
 Dauer 21 Stunden

Schulungsübersicht

Einführung in Multimodale KI und Ollama

  • Überblick zum multimodalen Lernen
  • Zentrale Herausforderungen bei der Integration von Vision und Sprache
  • Fähigkeiten und Architektur von Ollama

Einrichtung der Ollama-Umgebung

  • Installation und Konfiguration von Ollama
  • Arbeiten mit der lokalen Bereitstellung von Modellen
  • Integration von Ollama mit Python und Jupyter

Arbeiten mit multimodalen Eingaben

  • Integration von Text und Bild
  • Einbeziehung von Audio und strukturierten Daten
  • Gestaltung von Vorverarbeitungspipelines

Anwendungen zum Dokumentenverständnis

  • Extraktion strukturierter Informationen aus PDFs und Bildern
  • Kombination von OCR mit Sprachmodellen
  • Aufbau intelligenter Workflows für die Dokumentenanalyse

Visuelle Frage-Antwort-Systeme (VQA)

  • Einrichtung von VQA-Datensätzen und Benchmarks
  • Training und Evaluation multimodaler Modelle
  • Entwicklung interaktiver VQA-Anwendungen

Gestaltung multimodaler Agenten

  • Prinzipien des Agentendesigns mit multimodaler Schlussfolgerung
  • Kombination von Wahrnehmung, Sprache und Aktion
  • Bereitstellung von Agenten für reale Anwendungsfälle

Fortgeschrittene Integration und Optimierung

  • Feinjustierung multimodaler Modelle mit Ollama
  • Optimierung der Inferenzleistung
  • Erwägungen zu Skalierbarkeit und Bereitstellung

Zusammenfassung und nächste Schritte

Voraussetzungen

  • Starke Kenntnisse der Konzepte des Machine Learning
  • Erfahrung mit Deep-Learning-Frameworks wie PyTorch oder TensorFlow
  • Vertrautheit mit natürlichsprachiger Verarbeitung und Computer Vision

Zielgruppe

  • Machine-Learning-Engineere
  • KI-Forscher
  • Produktentwickler, die Vision- und Text-Workflows integrieren

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien