Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Dauer 21 Stunden
Schulungsübersicht
Einführung in Multimodale KI und Ollama
- Überblick zum multimodalen Lernen
- Zentrale Herausforderungen bei der Integration von Vision und Sprache
- Fähigkeiten und Architektur von Ollama
Einrichtung der Ollama-Umgebung
- Installation und Konfiguration von Ollama
- Arbeiten mit der lokalen Bereitstellung von Modellen
- Integration von Ollama mit Python und Jupyter
Arbeiten mit multimodalen Eingaben
- Integration von Text und Bild
- Einbeziehung von Audio und strukturierten Daten
- Gestaltung von Vorverarbeitungspipelines
Anwendungen zum Dokumentenverständnis
- Extraktion strukturierter Informationen aus PDFs und Bildern
- Kombination von OCR mit Sprachmodellen
- Aufbau intelligenter Workflows für die Dokumentenanalyse
Visuelle Frage-Antwort-Systeme (VQA)
- Einrichtung von VQA-Datensätzen und Benchmarks
- Training und Evaluation multimodaler Modelle
- Entwicklung interaktiver VQA-Anwendungen
Gestaltung multimodaler Agenten
- Prinzipien des Agentendesigns mit multimodaler Schlussfolgerung
- Kombination von Wahrnehmung, Sprache und Aktion
- Bereitstellung von Agenten für reale Anwendungsfälle
Fortgeschrittene Integration und Optimierung
- Feinjustierung multimodaler Modelle mit Ollama
- Optimierung der Inferenzleistung
- Erwägungen zu Skalierbarkeit und Bereitstellung
Zusammenfassung und nächste Schritte
Voraussetzungen
- Starke Kenntnisse der Konzepte des Machine Learning
- Erfahrung mit Deep-Learning-Frameworks wie PyTorch oder TensorFlow
- Vertrautheit mit natürlichsprachiger Verarbeitung und Computer Vision
Zielgruppe
- Machine-Learning-Engineere
- KI-Forscher
- Produktentwickler, die Vision- und Text-Workflows integrieren