Kontakt aufnehmen

Schulungsübersicht

Einführung in Vision-Language-Modelle

  • Übersicht über VLMs und deren Rolle in der multimodalen KI
  • Bekannte Architekturen: CLIP, Flamingo, BLIP usw.
  • Anwendungsfälle: Suche, Captioning, autonome Systeme, Inhaltsanalyse

Vorbereitung der Feinabstimmungsumgebung

  • Einrichten von OpenCLIP und anderen VLM-Bibliotheken
  • Datensatzformate für Bild-Text-Paare
  • Vorverarbeitungspipelines für visuelle und sprachliche Eingaben

Feinabstimmung von CLIP und ähnlichen Modellen

  • Kontrastiver Verlust und gemeinsame Einbettungsräume
  • Praxis: Feinabstimmung von CLIP auf benutzerdefinierten Datensätzen
  • Umgang mit domänenspezifischen und mehrsprachigen Daten

Fortschrittliche Feinabstimmungstechniken

  • Nutzung von LoRA und Adapter-basierten Methoden für Effizienz
  • Prompt-Tuning und visuelle Prompt-Injektion
  • Abwägungen zwischen Zero-Shot und feinabgestimmter Evaluation

Evaluation und Benchmarking

  • Metriken für VLMs: Retrieval-Genauigkeit, BLEU, CIDEr, Recall
  • Diagnose der visuell-textuellen Ausrichtung
  • Visualisierung von Einbettungsräumen und Fehlklassifikationen

Bereitstellung und Einsatz in realen Anwendungen

  • Exportieren von Modellen für die Inferenz (TorchScript, ONNX)
  • Integration von VLMs in Pipelines oder APIs
  • Ressourcenüberlegungen und Skalierung der Modelle

Fallstudien und angewandte Szenarien

  • Medienanalyse und Content-Moderation
  • Suche und Retrieval im E-Commerce und in digitalen Bibliotheken
  • Multimodale Interaktion in Robotik und autonomen Systemen

Zusammenfassung und nächste Schritte

Voraussetzungen

  • Grundkenntnisse im Deep Learning für Computer Vision und NLP
  • Erfahrung mit PyTorch und transformerbasierten Modellen
  • Vertrautheit mit multimodalen Modellarchitekturen

Zielgruppe

  • Computer-Vision-Ingenieure
  • KI-Entwickler
 14 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien