Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Dauer 14 Stunden
Schulungsübersicht
Einführung in die Multimodalität von Gemini 3
- Fähigkeiten im Umgang mit Text, Bildern, Audio und Video
- Modellauswahl und Übersicht der Endpunkte
- Wichtige Konzepte im multimodalen Schlussfolgern
Arbeiten mit Text und strukturierten Eingaben
- Prompt-Strategien für die Textgenerierung
- Metadaten, Kontextfenster und Embeddings
- Textbasierte Orchestrierung multimodaler Aufgaben
Bildverständnis und visuelle Workflows
- Bildanalyse und -interpretation mit Gemini 3
- Erstellung von Tools für visuelle Suche und Tagging
- Aufbau von Bild-zu-Text- und Text-zu-Bild-Interaktionen
Verarbeitung von Audioeingaben
- Workflows für Spracherkennung und Transkription
- Ermittlung und Interpretation von Audioereignissen
- Integration von Audio mit textuellen und visuellen Eingaben
Video-Intelligenz und Szenenanalyse
- Rahmenweise und kontinuierliches Videoschlussfolgern
- Erstellung von Tools für Zusammenfassungen und Extraktion von Highlights
- Videobasierte Automatisierung und Inhalts-Workflows
Gestaltung multimodaler Anwendungsarchitekturen
- Kombination mehrerer Eingangstypen in einer einzelnen Pipeline
- Berücksichtigung von Latenz, Kosten und Rechenaufwand
- Best Practices für skalierbare multimodale Systeme
Prototypisierung multimodaler Anwendungen
- Praktische Erstellung multimodaler Prototypen
- Schnelle Iteration durch Prompt Engineering
- Testen und Verfeinern von Nutzererfahrungsflüssen
Einführung multimodaler Lösungen
- Deployment-Strategien und Einrichtung der Umgebung
- Überwachung der Leistung in der Praxis
- Berücksichtigung von Sicherheit und Compliance
Zusammenfassung und nächste Schritte
Voraussetzungen
- Verständnis moderner KI-Konzepte
- Erfahrung mit Python oder JavaScript
- Vertrautheit mit REST APIs
Zielgruppe
- Designer
- Inhaltschaffende
- Technische Produktteams
Erfahrungsberichte (1)
Fluss, Vibe und Thema der Präsentation
Lukasz Kowalczyk - Allegro Sp. z o.o.
Kurs - Google Gemini AI for Data Analysis
Maschinelle Übersetzung