Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Dauer 14 Stunden
Schulungsübersicht
Fundamentals von Tencent Hunyuan für die Produktion
- Überblick über Einsatzszenarien für Tencent Hunyuan-Modell-Serving
- Produktionsspezifika großer Modelle und MoE-Architekturen
- Häufige Engpässe bei Latenz, Durchsatz und Kosten
- Definition von Service-Level-Zielen für Inferenzarbeitlasten
Bereitstellungsarchitektur und Serving-Flow
- Komponenten eines Produktions-Inferenz-Stacks
- Entscheidungshilfe zwischen containerisierter, On-Premise- und Cloud-Bereitstellung
- Grundlagen des Modell-Ladens, Request-Routings und GPU-Allokation
- Auslegung auf Zuverlässigkeit und operative Einfachheit
Latenzoptimierung in der Praxis
- Einsatz optimierter Inferenz-Engines wie TensorRT, wo anwendbar
- Konzepte des KV-Cache und praktisches Cache-Tuning
- Reduzierung von Startzeit, Warmup und Antwort-Overhead
- Messung der Time-to-First-Token und der Token-Generierungsgeschwindigkeit
Durchsatz, Batching und GPU-Effizienz
- Strategien für Continuous Batching und Request Batching
- Management von Konkurrenzanfragen und Warteschlangenverhalten
- Steigerung der GPU-Auslastung ohne Beeinträchtigung der Benutzererfahrung
- Bewältigung von Long-Context-Anfragen und gemischten Arbeitlasten
Quantisierung und Kostenkontrolle
- Warum Quantisierung für das Produktion-Serving wichtig ist
- Praktische Trade-offs zwischen FP16, INT8 und anderen gängigen Präzisionsoptionen
- Ausgleich zwischen Modellqualität, Latenz und Infrastrukturkosten
- Erstellung einer einfachen Checkliste zur Kostenoptimierung
Operationen, Überwachung und Readiness-Review
- Auto-Scaling-Auslöser für Inferenzdienste
- Überwachung von Latenz, Durchsatz, Cache-Nutzung und GPU-Gesundheit
- Grundlagen von Logging, Alerting und Incident Response
- Durchsicht einer Referenz-Bereitstellung und Erstellung eines Verbesserungsplans
Voraussetzungen
- Grundlegendes Verständnis von Deployment- und Inferenzworkflows für Large Language Models (LLMs)
- Erfahrung mit Containern, Cloud- oder On-Premise-Infrastrukturen sowie API-basierten Diensten
- Praktische Kenntnisse in Python oder System Engineering Aufgaben
Zielgruppe
- ML-Ingenieure, die LLMs in Produktionsumgebungen bereitstellen
- Platform Engineers, die für GPU-basierte Inferenzdienste verantwortlich sind
- Solution Architects, die skalierbare KI-Serving-Plattformen entwerfen