Kontakt aufnehmen

Schulungsübersicht

Fundamentals von Tencent Hunyuan für die Produktion

  • Überblick über Einsatzszenarien für Tencent Hunyuan-Modell-Serving
  • Produktionsspezifika großer Modelle und MoE-Architekturen
  • Häufige Engpässe bei Latenz, Durchsatz und Kosten
  • Definition von Service-Level-Zielen für Inferenzarbeitlasten

Bereitstellungsarchitektur und Serving-Flow

  • Komponenten eines Produktions-Inferenz-Stacks
  • Entscheidungshilfe zwischen containerisierter, On-Premise- und Cloud-Bereitstellung
  • Grundlagen des Modell-Ladens, Request-Routings und GPU-Allokation
  • Auslegung auf Zuverlässigkeit und operative Einfachheit

Latenzoptimierung in der Praxis

  • Einsatz optimierter Inferenz-Engines wie TensorRT, wo anwendbar
  • Konzepte des KV-Cache und praktisches Cache-Tuning
  • Reduzierung von Startzeit, Warmup und Antwort-Overhead
  • Messung der Time-to-First-Token und der Token-Generierungsgeschwindigkeit

Durchsatz, Batching und GPU-Effizienz

  • Strategien für Continuous Batching und Request Batching
  • Management von Konkurrenzanfragen und Warteschlangenverhalten
  • Steigerung der GPU-Auslastung ohne Beeinträchtigung der Benutzererfahrung
  • Bewältigung von Long-Context-Anfragen und gemischten Arbeitlasten

Quantisierung und Kostenkontrolle

  • Warum Quantisierung für das Produktion-Serving wichtig ist
  • Praktische Trade-offs zwischen FP16, INT8 und anderen gängigen Präzisionsoptionen
  • Ausgleich zwischen Modellqualität, Latenz und Infrastrukturkosten
  • Erstellung einer einfachen Checkliste zur Kostenoptimierung

Operationen, Überwachung und Readiness-Review

  • Auto-Scaling-Auslöser für Inferenzdienste
  • Überwachung von Latenz, Durchsatz, Cache-Nutzung und GPU-Gesundheit
  • Grundlagen von Logging, Alerting und Incident Response
  • Durchsicht einer Referenz-Bereitstellung und Erstellung eines Verbesserungsplans

Voraussetzungen

  • Grundlegendes Verständnis von Deployment- und Inferenzworkflows für Large Language Models (LLMs)
  • Erfahrung mit Containern, Cloud- oder On-Premise-Infrastrukturen sowie API-basierten Diensten
  • Praktische Kenntnisse in Python oder System Engineering Aufgaben

Zielgruppe

  • ML-Ingenieure, die LLMs in Produktionsumgebungen bereitstellen
  • Platform Engineers, die für GPU-basierte Inferenzdienste verantwortlich sind
  • Solution Architects, die skalierbare KI-Serving-Plattformen entwerfen
 14 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien