Kontakt aufnehmen
 Dauer 21 Stunden

Schulungsübersicht

Einführung in die Skalierung von Ollama

  • Architektur von Ollama und Überlegungen zur Skalierung
  • Gängige Engpässe in Multi-User-Deployment
  • Best Practices für die infrastrukturelle Bereitschaft

Ressourcenallokation und GPU-Optimierung

  • Strategien für eine effiziente Auslastung von CPU/GPU
  • Überlegungen zu Speicher und Bandbreite
  • Ressourcenbeschränkungen auf Containerebene

Deployment mit Containern und Kubernetes

  • Containerisierung von Ollama mit Docker
  • Betrieb von Ollama in Kubernetes-Clustern
  • Lastverteilung und Service Discovery

Autoscaling und Batching

  • Gestaltung von Autoscaling-Policies für Ollama
  • Batch-Inferenz-Techniken zur Optimierung des Durchsatzes
  • Ausgleich zwischen Latenz und Durchsatz

Latenzoptimierung

  • Profilierung der Inferenzleistung
  • Caching-Strategien und Modell-Warm-up
  • Reduzierung von I/O- und Kommunikations-Overhead

Überwachung und Observability

  • Integration von Prometheus für Metriken
  • Aufbau von Dashboards mit Grafana
  • Alerting und Incident Response für die Ollama-Infrastruktur

Kostenmanagement und Skalierungsstrategien

  • Kostenbewusste GPU-Allokation
  • Überlegungen zu Cloud- vs. On-Prem-Deployment
  • Strategien für eine nachhaltige Skalierung

Zusammenfassung und nächste Schritte

Voraussetzungen

  • Erfahrung mit der Linux-Systemadministration
  • Verständnis von Containerisierung und Orchestrierung
  • Vertrautheit mit dem Deployment von Machine-Learning-Modellen

Zielgruppe

  • DevOps-Engineers
  • Teams für ML-Infrastruktur
  • Site-Reliability-Engineers

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien