Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Dauer 21 Stunden
Schulungsübersicht
Einführung in die Skalierung von Ollama
- Architektur von Ollama und Überlegungen zur Skalierung
- Gängige Engpässe in Multi-User-Deployment
- Best Practices für die infrastrukturelle Bereitschaft
Ressourcenallokation und GPU-Optimierung
- Strategien für eine effiziente Auslastung von CPU/GPU
- Überlegungen zu Speicher und Bandbreite
- Ressourcenbeschränkungen auf Containerebene
Deployment mit Containern und Kubernetes
- Containerisierung von Ollama mit Docker
- Betrieb von Ollama in Kubernetes-Clustern
- Lastverteilung und Service Discovery
Autoscaling und Batching
- Gestaltung von Autoscaling-Policies für Ollama
- Batch-Inferenz-Techniken zur Optimierung des Durchsatzes
- Ausgleich zwischen Latenz und Durchsatz
Latenzoptimierung
- Profilierung der Inferenzleistung
- Caching-Strategien und Modell-Warm-up
- Reduzierung von I/O- und Kommunikations-Overhead
Überwachung und Observability
- Integration von Prometheus für Metriken
- Aufbau von Dashboards mit Grafana
- Alerting und Incident Response für die Ollama-Infrastruktur
Kostenmanagement und Skalierungsstrategien
- Kostenbewusste GPU-Allokation
- Überlegungen zu Cloud- vs. On-Prem-Deployment
- Strategien für eine nachhaltige Skalierung
Zusammenfassung und nächste Schritte
Voraussetzungen
- Erfahrung mit der Linux-Systemadministration
- Verständnis von Containerisierung und Orchestrierung
- Vertrautheit mit dem Deployment von Machine-Learning-Modellen
Zielgruppe
- DevOps-Engineers
- Teams für ML-Infrastruktur
- Site-Reliability-Engineers