Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Schulungsübersicht
KI-Souveränität und lokale Bereitstellung von LLMs
- Risiken von Cloud-LLMs: Datenspeicherung, Training mit Eingaben, ausländische Jurisdiktion.
- Ollama-Architektur: Modellservier, Registry und OpenAI-kompatible API.
- Vergleich mit vLLM, llama.cpp und Text Generation Inference.
- Modelllizenzen: Bedingungen für Llama, Mistral, Qwen und Gemma.
Installation und Hardwareeinrichtung
- Installation von Ollama auf Linux mit CUDA- und ROCm-Unterstützung.
- Fallback für CPU-only und AVX/AVX2-Optimierung.
- Docker-Bereitstellung und persistente Volume-Zuordnung.
- Multi-GPU-Einrichtung und VRAM-Zuweisungsstrategien.
Modellverwaltung
- Abrufen von Modellen aus dem Ollama-Registry: ollama pull llama3.
- Importieren von GGUF-Modellen von HuggingFace und TheBloke.
- Quantisierungsstufen: Q4_K_M, Q5_K_M, Q8_0 und deren Abwägungen.
- Modellwechsel und Limits für gleichzeitiges Laden von Modellen.
Individuelle Modelfiles
- Schreiben der Modelfile-Syntax: FROM, PARAMETER, SYSTEM, TEMPLATE.
- Anpassung von Temperatur, top_p und repeat_penalty.
- System-Prompt-Engineering für rollenspezifisches Verhalten.
- Erstellen und Veröffentlichen benutzerdefinierter Modelle im lokalen Registry.
API-Integration
- OpenAI-kompatibles /v1/chat/completions-Endpunkt.
- Streaming-Antworten und JSON-Modus.
- Integration mit LangChain, LlamaIndex und benutzerdefinierten Apps.
- Authentifizierung und Rate-Limiting über Reverse Proxy.
Leistungsoptimierung
- Kontextfenster-Größe und KV-Cache-Verwaltung.
- Batch-Inferenz und parallele Anforderungsverarbeitung.
- CPU-Thread-Zuweisung und NUMA-Bewusstsein.
- Überwachung der GPU-Auslastung und Speicherdruck.
Sicherheit und Compliance
- Netzwerkisolation für Modellservier-Endpunkte.
- Eingabe-Filterung und Ausgabemoderation-Pipelines.
- Audit-Protokollierung von Prompts und Fertigstellungen.
- Modellherkunft und Hash-Verifikation.
Voraussetzungen
- Mittelstufe in Linux- und Container-Verwaltung.
- Grundlegendes Verständnis von Machine Learning und Transformer-Modellen auf hoher Ebene.
- Bekanntschaft mit REST-APIs und JSON.
Zielgruppe
- KI-Ingenieure und Entwickler, die Cloud-LLM-APIs ersetzen möchten.
- Organisationen mit hohen Datenschutzanforderungen, die eine Nutzung von Cloud-Modellen ausschließen.
- Regierungs- und Verteidigungsteams, die luftgetrennte (air-gapped) Sprachmodelle benötigen.
14 Stunden