Kontakt aufnehmen

Schulungsübersicht

KI-Souveränität und lokale Bereitstellung von LLMs

  • Risiken von Cloud-LLMs: Datenspeicherung, Training mit Eingaben, ausländische Jurisdiktion.
  • Ollama-Architektur: Modellservier, Registry und OpenAI-kompatible API.
  • Vergleich mit vLLM, llama.cpp und Text Generation Inference.
  • Modelllizenzen: Bedingungen für Llama, Mistral, Qwen und Gemma.

Installation und Hardwareeinrichtung

  • Installation von Ollama auf Linux mit CUDA- und ROCm-Unterstützung.
  • Fallback für CPU-only und AVX/AVX2-Optimierung.
  • Docker-Bereitstellung und persistente Volume-Zuordnung.
  • Multi-GPU-Einrichtung und VRAM-Zuweisungsstrategien.

Modellverwaltung

  • Abrufen von Modellen aus dem Ollama-Registry: ollama pull llama3.
  • Importieren von GGUF-Modellen von HuggingFace und TheBloke.
  • Quantisierungsstufen: Q4_K_M, Q5_K_M, Q8_0 und deren Abwägungen.
  • Modellwechsel und Limits für gleichzeitiges Laden von Modellen.

Individuelle Modelfiles

  • Schreiben der Modelfile-Syntax: FROM, PARAMETER, SYSTEM, TEMPLATE.
  • Anpassung von Temperatur, top_p und repeat_penalty.
  • System-Prompt-Engineering für rollenspezifisches Verhalten.
  • Erstellen und Veröffentlichen benutzerdefinierter Modelle im lokalen Registry.

API-Integration

  • OpenAI-kompatibles /v1/chat/completions-Endpunkt.
  • Streaming-Antworten und JSON-Modus.
  • Integration mit LangChain, LlamaIndex und benutzerdefinierten Apps.
  • Authentifizierung und Rate-Limiting über Reverse Proxy.

Leistungsoptimierung

  • Kontextfenster-Größe und KV-Cache-Verwaltung.
  • Batch-Inferenz und parallele Anforderungsverarbeitung.
  • CPU-Thread-Zuweisung und NUMA-Bewusstsein.
  • Überwachung der GPU-Auslastung und Speicherdruck.

Sicherheit und Compliance

  • Netzwerkisolation für Modellservier-Endpunkte.
  • Eingabe-Filterung und Ausgabemoderation-Pipelines.
  • Audit-Protokollierung von Prompts und Fertigstellungen.
  • Modellherkunft und Hash-Verifikation.

Voraussetzungen

  • Mittelstufe in Linux- und Container-Verwaltung.
  • Grundlegendes Verständnis von Machine Learning und Transformer-Modellen auf hoher Ebene.
  • Bekanntschaft mit REST-APIs und JSON.

Zielgruppe

  • KI-Ingenieure und Entwickler, die Cloud-LLM-APIs ersetzen möchten.
  • Organisationen mit hohen Datenschutzanforderungen, die eine Nutzung von Cloud-Modellen ausschließen.
  • Regierungs- und Verteidigungsteams, die luftgetrennte (air-gapped) Sprachmodelle benötigen.
 14 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien