Kontakt aufnehmen

Schulungsübersicht

Einführung in EXO und lokales KI-Clustering

  • Übersicht des EXO-Frameworks und des exo-explore-Ökosystems
  • Vergleich der zentralisierten Cloud-Inferenz vs. verteilte lokale Inferenz
  • Architektur: libp2p-Gerätenachschau, MLX-Backend, Dashboard und API-Ebenen
  • Hardwareanforderungen: Apple Silicon (M3 Ultra, M4 Pro/Max), Thunderbolt 5, shared Storage

EXO auf macOS installieren

  • Einrichten von Xcode, Metal ToolChain und macOS-Voraussetzungen
  • Installation von uv, Node.js, Rust nightly toolchain
  • Installation des pinnten macmon-Forks für Apple-Silicon-Monitoring
  • Klonen des Repositorys und Erstellen des Dashboards mit npm
  • Ausführen von EXO aus dem Quellcode und Überprüfen des localhost:52415-Dashboards

EXO auf Linux installieren

  • Installation der Abhängigkeiten über apt oder Homebrew auf Linux
  • Konfiguration von uv, Node.js 18+ und Rust nightly
  • Erstellen des Dashboards und Ausführen von EXO im CPU-only-Modus
  • Verzeichnislayout: XDG-Basisverzeichnispfade für Konfiguration, Daten, Cache und Logs

Automatische Gerätenachschau und Clusterbildung

  • Verständnis der libp2b-basierten Auto-Nachschau über lokale Netzwerke
  • Konfigurieren von benutzerdefinierten Namenräumen mit EXO_LIBP2P_NAMESPACE für Clusterisolation
  • Überprüfen der Knotenmitgliedschaft in der Dashboard-Clusteransicht
  • Umgang mit Nachschau-Fehlern und Netzwerksegmentierungsproblemen

RDMA über Thunderbolt 5 aktivieren

  • RDMA-Architektur und der Anspruch einer 99-prozentigen Latenzreduktion
  • Aktivieren von RDMA im macOS Recovery-Modus mit rdma_ctl
  • Kabelanforderungen und Port-Topologiebeschränkungen auf Mac Studio
  • Übereinstimmung der macOS-Versionen über alle Clusterknoten
  • Behebung von RDMA-Nachschau- und DHCP-Konfigurationsproblemen

Bereitstellung von State-of-the-Art-Modellen

  • Verwendung des Dashboards zum Laden und Sharden von DeepSeek v3.1, Qwen3-235B und Llama-Familienmodellen
  • Vorschau der Instanzplatzierungen mit dem /instance/previews API-Endpunkt
  • Erstellen von Modellinstanzen mit Pipeline- oder Tensor-Parallel-Sharding
  • Konfigurieren benutzerdefinierter Model Cards vom HuggingFace Hub

Überwachung und Fehlersuche

  • Lesen der EXO-Logs und Verständnis der verteilten Nachschau
  • Auslegen der Cluster-Gesundheit in der Dashboard-Clusteransicht
  • Diagnose von Worker-Knotenausfällen und Wiederverbindungsverhalten
  • Nutzung von EXO_TRACING_ENABLED für Leistungshemmnisanalyse

Clusterwartung und Aktualisierungen

  • Aktualisierung der EXO-Binaries und Dashboard-Erstellungsverfahren
  • Migrieren von Modell-Caches und Verwalten vordownloadeter Modelle über NFS
  • Gestaltetes Entfernen von Knoten und Neugewichtung der Arbeitslasten

Voraussetzungen

  • Ein Verständnis von Netzwerkgrundlagen (IP, Subnetting, Firewalls)
  • Erfahrung mit der macOS- oder Linux-Befehlszeilenverwaltung
  • Bekanntschaft mit Python-Paketmanagement (pip/uv) und Node.js-Tooling

Zielgruppe

  • Systemadministratoren
  • DevOps-Ingenieure
  • KI-Infrastruktur-Architekten, die für die On-Premise-LLM-Bereitstellung verantwortlich sind
 21 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien