Kontakt aufnehmen

Schulungsübersicht

EXO Infrastructure as Code

  • Übersicht über EXO-Bereitstellungsmuster: Single-Node-, Multi-Node- und RDMA-Cluster
  • Automatisierung der Abhängigkeitsinstallation (Xcode, uv, Node.js, Rust) mit Konfigurationsverwaltung
  • Nutzung von Nix Flakes für reproduzierbare EXO-Builds und Entwicklerumgebungen
  • Erstellung von Ansible Playbooks oder Shell-Skripten für die unbemannte Clusterbereitstellung

Reproduzierbare Builds und CI-Integration

  • Festlegen von Abhängigkeiten und Bau des Dashboards in CI-Pipelines
  • Durchführung von EXO-Rauchtests in GitHub Actions oder GitLab CI-Läufern
  • Erstellung von Goldstandards (Golden Images) und snapshot-basierter Rollback-Workflows für macOS- und Linux-VMs
  • Versionierung benutzerdefinierter Modellkarten neben dem Anwendungscode

Cluster-Entdeckung und Netzwerkautomatisierung

  • Konfiguration von mDNS und statischem DNS für eine zuverlässige libp2p-Knotenentdeckung
  • Automatisierte Erstellung von Netzwerkprofilen und Thunderbolt-Brückenverwaltung auf macOS
  • Nutzung benutzerdefinierter Namespaces (EXO_LIBP2P_NAMESPACE) zur Trennung von Dev-, Staging- und Prod-Clustern
  • Firewallregeln und Netz segmentierung für Mandanten-fähige Umgebungen

Speicher und Modell-Lebenszyklusverwaltung

  • Konzeption von EXO_MODELS_DIRS und EXO_MODELS_READ_ONLY_DIRS Strategien
  • Einbindung von NFS- oder SAN-Shares als schreibgeschützte Modellarchive für schnelle Bereitstellungen
  • Garbage Collection abgelaufener Caches und Richtlinien zur Beibehaltung versionierter Gewichtungen
  • Automatisierung des vorab Herunterladens von Modellen und Gesundheitschecks vor Rolling Updates

Überwachung und Alarmierung

  • Transfer von EXO-Logs an zentralisiertes Logging (ELK, Loki oder Splunk)
  • Aufbau von Grafana-Dashboards basierend auf EXO_TRACING_ENABLED-Ausgaben
  • Alarmierung bei Cluster-Mitgliedschaftsänderungen, OOM-Ereignissen und Inferenz-Latenzspitzen
  • Korrelation von macmon-Hardwaretelemetrie mit Modellleistungsregressionen

Aktualisierung, Rollback und Disaster Recovery

  • Staging von EXO-Binärupdates auf einem Canary-Knoten vor der Flottenweiten Ausrollung
  • Modell-Level-Rollback: Wechseln zwischen quantisierten Versionen ohne Neu-Download
  • Sichern und Wiederherstellen von Clusterzustand, benutzerdefinierten Namespaces und zwischengespeicherten Gewichtungen
  • Dokumentation von Recovery-Runbooks für Szenarien vollständiger Cluster-Rebuilds

Sicherheitshärte und Compliance

  • Anwendung von TLS an der Reverse-Proxy-Ebene (nginx, traefik) für Dashboard und API
  • Implementierung von API-Ratenbegrenzung und IP-Whitelisting für EXO-Endpunkte
  • Isolierung von Clustern mit VLANs und Zero-Trust-Netzwerkrichtlinien
  • Auditierung des Zugriffs und Wartung eines Inventars von bereitgestellten Modellen und Versionen

Voraussetzungen

  • Erfahrung mit DevOps-Praktiken (CI/CD, IaC, Container-Orchestrierung)
  • Vertrautheit mit macOS- oder Linux-Systemverwaltung und Paketverwaltung
  • Verständnis von Netzwerk-, DNS- und Speicherkonzepten

Zielgruppe

  • DevOps-Ingenieure
  • Infrastukturarchitekten
  • SREs verantwortlich für on-premise AI-Arbeitslasten
 21 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Erfahrungsberichte (2)

Kommende Kurse

Verwandte Kategorien