Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Schulungsübersicht
EXO Infrastructure as Code
- Übersicht über EXO-Bereitstellungsmuster: Single-Node-, Multi-Node- und RDMA-Cluster
- Automatisierung der Abhängigkeitsinstallation (Xcode, uv, Node.js, Rust) mit Konfigurationsverwaltung
- Nutzung von Nix Flakes für reproduzierbare EXO-Builds und Entwicklerumgebungen
- Erstellung von Ansible Playbooks oder Shell-Skripten für die unbemannte Clusterbereitstellung
Reproduzierbare Builds und CI-Integration
- Festlegen von Abhängigkeiten und Bau des Dashboards in CI-Pipelines
- Durchführung von EXO-Rauchtests in GitHub Actions oder GitLab CI-Läufern
- Erstellung von Goldstandards (Golden Images) und snapshot-basierter Rollback-Workflows für macOS- und Linux-VMs
- Versionierung benutzerdefinierter Modellkarten neben dem Anwendungscode
Cluster-Entdeckung und Netzwerkautomatisierung
- Konfiguration von mDNS und statischem DNS für eine zuverlässige libp2p-Knotenentdeckung
- Automatisierte Erstellung von Netzwerkprofilen und Thunderbolt-Brückenverwaltung auf macOS
- Nutzung benutzerdefinierter Namespaces (EXO_LIBP2P_NAMESPACE) zur Trennung von Dev-, Staging- und Prod-Clustern
- Firewallregeln und Netz segmentierung für Mandanten-fähige Umgebungen
Speicher und Modell-Lebenszyklusverwaltung
- Konzeption von EXO_MODELS_DIRS und EXO_MODELS_READ_ONLY_DIRS Strategien
- Einbindung von NFS- oder SAN-Shares als schreibgeschützte Modellarchive für schnelle Bereitstellungen
- Garbage Collection abgelaufener Caches und Richtlinien zur Beibehaltung versionierter Gewichtungen
- Automatisierung des vorab Herunterladens von Modellen und Gesundheitschecks vor Rolling Updates
Überwachung und Alarmierung
- Transfer von EXO-Logs an zentralisiertes Logging (ELK, Loki oder Splunk)
- Aufbau von Grafana-Dashboards basierend auf EXO_TRACING_ENABLED-Ausgaben
- Alarmierung bei Cluster-Mitgliedschaftsänderungen, OOM-Ereignissen und Inferenz-Latenzspitzen
- Korrelation von macmon-Hardwaretelemetrie mit Modellleistungsregressionen
Aktualisierung, Rollback und Disaster Recovery
- Staging von EXO-Binärupdates auf einem Canary-Knoten vor der Flottenweiten Ausrollung
- Modell-Level-Rollback: Wechseln zwischen quantisierten Versionen ohne Neu-Download
- Sichern und Wiederherstellen von Clusterzustand, benutzerdefinierten Namespaces und zwischengespeicherten Gewichtungen
- Dokumentation von Recovery-Runbooks für Szenarien vollständiger Cluster-Rebuilds
Sicherheitshärte und Compliance
- Anwendung von TLS an der Reverse-Proxy-Ebene (nginx, traefik) für Dashboard und API
- Implementierung von API-Ratenbegrenzung und IP-Whitelisting für EXO-Endpunkte
- Isolierung von Clustern mit VLANs und Zero-Trust-Netzwerkrichtlinien
- Auditierung des Zugriffs und Wartung eines Inventars von bereitgestellten Modellen und Versionen
Voraussetzungen
- Erfahrung mit DevOps-Praktiken (CI/CD, IaC, Container-Orchestrierung)
- Vertrautheit mit macOS- oder Linux-Systemverwaltung und Paketverwaltung
- Verständnis von Netzwerk-, DNS- und Speicherkonzepten
Zielgruppe
- DevOps-Ingenieure
- Infrastukturarchitekten
- SREs verantwortlich für on-premise AI-Arbeitslasten
21 Stunden
Erfahrungsberichte (2)
Craig war extrem engagiert im Training und hat stets darauf geachtet, dass wir aufmerksam sind. Er passte die Beispiele an unsere täglichen Aktivitäten an und gab immer eine Antwort, wenn danach gefragt wurde, auch wenn die Information nicht im Präsentationsmaterial enthalten war.
Ecaterina Ioana Nicoale - BOOKING HOLDINGS ROMANIA SRL
Kurs - DevOps Foundation®
Maschinelle Übersetzung
Hoher Einsatz und Fachwissen des Trainers
Jacek - Softsystem
Kurs - DevOps Engineering Foundation (DOEF)®
Maschinelle Übersetzung