Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Dauer 14 Stunden
Schulungsübersicht
Einführung in prädiktives AIOps
- Überblick über prädiktive Analytik im IT-Betrieb
- Datenquellen für die Vorhersage (Logs, Metriken, Ereignisse)
- Schlüsselkonzepte in der Zeitreihenvorhersage und Anomalie-Mustern
Gestaltung von Modellen zur Störungsvorhersage
- Beschriftung historischer Störungen und Systemverhaltens
- Auswahl und Training von Modellen (z. B. LSTM, Random Forest, AutoML)
- Bewertung der Modellleistung und Umgang mit Falsch-positiven
Datenerfassung und Feature Engineering
- Ingestion und Ausrichtung von Log- und Metrikdaten für den Modell-Eingang
- Feature-Extraktion aus strukturierten und unstrukturierten Daten
- Umgang mit Rauschen und fehlenden Daten in Betriebspipelines
Automatisierung der Root-Cause-Analyse (RCA)
- Graphbasierte Korrelation von Diensten und Infrastruktur
- Verwendung von ML, um wahrscheinliche Ursachen aus Ereignisketten abzuleiten
- Visualisierung der RCA mit Topologie-bewussten Dashboards
Behebung und Workflow-Automatisierung
- Integration mit Automatisierungsplattformen (z. B. Ansible, Rundeck)
- Auslösung von Rollbacks, Neustarts oder Traffic-Umleitungen
- Auditierung und Dokumentation automatisierter Eingriffe
Skalierung intelligenter AIOps-Pipelines
- MLOps für Observability: Retraining und Modellversionierung
- Durchführung von Vorhersagen in Echtzeit über verteilte Nodes hinweg
- Best Practices für den Einsatz von AIOps in Produktionsumgebungen
Fallstudien und praktische Anwendungen
- Analyse echter Störungsdaten mit prädiktiven AIOps-Modellen
- Bereitstellung von RCA-Pipelines mit synthetischen und Produktionsdaten
- Überprüfung branchenspezifischer Anwendungsfälle: Cloud-Ausfälle, Instabilität von Microservices, Netzwerkdegradierungen
Zusammenfassung und nächste Schritte
Voraussetzungen
- Erfahrung mit Monitoring-Systemen wie Prometheus oder ELK
- Fundierte Kenntnisse in Python und grundlegendes Verständnis von Machine Learning
- Vertrautheit mit Incident-Management-Workflows
Zielgruppe
- Senior Site Reliability Engineers (SREs)
- IT-Automatisierungsarchitekten
- DevOps- und Observability-Platform-Leads