Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Dauer 14 Stunden
Schulungsübersicht
Einführung in AIOps
- Was ist AIOps und warum ist es wichtig
- Traditionelle Überwachung vs. AIOps-gestützte Observierbarkeit
- AIOps-Architektur und Schlüsselkomponenten
Erfassung und Normalisierung operativer Daten
- Arten von Observierbarkeitsdaten: Metriken, Logs und Traces
- Einlesen von Daten aus mehreren Quellen (Server, Container, Cloud)
- Nutzung von Agenten und Exportern (Prometheus, Beats, Fluentd)
Datenerfassung und Anomalie-Erkennung
- Zeitreihen-Korrelation und statistische Methoden
- Verwendung von ML-Modellen zur Anomalie-Erkennung
- Erkennung von Incidents in verteilten Systemen
Alarmierung und Rauschreduktion
- Gestaltung intelligenter Alarmregeln und Schwellenwerte
- Unterdrückung, Deduplizierung und Gruppierung von Alarmen
- Integration mit Alertmanager, Slack, PagerDuty oder Opsgenie
Ursachenanalyse und Visualisierung
- Verwendung von Dashboards zur Visualisierung von Metriken und zur Trendanalyse
- Untersuchung von Ereignissen und Zeitlinien zur RCA (Root Cause Analysis)
- Verfolgung von Problemen über Ebenen hinweg mit verteilten Tracing-Tools
Automatisierung und Wiederherstellung
- Auslösen automatisierter Skripte oder Workflows aus Incidents
- Integration mit ITSM-Systemen (ServiceNow, Jira)
- Anwendungsfälle: Selbstheilung, Skalierung, Verkehrsumleitung
Open-Source- und kommerzielle AIOps-Plattformen
- Überblick über Tools: Prometheus, Grafana, ELK, Moogsoft, Dynatrace
- Bewertungskriterien für die Auswahl einer AIOps-Plattform
- Demo und praktische Anwendung mit einem ausgewählten Stack
Zusammenfassung und nächste Schritte
Voraussetzungen
- Verständnis der Konzepte des IT-Betriebs und der Systemüberwachung
- Erfahrung mit Überwachungstools oder Dashboards
- Vertrautheit mit grundlegenden Log- und Metrikformaten
Zielgruppe
- Betriebsteams, die für Infrastruktur und Anwendungen verantwortlich sind
- Site Reliability Engineers (SREs)
- Teams für IT-Überwachung und Observierbarkeit