Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Dauer 14 Stunden
Schulungsübersicht
Gestaltung einer offenen AIOps-Architektur
- Überblick über die wichtigsten Komponenten in offenen AIOps-Pipelines
- Datenfluss von der Erfassung bis zur Alarmierung
- Tool-Vergleich und Integrationsstrategie
Datenerfassung und Aggregation
- Erfassung von Zeitreihendaten mit Prometheus
- Erfassung von Logs mit Logstash und Beats
- Normalisierung von Daten für die Korrelation zwischen verschiedenen Quellen
Aufbau von Observability-Dashboards
- Visualisierung von Metriken mit Grafana
- Erstellung von Kibana-Dashboards für die Log-Analyse
- Nutzung von Elasticsearch-Abfragen zur Gewinnung betrieblicher Erkenntnisse
Anomalieerkennung und Vorhersage von Vorfällen
- Export von Observability-Daten in Python-Pipelines
- Training von ML-Modellen für die Erkennung von Ausreißern und Prognostik
- Bereitstellung von Modellen für die Live-Inferenz in der Observability-Pipeline
Alarmierung und Automatisierung mit Open-Source-Tools
- Erstellung von Prometheus-Alarmregeln und Routing in Alertmanager
- Auslösung von Skripten oder API-Workflows für die automatische Reaktion
- Nutzung von Open-Source-Orchestrierungs-Tools (z. B. Ansible, Rundeck)
Integration und Skalierbarkeit
- Behandlung hoher Datenaufkommen und Langzeitarchivierung
- Sicherheit und Zugriffskontrolle in Open-Source-Stacks
- Unabhängige Skalierung jeder Ebene: Erfassung, Verarbeitung, Alarmierung
Praxisanwendungen und Erweiterungen
- Fallstudien: Performance-Tuning, Vermeidung von Ausfallzeiten und Kosteneffizienz
- Erweiterung der Pipelines mit Tracing-Tools oder Service-Graphen
- Best Practices für den Betrieb und die Wartung von AIOps in der Produktion
Zusammenfassung und nächste Schritte
Voraussetzungen
- Erfahrung mit Observability-Tools wie Prometheus oder ELK
- Praktisches Wissen über Python und Grundlagen des Machine Learnings
- Verständnis von IT-Betrieb und Alarmierungs-Workflows
Zielgruppe
- Fortgeschrittene Site-Reliability-Engineers (SREs)
- Data Engineers im operativen Bereich
- DevOps-Plattform-Leiter und Infrastruktur-Architekten