Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Schulungsübersicht
Einführung in Agentic AI für Betrieb
- Von statischen Runbooks zu schlussfolgernden Agenten: Die Evolution der IT-Automatisierung
- Anatomie eines Agenten: Schlussfolgerungszyklus, Werkzeugnutzung, Gedächtnis und Planung
- Wann automatisieren und wann den Menschen im Prozess behalten
Agenten-Frameworks und Architekturen
- Single-Agent-Muster: ReAct, Plan-and-Execute und Tool-Calling-Loops
- Multi-Agenten-Architekturen: Supervisor-, Hierarchie- und Schwarmmuster
- Framework-Vergleich: LangGraph, CrewAI, AutoGen und eigene Agenten
- Entwicklung des ersten operativen Agenten: Monitoring abfragen, diagnostizieren, vorschlagen
Werkzeugintegration für IT-Betrieb
- Verbindung von Agenten mit den APIs von Prometheus, Grafana, Datadog und PagerDuty
- Log-Abfragen mit Agenten: Integration von Elasticsearch, Loki und Splunk
- Nutzung von Infrastruktur-Werkzeugen: kubectl, Terraform, Ansible über Agenten-Aktionen
- Gestaltung sicherer Werkzeug-Interfaces mit Parametervalidierung und Idempotenz
Automatisierung der Incident-Response
- Automatisierte Incident-Triage: Schweregrad-Klassifizierung und Weiterleitung
- Generierung von Root-Cause-Hypothesen und Sammlung von Beweisen
- Automatisierte Behebung: Neustart, Skalierung, Rollback und Failover-Aktionen
- Aufbau eines Incident-Runbook-Agenten mit stufenweisen Autonomieebenen
Sicherheit, Guardrails und Human-in-the-Loop
- Klassifizierung von Aktionen: nur-Lesen, geringes Risiko, hohes Risiko und destruktiv
- Genehmigungsgatter und Eskalationsrichtlinien für kritische Operationen
- Guardrail-Muster: Aktions-Allowlists, Begrenzung der Blast-Radius und Rollback-Garantien
- Audit-Trails und Entscheidungs-Herkunft für Compliance
Multi-Agenten-Orchestrierung für komplexe Vorfälle
- Koordination spezialisierter Agenten: Triage-Agent, Diagnose-Agent, Behebungs-Agent
- Kommunikation zwischen Agenten und Verwaltung des gemeinsamen Kontexts
- Auflösung von Konflikten, wenn Agenten widersprüchliche Aktionen vorschlagen
- End-to-End-Simulation schwerer Vorfälle mit multi-agentischer Reaktion
Beobachtbarkeit und Bewertung
- Verfolgung der Schlussfolgerungsketten von Agenten für Debugging und Audit
- Bewertung der Entscheidungsqualität von Agenten: Präzision, Recall, Lösungszeit
- Feedback-Schleifen: Lernen aus Operator-Overrides und Ergebnissen
- Kostenverfolgung und Token-Ökonomie für operative Agenten
Produktive Bereitstellung und Betrieb
- Bereitstellung von Agenten als Dienste: APIs, Webhooks und geplante Jobs
- Graduelle Autonomie-Einführung: Vom Shadow-Modus zur vollständigen automatischen Behebung
- Runbook für Agentenausfälle: Was passiert, wenn der Agent selbst kaputtgeht
- Aufbau der Business Case und Messung der ROI für autonome Betriebsprozesse
Voraussetzungen
- Erfahrung in IT-Betrieb, DevOps oder SRE-Praktiken.
- Vertrautheit mit Python-Skripterstellung und REST-APIs.
- Grundlegendes Verständnis der Fähigkeiten von LLMs und des Prompt Engineering.
Zielgruppe
- SRE- und DevOps-Ingenieure, die KI-gestützte Automatisierung erkunden.
- Plattform-Ingenieure, die sichheilende Infrastruktur aufbauen.
- IT-Betriebsleiter, die Agentic AI für das Incident-Management evaluieren.
14 Stunden