Kontakt aufnehmen

Schulungsübersicht

Einführung in Agentic AI für Betrieb

  • Von statischen Runbooks zu schlussfolgernden Agenten: Die Evolution der IT-Automatisierung
  • Anatomie eines Agenten: Schlussfolgerungszyklus, Werkzeugnutzung, Gedächtnis und Planung
  • Wann automatisieren und wann den Menschen im Prozess behalten

Agenten-Frameworks und Architekturen

  • Single-Agent-Muster: ReAct, Plan-and-Execute und Tool-Calling-Loops
  • Multi-Agenten-Architekturen: Supervisor-, Hierarchie- und Schwarmmuster
  • Framework-Vergleich: LangGraph, CrewAI, AutoGen und eigene Agenten
  • Entwicklung des ersten operativen Agenten: Monitoring abfragen, diagnostizieren, vorschlagen

Werkzeugintegration für IT-Betrieb

  • Verbindung von Agenten mit den APIs von Prometheus, Grafana, Datadog und PagerDuty
  • Log-Abfragen mit Agenten: Integration von Elasticsearch, Loki und Splunk
  • Nutzung von Infrastruktur-Werkzeugen: kubectl, Terraform, Ansible über Agenten-Aktionen
  • Gestaltung sicherer Werkzeug-Interfaces mit Parametervalidierung und Idempotenz

Automatisierung der Incident-Response

  • Automatisierte Incident-Triage: Schweregrad-Klassifizierung und Weiterleitung
  • Generierung von Root-Cause-Hypothesen und Sammlung von Beweisen
  • Automatisierte Behebung: Neustart, Skalierung, Rollback und Failover-Aktionen
  • Aufbau eines Incident-Runbook-Agenten mit stufenweisen Autonomieebenen

Sicherheit, Guardrails und Human-in-the-Loop

  • Klassifizierung von Aktionen: nur-Lesen, geringes Risiko, hohes Risiko und destruktiv
  • Genehmigungsgatter und Eskalationsrichtlinien für kritische Operationen
  • Guardrail-Muster: Aktions-Allowlists, Begrenzung der Blast-Radius und Rollback-Garantien
  • Audit-Trails und Entscheidungs-Herkunft für Compliance

Multi-Agenten-Orchestrierung für komplexe Vorfälle

  • Koordination spezialisierter Agenten: Triage-Agent, Diagnose-Agent, Behebungs-Agent
  • Kommunikation zwischen Agenten und Verwaltung des gemeinsamen Kontexts
  • Auflösung von Konflikten, wenn Agenten widersprüchliche Aktionen vorschlagen
  • End-to-End-Simulation schwerer Vorfälle mit multi-agentischer Reaktion

Beobachtbarkeit und Bewertung

  • Verfolgung der Schlussfolgerungsketten von Agenten für Debugging und Audit
  • Bewertung der Entscheidungsqualität von Agenten: Präzision, Recall, Lösungszeit
  • Feedback-Schleifen: Lernen aus Operator-Overrides und Ergebnissen
  • Kostenverfolgung und Token-Ökonomie für operative Agenten

Produktive Bereitstellung und Betrieb

  • Bereitstellung von Agenten als Dienste: APIs, Webhooks und geplante Jobs
  • Graduelle Autonomie-Einführung: Vom Shadow-Modus zur vollständigen automatischen Behebung
  • Runbook für Agentenausfälle: Was passiert, wenn der Agent selbst kaputtgeht
  • Aufbau der Business Case und Messung der ROI für autonome Betriebsprozesse

Voraussetzungen

  • Erfahrung in IT-Betrieb, DevOps oder SRE-Praktiken.
  • Vertrautheit mit Python-Skripterstellung und REST-APIs.
  • Grundlegendes Verständnis der Fähigkeiten von LLMs und des Prompt Engineering.

Zielgruppe

  • SRE- und DevOps-Ingenieure, die KI-gestützte Automatisierung erkunden.
  • Plattform-Ingenieure, die sichheilende Infrastruktur aufbauen.
  • IT-Betriebsleiter, die Agentic AI für das Incident-Management evaluieren.
 14 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien