Kontakt aufnehmen

Schulungsübersicht

Grundlagen agentischer Systeme in der Produktion

  • Agentische Architekturen: Schleifen, Tools, Speicher und Orchestrierungsebenen
  • Lebenszyklus von Agenten: Entwicklung, Deployment und kontinuierlicher Betrieb
  • Herausforderungen im Management agentischer Systeme im Produktionsmaßstab

Infrastruktur und Deployment-Modelle

  • Deployment von Agenten in containerisierten und Cloud-Umgebungen
  • Skalierungsmuster: horizontale vs. vertikale Skalierung, Parallelität und Drosselung
  • Orchestrierung multipler Agenten und Workload-Balancing

Monitoring und Observability

  • Wesentliche Kennzahlen: Latenz, Erfolgsquote, Speichernutzung und Agenten-Aufruftiefe
  • Verfolgung der Agentenaktivität und von Aufrufgraphen
  • Instrumentierung von Observability mit Prometheus, OpenTelemetry und Grafana

Logging, Auditierung und Compliance

  • Zentralisiertes Logging und strukturierte Ereignissammlung
  • Compliance und Nachvollziehbarkeit in agentischen Workflows
  • Gestaltung von Audit-Trails und Replay-Mechanismen für die Fehlersuche

Performance-Tuning und Ressourcenoptimierung

  • Reduzierung der Inferenz-Auslastung und Optimierung der Orchestrierungszyklen von Agenten
  • Modell-Caching und Lightweight-Embeddings für schnellere Abfragen
  • Lasttests und Stressszenarien für KI-Pipelines

Kostenkontrolle und Governance

  • Verständnis der Kostenfaktoren für Agenten: API-Aufrufe, Speicher, Compute-Ressourcen und externe Integrationen
  • Erfassung agentenspezifischer Kosten und Implementierung von Chargeback-Modellen
  • Automatisierungsrichtlinien zur Vermeidung von Agent Sprawl und unnötiger Ressourcenverbrauch im Leerlauf

CI/CD- und Rollout-Strategien für Agenten

  • Integration von Agenten-Pipelines in CI/CD-Systeme
  • Testen, Versionierung und Rollback-Strategien für iterative Agenten-Updates
  • Progressive Rollouts und sichere Deployment-Mechanismen

Failure Recovery und Reliability Engineering

  • Gestaltung für Fehlertoleranz und sanfte Degradation
  • Retry-, Timeout- und Circuit-Breaker-Muster für die Zuverlässigkeit von Agenten
  • Incident-Response und Post-Mortem-Frameworks für KI-Betrieb

Capstone-Projekt

  • Aufbau und Deployment eines agentischen KI-Systems mit vollständigem Monitoring und Kostenverfolgung
  • Simulation von Last, Leistungsmessung und Optimierung der Ressourcennutzung
  • Präsentation der finalen Architektur und des Monitoring-Dashboards vor Kollegen

Zusammenfassung und nächste Schritte

Voraussetzungen

  • Solides Verständnis von MLOps und produktiven Machine-Learning-Systemen
  • Erfahrung mit containerisierten Deployment (Docker/Kubernetes)
  • Vertrautheit mit Cloud-Kostenoptimierung und Observability-Tools

Zielgruppe

  • MLOps-Ingenieure
  • Site Reliability Engineers (SREs)
  • Engineering-Manager, die KI-Infrastrukturen beaufsichtigen
 21 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Erfahrungsberichte (3)

Kommende Kurse

Verwandte Kategorien