Vordenker
KI‑Agenten können die Arbeit erledigen. Aber können Unternehmen sie betreiben?

KI‑Agenten werden bemerkenswert gut darin, Aufgaben zu erledigen. Gibt man einem Agenten ein Ziel, Zugriff auf die richtigen Werkzeuge, genügend Kontext und einen gut definierten Arbeitsablauf, kann er Informationen recherchieren, Dokumente analysieren, Entscheidungen treffen, Systeme aktualisieren und mit anderen Agenten koordinieren.
Das ist der spannende Teil von Agentic AI. Es ist auch der Teil, den wir in Demonstrationen meist sehen.
Unternehmensabläufe sehen anders aus. Ein Kreditantrag ändert sich mitten im Underwriting. Ein Kunde liefert neue Informationen, nachdem die Verifizierung abgeschlossen ist. Zwei Systeme stimmen über dasselbe Konto nicht überein. Eine Genehmigung, die gestern noch gültig war, ist heute möglicherweise nicht mehr gültig. Ein Agent fasst einen Fall zusammen, bevor er ihn an einen anderen Agenten übergibt, und ein scheinbar unwichtiges Detail geht dabei verloren.
Der reibungslose Pfad kann 80 % dessen ausmachen, was ein Agent erledigen muss. Unternehmen operieren im verbleibenden 20 %.
Die 80/20‑Einordnung ist keine Branchenstatistik. Sie dient dazu zu beschreiben, wo sich operative Komplexität typischerweise verbirgt. Der schwierige Teil von Unternehmensabläufen ist oft nicht der Normalfall, sondern die Ausnahmen, Übergaben, Abhängigkeiten, wechselnde Kontexte und Entscheidungen, bei denen die Organisation für das Ergebnis verantwortlich bleibt.
Während KI von der Beantwortung von Fragen zu Handlungen übergeht, wird diese operative Komplexität viel wichtiger. Unternehmen müssen über das reine Design von Agenten hinausdenken und beginnen, darüber nachzudenken, wie sie betrieben werden.
Das ist, wo Agentic Operations beginnt.
Von der Generierung von Antworten zum Ausführen von Aktionen
Die erste Welle der unternehmensinternen Generativen KI drehte sich hauptsächlich um Informationen. Modelle fassten Dokumente zusammen, erzeugten Berichte, beantworteten Fragen, durchsuchten das Unternehmenswissen und halfen Mitarbeitenden, bestehende Aufgaben schneller zu erledigen.
Agenten bringen etwas grundlegend Neues ein. Sie können Handlungen ausführen, die den Zustand eines Geschäftsprozesses verändern. Ein Agent kann etwas genehmigen oder ablehnen, ein Aufzeichnungssystem aktualisieren, eine Kundenkommunikation senden, einen weiteren Workflow auslösen, einen anderen Agenten aufrufen oder eine Entscheidung treffen, die bestimmt, was als Nächstes geschieht.
OpenAI beschreibt Agenten in seinem Praxisleitfaden als Systeme, die eigenständig Aufgaben im Auftrag von Nutzern erledigen, Modelle zur Steuerung der Workflow‑Ausführung und Werkzeuge zur Interaktion mit externen Systemen nutzen. Die operative Folge einer falschen Antwort unterscheidet sich stark von der Folge einer falschen Aktion.
Die Unternehmensfrage ändert sich daher. Es reicht nicht mehr zu fragen, ob ein Modell eine gute Antwort erzeugt hat oder ob ein Agent seine zugewiesene Aufgabe erfolgreich abgeschlossen hat. Unternehmen müssen zunehmend wissen, ob eine Handlung überhaupt hätte stattfinden sollen, unter Berücksichtigung des Geschäftskontexts, der Richtlinien, der Autorität und allem, was zuvor im Prozess geschehen ist.
Abbildung 1: Generative KI erzeugt ein Ergebnis. Agentic KI ändert den Geschäftsstatus.

Sobald KI den Geschäftsstatus ändern und nachfolgende Entscheidungen beeinflussen kann, lässt sich Zuverlässigkeit nicht mehr ausschließlich auf Modellebene messen.
Ein Agent kann erfolgreich sein, während der Geschäftsprozess scheitert
Betrachten wir einen KI‑gestützten Kredit‑Underwriting‑Workflow. Ein Agent extrahiert Antragsdokumente, ein anderer prüft das Einkommen, ein weiterer bewertet Kreditinformationen, und ein späterer Agent fasst den Fall zusammen, bevor ein Underwriting‑Agent eine Entscheidung trifft oder empfiehlt.
Jeder Agent hat eine klar definierte Verantwortung und kann diese Verantwortung korrekt ausführen. Der Dokumenten‑Agent kann die richtigen Informationen extrahieren. Der Einkommens‑Verifizierungs‑Agent kann seine Aufgabe erfolgreich erledigen. Der Zusammenfassungs‑Agent kann eine präzise Zusammenfassung der ihm zur Verfügung stehenden Informationen erstellen. Der Underwriting‑Agent kann seine Anweisungen korrekt befolgen.
Die endgültige Geschäftsentscheidung kann immer noch falsch.
Stellen Sie sich vor, dass aktualisierte Einkommensinformationen nach der ersten Verifizierung eintreffen. Das neue Dokument wird verarbeitet, aber seine Bedeutung wird reduziert, wenn der Fall für den nächsten Schritt zusammengefasst wird. Der abschließende Underwriting‑Agent erhält eine angemessene Zusammenfassung, jedoch nicht den vollständigen Geschäftskontext, der über den gesamten Prozess hinweg bestand.
Nichts ist zwangsläufig abgestürzt. Keine API ist fehlgeschlagen. Kein einzelner Agent hat notwendigerweise halluziniert. Jede Komponente könnte eine erfolgreiche Ausführung melden, während der Geschäftsprozess ein falsches Ergebnis erzielt.
Anthropic erörtert eine verwandte Herausforderung in seiner Anleitung zum Aufbau effektiver Agenten, wobei darauf hingewiesen wird, dass autonome Systeme bei mehr Schritten kumulative Fehler erleiden können. Das Problem wird umfassender als die Modellgenauigkeit, weil Zustand, Kontext, Entscheidungen und Annahmen über den Workflow hinweg weitergereicht werden.
Dies schafft eine wichtige Unterscheidung zwischen Agenten‑Zuverlässigkeit und Geschäftsprozess‑Zuverlässigkeit. Ein Unternehmen erlebt letztlich nicht einen einzelnen Agenten. Es erlebt das Ergebnis, das durch den gesamten Prozess erzeugt wird.
Abbildung 2: Lokaler Erfolg garantiert keinen geschäftlichen Erfolg

Dies ist eine der wichtigen Änderungen, die durch Agentic AI eingeführt werden. Ein Workflow kann scheitern, selbst wenn jede Komponente bei unabhängiger Prüfung gesund erscheint.
Fähigkeit ist nicht Autorität
Ein Großteil des aktuellen Agenten-Stacks konzentriert sich verständlicherweise auf die Fähigkeit. Teams wollen wissen, ob ein Agent logisch schlussfolgern, das richtige Werkzeug auswählen, eine Aufgabe erledigen, sich von Fehlern erholen und mit akzeptabler Genauigkeit und Latenz arbeiten kann.
Unternehmen haben eine weitere Anforderung: Autorität.
Angenommen, ein Underwriting-Agent ist in der Lage, einen Kredit zu genehmigen. Das bedeutet nicht, dass er jeden Kredit, den er bewerten kann, genehmigen sollte. Seine Autorität kann vom Kreditbetrag, Risikokategorie, Kundentyp, verfügbaren Beweisen, Vertrauensgrad, früheren Entscheidungen oder davon abhängen, ob sich der Antrag nach einer früheren Prüfung geändert hat.
Dies schafft eine Grenze zwischen dem, was ein Agent kann und dem, was ein Agent darf.
OpenAI empfiehlt, das mit Agenten-Tools verbundene Risiko zu bewerten und Schutzmaßnahmen oder menschliche Interventionen bei sensiblen und irreversiblen Aktionen hinzuzufügen. Microsoft verfolgt in seiner Leitlinie für von Agenten betriebene Kern‑Geschäftsprozesse einen ähnlichen Ansatz, wobei Agenten Routineentscheidungen innerhalb definierter Grenzen treffen können, während Entscheidungsrechte festlegen, welche Aktionen eigenständig ausgeführt werden dürfen und welche menschliche Genehmigung erfordern.
Wenn die Fähigkeit von Agenten zunimmt, wird diese Unterscheidung wichtiger, nicht weniger. Fähigere Agenten können folgerichtigere Aktionen ausführen. Unternehmen benötigen daher klarere Methoden, um die Grenzen, innerhalb derer diese Aktionen erlaubt sind, zu definieren und durchzusetzen.
Die Frage wandelt sich von Kann der Agent das tun? zu Unter welchen Bedingungen sollte der Agent das tun dürfen?
Geschäftspolitik muss näher an die Ausführung rücken
Unternehmen verfügen bereits über umfangreiche Mechanismen zur Steuerung von menschlich betriebenen Prozessen. Sie nutzen SOPs, Genehmigungsmatrizen, Compliance‑Richtlinien, Risikoschwellen, Schulungen, Aufgaben‑Trennung, Audits und Eskalationsverfahren. Die meisten dieser Mechanismen basieren auf einer einfachen Annahme: Eine Person liest die Regel, versteht die Situation und wendet die Regel bei der Ausführung der Arbeit an.
Agenten ändern diese Annahme.
Betrachten Sie eine Richtlinie, die eine sekundäre Genehmigung für Transaktionen über einem bestimmten Schwellenwert verlangt. Wenn ein Mensch die Aufgabe ausführt, kann die Richtlinie in einem Dokument existieren, das durch Schulungen und Workflow‑Kontrollen unterstützt wird. Wenn ein Agent jedoch Hunderte oder Tausende von Aktionen schnell ausführen kann, verhindert das Vorhandensein dieses Richtliniendokuments nicht automatisch eine Aktion, die ihr widerspricht.
Irgendwo zwischen der schriftlichen Richtlinie und der geschäftlichen Handlung muss die Richtlinie operational werden.
Das bedeutet nicht, dass jede Richtlinie zu deterministischem Code werden muss. Einige Kontrollen werden deterministisch sein, andere erfordern semantische Interpretation, wieder andere hängen von Risiko oder Vertrauen ab, und wieder andere benötigen weiterhin menschliches Urteil. Die größere architektonische Veränderung besteht darin, dass die Geschäftspolitik näher an den Ausführungspfad rückt.
AWS macht diesen Punkt speziell im Kontext von Agentic AI im Finanzsektor, einschließlich der Notwendigkeit einer richtlinienbasierten Validierung von Agenten‑Aktionen und von Prüfpfaden für folgerichtige Aktivitäten.
Historisch konnten Organisationen viele Governance‑Anforderungen vor der Ausführung definieren und die Einhaltung später durch Audits und Prüfungen verifizieren. Wenn autonome Systeme kontinuierlich und mit Maschinengeschwindigkeit agieren, müssen einige Kontrollen während des laufenden Prozesses aktiv sein.
Mensch im Loop ist notwendig, aber nicht das Betriebsmodell
Die häufigste Reaktion auf Unsicherheit in einem KI‑Workflow ist, einen Menschen in den Loop zu setzen. Das ist sinnvoll, besonders bei folgerichtigen Entscheidungen, wird jedoch problematisch, wenn die menschliche Prüfung als Antwort auf jede Ausnahme behandelt wird.
Stellen Sie sich einen agentischen Betrieb vor, der Tausende oder Millionen von Entscheidungen verarbeitet. Wenn jede ungewöhnliche Situation, jedes Ergebnis mit geringem Vertrauen, jede Richtlinien‑Mehrdeutigkeit oder Ausnahme an eine Person weitergeleitet wird, hat die Organisation die operative Engstelle nicht beseitigt. Sie hat die Engstelle lediglich in eine Prüf‑Warteschlange verlagert. Im Laufe der Zeit kann dies ein weiteres Problem erzeugen: Wenn Menschen aufgefordert werden, zu viele Routineentscheidungen zu genehmigen, kann die menschliche Aufsicht selbst an Bedeutung verlieren.
Menschen bleiben unverzichtbar, aber ihre Rolle muss sich ändern. Anstatt jede Entscheidung zu prüfen, sollten sie sich auf Situationen konzentrieren, in denen tatsächlich ein Urteil erforderlich ist, in denen die Autorität eines Agenten erreicht wurde oder in denen das System auf eine Bedingung stößt, die es nicht eigenständig lösen sollte.
Ein skalierbares Betriebsmodell kann daher nicht ausschließlich auf Risikobewertung und menschliche Prüfung vertrauen. Bevor eine Agentenaktion zu einer Geschäftsaktion wird, muss das System den aktuellen Geschäftskontext, relevante Richtlinien, die Autorität des Agenten und das bereits im Workflow Geschehene berücksichtigen. Das Ergebnis kann sein, die Aktion fortzusetzen, zusätzliche Nachweise anzufordern, die Aktion zurückzuhalten oder die Entscheidung an einen Menschen zu eskalieren.
Abbildung 3: Menschliche Prüfung wird zu einem Ergebnis der Laufzeitsteuerung

Dies ändert die Rolle der menschlichen Aufsicht. Ein Mensch wird nicht mehr standardmäßig in jeden unsicheren Schritt eingefügt. Menschliches Eingreifen wird zu einem möglichen Ergebnis, wenn der Geschäftskontext, die Richtlinie, die Autorität oder die Konsequenz einer Aktion ein Urteil erfordert.
Die Unterscheidung ist für Unternehmensmaßstäbe wichtig. Einige Aktionen sollten automatisch ausgeführt werden, weil sie eindeutig innerhalb von Richtlinien und Autorität liegen. Andere sollten pausieren, weil erforderliche Nachweise fehlen oder der Geschäftsstatus sich geändert hat. Wiederum andere sollten eskaliert werden, weil die Entscheidung eine Grenze überschritten hat, die die Organisation bewusst für Menschen reserviert hat.
Das Ziel ist nicht, Menschen aus dem Kreislauf zu entfernen. Es geht darum, Menschen in die richtige Schleifen, während routinemäßige Entscheidungen innerhalb klar definierter Grenzen weitergeführt werden können. Wenn agentische Systeme skalieren, kann die Qualität der menschlichen Aufsicht weniger davon abhängen, wie viele Entscheidungen Menschen prüfen, sondern vielmehr davon, ob das Betriebssystem die Entscheidungen identifizieren kann, bei denen menschliches Urteil tatsächlich wichtig ist.
Beobachtbarkeit ist notwendig, aber Sehen ist nicht Kontrollieren
Die Branche hat bedeutende Fortschritte bei der KI‑Beobachtbarkeit erzielt. Teams können Eingabeaufforderungen, Modellantworten, Traces, Werkzeugaufrufe, Latenz, Token‑Verbrauch und zunehmend die gesamte Trajektorie, die ein Agent vor der Ergebnisgenerierung verfolgt hat, untersuchen.
Diese Sichtbarkeit ist entscheidend. OpenAI-Leitfaden zur Sicherheit und Bewertung von Agenten betont zudem Techniken wie Bewertungen und Trace‑Bewertung, um das Verhalten von Agenten zu verstehen.
Aber Sichtbarkeit allein löst das betriebliche Problem nicht.
Stellen Sie sich vor, Sie entdecken, dass ein Underwriting‑Agent letzte Woche 2,700 Mal gegen eine Genehmigungsrichtlinie verstoßen hat. Das würde exzellente Beobachtbarkeit und katastrophale Abläufe bedeuten.
Für entscheidende Geschäftsprozesse benötigen Unternehmen letztlich die Fähigkeit, nicht nur das Verhalten von Agenten zu verstehen, sondern auch während des laufenden Prozesses zu reagieren.
Abbildung 4: Die operative Steuerungsschleife

Beobachtbarkeit beantwortet was der Agent getan hat. Agentic Operations muss außerdem beantworten ob der Agent fortfahren soll.
Diese Unterscheidung wird besonders wichtig, wenn eine Aktion kostspielig, folgenschwer, schwer rückgängig zu machen oder in der Lage ist, viele nachgelagerte Entscheidungen zu beeinflussen.
Die schwersten Fehler können zwischen Agenten auftreten
Eine weitere Herausforderung wird sichtbar, wenn Unternehmen zu Multi‑Agent‑ und länger laufenden Workflows übergehen. Viele Geschäftsrichtlinien gelten nicht nur für eine einzelne Aktion.
Betrachten Sie eine Richtlinie, die die gesamte finanzielle Exposition über eine Reihe von Entscheidungen begrenzt. Jede einzelne Transaktion kann unterhalb der zulässigen Schwelle liegen, während die kumulative Exposition sie überschreitet. Betrachtet man jede Aktion isoliert, würde keine Verletzung sichtbar.
Das gleiche Problem kann bei der Autorität auftreten. Ein Agent kann befugt sein, Informationen zu sammeln, jedoch nicht die endgültige Entscheidung zu treffen. Nach mehreren Weitergaben kann ein nachgelagerter Agent die Informationen erhalten, ohne die an die ursprüngliche Aufgabe geknüpften Autoritätsbeschränkungen zu behalten. Jeder einzelne Schritt kann vernünftig erscheinen, während die Gesamtabfolge den beabsichtigten Geschäftsprozess verletzt.
Der Kontext erzeugt ein ähnliches Problem. Informationen, die in der ersten Phase eines Workflows wichtig waren, können mehrere Schritte später zusammengefasst, transformiert oder weggelassen werden. Der nachgelagerte Agent kann nicht über Informationen nachdenken, die er nicht mehr besitzt, selbst wenn seine Argumentation sonst korrekt ist.
Diese Fehler deuten darauf hin, dass die Zuverlässigkeitseinheit erweitert werden muss.
Wir werden weiterhin Modelle evaluieren, indem wir fragen, ob ihre Antworten korrekt sind. Wir werden Agenten evaluieren, indem wir prüfen, ob sie ihre Aufgaben korrekt erledigt haben. Auf Workflow‑Ebene stellt sich jedoch die Frage, ob Informationen, Autorität und Richtlinien über die gesamte Aktionssequenz hinweg erhalten blieben. Auf Geschäftsebene lautet die Frage, ob das Endergebnis sowohl korrekt als auch zulässig war.
Das ist auch konsistent mit der umfassenderen Lebenszyklusperspektive im NIST AI Risikomanagement‑Rahmen, der fortlaufende Messung und Verwaltung von KI‑Risiken betont, anstatt die Bewertung als einmalige Aktivität vor dem Einsatz zu behandeln.
Hier beginnt Agentic Operations
KI-Governance, Modellauswertung, LLMOps, Beobachtbarkeit, Sicherheit und verantwortungsbewusste KI decken bereits wichtige Aspekte des Betriebs von KI‑Systemen ab. Agentic Operations ersetzt diese Disziplinen nicht. Es adressiert die operationelle Ebene, die wichtig wird, wenn autonome und halbautonome Systeme direkt in Geschäftsprozesse eingreifen.
Agentic Operations ist die Disziplin, autonome und halbautonome KI‑Systeme innerhalb realer Geschäftsprozesse zu betreiben, einschließlich der Verwaltung von Autorität, Kontext, Entscheidungen, Ausnahmen, menschlichen Eingriffen und Verantwortlichkeit während der Ausführung.
Der Unterschied ist wichtig, weil das zu verwaltende Objekt nicht mehr nur ein Modell ist. Es handelt sich um einen fortlaufenden Geschäftsprozess, in dem Software eigenständig Entscheidungen treffen und Aktionen ausführen kann.
In der Praxis erzeugt dies ein anderes Set an operativen Fragen. Was darf ein Agent tun? Welcher Geschäftskontext muss über einen lang laufenden Workflow hinweg erhalten bleiben? Was geschieht, wenn neue Beweise eine frühere Entscheidung ungültig machen? Wie kann eine Organisation erkennen, wann individuell zulässige Handlungen zusammen eine Richtlinie verletzen? Wann sollte ein Agent fortfahren, pausieren, stoppen oder eskalieren? Monate später, kann die Organisation rekonstruieren, warum eine bestimmte Entscheidung getroffen wurde?
Es gibt zudem die Frage nach dem Eigentum. Wenn ein Agent seine technische Aufgabe korrekt ausführt, das Geschäftsergebnis jedoch falsch ist, wem gehört das Scheitern? Die Delegation der Ausführung an einen Agenten delegiert nicht die Verantwortlichkeit der betreibenden Organisation.
Agenten können die Arbeit ausführen. Das Unternehmen bleibt jedoch für das Ergebnis verantwortlich.
Das Ziel ist kontrollierte Autonomie
Die Zukunft von Agentic AI wird manchmal als ein Fortschritt hin zu vollständiger Autonomie beschrieben, bei dem Menschen allmählich aus Geschäftsabläufen verschwinden. Für die meisten Unternehmen ist das wahrscheinlich das falsche Ziel.
Das nützlichere Ziel ist kontrollierte Autonomie.
Viele heute von KI unterstützte Prozesse folgen einem Muster, bei dem ein Agent einen Handlungsvorschlag macht und eine Person die endgültige Entscheidung trifft. Mit zunehmendem Vertrauen werden einige Workflows es Agenten erlauben, Entscheidungen innerhalb definierter Autorität zu treffen, während das umgebende System die Ausführung überwacht und Menschen Ausnahmen bearbeiten. Reife, risikoärmere Workflows können schließlich Agenten ermöglichen, eigenständig zu entscheiden und zu handeln, während Konsequenzentscheidungen weiterhin überwacht und protokolliert werden.
Abb. 5 : Steigendes Autonomie‑Level

Die geeignete Grenze variiert je nach Prozess. Eine Bank kann erhebliche Autonomie bei der Dokumentklassifizierung zulassen, während sie strenge Kontrollen bei Kreditentscheidungen verlangt. Ein Versicherer kann routinemäßige Schadensfälle automatisieren und gleichzeitig ungewöhnliche Kombinationen von Beweisen eskalieren. Eine Gesundheitseinrichtung kann Agenten erlauben, Informationen zu sammeln und zusammenzufassen, während sie folgenschwere Entscheidungen Menschen vorbehalten.
Die entscheidende Frage ist daher nicht nur, wie autonom ein Agent werden kann, sondern wie viel Autonomie eine Organisation verantwortungsbewusst betreiben kann.
Dies verändert auch die Rolle von Kontrollen. Kontrollen sind nicht zwangsläufig Mechanismen zur Reduzierung von Autonomie. Wenn sie gut umgesetzt werden, ermöglichen sie einer Organisation, Autonomie mit größerem Vertrauen auszubauen.
Der Betrieb von Agenten kann schwieriger werden als deren Entwicklung
Modelle werden sich weiter verbessern. Der Einsatz von Werkzeugen wird zunehmen. Agenten‑Frameworks werden sich weiterentwickeln. Das Schließen von Schlüssen wird besser, und viele heute noch schwierige Probleme werden schließlich zur Routine.
Bessere Modelle beseitigen jedoch nicht Geschäftsrichtlinien, wechselnde Kontexte, Ausnahmen, organisatorische Grenzen oder Verantwortlichkeit. In gewisser Weise machen bessere Agenten diese Themen noch wichtiger. Ein System, das nicht autonom handeln kann, hat nur begrenzte operative Befugnisse. Ein System, das Tausende von Geschäftsentscheidungen ausführen kann, schafft eine völlig andere Verantwortung.
Deshalb wird die nächste Phase von Enterprise‑AI möglicherweise nicht dadurch bestimmt, welche Organisation die meisten Agenten einsetzt, sondern dadurch, welche Organisationen lernen, sie zu betreiben.
Die ersten 80 % zeigen, dass der Agent funktionieren kann. Die verbleibenden 20 % bestimmen, ob das Unternehmen ihm das Geschäft anvertrauen kann.
Wenn Agenten fähiger werden, könnte sich die entscheidende Unternehmensfrage von was können unsere Agenten tun zu etwas Schwierigerem verschieben:
Was sind wir bereit, ihnen zu erlauben, unter welchen Bedingungen, und wie werden wir erkennen, wann sich diese Bedingungen ändern?
Dort beginnt Agentic Operations.












