Vordenker

Warum Tokenkosten 2026 die Budgets der Finanzvorstände sprengen

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Die Kosten für KI-Token haben sich innerhalb von weniger als einem Jahr von einem unbedeutenden technischen Detail zu einem Budgetproblem für die Vorstandsebene entwickelt. Vor zwölf Monaten war der „Tokenpreis“ für die meisten Finanzvorstände noch kein eigener Posten. Heute taucht er an allen unerwünschten Stellen auf: in den Nachrichten, in internen Memos, bei Budgetstopps und in Bilanzkonferenzen.

Uber gab seinen Ingenieuren Ende 2025 Zugang zu Claude Code. Bis April 2026 hatte das Unternehmen sein gesamtes jährliches Budget für KI-gestützte Programmierung in vier Monaten aufgebraucht. Als Reaktion begrenzte Uber die Ausgaben auf 1.500 US-Dollar pro Mitarbeiter, Monat und Werkzeug, wie Bloomberg zuerst berichtete. Wird die gleichzeitige Nutzung von zwei agentenbasierten Programmierwerkzeugen erlaubt, etwa Claude und Cursor, verdoppelt sich diese Obergrenze auf 3.000 US-Dollar pro Monat und Ingenieur. Das sind 36.000 US-Dollar pro Jahr für die KI-Nutzung einer einzigen Person. Schätzungen zufolge beschäftigt Uber rund 4.000 Ingenieure, was KI-Ausgaben von 144 Millionen US-Dollar entsprechen würde.

Bei Meta könnten die Kosten noch höher sein. Ein internes Memo warnte davor, dass die Ausgaben für KI-Token 2026 auf mehrere Milliarden US-Dollar zusteuerten. Der Grund liegt in der Funktionsweise von Agenten im großen Maßstab. Wenn sich ein KI-Agent mit einer Codebasis verbindet, um einen Fehler zu beheben oder Software zu schreiben, verarbeitet er bei jeder einzelnen Eingabe Tausende Token an Hintergrundkontext. Überträgt man das auf eine Organisation von Metas Größe und verbindet es mit einer unternehmensweiten Vorgabe an die Entwicklungsabteilung, Claude zu nutzen, wächst der Tokenverbrauch nicht einfach – er explodiert.

Laut Ramps AI Index, der die tatsächlichen Zahlungen an Anbieter bei mehr als 70.000 Unternehmen verfolgt, geben die obersten 1% der Unternehmen bei der KI-Einführung inzwischen rund 7.500 US-Dollar pro Mitarbeiter und Monat für KI aus. Diese Ausgaben wachsen monatlich um 14,1%. Führungskräfte des KI-Recruiting-Start-ups Mercor haben öffentlich erklärt, dass sich die Kosten für KI-Token in einigen Organisationen den Personalkosten annähern oder diese sogar übersteigen.

Daraus lässt sich eine Lehre ziehen. Wenn die größten Technologieunternehmen der Welt von diesen Kosten überrascht werden können, kann das jedem passieren. Der Tokenverbrauch ist zu einer tatsächlich neuen Ausgabenkategorie geworden, die vor zwei Jahren in keiner Gewinn-und-Verlust-Rechnung existierte. Er verhält sich nicht wie die Softwarekosten, die Finanzteams seit Jahrzehnten zu modellieren und in herkömmliche ROI-Berechnungen einzubeziehen gelernt haben. Zu verstehen, warum sich die Kosten für KI-Token so anders als herkömmliche Softwareausgaben verhalten, ist der erste Schritt, um sie unter Kontrolle zu bringen.

Warum die Kosten für KI-Token so schwer vorherzusagen sind

Die traditionelle Softwarebudgetierung beruht auf einer einfachen Annahme: Die Kosten steigen mit der Mitarbeiterzahl. Zehn zusätzliche Mitarbeiter bedeuten zehn zusätzliche Lizenzen zu einem bekannten Preis. Das lässt sich einfach prognostizieren und einplanen, wenn Unternehmen wachsen oder neue Softwareplattformen lizenzieren.

KI-Token durchbrechen diese Annahme. Die Kosten richten sich nach der Nutzung und nicht nach der Mitarbeiterzahl. Diese Nutzung ist extrem ungleichmäßig verteilt, schwer vorherzusagen und bei autonomen Agenten nicht einmal an einen Menschen gebunden, der an einer Tastatur sitzt. Ein einzelner Ingenieur kann in einer agentenbasierten Programmiersitzung ohne Vorwarnung Tausende Dollar in einem Monat verbrauchen, weil der Zähler unabhängig davon läuft, ob die Ausgabe nützlich ist. Viele Modelle erzeugen außerdem Tausende verborgene, unsichtbare Token, nur um vor der Antwort Schritt für Schritt zu „denken“, wodurch sich die Kosten pro Eingabe vervielfachen.

Genau das haben die meisten Organisationen noch nicht eingepreist: Jeder Dollar neuer Ausgaben für agentenbasierte KI muss irgendwoher kommen. Für die meisten Finanzvorstände ist das kein Rundungsfehler, den ein Innovationsfonds auffängt. Wir sprechen über Millionen Dollar an neuen Ausgaben, die vor zwei Jahren nicht existierten. Dadurch entsteht ein echter Zielkonflikt mit der Mitarbeiterzahl, anderen Technologieinvestitionen oder frei verfügbaren Budgets in anderen Unternehmensbereichen.

Die drei Risikostufen bei KI-Ausgaben in Unternehmen

Betrachtet man, wie Organisationen tatsächlich Geld für KI ausgeben, zeichnet sich ein klareres Muster ab. Das Kostenrisiko ist nicht gleichmäßig verteilt. Es konzentriert sich auf bestimmte Bereiche, und in einer typischen Organisation ist derzeit wahrscheinlich nur einer von drei Bereichen unter Kontrolle.

Geschäftsanwender in Vertrieb, Marketing und Betrieb nutzen größtenteils Werkzeuge mit Preisen pro Benutzer: pauschal 20 bis 30 US-Dollar pro Nutzer und Monat. Diesen Bereich kann die Finanzabteilung bereits budgetieren, weil er sich genauso verhält wie alle anderen SaaS-Posten, die sie in den vergangenen zwanzig Jahren eingekauft hat.

Entwickler mit agentenbasierten Programmierwerkzeugen sind der Ursprung von Geschichten wie der bei Uber, und die gesamte Kategorie ist gerade von Pauschalpreisen auf nutzungsabhängige Abrechnung umgestiegen. GitHub Copilot führte im Juni 2026 die tokenbasierte Abrechnung ein. Entwickler prognostizierten, dass ihre Rechnungen von 29 auf 750 US-Dollar pro Monat und bei intensiven agentenbasierten Sitzungen von 50 auf 3.000 US-Dollar pro Monat steigen würden. Uber ist hier kein Ausreißer, sondern liefert einen frühen Blick darauf, wohin sich die gesamte Kategorie entwickelt.

Autonome Agenten sind die Stufe, die fast niemand bisher modelliert hat. Für einen Agenten gibt es kein Konzept eines „Benutzerplatzes“. Er läuft unbeaufsichtigt, startet Unteragenten, wiederholt fehlgeschlagene Versuche und verbraucht die ganze Zeit Token – unabhängig davon, ob er etwas Wertvolles produziert. Für diese Ebene gibt es die wenigsten Kostendaten und kaum Präzedenzfälle bei der Budgetierung.

Einfach ausgedrückt: Die Stufe, mit der sich Finanzvorstände am wohlsten fühlen, birgt zugleich das geringste finanzielle Risiko. Die beiden Stufen, die Budgets tatsächlich sprengen, entfernen sich genau in dem Moment von berechenbaren Preisen, in dem ihre Nutzung am schnellsten wächst.

Die Lücke im KI-Kostenmanagement schließen

Der gemeinsame Nenner bei Uber, Meta und dem breiteren Datensatz von Ramp ist mangelnde Transparenz. Die meisten Organisationen verfügen über keine Steuerungsebene zwischen einem Mitarbeiter oder Agenten und dem geöffneten Werkzeug. Ausgabenobergrenzen wie die von Uber sind eine grobe nachträgliche Lösung für ein Problem, das eigentlich früher im Prozess angegangen werden muss.

Genau diese Lücke soll eine neuere Kategorie von Werkzeugen schließen, die häufig als Agentenorchestrierung oder Agenten-Gateways bezeichnet wird. Sie leitet jede Aufgabe an das günstigste Modell weiter, das sie bewältigen kann, setzt Ausgabengrenzen durch, bevor sie überschritten werden, und stellt der Finanzabteilung einen Echtzeitzähler statt einer monatlichen Überraschung zur Verfügung.

Diese Kategorie entwickelt sich schnell und gliedert sich bereits in mehrere Ebenen. Eine davon sind kostenkontrollierte Gateways, die zwischen den Anwendungen einer Organisation und ihren Modellanbietern sitzen. Sie ergänzen Ausgabenobergrenzen pro Team, die automatische Weiterleitung einfacher Aufgaben an günstigere Modelle sowie Antwort-Caching – dieselben Hebel, die Uber manuell einsetzte, als es seine Obergrenze einführte. Eine zweite Ebene ist die Agentenorchestrierung, die sich auf die Koordination mehrerer zusammenarbeitender Agenten konzentriert und Kostentransparenz zunehmend von Anfang an integriert, statt sie nachträglich anzubauen. Eine neuere, auf die Finanzabteilung ausgerichtete Ebene beginnt damit, KI-Ausgaben so zu behandeln, wie FinOps-Teams seit Langem Cloud-Ausgaben behandeln: nach Team und Funktion zugeordnet, budgetiert und monatlich geprüft, statt erst im Nachhinein entdeckt.

Hinzu kommt ein Architekturansatz, der die Ausgaben durch eine geringere Abhängigkeit von großen Sprachmodellen begrenzen soll. Einige Unternehmen haben begonnen, eine hybride SLM/LLM-Architektur zu schaffen, bei der kleine Sprachmodelle für einen eng umrissenen Satz von Unternehmensaufgaben trainiert werden, beispielsweise interne Richtlinien, Kundenservice, Verarbeitung von Kreditunterlagen oder Auswertung von Frachtmanifesten. Die wirtschaftlichen Vorteile können beträchtlich sein.

Laut einem Unternehmensvergleich von LLMs aus dem Jahr 2026 kosten gehostete führende LLMs bei einer Million Gesprächen pro Monat zwischen 15.000 und 75.000 US-Dollar monatlich. Ein feinabgestimmtes kleines Sprachmodell, das intern eingesetzt wird, kostet beim gleichen Volumen dagegen 150 bis 800 US-Dollar pro Monat. Goldman Sachs verwaltet KI-Ausgaben im großen Maßstab beispielsweise über ein zentrales Modell-Gateway, das jede Anfrage nach Aufgabentyp klassifiziert und an das kostengünstigste geeignete Modell weiterleitet – von schlanken Open-Source-Modellen bis zu führenden LLMs – und zwar vollständig innerhalb der eigenen Sicherheitsgrenzen.

Der gemeinsame Nenner ist, dass die meisten heutigen Werkzeuge von und für Ingenieure entwickelt wurden, um deren Produktivität durch Agenten stark zu erhöhen. Was den meisten Organisationen noch fehlt, ist eine Ebene, die die Fragen eines Finanzvorstands unmittelbar beantwortet: Welches Team, welches Budget, wie prognostizieren wir die Ausgaben und welcher geschäftliche Anwendungsfall wird durch diese Ausgaben unterstützt? Diese Lücke wird voraussichtlich am stärksten ins Gewicht fallen, wenn die Ausgaben für agentenbasierte KI weiter anwachsen.

Vor zwei Jahren existierte all das noch nicht als eigener Posten. Heute zählen die Kosten für KI-Token zu den am schnellsten wachsenden und am wenigsten verstandenen Positionen in der Bilanz. KI-Kostenmanagement entwickelt sich rasch von einem Nebenprojekt zu einer zentralen Finanzdisziplin. Eine ähnliche Entwicklung war bei der ersten Einführung der Cloud zu beobachten, als die Kosten in der ersten Welle explodierten. Organisationen, die eine Einführung agentenbasierter KI planen, sollten dieses Gespräch zwischen Technik und Finanzabteilung jetzt führen und einen Ansatz für das Kostenmanagement festlegen. Uber und Meta haben bereits gezeigt, was passiert, wenn dieses Gespräch erst nachträglich statt im Voraus geführt wird.

Bob ist ein leitender Technologie‑ und Geschäftsführer mit mehr als 30 Jahren Erfahrung in Vertrieb, Geschäftsentwicklung, Marketing, globaler Bereitstellung, Produktentwicklung, Betrieb und P&L‑Management.