Vordenker

Der Speicher Ihres Unternehmens sollte länger als seine KI-Modelle überdauern

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Die Leute fragen oft, welches Modell mein Unternehmen antreibt. Die Antwort ist wichtig: Sie bestimmt Qualität, Kosten und Grenzen, und ich nehme mir gerne eine Stunde Zeit dafür. Ich möchte auch noch etwas wissen: was die Organisation noch hat, wenn dieses Modell wechselt.

Stellen Sie es als Datum dar. Wenn Ihr Anbieter an einem Dienstag seinen Preis verdoppelt oder den Endpunkt, den Sie gebaut haben, stilllegt, was würden Sie am Mittwochmorgen noch besitzen?

Für viele Unternehmen lautet die ehrliche Antwort: ein API‑Schlüssel, eine Rechnung und ein sehr langer Gesprächsverlauf, der auf den Servern eines Dritten unter dessen Aufbewahrungsrichtlinie liegt.

Mein Hintergrund ist Chemie. Ich habe jahrelang graue‑Box‑Modelle für Chemieanlagen gebaut, die in SCADA, Laborergebnisse und die Notizen des Betreibers eingebunden waren. Diese Arbeit lehrt schnell eine Regel: Eine Zahl ohne ihre Bedingungen ist kein Ergebnis. Wenn jemand letzte Woche einen Sensor ausgetauscht hat und niemand es notiert hat, erklärt die Anzeige auf dem Bildschirm nichts.

Das ist ein Laborbuch‑Problem. Es erscheint jetzt als Beschaffungsproblem und findet selten auf dem Blatt statt, auf dem das KI‑Budget beschlossen wird.

Drei Fragen, die als eine beantwortet werden

Ein größeres Kontextfenster ermöglicht es einem Modell, mehr Informationen innerhalb einer einzelnen Anfrage zu nutzen. Dauerhafter Speicher bestimmt, was zwischen Anfragen erhalten bleibt. Portabilität bestimmt, ob diese Informationen weiterhin nutzbar sind, wenn der Anbieter wechselt. Das sind separate architektonische Fragen, und das Million‑Token‑Fenster hat alle dazu verleitet, sie als eine zu behandeln.

Die eigene Dokumentation von Google bietet die Analogie direkt: “Eine Analogie für das Kontextfenster ist das Kurzzeitgedächtnis.” Nehmen Sie das wörtlich. Kurzzeitgedächtnis ist das, was Sie verlieren.

Daher verkauft jeder Anbieter, der ein riesiges Fenster anbietet, auch etwas Separates, um den Zustand zu persistieren. Lesen Sie diese Schichten genau, in deren eigenen Worten, und notieren Sie, was jede tatsächlich abdeckt.

OpenAI speichert Response‑Objekte standardmäßig 30 Tage; Conversation‑Objekte und deren Elemente sind von dieser TTL ausgenommen. Amazons 30‑Tage‑Löschung gilt für die Bedrock Session Management API und betrifft ausschließlich diese API. Anthropic’s Client‑seitiges Speicher‑Tool veranschaulicht eine nützliche Grenze: Das Modell fordert Speicheroperationen an, die Anwendung steuert die Speicherung, während dasselbe Unternehmen auch verwaltete Speicher‑Stores für seine gehosteten Agenten bereitstellt.

All dies sind gewöhnliche technische Entscheidungen, die offen veröffentlicht werden. Das bedeutet auch, dass die Aufbewahrungsregeln für den Arbeitskontext Ihres Unternehmens in den Release‑Notes eines Dritten stehen, und Sie sollten benennen können, welche Regel auf welche Ihrer Daten zutrifft.

Wo die Umstellungskosten tatsächlich liegen

Den Aufruf einer Textgenerierung gegen einen anderen auszutauschen, dauert ein Wochenende. Deshalb ist „wir sind multimodell“ ein so leichtes Statement. Die teuren Schichten sind die, die niemand demonstriert.

Einbettungen.Ändern desEinbettungModell erfordert typischerweise das erneute Einbetten des Korpus und das Migrieren oder den Wiederaufbau des Index. Eine Änderung desGenerierungModell erfordert keine solche Anforderung, und die beiden werden ständig verwechselt — meist von denen, die versprechen, die Migration sei schnell. Die Literatur von 2025 beschreibt den Standardweg als“die gesamte Corpus neu zu kodieren und den Approximate Nearest Neighbor (ANN)-Index neu aufzubauen, was zu erheblichen betrieblichen Störungen und hohen Rechenkosten führt”; der eigene Beitrag dieses Papiers, Drift-Adapter, ist eine Methode zumAufschiebenden Wiederaufbau, indem man eine Transformation zwischen Einbettungsräumen lernt. So oder so deckt der Migrationsaufwand sowohl die Validierung der Abrufe als auch die operative Arbeit sowie die Einbettungsaufrufe selbst ab.

Feinabgestimmtes Verhalten.Ein Satz von Cohere’sSeptember‑2025‑Abkündigungsmitteilungsteht über jedem Beschaffungstisch: “Zuvor feinabgestimmte Modelle werden nicht mehr zugänglich sein.” Verhalten, für das Sie bezahlt haben, wurde zusammen mit dem Endpunkt, der es hostete, eingestellt. Jeder folgte dem veröffentlichten Prozess. Ihr Modell verschwand trotzdem.

Prompt‑ und Tool‑Verhalten.Dieselben Anweisungen erzeugen eine andere Anwendung auf einem anderen Modell. In einer Unternehmensanwendung berichteten Forscher meldeten, dass die Erfolgsrate der Regression fälltvon 100 % im ursprünglichen Modell auf 97,3 % in einem neueren Modell mit identischen Prompts, erst nach gezielter Prompt‑Neugestaltung wiederhergestellt. Testszenarien erscheinen in der Produktion mit eigenen Häufigkeiten, sodass diese Zahl keine Schätzung darüber liefert, wie oft Live‑Workflows fehlschlagen. Die unterstützende betriebliche Regel ist einfacher: Validieren Sie jedes Modell‑Upgrade auf Anwendungsebene selbst, bevor es einen Kunden erreicht.

All das führt schließlich zur Rechnung, lange nachdem die Preisseiten verglichen wurden.

Jemand anderes hält Ihren Kalender

Deprecation läuft nach einem veröffentlichten Zeitplan, und die Zeitpläne gehören nicht Ihnen. OpenAI gab eine einjährige Vorankündigung bevor die Assistants‑API im August 2026 eingestellt wurde – großzügig nach den Maßstäben derselben Seite, wo die GPT‑4.5‑Preview etwa drei Monate erhielt. Mistrals Richtlinie beträgt sechs Monate für GA‑Modelle und einen Monat für Preview‑ und Drittanbieter‑Modelle, mit dem Hinweis, dass ein rollierender Alias „Sie zu stillen Aktualisierungen im Modellverhalten und bei den Preisen führen kann.“

AWS sagt den stillen Teil laut in seiner Lebenszyklusrichtlinie: „Migrieren Sie vor dem EOL‑Datum zu einem aktiven Modell; die Migration erfolgt nicht automatisch.“

Ihr Fahrplan hat einen Co‑Autor. Er nimmt nie an Ihren Planungssitzungen teil und interessiert sich nicht dafür, in welchem Quartal Sie sich befinden.

Preis ist ebenfalls ein beweglicher Faktor

Bei den in Gemini 3.7 Flash angegebenen Standardtarifen kosten fünf Milliarden nicht zwischengespeicherte Eingabetoken und eine Milliarde abgerechnete Ausgabetoken 7.500 $ pro Monat. Die derzeit geplanten Tarife für den 1. Januar 2027 würden diese Token‑Rechnung auf 15.000 $ erhöhen, zuzüglich anderer Gebühren oder Rabatte, während Ihr Produkt genau das tut, was es zuvor getan hat.

Eine eingefrorene Preisliste kann ebenfalls zu einer höheren Rechnung führen. Anthropics Preis‑Dokumentation weist darauf hin, dass der Tokenizer, der bei neueren Modellgenerationen verwendet wird, „für denselben Text etwa 30 % mehr Token erzeugt“ – inhaltsabhängig und spezifisch für diese Generationen – was die Auswirkung auf eine einzelne Rechnung messbar macht. Messen Sie also die Token, für die Sie abgerechnet werden. Ein reiner Tarifkatalog gibt Ihnen diese Information nicht.

Bei einem Produkt, das Workflows ausführt, ist das sinnvolle wirtschaftliche Maß die Kosten eines erfolgreich abgeschlossenen Auftrags, einschließlich Wiederholungen und menschlicher Prüfung. Diese Kennzahl ändert sich, wenn ein Modell wechselt, selbst wenn der Tarifkatalog unverändert bleibt.

Und nichts davon ist verhandelbar, wenn ein Wechsel ein Jahr dauert. Capgemini befragte 1.300 Führungskräfte bei milliardenschweren Unternehmen im Frühjahr 2026 zu kritischen Technologielieferanten im Allgemeinen: 36 % gaben an, dass ein Wechsel mehr als zwölf Monate dauern würde, und einer von zehn hatte überhaupt keine brauchbare Alternative. Das ist eine Beschreibung einer Lieferantenbeziehung ohne Zweitquelle.

Bringen Sie es zur Beschaffung

Ich führe ein französisches Unternehmen, das in Marseille registriert und in Europa gehostet ist, und ich werde dennoch die Souveränitätsrede im Abstrakten überspringen. Unabhängigkeit von jedem Technologielieferanten ist für ein normales Unternehmen unerreichbar. Die gleiche Capgemini‑Studie ergab, dass 59 % der Führungskräfte vollständige digitale Souveränität für unrealistisch halten, und ich stimme ihnen zu.

Das Verständnis und die Kontrolle Ihrer kritischen Abhängigkeiten ist eine kleinere, aber machbare Aufgabe. Drei Fragen, die in einem Meeting beantwortet werden können: Wo werden unsere Daten gespeichert und verarbeitet, wer hat Zugriff darauf und was wäre nötig, um mit einem anderen Anbieter weiter zu operieren?

Jedes Unternehmen weiß, wie man das bei Logistik, Zahlungen und Cloud‑Speicherung fragt. Wird nach dem Arbeitskontext gefragt, erscheint die europäische Abhängigkeit im Meeting als Zweitquellen‑Diskussion mit einer Zahl, was eine Form ist, auf die die Beschaffung reagieren kann.

Ein Hinweis zu den hier genannten Zahlen: Dass ein Unternehmen mehrere Modelle nutzt, sagt wenig darüber aus, ob es seinen Arbeitskontext zwischen Anbietern verlagern kann. Das erfordert einen separaten Test: Können die Aufzeichnungen, Berechtigungen und die unvollständige Arbeit übertragen werden und weiterhin genutzt werden?

Was ein Modell tatsächlich austauschbar macht

Eine gemeinsame Schnittstelle über Modelle hinweg ist nützlich, und ich würde eine solche bauen. Sie sollte modell‑spezifische Fähigkeiten und Abhängigkeiten sichtbar machen. Portabilität erfordert keine Vortäuschung, dass jedes Modell gleich funktioniert, und eine Abstraktion, die die Unterschiede nivelliert, verwirft stillschweigend den Grund, warum Sie für ein gutes Modell bezahlt haben.

Die schwerere Arbeit besteht darin, den Zustand zu besitzen, dessen alleiniger Hüter kein Anbieter sein sollte. Vier Dinge, in der Reihenfolge, in der sie scheitern.

Ein autoritativer Datensatz unter Ihrer Kontrolle. Nachrichten, abgerufene Quellen, Genehmigungen, Ausführungspunkte. Dokumentieren Sie, was in externen Systemen abgeschlossen wurde und was sicher erneut versucht werden kann: Die E‑Mail könnte gesendet worden sein, während die Bestätigung nicht gespeichert wurde, und ein Wiederherstellungsprozess, der das nicht kennt, würde sie zweimal senden. Jeder Anbieter‑Zustand, den Sie nicht rekonstruieren können, ist eine Abhängigkeit. Schreiben Sie ihn eindeutig als solchen nieder, bevor ein Vorfall die Dokumentation für Sie übernimmt.

Die Quelle neben jedem Vektor. Ein Vektor ist ein kompiliertes Artefakt; das Chunk ist der Quellcode. Speichern Sie das Quelldokument und seine Version, Dokument‑ID, Chunk‑Grenzen, Chunk‑Version, Einbettungsmodell mit Version und Dimensionen, Index‑Version und welche Verarbeitung den Text erzeugt hat. Ein einzelnes gespeichertes Textfragment kann weder eine Tabelle, ein Bild noch ein OCR‑Ergebnis rekonstruieren. Alles zu behalten verwandelt ein Re‑Indexieren in eine geplante Migration, was ebenso viel Sicherheit bietet, wie ich versprechen würde.

Datensätze, die Quelle, Schlussfolgerung und Entscheidung unterscheiden.Der Speicher muss trennen, was eine Quelle gesagt hat, was ein Modell geschlossen hat und was eine Person genehmigt hat. Ein Kunde, der verspricht, am Donnerstag zu zahlen, die Vermutung eines Modells, dass die Zahlung verzögert wird, und eine vereinbarte Verlängerung bis Freitag sind drei unterschiedliche Datensätze mit drei verschiedenen Status, und das System muss wissen, welcher davon verwendet werden kann. Jeder benötigt seinen Ursprung, seinen Geltungsbereich, Zugriffsregeln und den aktuellen Status, einschließlich der Information, ob er korrigiert oder ersetzt wurde. Ein Transkript kann zwar die Beweise enthalten; das erneute Abspielen identifiziert nicht zuverlässig, welche Schlussfolgerungen noch aktuell sind und welche Entscheidungen weiterhin gelten.

Portabilität, die Sie tatsächlich getestet haben.Machen Sie es auf zwei Arten testbar: durch einen Export‑und‑Wiederherstellungs‑Durchlauf und durch eine Evaluationssuite, die definiert, was die Anwendung leisten muss. Dann wird „wir könnten wechseln“ zu einer Messgröße, die jemand ausführen kann: Kann der Ersatz die repräsentativen Arbeitsabläufe innerhalb Ihrer Qualitäts‑, Berechtigungs‑, Latenz‑ und Kostenanforderungen fortführen? Und bewahren Sie die Trainingsdaten, die Sie wiederverwenden dürfen, zusammen mit deren Versionen, Feinabstimmungs‑Konfiguration und Akzeptanztests. Diese ermöglichen ein erneutes Training, jedoch ohne Garantie für identisches Verhalten, und die ID des feinabgestimmten Modells läuft an einem von einer Ihnen nie begegneten Person festgelegten Datum ab.

Verwenden Sie dann gehostete Sitzungen, Prompt‑Caches und Provider‑Abrufe, wo immer sie helfen. Sie sind oft ausgezeichnet, und sie aus Prinzip abzulehnen, ist seinerseits teuer. Die Anforderung ist, dass die von ihnen gehaltenen Datensätze wiederhergestellt und an anderer Stelle verwendet werden können, wobei ihre Zugriffs‑ und Aufbewahrungsregeln unverändert bleiben. Mieten Sie die Rechenleistung; behalten Sie die Kontrolle über den Datensatz.

Ich würde die Architektur ebenfalls nicht überbewerten. Vor dem Erreichen des Product‑Market‑Fit schlägt das Ausliefern sechs Wochen früher oft jede Abstraktionsebene, und ein Startup, das drei Abruf‑Backends aufbaut, bevor es Kunden hat, hat ein Museum gebaut. Ob dieser Trade‑off richtig ist, hängt vom Produkt und den Kosten des späteren Wiederaufbaus ab. Halten Sie das Rohmaterial wiederherstellbar, und ein Shortcut bleibt ein Shortcut.

Der Teil, der sich geändert hat

Während KI früher nur Fragen beantwortete, war der Verlust von Kontext lediglich eine Unannehmlichkeit. Man tippte die Eingabeaufforderung neu und fuhr fort. Jetzt bucht sie das Meeting, erstellt das Ticket und greift auf das CRM zu, und fehlender Kontext führt zu doppelten oder halb fertigen Arbeiten in Systemen, die Ihren Kunden gehören.

Die Modellanbieter bauen außergewöhnliche Dinge, und ich nutze sie täglich. Die Verantwortung, die ich beschreibe, liegt bei uns, die Plattformen dazwischen bauen: die Abhängigkeiten sichtbar zu machen und ein zuverlässiges Protokoll dessen zu bewahren, was autorisiert und was abgeschlossen wurde.

Jeder abgeschlossene Arbeitsablauf sollte der Organisation etwas hinterlassen, das sie erneut nutzen kann – ein verifiziertes Ergebnis, eine Entscheidung mit nachvollziehbarer Historie, einen klareren Ausgangspunkt für die nächste Aufgabe. Dieser angesammelte Wert sollte das Modell, das zu seiner Entstehung beigetragen hat, überdauern.

Fragen Sie, was Sie am Mittwochmorgen noch besitzen würden.

Ilia Razvin ist Gründer und CEO von IOSYA, eine Plattform für betriebliche Produktivität und KI‑Workflow‑Automatisierung. Er hat zuvor Grey‑Box‑Prozessmodelle und Entscheidungsunterstützungssysteme für die chemische Fertigung entwickelt und besitzt einen Master 2 in Mikrosensoren und Detektionssystemen von der Aix‑Marseille Université.