Thought leaders
Het geheugen van uw bedrijf moet langer meegaan dan de AI-modellen

Mensen vragen vaak welk model mijn bedrijf aandrijft. Het antwoord is belangrijk: het bepaalt kwaliteit, kosten en limieten, en ik neem graag een uur de tijd om het uit te leggen. Ik wil ook een tweede ding weten: wat de organisatie nog zal hebben wanneer dat model verandert.
Stel het als een datum. Als uw provider op een dinsdag de prijs verdubbelde, of het endpoint waarop u gebouwd heeft beëindigde, wat zou u dan op woensdagochtend nog bezitten?
Voor veel bedrijven is het eerlijke antwoord: een API-sleutel, een factuur, en een zeer lange gespreksgeschiedenis die op de servers van iemand anders zit onder het retentie‑schema van iemand anders.
Mijn achtergrond is scheikunde. Ik heb jaren besteed aan het bouwen van grey‑box‑modellen voor chemische installaties, gekoppeld aan SCADA, laboratoriumresultaten en de notities van de operator. Dat werk leert één regel snel: een getal zonder zijn voorwaarden is geen resultaat. Als iemand vorige week een sensor heeft verwisseld en niemand het heeft genoteerd, verklaart de weergave op het scherm niets.
Dat is een laboratoriumnotitie‑probleem. Het verschijnt nu als een inkoopprobleem, en het staat zelden op het blad waar het AI‑budget wordt bepaald.
Drie vragen die als één beantwoord worden
Een groter contextvenster stelt een model in staat meer informatie binnen één aanvraag te gebruiken. Duurzame opslag bepaalt wat tussen aanvragen overleeft. Portabiliteit bepaalt of die informatie bruikbaar blijft wanneer de provider verandert. Dit zijn afzonderlijke architecturale vragen, en het miljoen‑token‑venster heeft iedereen aangemoedigd ze als één te beschouwen.
Google’s eigen documentatie biedt de analogie direct: “Een analogie voor het contextvenster is kortetermijngeheugen.” Neem dat letterlijk. Kortetermijngeheugen is wat je verliest.
Dus elke leverancier die een enorm venster verkoopt, biedt ook iets afzonderlijks aan om de staat te behouden. Lees die lagen nauwkeurig, in hun eigen woorden, en noteer wat elk van hen werkelijk dekt.
OpenAI slaat Response‑objecten standaard 30 dagen op; Conversation‑objecten en hun items zijn vrijgesteld van die TTL. De 30‑daagse verwijdering van Amazon is van toepassing op the Bedrock Session Management API, en betreft alleen die API. Anthropic’s client‑side memory‑tool illustreert een nuttige grens: het model vraagt om geheugenbewerkingen, de applicatie beheert de opslag, terwijl hetzelfde bedrijf ook beheerde geheugenopslag levert voor zijn gehoste agents.
Al deze zijn gewone technische beslissingen, openbaar gepubliceerd. Ze betekenen ook dat de retentieregels voor de werkcontext van uw bedrijf zich in de release‑notes van iemand anders bevinden, en u moet kunnen aangeven welke regel op welke van uw gegevens van toepassing is.
Waar de overstelkosten zich daadwerkelijk bevinden
Het vervangen van één tekst‑generatie‑aanroep door een andere is een weekendtaak. Daarom is “we zijn multi‑model” zo’n goedkope uitspraak. De dure lagen zijn diegenen die niemand demonstreert.
Inbeddingen. Het wijzigen van de inbedding model vereist doorgaans het opnieuw inbedden van de corpus en het migreren of herbouwen van de index. Een wijziging van generatie model heeft geen dergelijke vereiste, en de twee raken voortdurend verward — meestal door degene die belooft dat de migratie snel zal zijn. De literatuur uit 2025 beschrijft het standaardpad als “het opnieuw coderen van de volledige corpus en het herbouwen van de Approximate Nearest Neighbor (ANN) index, wat leidt tot aanzienlijke operationele verstoringen en computatiekosten”; de eigen bijdrage van dat paper, Drift-Adapter, is een methode om uitstellen van de herbouwing door een transformatie tussen inbeddingsruimtes te leren. Hoe dan ook, de migratiekosten dekken zowel validatie van ophalen als operationeel werk, evenals de inbeddingsaanroepen zelf.
Fijn-afgestemd gedrag. Eén zin uit Cohere’s september 2025 deprecation notice staat boven elke inkoopdesk: “Voorheen fijn-afgestelde modellen zullen niet langer toegankelijk zijn.” Gedrag waarvoor u heeft betaald, wordt beëindigd samen met het endpoint dat het hostte. Iedereen volgde het gepubliceerde proces. Uw model verdween toch.
Prompt‑ en toolgedrag. Dezelfde instructies produceren een andere toepassing op een ander model. In één bedrijfsapplicatie, onderzoekers rapporteerde dat de regressie‑passingsratio daalde van 100 % op het oorspronkelijke model naar 97,3 % op een nieuwer model met identieke prompts, en werd alleen hersteld na een bewuste prompt‑herontwerp. Testsituaties verschijnen in productie met hun eigen frequenties, waardoor dat cijfer geen schatting ondersteunt van hoe vaak live‑werkstromen falen. De operationele regel die het ondersteunt is eenvoudiger: valideer elke modelupgrade op applicatieniveau, zelf, voordat deze bij een klant terechtkomt.
Dit alles komt uiteindelijk op de factuur terecht, lang nadat de prijs‑pagina’s waren vergeleken.
Iemand anders houdt uw agenda vast
Deprecatie gebeurt volgens een gepubliceerd schema, en de schema’s zijn niet van jou. OpenAI gaf een jaar opzegtermijn voordat de Assistants API in augustus 2026 werd afgesloten – genereus volgens de normen van dezelfde pagina, waar GPT-4.5 Preview ongeveer drie maanden kreeg. Het beleid van Mistral is zes maanden voor GA-modellen en één maand voor preview- en derde‑partij‑modellen, met een waarschuwing dat een roterende alias “je kan blootstellen aan stille updates in modelgedrag en prijzen.”
AWS zegt het stille deel hardop in haar levenscyclusbeleid: “Migreer naar een Actief model vóór de EOL‑datum; migratie gebeurt niet automatisch.”
Je roadmap heeft een co‑auteur. Deze neemt nooit deel aan je planningsvergaderingen en maakt zich niet druk om in welk kwartaal je zit.
Prijs is ook een variabel onderdeel
Bij de vermelde Standaardtarieven van Gemini 3.7 Flash kosten vijf miljard ongecachete invoertokens en één miljard gefactureerde uitvoertokens $7.500 per maand. De tarieven momenteel gepland voor 1 januari 2027 zouden die tokenrekening op $15.000 brengen, vóór andere kosten of kortingen, terwijl je product precies doet wat het voorheen deed.
Een bevroren prijslijst kan ook een hogere rekening opleveren. De prijzendocumentatie van Anthropic vermeldt dat de tokenizer die door haar nieuwere modelgeneraties wordt gebruikt “ongeveer 30 % meer tokens produceert voor dezelfde tekst” – inhoudsafhankelijk en specifiek voor die generaties – waardoor het effect op een bepaalde factuur iets is dat je moet meten. Meet dus de tokens waarvoor je wordt gefactureerd. Een tariefkaart alleen vertelt je dat niet.
Voor een product dat workflows uitvoert, is de nuttige economische maatstaf de kosten van een succesvol voltooide taak, inclusief retries en menselijke beoordeling. Dat cijfer verandert wanneer een model wijzigt, zelfs als de tariefkaart dat niet doet.
En niets daarvan is onderhandelbaar vanuit een positie waarin vertrekken een jaar duurt. Capgemini ondervroeg 1.300 leidinggevenden bij organisaties met een omzet van miljarden dollars in het voorjaar van 2026 over kritieke technologische leveranciers in het algemeen: 36 % zei dat het overstappen van een leverancier meer dan twaalf maanden zou duren, en één op de tien had helemaal geen haalbaar alternatief. Dat is een beschrijving van een leveranciersrelatie zonder tweede bron.
Breng het naar Inkoop
Ik run een Frans bedrijf, geregistreerd in Marseille, gehost in Europa, en ik zal de soevereiniteitstoespraak in abstracte zin nog steeds overslaan. Onafhankelijkheid van elke technologische leverancier is onhaalbaar voor een normaal bedrijf. Dezelfde Capgemini‑studie vond dat 59 % van de leidinggevenden volledige digitale soevereiniteit onrealistisch vindt, en ik ben het met hen eens.
Het begrijpen en beheersen van je kritieke afhankelijkheden is een kleinere, maar haalbare taak. Drie vragen, die allemaal in een vergadering beantwoord kunnen worden: waar wordt onze data opgeslagen en verwerkt, wie er toegang toe heeft, en wat er nodig zou zijn om met een andere leverancier te blijven opereren?
Elk bedrijf weet hoe het die vraag moet stellen over logistiek, betalingen en cloudopslag. Als er naar de werkomgeving wordt gevraagd, komt Europese afhankelijkheid in de vergadering naar voren als een second‑source‑discussie met een bijbehorend cijfer, een vorm waarop inkoop kan reageren.
Een waarschuwing bij de cijfers die hier worden geciteerd. Het feit dat een onderneming meerdere modellen gebruikt, zegt weinig over of ze haar werkomgeving tussen leveranciers kan verplaatsen. Dat vereist een aparte test: kunnen de records, de permissies en het onafgewerkte werk worden overgedragen en nog steeds worden gebruikt?
Wat maakt een model eigenlijk verwisselbaar
Een gedeelde interface tussen modellen is nuttig, en ik zou er één bouwen. Deze moet model‑specifieke mogelijkheden en afhankelijkheden zichtbaar maken. Portabiliteit vereist geen schijn dat elk model zich op dezelfde manier gedraagt, en een abstractie die de verschillen egaliseert, verwijdert stilletjes de reden waarom je voor een goed model hebt betaald.
Het zwaardere werk is het eigenaarschap van de status, waarvan geen enkele provider de enige bewaker mag zijn. Vier zaken, in de volgorde waarin ze falen.
Een gezaghebbend record onder uw controle. Berichten, opgehaalde bronnen, goedkeuringen, uitvoercontroles. Leg vast wat in externe systemen is voltooid en wat veilig opnieuw kan worden geprobeerd: de e‑mail kan zijn verzonden terwijl de bevestiging niet is opgeslagen, en een herstelprocedure die dit niet kent, zal hem twee keer verzenden. Elke provider‑status die u niet kunt reconstrueren, is een afhankelijkheid. Noteer het als één, expliciet, voordat een incident de documentatie voor u doet.
De bron naast elke vector. Een vector is een gecompileerd artefact; de chunk is de broncode. Bewaar het brondocument en de versie, document‑ID, chunk‑grenzen, chunk‑versie, embed‑model met versie en dimensies, indexversie, en welke verwerking de tekst heeft opgeleverd. Een opgeslagen tekstdeler alleen zal geen tabel, afbeelding of OCR‑resultaat reconstrueren. Alles bewaren maakt van een herindexering een geplande migratie, wat evenveel geruststelling biedt als ik zou beloven.
Records die bron, inferentie en beslissing onderscheiden. Het geheugen moet scheiden wat een bron heeft gezegd, wat een model heeft geïnferreerd en wat een persoon heeft goedgekeurd. Een klant die belooft donderdag te betalen, een gok van een model dat de betaling zal uitlopen, en een overeengekomen uitstel tot vrijdag zijn drie verschillende records met drie verschillende statussen, en het systeem moet weten welke het mag uitvoeren. Elk record heeft zijn oorsprong, reikwijdte, toegangsregels en huidige status nodig, inclusief of het is gecorrigeerd of vervangen. Een transcript kan wel het bewijs bevatten; het opnieuw afspelen identificeert niet betrouwbaar welke conclusies nog actueel zijn en welke beslissingen nog gelden.
Draagbaarheid die je daadwerkelijk hebt getest. Maak het testbaar op twee manieren: een export‑en‑herstel‑oefening, en een evaluatiesuite die definieert wat de applicatie moet bereiken. Dan wordt “we zouden kunnen overschakelen” een meetwaarde die iemand kan uitvoeren: kan de vervanging representatieve workflows voortzetten binnen jouw eisen voor kwaliteit, permissies, latentie en kosten? En behoud de trainingsdata die je mag hergebruiken, samen met de versies, afstemmingsconfiguratie en acceptatietests. Die maken hertraining mogelijk, zonder garantie op identiek gedrag, en de fijn‑afgestemde model‑ID verloopt op een datum die is vastgesteld door iemand die je nog nooit hebt ontmoet.
Gebruik dan gehoste sessies, promptcaches en provider‑ophaling waar ze van nut zijn. Ze zijn vaak uitstekend, en ze uit principe weigeren is op zichzelf al kostbaar. De eis is dat de records die ze bevatten kunnen worden hersteld en elders kunnen worden gebruikt met hun toegangs‑ en retentieregels intact. Huur de berekening; behoud de controle over het record.
Ik zou de architectuur ook niet overschatten. Voor product‑marktfit kan het zes weken eerder uitbrengen vaak beter zijn dan welke abstractielaag dan ook, en een startup die drie ophaal‑back‑ends bouwt voordat het klanten heeft, heeft een museum gebouwd. Of die afweging juist is, hangt af van het product en de prijs van de uiteindelijke herbouw. Houd het ruwe materiaal herstelbaar en een snelkoppeling blijft een snelkoppeling.
Het Deel Dat Veranderde
Terwijl AI alleen vragen beantwoordde, was het verlies van context een ongemak. Je typte de prompt opnieuw in en ging verder. Nu boekt het de vergadering, maakt het een ticket aan en raakt het het CRM, en ontbrekende context leidt tot gedupliceerd of half afgerond werk in systemen die van jouw klanten zijn.
De modelleveranciers bouwen buitengewone dingen en ik gebruik ze dagelijks. De verantwoordelijkheid die ik beschrijf ligt bij ons die de platformen ertussen bouwen: de afhankelijkheden zichtbaar maken en een betrouwbaar record behouden van wat is geautoriseerd en wat is voltooid.
Elke voltooide workflow moet de organisatie achterlaten met iets dat opnieuw kan worden gebruikt — een geverifieerd resultaat, een beslissing met een traceerbare geschiedenis, een duidelijker startpunt voor de volgende taak. Die opgebouwde waarde moet langer meegaan dan het model dat heeft geholpen het te creëren.
Vraag wat je woensdagmorgen nog zou bezitten.












