Tankeledere

Din virksomheds hukommelse bør overleve sine AI-modeller

mm
Føj Unite.AI til dine foretrukne kilder på Google

Folk spørger ofte, hvilken model der driver min virksomhed. Svaret betyder noget: det fastsætter kvalitet, omkostninger og begrænsninger, og jeg er villig til at bruge en time på det. Jeg vil også vide en anden ting: hvad organisationen stadig vil have, når den model skifter.

Sæt det som en dato. Hvis din leverandør fordoblede prisen på en tirsdag, eller pensionerede den endpoint, du byggede på, hvad ville du så stadig eje onsdag morgen?

For mange virksomheder er det ærlige svar: en API‑nøgle, en faktura og en meget lang samtalehistorik, der ligger på en andens servere under en andens opbevaringsplan.

Min baggrund er kemi. Jeg tilbragte år med at bygge grey‑box‑modeller for kemianlæg, koblet til SCADA, laboratorieresultater og operatørens egne noter. Det arbejde lærer én regel hurtigt: et tal uden sine betingelser er ikke et resultat. Hvis nogen udskiftede en sensor i sidste uge, og ingen skrev det ned, forklarer skærmavlæsningen intet.

Det er et laboratoriebog‑problem. Det dukker nu op som et indkøbsproblem, og det er sjældent på den side, hvor AI‑budgettet beslutes.

Tre spørgsmål, der besvares som ét

Et større kontekstvindue giver en model mulighed for at bruge mere information inden for en enkelt forespørgsel. Holdbar lagring bestemmer, hvad der overlever mellem forespørgsler. Portabilitet afgør, om den information forbliver brugbar, når leverandøren skifter. Dette er separate arkitektoniske spørgsmål, og million‑token‑vinduet har fået alle til at behandle dem som ét.

Googles egen dokumentation tilbyder analogen direkte: “En analogi for kontekstvinduet er korttidshukommelse.” Tag det bogstaveligt. Korttidshukommelse er det, du mister.

Så hver leverandør, der sælger et enormt vindue, sælger også noget separat til at vedvare tilstand. Læs de lag nøje, i deres egne ord, og bemærk, hvad hvert enkelt faktisk dækker.

OpenAI gemmer Response‑objekter i 30 dage som standard; Samtaleobjekter og deres elementer er undtaget fra den TTL. Amazons 30‑dages sletning gælder for Bedrock Session Management API, og dækker kun den API. Anthropic’s klient‑side hukommelsesværktøj illustrerer en nyttig grænse: modellen anmoder om hukommelsesoperationer, applikationen kontrollerer lagringen, mens samme virksomhed også leverer administrerede hukommelseslagre til sine hostede agenter.

Alle disse er almindelige ingeniørbeslutninger, offentliggjort åbent. De betyder også, at opbevaringsreglerne for din virksomheds arbejds‑kontekst lever i en andens udgivelsesnoter, og du bør kunne navngive, hvilken regel der gælder for hvilke af dine data.

Hvor omkostningerne ved skiftet faktisk ligger

At udskifte et tekstgenereringskald med et andet er en weekendopgave. Det er derfor, “vi er multi‑model” er så let at sige. De dyre lag er dem, ingen demonstrerer.

Indlejringer. Ændring af indlejring model kræver typisk genindlejrering af korpuset og migrering eller genopbygning af indekset. En ændring af generering model medfører ingen sådan krav, og de to forveksles konstant — typisk af dem, der lover, at migreringen vil være hurtig. Litteraturen fra 2025 beskriver den standardmæssige vej som “genkodning af hele korpuset og genopbygning af Approximate Nearest Neighbor (ANN)-indekset, hvilket fører til betydelige driftsforstyrrelser og beregningsomkostninger”; dette papers egen bidrag, Drift-Adapter, er en metode til udsættelse af genopbygningen ved at lære en transformation mellem indlejringsrum. På begge måder dækker migrationsomkostningerne validering af genfinding samt driftsarbejde såvel som selve indlejrings‑opkaldene.

Finjusteret adfærd. En sætning fra Cohere’s september 2025 deprecationsmeddelelse tilhører over hver indkøbsdesk: “Tidligere finjusterede modeller vil ikke længere være tilgængelige.” Adfærd du betalte for at skabe, pensioneret sammen med den endpoint, der hostede den. Alle fulgte den offentliggjorte proces. Din model forsvandt alligevel.

Prompt- og værktøjsadfærd. De samme instruktioner giver en anden applikation på en anden model. I en virksomhedsapplikation rapporterede forskere rapportere, at regressionsbeståelsesraten falder fra 100 % på den oprindelige model til 97,3 % på en nyere med identiske prompts, kun genoprettet efter bevidst prompt‑omdesign. Testscenarier forekommer i produktion med deres egne frekvenser, så tallet understøtter ingen estimering af, hvor ofte live‑arbejdsprocesser fejler. Den operationelle regel, den understøtter, er enklere: valider hver modelopgradering på applikationsniveauet selv, før den når en kunde.

Alt dette ender på fakturaen til sidst, længe efter at pris‑siderne blev sammenlignet.

En anden holder din kalender

Udfasning kører efter en offentliggjort tidsplan, og tidsplanerne er ikke dine. OpenAI gav et års varsel før de lukkede Assistants API i august 2026 – generøst efter standarderne på samme side, hvor GPT‑4.5 Preview fik omkring tre måneder. Mistrals politik er seks måneder for GA‑modeller og én måned for preview‑ og tredjepartsmodeller, med en advarsel om at et rullende alias “kan udsætte dig for stille opdateringer i modellens adfærd og prisfastsættelse.”

AWS siger den stille del højt i sin livscyklus‑politik: “Migrer til en aktiv model før EOL‑datoen; migration vil ikke ske automatisk.”

Din roadmap har en medforfatter. Den deltager aldrig i dine planlægningsmøder og er ligeglad med hvilket kvartal du er i.

Pris er også en bevægelig del

Ved Gemini 3.7 Flash’s oplyste standardpriser koster fem milliarder ukodede input‑tokens og en milliard fakturerede output‑tokens $7.500 pr. måned. De aktuelt planlagte priser for 1. januar 2027 ville løfte den token‑regning til $15.000 før andre gebyrer eller rabatter, mens dit produkt gør præcis det, det gjorde før.

En frosset prisliste kan også give en større regning. Anthropics prisdokumentation bemærker, at tokenizeren, der bruges af deres nyere modelgenerationer, “producerer cirka 30 % flere tokens for den samme tekst” – indholdsafhængig og specifik for de generationer – hvilket gør effekten på en given faktura til noget, du selv skal måle. Så mål de tokens, du faktureres for. Et prisark alene vil ikke fortælle dig det.

For et produkt, der kører arbejdsprocesser, er den nyttige økonomiske måling omkostningen for en succesfuldt gennemført opgave, inklusive genforsøg og menneskelig gennemgang. Det tal ændrer sig, når en model skifter, selvom prisarket ikke gør.

Og intet af det er forhandlingsbart fra en position, hvor det tager et år at forlade. Capgemini undersøgte 1.300 ledere i milliard-dollar‑organisationer i foråret 2026 om kritiske teknologileverandører generelt: 36 % sagde, at det ville tage mere end tolv måneder at skifte fra én, og én ud af ti havde ingen levedygtig alternativ overhovedet. Det er en beskrivelse af et leverandørforhold uden en sekundær kilde.

Tag det til indkøb

Jeg driver et fransk selskab, registreret i Marseille, hostet i Europa, og jeg vil stadig springe suverænitetstalen over i abstrakt. Uafhængighed fra hver teknologileverandør er uden for rækkevidde for en normal virksomhed. Den samme Capgemini‑undersøgelse fandt, at 59 % af lederne anser fuld digital suverænitet som urealistisk, og jeg er enig med dem.

At forstå og kontrollere dine kritiske afhængigheder er en mindre opgave, og en mulig en. Tre spørgsmål, som alle kan besvares på et møde: hvor lagres og behandles vores data, hvem kan få adgang til den, og hvad vil det kræve at fortsætte driften med en anden leverandør?

Alle virksomheder ved, hvordan man stiller det spørgsmål om logistik, betalinger og cloud‑lagring. Når man spørger om arbejdskonteksten, fremkommer den europæiske afhængighed på mødet som en sekundær‑kilde‑diskussion med et tal knyttet til, hvilket er en form, som indkøb kan handle på.

En forbehold ved de tal, folk citerer her. At en virksomhed bruger flere modeller fortæller os lidt om, hvorvidt den kan flytte sin arbejdskontekst mellem leverandører. Det kræver en separat test: kan registreringerne, tilladelserne og det uafsluttede arbejde overføres og stadig bruges?

Hvad der egentlig gør en model udskiftelig

Et delt interface på tværs af modeller er nyttigt, og jeg ville bygge et. Det bør gøre model‑specifikke funktioner og afhængigheder synlige. Portabilitet kræver ingen påskud om, at alle modeller opfører sig ens, og en abstraktion, der udligner forskellene, fjerner stille den grund, du betalte for en god model.

Det tungere arbejde er at eje tilstanden, som ingen leverandør bør være den eneste forvalter af. Fire ting, i den rækkefølge de fejler.

En autoritativ registrering under din kontrol. Meddelelser, hentede kilder, godkendelser, udførelses‑kontrolpunkter. Registrer hvad der blev fuldført i eksterne systemer, og hvad der sikkert kan genforsøges: e‑mailen kan være sendt, mens bekræftelsen ikke blev gemt, og en gendannelsesprocedure, der ikke kender dette, vil sende den to gange. Enhver leverandørtilstand, du ikke kan genskabe, er en afhængighed. Skriv den ned som én, eksplicit, før en hændelse dokumenterer den for dig.

Kilden ved siden af hver vektor. En vektor er et kompileret artefakt; chunk’en er kildekoden. Gem kilde‑dokumentet og dets version, dokument‑ID, chunk‑grænser, chunk‑version, indlejringsmodel med version og dimensioner, indeks‑version, og hvilken behandling der producerede teksten. Et gemt tekst‑fragment alene vil ikke genskabe en tabel, et billede eller et OCR‑resultat. At bevare alt dette gør en gen‑indeksering til en planlagt migration, hvilket er lige så betryggende, som jeg ville love.

Registreringer, der skelner mellem kilde, inferens og beslutning. Hukommelsen skal adskille, hvad en kilde har sagt, hvad en model har infereret, og hvad en person har godkendt. En klient, der lover at betale på torsdag, en models gæt på, at betalingen vil blive forsinket, og en aftalt forlængelse til fredag er tre forskellige registreringer med tre forskellige statusser, og systemet skal vide, hvilken det kan handle på. Hver af dem har brug for sin oprindelse, omfang, adgangsregler og aktuelle status, inklusive om den er blevet korrigeret eller erstattet. Et transskript kan indeholde beviserne; at afspille det igen identificerer ikke pålideligt, hvilke konklusioner der stadig er aktuelle, og hvilke beslutninger der stadig gælder.

Portabilitet, du faktisk har testet. Gør den testbar på to måder: en eksport‑og‑gendannelsesøvelse og en evalueringssuite, der definerer, hvad applikationen skal opnå. Derefter bliver “vi kunne skifte” til en måling, nogen kan udføre: kan erstatningen fortsætte repræsentative arbejdsprocesser inden for dine krav til kvalitet, tilladelser, latenstid og omkostninger? Og bevar de træningsdata, du har ret til at genbruge, sammen med deres versioner, tuning‑konfiguration og accepttest. Disse gør gen‑træning mulig, uden garanti for identisk adfærd, og den finjusterede model‑ID udløber på en dato fastsat af en person, du aldrig har mødt.

Brug derefter hosted‑sessioner, prompt‑caches og udbyder‑hentning, hvor de hjælper. De er ofte fremragende, og at afvise dem af princip er sin egen form for dyrt. Kravet er, at de poster, de indeholder, kan gendannes og bruges andre steder med deres adgangs‑ og opbevaringsregler intakte. Lej beregningen; behold kontrollen over posten.

Jeg ville heller ikke oversælge arkitekturen. Før produkt‑marked‑fit kan levering seks uger tidligere ofte slå ethvert abstractionslag, og en startup, der bygger tre hentnings‑backends, før den har kunder, har bygget et museum. Om den handel er rigtig, afhænger af produktet og prisen på den endelige genopbygning. Hold råmaterialet genvindeligt, og en genvej forbliver en genvej.

Den del, der ændrede sig

Mens AI kun besvarede spørgsmål, var tab af kontekst en gene. Du skrev prompten igen og gik videre. Nu booker den mødet, opretter sagen og rører CRM‑systemet, og manglende kontekst fører til duplikeret eller halvt færdigt arbejde i systemer, der tilhører dine kunder.

Modelleverandørerne bygger ekstraordinære ting, og jeg bruger dem dagligt. Det ansvar, jeg beskriver, ligger hos os, der bygger platformene imellem: at gøre afhængighederne synlige og bevare en pålidelig registrering af, hvad der blev godkendt, og hvad der blev fuldført.

Hver fuldført arbejdsproces bør efterlade organisationen med noget, den kan genbruge — et verificeret resultat, en beslutning med en sporbar historik, et klarere udgangspunkt for den næste opgave. Den akkumulerede værdi bør overleve den model, der hjalp med at skabe den.

Spørg, hvad du stadig ville eje onsdag morgen.

Ilia Razvin er grundlægger og administrerende direktør for IOSYA, en forretningsproduktivitet og AI-arbejdsprocesautomatiseringsplatform. Han har tidligere bygget grey-box procesmodeller og beslutningsstøttesystemer for kemisk fremstilling, og har en Master 2 i mikrosensorer og detektionssystemer fra Aix-Marseille Université.