Tankeledere

Bedriftens minne bør vare lenger enn AI-modellene

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Folk spør ofte hvilken modell som driver selskapet mitt. Svaret er viktig: det bestemmer kvalitet, kostnad og begrensninger, og jeg bruker gjerne en time på det. Jeg vil også vite en annen ting: hva organisasjonen fortsatt vil ha når den modellen endres.

Tenk på det som en dato. Hvis leverandøren din doblet prisen på en tirsdag, eller avviklet endepunktet du bygde på, hva ville du fortsatt eie onsdag morgen?

For mange selskaper er det ærlige svaret: en API-nøkkel, en faktura og en svært lang samtalehistorikk som ligger på andres servere under andres lagringsplan.

Bakgrunnen min er kjemi. Jeg tilbrakte år med å bygge grå‑boks-modeller for kjemiske anlegg, koblet til SCADA, laboratorieresultater og operatørens egne notater. Det arbeidet lærer én regel raskt: et tall uten sine betingelser er ikke et resultat. Hvis noen byttet en sensor forrige uke og ingen skrev det ned, forklarer avlesningen på skjermen ingenting.

Det er et labjournalproblem. Det dukker nå opp som et anskaffelsesproblem, og det er sjelden på arket hvor AI-budsjettet blir besluttet.

Tre spørsmål som besvares som ett

Et større kontekstvindu lar en modell bruke mer informasjon i én enkelt forespørsel. Holdbar lagring bestemmer hva som overlever mellom forespørsler. Portabilitet avgjør om den informasjonen fortsatt er brukbar når leverandøren byttes. Dette er separate arkitekturelle spørsmål, og vinduet på en million token oppmuntret alle til å behandle dem som ett.

Googles egen dokumentasjon tilbyr analogen direkte: «En analogi for kontekstvinduet er korttidsminne». Ta det bokstavelig. Korttidsminnet er det du mister.

Så hver leverandør som selger et enormt vindu, selger også noe separat for å vedvare tilstand. Les disse lagene nøye, i deres egne ord, og merk hva hvert lag faktisk dekker.

OpenAI lagrer Response-objekter i 30 dager som standard; Samtaleobjekter og deres elementer er unntatt fra den TTL-en. Amazons 30-dagers sletting gjelder Bedrock Session Management API, og dekker kun dette API-et. Anthropics klient‑sidige minneverktøy illustrerer en nyttig grense: modellen ber om minneoperasjoner, applikasjonen kontrollerer lagringen, mens samme selskap også leverer administrerte minnelagre for sine hostede agenter.

Alle disse er vanlige ingeniørbeslutninger, publisert åpent. De betyr også at lagringsreglene for selskapets arbeidskontekst lever i andres utgivelsesnotater, og du bør kunne navngi hvilken regel som gjelder for hvilke av dine data.

Hvor byttekostnaden faktisk ligger

Å bytte ett tekstgenereringskall med et annet tar en helg. Det er derfor «vi er multimodell» er så lett å si. De kostbare lagene er de ingen demonstrerer.

Innebygginger. Endrer innbygging modell krever vanligvis at korpuset re‑innbygges og at indeksen migreres eller bygges på nytt. En endring av generasjons modell har ikke et slikt krav, og de to blir konstant forvekslet — vanligvis av den som lover at migreringen vil gå raskt. Litteraturen fra 2025 beskriver standardveien som “re‑koding av hele korpuset og gjenoppbygge Approximate Nearest Neighbor (ANN)-indeksen, noe som fører til betydelig operasjonell forstyrrelse og beregningskostnad”; papirens egen bidrag, Drift-Adapter, er en metode for utsetter gjenoppbyggingen ved å lære en transformasjon mellom innbyggingsrom. Uansett dekker migrasjonskostnaden validering av gjenfinning og operasjonelt arbeid så vel som selve innbyggings‑kallene.

Finjustert oppførsel. En setning fra Cohere’s september 2025 avskrivningsvarsel tilhører over hver anskaffelsesdesk: “Tidligere finjusterte modeller vil ikke lenger være tilgjengelige.” Oppførselen du betalte for å skape, ble pensjonert sammen med endepunktet som hostet den. Alle fulgte den publiserte prosessen. Modellen din forsvant likevel.

Prompt‑ og verktøyoppførsel. De samme instruksjonene gir en annen applikasjon på en annen modell. I en bedriftsapplikasjon rapporterte forskere rapporterte at regresjonspassraten falt fra 100 % på den opprinnelige modellen til 97,3 % på en nyere med identiske prompts, og ble kun gjenopprettet etter bevisst omdesign av prompten. Testscenarioer dukker opp i produksjon med sine egne frekvenser, så dette tallet gir ingen estimat på hvor ofte live‑arbeidsflyter feiler. Den operative regelen den støtter er enklere: valider hver modelloppgradering på applikasjonsnivå, selv, før den når en kunde.

Alt dette ender opp på fakturaen til slutt, lenge etter at prisingssidene ble sammenlignet.

Noen andre holder kalenderen din

Utdatert kjøring følger en publisert tidsplan, og tidsplanene er ikke dine. OpenAI ga ett års varsel før de stengte Assistants API i august 2026 – generøst etter standardene på samme side, hvor GPT-4.5 Preview fikk omtrent tre måneder. Mistral’s policy er seks måneder for GA-modeller og én måned for forhåndsvisnings- og tredjepartsmodeller, med en advarsel om at et rullende alias «kan eksponere deg for stille oppdateringer i modelladferd og prisfastsettelse».

AWS sier den stille delen høyt i sin livssykluspolicy: «Migrer til en aktiv modell før EOL-datoen; migrering vil ikke skje automatisk».

Din veikart har en medforfatter. Den deltar aldri på planleggingsmøtene dine og bryr seg ikke om hvilket kvartal du er i.

Pris er også en bevegelig del

På Gemini 3.7 Flash sine oppførte standardpriser koster fem milliarder ukatalogiserte inntokener og én milliard fakturerte utgangstoken $7 500 per måned. Prisene for tiden planlagt for 1. januar 2027 vil doble tokenregningen til $15 000, før andre avgifter eller rabatter, mens produktet ditt gjør akkurat det det gjorde før.

En frosset prisliste kan også gi en større regning. Anthropic sin prisdokumentasjon bemerker at tokenisereren som brukes av de nyere modellgenerasjonene «produserer omtrent 30 % flere token for samme tekst» – innholdsavhengig og spesifikk for de generasjonene – noe som gjør effekten på en gitt faktura til noe du må måle. Så mål tokenene du blir fakturert for. Et pristabell alene vil ikke fortelle deg.

For et produkt som kjører arbeidsflyter er den nyttige økonomiske målingen kostnaden for en vellykket fullført oppgave, inkludert gjentakelser og menneskelig gjennomgang. Det tallet endres når en modell endres, selv om prisarket ikke gjør det.

Også ingenting av dette er forhandlingsbart fra en posisjon der å forlate tar ett år. Capgemini undersøkte 1,300 ledere i milliard-dollarorganisasjoner våren 2026 om kritiske teknologileverandører generelt: 36 % sa at det å bytte fra en leverandør ville ta mer enn tolv måneder, og én av ti hadde ingen levedyktig alternativ i det hele tatt. Det er en beskrivelse av et leverandørforhold uten sekundær kilde.

Ta det til innkjøp

Jeg driver et fransk selskap, registrert i Marseille, hostet i Europa, og jeg vil fortsatt hoppe over suverenitetstalen i abstrakt. Uavhengighet fra hver teknologileverandør er utenfor rekkevidde for et vanlig selskap. Den samme Capgemini‑studien fant at 59 % av lederne anser full digital suverenitet som urealistisk, og jeg er enig med dem.

Forståelse og kontroll av dine kritiske avhengigheter er en mindre oppgave, og en mulig en. Tre spørsmål, alle svarbare i et møte: Hvor lagres og behandles dataene våre, hvem kan få tilgang til dem, og hva vil det kreve for å fortsette driften med en annen leverandør?

Hvert selskap vet hvordan man stiller dette spørsmålet om logistikk, betalinger og skylagring. Når man spør om arbeidskontekst, kommer europeisk avhengighet inn i møtet som en diskusjon om sekundær kilde med et tall knyttet, noe innkjøp kan handle på.

En advarsel om tallene folk siterer her. At en virksomhet bruker flere modeller forteller oss lite om den kan flytte sin arbeidskontekst mellom leverandører. Det krever en egen test: kan rekordene, tillatelsene og det ufullstendige arbeidet overføres og fortsatt brukes?

Hva som faktisk gjør en modell utskiftbar

Et delt grensesnitt på tvers av modeller er nyttig, og jeg ville bygget et slikt. Det bør gjøre modellspesifikke funksjoner og avhengigheter synlige. Portabilitet krever ingen påskudd om at alle modeller oppfører seg likt, og en abstraksjon som jevner ut forskjellene, fjerner stille grunnen til at du betalte for en god modell.

Det tyngre arbeidet er å eie tilstanden som ingen leverandør bør være eneste forvalter av. Fire ting, i den rekkefølgen de svikter.

En autoritativ post under din kontroll. Meldinger, hentede kilder, godkjenninger, utførelsespunkter. Registrer hva som ble fullført i eksterne systemer og hva som trygt kan gjentas: e-posten kan ha blitt sendt mens bekreftelsen feilet å lagres, og en gjenopprettingsprosedyre som ikke kjenner til dette vil sende den to ganger. Enhver leverandørtilstand du ikke kan rekonstruere er en avhengighet. Skriv den ned som én, eksplisitt, før en hendelse dokumenterer den for deg.

Kilden ved siden av hver vektor. En vektor er et kompilert artefakt; chunken er kildekoden. Lagre kilde‑dokumentet og dets versjon, dokument‑ID, chunk‑grenser, chunk‑versjon, embed‑modell med versjon og dimensjoner, indeksversjon, og hvilken prosess som produserte teksten. Et lagret tekstfragment alene vil ikke rekonstruere en tabell, et bilde eller et OCR‑resultat. Å beholde alt dette gjør en re‑indeksering til en planlagt migrasjon, noe som gir like mye trygghet som jeg ville love.

Poster som skiller kilde, inferens og beslutning. Hukommelsen må skille hva en kilde har sagt, hva en modell har inferert, og hva en person har godkjent. En kunde som lover å betale på torsdag, en modells gjetning om at betalingen vil bli forsinket, og en avtalt forlengelse til fredag er tre ulike poster med tre ulike statusser, og systemet må vite hvilken av dem det kan handle på. Hver av dem trenger sin opprinnelse, omfang, tilgangsregler og nåværende status, inkludert om den er korrigert eller erstattet. Et transkript kan godt inneholde bevisene; å spille det av igjen identifiserer ikke pålitelig hvilke konklusjoner som fortsatt er aktuelle og hvilke beslutninger som fortsatt gjelder.

Portabilitet du faktisk har testet. Gjør det testbart på to måter: en eksport‑og‑gjenopprettingsøvelse, og en evalueringspakke som definerer hva applikasjonen skal oppnå. Så blir \”vi kunne bytte\” en måling noen kan kjøre: kan erstatningen opprettholde representative arbeidsflyter innenfor dine krav til kvalitet, tillatelser, latenstid og kostnad? Og bevar treningsdataene du har rett til å gjenbruke, sammen med deres versjoner, justeringskonfigurasjon og akseptansetester. Disse gjør ny‑trening mulig, uten garanti for identisk oppførsel, og den finjusterte modell‑ID‑en utløper på en dato satt av noen du aldri har møtt.

Bruk deretter hostede økter, prompt‑hurtiglagre og leverandør‑gjenfinning hvor de hjelper. De er ofte utmerkede, og å avvise dem av prinsipp er sin egen form for kostbart. Kravet er at postene de inneholder kan gjenopprettes og brukes andre steder med deres tilgangs‑ og lagringsregler intakte. Lei beregningen; behold kontrollen over posten.

Jeg ville heller ikke overselge arkitekturen. Før produkt‑marked‑passform er det ofte bedre å levere seks uker tidligere enn noen abstraksjonslag, og en oppstart som bygger tre gjenfinning‑bakender før den har kunder, har bygget et museum. Om den handelen er riktig avhenger av produktet og prisen på den eventuale ombyggingen. Hold råmaterialet gjenopprettbart, og en snarvei forblir en snarvei.

Den delen som endret seg

Mens AI bare svarte på spørsmål, var tap av kontekst en ulempe. Du tastet inn prompten på nytt og fortsatte. Nå booker den møtet, oppretter saken og berører CRM‑systemet, og manglende kontekst fører til duplisert eller halvferdig arbeid i systemer som tilhører kundene dine.

Modellleverandørene bygger ekstraordinære ting, og jeg bruker dem daglig. Ansvarligheten jeg beskriver ligger hos oss som bygger plattformene i mellom: å gjøre avhengighetene synlige og bevare en pålitelig oversikt over hva som ble autorisert og hva som ble fullført.

Hver fullførte arbeidsflyt bør etterlate organisasjonen med noe den kan bruke igjen – et verifisert resultat, en beslutning med sporbar historikk, et klarere utgangspunkt for neste oppgave. Den akkumulerte verdien bør overleve modellen som hjalp til med å skape den.

Spør hva du fortsatt ville eie onsdag morgen.

Ilia Razvin er grunnlegger og administrerende direktør i IOSYA, en plattform for forretningsproduktivitet og AI‑arbeidsflytautomatisering. Han har tidligere bygget grey‑box prosessmodeller og beslutningsstøttesystemer for kjemisk produksjon, og har en Master 2 i mikrosensorer og deteksjonssystemer fra Aix‑Marseille Université.