Myslitelé

Paměť vaší společnosti by měla přežít její AI modely

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Lidé se často ptají, který model pohání mou společnost. Odpověď je důležitá: určuje kvalitu, náklady a omezení, a rád na to věnuji hodinu. Chci také vědět druhou věc: co organizace bude mít i po změně toho modelu.

Uveďte to jako datum. Kdyby váš poskytovatel v úterý zdvojnásobil cenu nebo ukončil koncový bod, na kterém jste stavěli, co byste stále vlastnili ve středu ráno?

Pro mnoho firem je upřímná odpověď: API klíč, faktura a velmi dlouhá historie konverzací uložená na serverech někoho jiného podle jeho plánu uchovávání dat.

Mám vzdělání v chemii. Strávil jsem roky budováním šedých krabicových modelů pro chemické závody, propojených se SCADA, laboratorními výsledky a poznámkami operátora. Tato práce rychle učí jedno pravidlo: číslo bez svých podmínek není výsledek. Pokud někdo minulý týden vyměnil senzor a nikdo to nezapsal, odečet na obrazovce nic nevysvětluje.

Jedná se o problém laboratorního zápisníku. Nyní se objevuje jako problém nákupu a zřídka se objeví v rozpočtovém listu, kde se rozhoduje o rozpočtu na AI.

Tři otázky, na které se odpovídá najednou

Větší kontextové okno umožňuje modelu použít více informací v rámci jedné žádosti. Trvalé úložiště určuje, co přežije mezi požadavky. Přenositelnost určuje, zda jsou tyto informace nadále použitelné při změně poskytovatele. Jedná se o samostatné architektonické otázky a okno s miliónem tokenů podnítilo všechny, aby je považovali za jedno.

Google vlastní dokumentace nabízí analýzu přímo: „Analogií pro kontextové okno je krátkodobá paměť.“ Vezměte to doslovně. Krátkodobá paměť je to, co ztrácíte.

Takže každý dodavatel, který prodává obrovské okno, také prodává něco samostatného pro uchování stavu. Přečtěte si tyto vrstvy úzce, v jejich vlastních slovech, a zaznamenejte, co každá z nich skutečně pokrývá.

OpenAI ve výchozím nastavení ukládá objekty Response po dobu 30 dnů; Objekty konverzace a jejich položky jsou z tohoto TTL vyjmuty. Amazonova 30denní smazání se vztahuje na Bedrock Session Management API a pokrývá pouze toto rozhraní. Anthropicův nástroj pro paměť na straně klienta ilustruje užitečnou hranici: model požaduje operace s pamětí, aplikace řídí úložiště, zatímco stejná společnost také poskytuje spravované úložiště paměti pro své hostované agenty.

Všechny tyto jsou běžná inženýrská rozhodnutí, zveřejněná otevřeně. To také znamená, že pravidla uchovávání pro pracovní kontext vaší společnosti jsou obsažena v poznámkách k vydání někoho jiného, a měli byste být schopni pojmenovat, které pravidlo se vztahuje na která vaše data.

Kde se skutečně skrývají náklady na přepnutí

Výměna jednoho volání pro generování textu za jiné trvá celý víkend. Proto je fráze „jsme multi-model“ tak levná na říkání. Nákladné vrstvy jsou ty, které nikdo neukazuje.

Vkládání. Změna vkládání model obvykle vyžaduje opětovné vkládání korpusu a migraci nebo přestavbu indexu. Změna generace model nevyžaduje takový požadavek a oba se neustále pletou — obvykle tím, kdo slibuje rychlou migraci. Literatura z roku 2025 popisuje standardní cestu jako “překódování celého korpusu a přestavba indexu Approximate Nearest Neighbor (ANN), což vede k významnému provoznímu narušení a výpočetním nákladům”; příspěvek tohoto článku, Drift-Adapter, je metoda pro odkládání přestavbu učením transformace mezi prostory vkládání. Každopádně náklady na migraci zahrnují validaci vyhledávání a provozní práci stejně jako samotné volání vkládání.

Chování po jemném doladění. Jedna věta od Cohere oznámení o ukončení podpory ze září 2025 patří nad každou nákupní kancelář: “Dříve doladěné modely již nebudou přístupné.” Chování, za které jste zaplatili, bylo ukončeno spolu s koncovým bodem, který jej hostoval. Všichni dodrželi zveřejněný proces. Váš model přesto zmizel.

Chování výzev a nástrojů. Stejné instrukce vytvářejí jinou aplikaci na jiném modelu. V jedné podnikově aplikaci výzkumníci hlásili pokles úspěšnosti regresního testu z 100 % na původním modelu na 97,3 % na novějším modelu se stejnými výzvami, obnoveno až po úmyslném přepracování výzvy. Testovací scénáře se v produkci objevují s vlastní frekvencí, takže tento údaj nepodporuje žádný odhad, jak často selhávají živé pracovní postupy. Provozní pravidlo, které podporuje, je jednodušší: ověřte každou aktualizaci modelu na úrovni aplikace sami, než se dostane ke klientovi.

Vše toto nakonec skončí na faktuře, dlouho po tom, co byly porovnány stránky s cenami.

Někdo jiný drží váš kalendář

Ukončování (deprecace) probíhá podle zveřejněného plánu a tyto plány nejsou vaše. OpenAI dal roční výpověď před vypnutím Assistants API v srpnu 2026 – štědré podle standardů téže stránky, kde GPT‑4.5 Preview dostalo asi tři měsíce. Mistralova politika je šest měsíců pro GA modely a jeden měsíc pro preview a třetí strany, s varováním, že se „rolující alias může vystavit tichým aktualizacím chování modelu a cenám.“

AWS říká tichou část nahlas ve své politice životního cyklu: „Přesuňte se na aktivní model před datem konce podpory; migrace se neuskuteční automaticky.“

Vaše roadmapa má spoluautora. Nikdy se neúčastní vašich plánovacích schůzek a nezajímá ho, ve kterém čtvrtletí se nacházíte.

Cena je také proměnnou součástí

U Gemini 3.7 Flash jsou uvedené standardní sazby – pět miliard nevyrovnaných vstupních tokenů a jedna miliarda fakturovaných výstupních tokenů stojí 7 500 $ měsíčně. Sazby aktuálně naplánované k 1. lednu 2027 by tuto fakturu za tokeny zvýšily na 15 000 $, před dalšími poplatky nebo slevami, zatímco váš produkt dělá přesně to, co dříve.

Zmražený ceník může také vést k vyšší účtence. Anthropicova dokumentace o cenách uvádí, že tokenizér používaný novějšími generacemi modelů „produkuje přibližně o 30 % více tokenů pro stejný text“ – závislé na obsahu a specifické pro tyto generace – což znamená, že dopad na konkrétní fakturu musíte měřit. Takže změřte tokeny, za které jste fakturováni. Samotná ceníková karta vám to neřekne.

U produktu, který spouští pracovní postupy, je užitečným ekonomickým měřítkem náklad na úspěšně dokončený úkol, včetně opakování a lidské kontroly. Toto číslo se mění, když se model změní, i když ceníková karta zůstane stejná.

A nic z toho není vyjednatelné z pozice, kde odchod trvá rok. Capgemini provedl průzkum mezi 1 300 manažery v organizacích s miliardovými obraty na jaře 2026 ohledně kritických dodavatelů technologií obecně: 36 % uvedlo, že přechod od jednoho by trval více než dvanáct měsíců, a jeden z deseti neměl vůbec žádnou životaschopnou alternativu. Jedná se o popis vztahu k dodavateli bez druhého zdroje.

Předejte to nákupu

Vedu francouzskou společnost, registrovanou v Marseille, hostovanou v Evropě, a přesto vynechám řeč o suverenitě v abstraktu. Nezávislost na každém dodavateli technologií je pro běžnou firmu nedosažitelná. Stejná studie Capgemini zjistila, že 59 % manažerů považuje úplnou digitální suverenitu za nerealistickou, a já s nimi souhlasím.

Pochopení a řízení vašich kritických závislostí je menší úkol a je proveditelný. Tři otázky, na které lze odpovědět během schůzky: kde jsou naše data uložena a zpracovávána, kdo k nim má přístup a co by bylo potřeba k pokračování provozu s jiným poskytovatelem?

Každá firma ví, jak se na to ptát v souvislosti s logistikou, platbami a cloudovým úložištěm. Když se zeptáte na pracovní kontext, evropská závislost se na schůzce objeví jako diskuse o druhém zdroji s připojeným číslem, což je forma, na kterou může nákup reagovat.

Jedno varování ohledně čísel, která lidé zde citují. To, že podnik používá několik modelů, nám málo říká o tom, zda může přesunout svůj pracovní kontext mezi poskytovateli. To vyžaduje samostatný test: lze přenést záznamy, oprávnění a nedokončenou práci a stále je využít?

Co ve skutečnosti umožňuje vyměnitelnost modelu

Sdílené rozhraní napříč modely je užitečné a rád bych ho vytvořil. Mělo by zobrazovat specifické schopnosti a závislosti modelu. Přenositelnost nevyžaduje předstírání, že se každý model chová stejně, a abstrakce, která rozdíly vyhlazuje, tiše odstraňuje důvod, proč jste zaplatili za kvalitní model.

Těžší práce spočívá ve vlastnictví stavu, který by žádný poskytovatel neměl být jediným správcem. Čtyři věci v pořadí, v jakém selhávají.

Autoritativní záznam pod vaší kontrolou. Zprávy, získané zdroje, schválení, kontrolní body provedení. Zaznamenejte, co bylo dokončeno v externích systémech a co lze bezpečně zopakovat: e‑mail mohl být odeslán, zatímco potvrzení se neuložilo, a procedura obnovy, která to neví, jej odešle dvakrát. Jakýkoli stav poskytovatele, který nedokážete zrekonstruovat, je závislostí. Zapište jej jako jednu položku, explicitně, dříve než incident udělá dokumentaci za vás.

Zdroj vedle každého vektoru. Vektor je zkompilovaný artefakt; chunk je zdrojový kód. Uložte zdrojový dokument a jeho verzi, ID dokumentu, hranice chunku, verzi chunkeru, model vkládání s verzí a rozměry, verzi indexu a to, jaké zpracování vytvořilo text. Samotný uložený úryvek textu neobnoví tabulku, obrázek ani výsledek OCR. Uchovávání všeho promění přeindexování na plánovanou migraci, což je taková míra jistoty, jakou bych slíbil.

Záznamy, které rozlišují zdroj, inferenci a rozhodnutí.Paměť musí oddělit, co zdroj řekl, co model inferoval a co osoba schválila. Klient slibující platbu ve čtvrtek, odhad modelu, že platba se zpozdí, a dohodnuté prodloužení do pátku jsou tři různé záznamy se třemi různými stavy a systém musí vědět, na který může reagovat. Každý potřebuje svůj původ, rozsah, pravidla přístupu a aktuální stav, včetně toho, zda byl opraven nebo nahrazen. Přepis může dobře obsahovat důkazy; jeho opakované přehrání spolehlivě neidentifikuje, které závěry jsou stále aktuální a která rozhodnutí stále platí.

Přenositelnost, kterou jste skutečně otestovali.Udělejte to testovatelné dvěma způsoby: export‑restore cvičením a evaluační sadou definující, co má aplikace dosáhnout. Pak se „mohli bychom přepnout“ stane měřením, které může někdo provést: dokáže náhrada pokračovat ve reprezentativních pracovních postupech v rámci vašich požadavků na kvalitu, oprávnění, latenci a náklady? A zachovejte tréninková data, která máte právo znovu použít, spolu s jejich verzemi, konfigurací ladění a akceptačními testy. To umožňuje opětovné trénování, bez záruky stejného chování, a ID vyladěného modelu vyprší k datu nastavenému někým, koho jste nikdy nepotkali.

Pak použijte hostované relace, mezipaměti výzev a získávání od poskytovatele, kdekoliv pomáhají. Často jsou vynikající a odmítání je z principu je samo o sobě drahé. Požadavek je, aby záznamy, které drží, mohly být obnoveny a použity jinde se zachovanými pravidly přístupu a uchovávání. Pronajměte výpočet; zachovejte kontrolu nad záznamem.

Nepřeháněl bych ani architekturu. Před dosažením produkt‑tržní shody často doručení o šest týdnů dříve překoná jakoukoli abstrahovací vrstvu a startup, který postaví tři vyhledávací backendy, než má zákazníky, postavil muzeum. Zda je tato výměna správná, závisí na produktu a na ceně následné přestavby. Udržujte surový materiál obnovitelný a zkratka zůstane zkratkou.

Část, která se změnila

Zatímco AI jen odpovídala na otázky, ztráta kontextu byla nepříjemnost. Přepsali jste výzvu a pokračovali dál. Nyní rezervuje schůzku, vytvoří tiket a zasáhne do CRM a chybějící kontext vede k duplicitní nebo nedokončené práci v systémech, které patří vašim zákazníkům.

Dodavatelé modelů vytvářejí mimořádné věci a já je používám denně. Odpovědnost, kterou popisuji, leží na nás, kteří stavíme platformy mezi nimi: učinit závislosti viditelnými a zachovat spolehlivý záznam toho, co bylo schváleno a co bylo dokončeno.

Každý dokončený pracovní tok by měl organizaci zanechat něco, co může znovu použít – ověřený výsledek, rozhodnutí s dohledatelnou historií, jasnější výchozí bod pro další úkol. Tato nahromaděná hodnota by měla přežít model, který ji pomohl vytvořit.

Zeptejte se, co byste stále vlastnili ve středu ráno.

Ilia Razvin je zakladatel a generální ředitel IOSYA, platforma pro obchodní produktivitu a automatizaci pracovních postupů s umělou inteligencí. Dříve vyvíjel modely procesů typu grey-box a rozhodovací podporné systémy pro chemickou výrobu a má titul Master 2 v mikrosenzorech a detekčních systémech z Aix-Marseille Université.