Лідери думок

Пам’ять вашої компанії повинна пережити її AI‑моделі

mm
Додайте Unite.AI до бажаних джерел у Google

Люди часто запитують, яка модель живить мою компанію. Відповідь важлива: вона визначає якість, вартість і обмеження, і я готовий витратити на це годину. Я також хочу знати ще одне: що організація залишить після зміни цієї моделі.

Уявіть це у вигляді дати. Якщо ваш постачальник у вівторок подвоїть ціну або закриє кінцеву точку, на якій ви будували, що залишиться у вас в середу вранці?

Для багатьох компаній чесна відповідь така: ключ API, рахунок‑фактура та дуже довга історія розмов, що зберігається на серверах сторонніх компаній за їхнім графіком зберігання.

Моя спеціалізація — хімія. Я багато років будував сірі моделі для хімічних заводів, підключені до SCADA, лабораторних результатів та нотаток оператора. Ця робота швидко навчає одному правилу: число без умов не є результатом. Якщо хтось минулого тижня замінив сенсор, а ніхто це не зафіксував, показання на екрані нічого не пояснюють.

Це проблема лабораторного журналу. Тепер це стає проблемою закупівель, і рідко потрапляє у розділ, де визначається бюджет на ШІ.

Три питання, на які відповідає одне

Більше вікно контексту дозволяє моделі використовувати більше інформації в одному запиті. Надійне сховище визначає, що зберігається між запитами. Переносимість визначає, чи залишиться ця інформація придатною, коли змінюється постачальник. Це окремі архітектурні питання, і вікно у мільйон токенів спонукало всіх розглядати їх як одне.

Документація Google пропонує аналогію безпосередньо: “Аналогія вікна контексту — це короткочасна пам’ять.” Сприйміть це буквально. Короткочасна пам’ять — це те, що ви втрачаєте.

Отже, кожен постачальник, що пропонує величезне вікно, також продає окремий засіб для збереження стану. Читайте ці шари уважно, у їхніх власних словах, і зауважте, що саме кожен з них охоплює.

OpenAI зберігає об’єкти Response за замовчуванням 30 днів; Об’єкти розмов та їхні елементи не підлягають цьому TTL. 30‑денне видалення Amazon застосовується до API управління сесіями Bedrock і охоплює лише цей API. Інструмент пам’яті на боці клієнта від Anthropic ілюструє корисну межу: модель запитує операції пам’яті, додаток контролює сховище, тоді як та сама компанія також постачає керовані сховища пам’яті для своїх хостованих агентів.

Усі ці рішення — звичайні інженерні рішення, опубліковані відкрито. Це також означає, що правила зберігання контексту вашої компанії знаходяться у примітках до випуску сторонніх постачальників, і ви повинні мати можливість вказати, яке правило застосовується до яких ваших даних.

Де насправді живе вартість переключення

Заміна одного запиту на генерацію тексту іншим займає уікенд. Ось чому фраза «ми мульти‑модельні» така дешева. Дорогі шари — це ті, які ніхто не демонструє.

Вбудовування. Зміна вбудовування модель зазвичай вимагає повторного вбудовування корпусу та міграції або перебудови індексу. Зміна генерації модель не має таких вимог, і ці дві категорії постійно плутаються — зазвичай тим, хто обіцяє швидку міграцію. Література 2025 року описує стандартний шлях як “повторне кодування всього корпусу та перебудова індексу Approximate Nearest Neighbor (ANN), що призводить до значних операційних перебоїв та обчислювальних витрат”; внесок цієї статті, Drift-Adapter, — це метод для відкладення перебудови шляхом вивчення перетворення між просторами вбудовувань. У будь-якому випадку вартість міграції включає валідацію пошуку та операційну роботу, а також самі виклики вбудовувань.

Тонко налаштована поведінка. Одне речення з Cohere повідомлення про припинення підтримки у вересні 2025 року належить до розділу кожного підрозділу закупівель: “Раніше тонко налаштовані моделі більше не будуть доступні.” Поведінка, за яку ви заплатили, була знята разом із кінцевою точкою, що її хостила. Усі дотримувалися опублікованого процесу. Ваша модель все одно зникла.

Поведінка підказок і інструментів. Ті ж інструкції створюють інший застосунок на іншій моделі. У одному корпоративному застосунку дослідники повідомили про падіння рівня успішності регресії з 100% на оригінальній моделі до 97,3% на новішій з ідентичними підказками, відновлене лише після навмисного перепроектування підказок. Сценарії тестування з’являються у продакшені з їхньою частотою, тому цей показник не дає оцінки того, як часто живі робочі процеси зазнають збою. Операційне правило простіше: перевіряйте кожне оновлення моделі на рівні застосунку самостійно, перш ніж воно потрапить до клієнта.

Все це в кінцевому підсумку відображається у рахунку, задовго після порівняння цінових сторінок.

Хтось інший тримає ваш календар

Виведення з експлуатації відбувається за опублікованим графіком, і цей графік не ваш. OpenAI повідомив за рік перед тим, як закрити Assistants API у серпні 2026 р. — щедро за стандартами тієї ж сторінки, де GPT‑4.5 Preview отримав близько трьох місяців. Mistral’s політика становить 6 міс для GA‑моделей і 1 міс для попередніх та сторонніх, з попередженням, що «постійний псевдонім може піддати вас безшумним оновленням у поведінці моделі та ціноутворенні».

AWS проголошує тихе голосно у своїй політиці життєвого циклу: «Перейдіть на активну модель до дати завершення підтримки; міграція не відбудеться автоматично».

У вашій дорожній карті є співавтор. Він ніколи не відвідує ваші планові зустрічі і не цікавиться, у якому кварталі ви перебуваєте.

Ціна теж змінюється

У стандартних тарифах Gemini 3.7 Flash, 5 млрд некешованих вхідних токенів та 1 млрд токенів вихідних, за які стягується плата, коштують $7 500 на місяць. Тарифи наразі заплановано на 1 січня 2027 р. підвищать цей рахунок до $15 000, без урахування інших зборів чи знижок, тоді як ваш продукт робить саме те, що робив раніше.

Заморожений прайс‑лист також може призвести до більшого рахунку. У документації щодо ціноутворення Anthropic зазначено, що токенізатор, який використовується в новіших поколіннях моделей, «генерує приблизно на 30 % більше токенів для того самого тексту» — залежно від вмісту і специфічно для цих поколінь, що означає, що вплив на конкретний рахунок треба вимірювати. Тому вимірюйте токени, за які вас стягують. Окремий прайс‑лист сам по собі нічого не скаже.

Для продукту, який виконує робочі процеси, корисною економічною мірою є вартість успішно завершеного завдання, включаючи повторні спроби та людський перегляд. Це число змінюється, коли модель змінюється, навіть якщо прайс‑лист залишається незмінним.

І жодна з цих умов не підлягає переговорам, коли вихід займе рік. Capgemini опитали 1 300 керівників у мільярдних організаціях навесні 2026 р. щодо критичних постачальників технологій загалом: 36 % сказали, що перехід займе більше дванадцяти місяців, і один із десяти не мав жодної життєздатної альтернативи. Це опис відносин із постачальником без другого джерела.

Зверніться до закупівель

Я керую французькою компанією, зареєстрованою в Марселі, розміщеною в Європі, і все одно пропущу промову про суверенітет у абстрактному вигляді. Незалежність від кожного постачальника технологій недосяжна для звичайної компанії. Те ж саме дослідження Capgemini виявило, що 59 % керівників вважають повний цифровий суверенітет нереалістичним, і я згоден з ними.

Розуміння та контроль над вашими критичними залежностями — це менша, але здійсненна задача. Три питання, на які можна відповісти під час зустрічі: де зберігаються та обробляються наші дані, хто має до них доступ і що потрібно, щоб продовжити роботу з іншим постачальником?

Кожна компанія знає, як ставити це питання щодо логістики, платежів і хмарного сховища. Коли мова йде про робочий контекст, європейська залежність з’являється на зустрічі як обговорення другого джерела з вказаною цифрою, що є формою, на яку може вплинути закупівля.

Одна застереження щодо цифр, які тут наводять. Той факт, що підприємство використовує кілька моделей, мало що говорить про те, чи може воно перенести свій робочий контекст між постачальниками. Це вимагає окремого тесту: чи можна перенести записи, дозволи та незавершену роботу та все ще їх використовувати?

Що насправді робить модель замінною

Спільний інтерфейс між моделями корисний, і я би його створив. Він має робити видимими можливості та залежності, специфічні для кожної моделі. Переносимість не вимагає претензій, що всі моделі поводяться однаково, а абстракція, яка згладжує відмінності, тихо знищує причину, чому ви заплатили за хорошу модель.

Більш складна робота — це володіння станом, яким жоден постачальник не повинен бути єдиним зберігачем. Чотири речі, у порядку їх поломки.

Авторитетний запис під вашим контролем.Повідомлення, отримані джерела, затвердження, контрольні точки виконання. Зафіксуйте, що було завершено в зовнішніх системах і що можна безпечно повторити: електронний лист міг бути надісланий, а підтвердження не збережено, і процедура відновлення, яка цього не знає, надішле його двічі. Будь-який стан постачальника, який ви не можете відтворити, є залежністю. Запишіть його як один, явно, до того, як інцидент задокументує це за вас.

Джерело поряд з кожним вектором.Вектор — це скомпільований артефакт; фрагмент — це вихідний код. Зберігайте вихідний документ та його версію, ідентифікатор документа, межі фрагмента, версію розбивача, модель вбудовування з версією та розмірами, версію індексу та процес, який створив текст. Одиночний збережений текстовий фрагмент не відтворить таблицю, зображення чи результат OCR. Збереження всього цього перетворює переіндексацію на заплановану міграцію, що забезпечує такий же комфорт, який я б обіцяв.

Записи, що розрізняють джерело, висновок і рішення. Пам’ять має розділяти те, що сказало джерело, те, що вивів модель, і те, що затвердив користувач. Клієнт, який обіцяв сплатити у четвер, припущення моделі, що платіж затримається, і погоджене продовження до п’ятниці — це три різні записи з трьома різними статусами, і система повинна знати, на який з них можна реагувати. Кожен потребує свого походження, обсягу, правил доступу та поточного статусу, включаючи те, чи був він виправлений або замінений. Транскрипція може містити докази; її відтворення не гарантує, які висновки залишаються актуальними, а які рішення ще діють.

Переносимість, яку ви реально протестували. Зробіть її тестованою двома способами: вправою з експорту та відновлення, і набором оцінювальних тестів, що визначають, що має виконати застосунок. Тоді «ми могли б переключитися» стає вимірюванням, яке хтось може виконати: чи зможе заміна продовжити представницькі робочі процеси у межах ваших вимог щодо якості, дозволів, затримки та вартості? І збережіть навчальні дані, які ви маєте право повторно використовувати, разом з їхніми версіями, конфігурацією налаштувань та тестами прийнятності. Це робить повторне навчання можливим, без гарантії ідентичної поведінки, а ідентифікатор тонко налаштованої моделі закінчує термін дії у дату, встановлену кимось, кого ви ніколи не зустрічали.

Тоді використовуйте хостовані сеанси, кеші підказок і отримання даних від провайдера, де це допомагає. Вони часто є відмінними, а відмова від них за принципом — це свого роду дороговартісність. Вимога полягає в тому, щоб записи, які вони зберігають, можна було відновити і використати в іншому місці з незмінними правилами доступу та зберігання. Орендуйте обчислення; зберігайте контроль над записом.

Я також не буду перебільшувати архітектуру. До досягнення product‑market fit випуск продукту на шість тижнів раніше часто переважає будь‑який рівень абстракції, і стартап, який створює три бекенди отримання даних, перш ніж у нього з’являться клієнти, будує музей. Чи правильний цей вибір, залежить від продукту та вартості майбутньої перебудови. Зберігайте сировину відновлюваною, і скорочення залишиться скороченням.

Той аспект, який змінився

Поки ШІ лише відповідала на запитання, втрата контексту була лише незручністю. Ви переписували підказку і продовжували. Тепер вона планує зустріч, створює заявку та взаємодіє з CRM, і відсутність контексту призводить до дублювання або незавершеної роботи в системах, що належать вашим клієнтам.

Виробники моделей створюють надзвичайні рішення, і я використовую їх щодня. Відповідальність, про яку я говорю, лежить на нас, хто будує проміжні платформи: робити залежності видимими та зберігати надійний запис того, що було схвалено і що було виконано.

Кожен завершений робочий процес має залишати організації щось, що вона може використати знову — перевірений результат, рішення з простежуваною історією, чіткіший стартовий пункт для наступного завдання. Ця накопичена цінність повинна пережити модель, яка допомогла її створити.

Запитайте, що ви все ще матимете у власності в середу вранці.

Ilia Razvin є засновником і генеральним директором IOSYA, платформа для підвищення продуктивності бізнесу та автоматизації робочих процесів ШІ. Раніше він створював процесні моделі «сірий ящик» та системи підтримки прийняття рішень для хімічного виробництва, а також має ступінь Master 2 у галузі мікросенсорів і систем виявлення, отриману в Aix-Marseille Université.