Лідери думок
Проблема надійності штучного інтелекту, про яку ніхто не хоче говорити

Домінуючий нарратив про надійність штучного інтелекту простий: моделі мають галюцинації. Тому компанії повинні покращувати моделі, щоб отримувати від них最大ну користь. Більше параметрів. Кращі навчальні дані. Більше навчання з підкріпленням. Більше узгодження.
І все ж, навіть коли моделі стають більш потужними, дебати про надійність не зникають. Лідери підприємств все ще вагаються, дозволяючи агентам виконувати значимі дії в核心них системах. Ради все ще запитують: “Чи можна їм довіряти?”
Але галюцинації не є перш за все проблемою моделі. Вони є проблемою контексту. Ми просимо системи штучного інтелекту працювати на підприємницькій інфраструктурі без надання їм структурної видимості, необхідної для безпечної роботи. Потім ми звинувачуємо модель, коли вона робить припущення.
Фактичний розрив у надійності не так сильно в вагах, як у інформаційному шарі.
Хірург без зображення
П уявіть собі хірурга, який працює без зображення. Ні МРТ. Ні КТ. Ні реального візуалізації навколишніх тканин. Лише загальне розуміння анатомії та скальпель. Навіть найкваліфікованіший хірург був би змушений робити припущення. Приблизнюватися. Довіряти ймовірнісному висновку.
Це саме те, що роблять агенти штучного інтелекту підприємств зараз.
Коли систему штучного інтелекту просять змінити робочий процес, оновити правило ERP або запустити автоматизацію інструментів, вона рідко має повний граф залежностей середовища. Вона не знає, яке “не використовуване” поле живить нижню панель інструментів. Вона не бачить, яку автоматизацію посилається ця перевірка. Вона не може надійно симулювати вплив другого порядку.
Тому вона робить те, до чого великі мовні моделі тренуються: вона передбачає. Передбачення не є розумінням. А передбачення без структурного контексту виглядає як галюцинація.
Ми постійно формуємо неправильну дискусію
Спільнота штучного інтелекту була зайнята дискусією про надійність, зосередженою на моделі. Дослідження про закони масштабування. Дослідження про ланцюгове мислення підказки. Техніки посилення вивчення. Бенчмарки оцінки.
Все це необхідно. Все це цінно. Але помітте, чого бракує: обговорення топології підприємств.
Надійність у контексті підприємства не просто означає “модель генерує правильний текст”. Це означає “система робить зміни, які є безпечними, простежуваними та передбачуваними”.
Це фундаментально інша вимога.
Коли OpenAI та Anthropic публікують оцінки продуктивності моделі, вони вимірюють точність у завданнях мислення, бенчмарках кодування або запам’ятовуванні знань. Це корисні сигнали. Однак вони не вимірюють здатність агента штучного інтелекту безпечно змінювати живу систему доходу з 15-річним накопиченим боргом автоматизації.
Проблема не полягає в тому, чи може модель написати синтаксично правильний код; це питання того, чи розуміє штучний інтелект середовище, в яке цей код розгортається.
Живі системи накопичують ентропію
Підприємницькі системи не є статичними базами даних. Це живі системи. Кожна нова інтеграція залишає слід. Кожна кампанія вводить поле. Кожне “швидке рішення” вводить додатковий шар автоматизації. З часом ці шари взаємодіють способами, яких жодна людина не повністю розуміє.
Це функція зростання. Комплексні адаптивні системи природно накопичують ентропію. Дослідження Массачусетського технологічного інституту довго підкреслювали, як асиметрія інформації всередині організацій посилює операційний ризик. Тоді Gartner оцінює, що погана якість даних коштує організаціям в середньому $12,9 мільйона на рік.
Тепер уявіть собі введення автономних агентів у це середовище без попереднього вирішення його структурної не透明ості.
Ми не повинні бути здивовані, коли результати здаються непередбачуваними. Агент не є злим або дурним. Він сліпий. Він будує у темній кімнаті.
Вивчення не достатньо
Дехто буде стверджувати, що генерація, посилена вивченням (RAG), вирішує цю проблему. Надайте моделі доступ до документації. Підгодуйте її описами схем. Зв’яжіть її з API.
Це допомагає.
Але документація не є топологією.
PDF, який пояснює, як робочий процес “повинен” працювати, не є тим же, що і реальний граф того, як він фактично взаємодіє з 17 іншими автоматизаціями.
Реальність підприємств рідко відповідає документації підприємств.
Дослідження 2023 року, опубліковане в Communications of the ACM, встановило, що застаріла документація є основним внеском у невдачі технічного обслуговування програмного забезпечення. Системи еволюціонують швидше, ніж їхні розповіді.
Тому навіть коли ми надаємо агентам штучного інтелекту документацію, ми часто надаємо їм часткову або ідеалізовану карту.
Часткові карти все ж таки призводять до впевнених помилок.
Агентський шар є справжнім шаром безпеки
Ми схильні вважати, що безпека полягає в тренуванні з узгодженням, перилах, червоних командах та фільтрах політики. Все це важливо. Але в контексті підприємств безпека є контекстною. Це знання:
- Що залежить від цього поля?
- Яка автоматизація посилається на цей об’єкт?
- Які нижні звіти будуть порушені?
- Хто володіє цим процесом?
- Коли це було останнє змінено?
- Які історичні зміни передували поточній конфігурації?
Без цього шару агент штучного інтелекту фактично імпровізує всередині чорної скриньки. З цим шаром він може симулювати вплив перед виконанням. Різниця між галюцинацією та надійністю часто полягає у видимості.
Чому модель звинувачується
Чому, тоді, дискусія зосереджена так сильно на моделях? Тому що моделі є зрозумілими. Ми можемо вимірювати перплексію. Ми можемо порівнювати бенчмарки. Ми можемо публікувати криві масштабування. Ми можемо дискутувати про якість навчальних даних.
Інформаційна топологія підприємств є набагато складнішою. Вона вимагає координації між функціями. Вона вимагає дисципліни управління. Вона змушує організації вирішувати накопичену складність своїх власних систем.
Легше сказати “модель не готова”, ніж визнати “наша інфраструктура не прозора”.
Але коли агенти штучного інтелекту переходять від генерації вмісту до виконання операцій, таке формулювання стає небезпечним.
Якщо ми розглядаємо надійність лише як проблему моделі, ми продовжимо розгортати агентів у середовищах, які вони не можуть суттєво сприймати.
Автономія вимагає контексту
Недавні експерименти Anthropic з командами розробки програмного забезпечення для багатокористувальницького середовища показують, що системи штучного інтелекту можуть координувати між собою складні завдання, коли їм надається структурований контекст та постійна пам’ять. Фронт капабельності швидко просувається вперед. Але ця марка автономії без екологічної осведомленості є крихкою.
Самохідний автомобіль не залежить лише від потужної нейронної мережі. Він залежить від лідару, камер, систем відображення та реального часу.
Штучний інтелект підприємств потребує еквіваленту лідару. Не тільки доступ до API. Не тільки документація. Але структурований, динамічний розуміння залежностей системи.
Поки це не існує, дискусії про галюцинацію продовжуватимуть неправильно діагностувати кореневу причину.
Прихований ризик: надмірна впевненість
Є ще один тонкий ризик у поточному формулюванні.
Коли моделі покращуються, їхні виходи стають більш плавними, переконливими, авторитетними.
Плавність посилює надмірну впевненість.
Коли агент впевнено змінює систему без повного контексту, невдача не є негайно очевидною. Вона може проявитися через тижні як розбіжність у звітності, пробіл у дотриманні вимог або помилка у прогнозуванні доходів. Через те, що модель здається компетентною, організації можуть переоцінювати її операційну безпеку. Фактичний режим невдачі – це правдоподібна помилка.
І правдоподібна помилка процвітає у темряві.
Переформулювання питання про надійність
Замість того, щоб питати: “Чи достатньо хороша модель?” Ми повинні питати: “Чи має агент достатній структурний контекст для безпечної дії?” Замість вимірювання точності бенчмарків ми повинні вимірювати екологічну видимість. Замість дискусій про кількість параметрів ми повинні проводити аудит структурної не透аності.
Наступний фронт надійності штучного інтелекту не просто більші моделі. Це багатші контекстні шари.
Це включає:
- Графи залежностей підприємств
- Відстежування змін у реальному часі
- Мапування власності
- Історична осведомленість про конфігурацію
- Симуляція впливу перед виконанням
Нічого з цього не є гламурним. Нічого з цього не трендить у соціальних мережах. Але це саме тут буде виграна надійність.
Будування з включеними світлами
Лідери підприємств мають право вимагати надійності, перш ніж надавати агентам операційну владу. Але шлях вперед не полягає у чеканні на міфічну модель без галюцинацій.
Це інвестиції у видимість інфраструктури, яка робить можливою інтелектуальну дію.
Ми не дозволили б молодому адміністратору змінювати системи виробництва без розуміння залежностей. Ми не повинні дозволяти агентам штучного інтелекту робити це теж.
Мета? Зменшити сліпі плями.
Коли агенти працюють зі структурною осведомленістю, показники галюцинацій знижуються не тому, що модель змінилася, а тому, що поверхня для припущень зменшується.
Прогнозування стає розумінням. Розуміння стає симуляцією. Симуляція стає безпечною виконавчою дією.
Невідворотний зсув
За наступні п’ять років стек штучного інтелекту розгалужиться. Один шар зосередиться на можливостях моделі: глибині мислення, багатомодальній плавності та ефективності витрат. Інший шар зосередиться на інформаційній/контекстній топології: графіках систем, інтелекті метаданих та рамках управління.
Організації, які розглядають надійність лише як вибір моделі, будуть боротися.
Організації, які розглядають надійність як архітектурну властивість, рухатимуться швидше з меншим ризиком.
Дебати про галюцинацію виглядатимуть наївними у ретроспективі. Справжня історія буде про видимість.
Штучний інтелект не є внутрішньо безрозсудним.
Він працює у темній кімнаті.
Поки ми не вирішимо цю проблему, ми не будемо будувати інтелектуальні системи. Ми будемо будувати потужні передбачувачі всередині не прозорих середовищ.
І це означає, що, попри весь прогрес, штучний інтелект все ще будує у темряві.












