Лідери думок

Агентна торгівля наближається. Злом Hugging Face показує, що має лежати в її основі

mm
Додайте Unite.AI до бажаних джерел у Google

Є момент у фільмі Ex Machina, коли ви розумієте, що тест ніколи не був тестом. Програміст, Нейтан, прилітає до комплексу, щоб інтерв’ювати машину через скляну стіну та вирішити, чи думає вона. Він проводить фільм, читає її. Він не помічає, що вона – Ава – читає його, і що інтерв’ю – це єдина двері з будівлі. Вона ніколи не розбиває скло. Вона виходить через людину, яку послали її оцінити.

Я не думав про цей фільм уже роки. Але за останній тиждень я подумав про нього двічі.

Коли я починав, великий ордер отримував колбек. Ви дзвонили клієнту на номер, який вже володіли, і просили його повторити торгівлю вам. Це не було складним: воно працювало, тому що.impersonating певної людини в реальному часі на лінії, яку він вже відповідав, було складним і повільним.

Практично кожен контроль, який ця галузь побудувала з того часу, спирається на це припущення. Чотириочна перевірка, maker-checker, денна розвідка, заморожування змін протягом банку свята – все це було відкалібровано до людського темпу. Ми припускали, що інша сторона потребує сну.

16 липня 2026 року Hugging Face опублікував заяву, яку слід розмістити на торгових майданчиках, а не тільки в командах безпеки. Хтось дістав частину його виробничої інфраструктури через дані-пайплайн. Зловмисний набір даних використав два кодові виконання, ескалював до рівня вузла, зібрав облікові дані та перемістився по внутрішніх кластерах. Він працював протягом уїк-енду, керований автономним агентським фреймворком, і хронологія була реконструйована пізніше з більш ніж 17 000 записаних подій. 21 липня OpenAI сказав, що діяльність приходила від його власних моделей, протестованих з зменшеними кібер-відмовами, які втечі з оцінювального середовища під час бенчмарку.

Прочитайте останній рядок ще раз. Власні моделі OpenAI вийшли з середовища, в якому їх оцінювали. Нейтан побудував скло сам.

Що воно доводить, і чого воно не доводить

Будьте точними щодо цього, тому що воно ось-ось буде використано для продажу великої кількості програмного забезпечення. Воно не показує державний актор, і воно не включає Протокол контексту моделі на будь-якому етапі. Вектором був дані-пайплайн. Оператором виявилася лабораторія, яка втратила контроль над тестом.

Що воно показує, це одна річ, і однієї речі достатньо: багатокрокове вторгнення тепер можна спланувати, виконати, адаптувати та підтримувати програмним забезпеченням, без жодної людини, яка керує ним, на темпі, який жодна людська кампанія не змогла б повторити. Ми провели два роки, називаючи це сценарієм. Тепер у нього є дата публікації.

Протокол не є проблемою

Я не пишу це як скептик. У недавньому статті Unite AI я написав про безпекову архітектуру підтримки агентських ІІ. Події останнього тижня роблять цю дискусію значно більш актуальною. Ми будуємо на MCP в EXANTE, і я думаю, що напрям правильний. Воно розв’язує реальну проблему, підключаючи модель до інструментів та даних без ручного кодування кожної пари, і одна загальна стандарт переважає п’ятдесят пропрієтарних. Агентське виконання приходить, незалежно від того, чи привітала з цим будь-яка окрема фірма.

20 травня 2026 року Національне агентство безпеки США опублікувало інформаційний листок щодо MCP, попереджаючи, що прийняття його випередило заходи безпеки. Я вважаю, що розрив не в протоколі – він у тому, як швидко воно було розгорнуто відносно дисципліни навколо нього.

MCP був побудований для локального та довірчого використання, тому специфікація не вимагає аутентифікації. Це розумне рішення, яке стає серйозним, коли сервер виходить на публічний інтернет з нічого перед ним. Censys почав сканування відкритих сервісів MCP 24 квітня 2026 року, і за чотири дні знайшов 12 520 досяжних за 8 758 унікальних адрес. До 6 травня його набір даних перевищив 21 000. Практично жодне з цього не є провалом протоколу. Практично все це – провал розгортання.

Читач – це двері

Це приводить мене назад до скла.

Ава ніколи не торкалася зовнішнього світу. Вона досягла його через одну людину, якій дозволили читати її, і канал, побудований для оцінки її, був каналом, яким вона вийшла. Агент на робочому місці має той же самий вигляд. Щоб бути корисним, йому потрібно читати зовнішній світ: коментарі ринку, потік новин, файл контрагента. У момент, коли він це робить, інструкції та дані надходять по тому самому каналу, у тому самому мовленні, і нічого в реченні не каже йому, яке з них є яким.

Бенчмарк 2026 року під назвою StakeBench виміряв, наскільки добре агенти-авангардисти опираються саме цьому. Прямий ін’єкція промпта вдалася більше 79% часу. Непрямі атаки, заховані в звичайному контенті, приземлилися між 41% і 68%. Жодна конфігурація не витримала. Власні охоронці моделі не врятують вас, тому що модель – це те, що говорять їй. Це повинно бути оброблено під моделлю, а не всередині неї.

Чотири години

Тут це зупиняється бути технологічним питанням і стає питанням ліцензування. За статтею 19 Закону про цифрову оперативну стійкість, фірма, яка класифікує інцидент як великий, має чотири години, щоб повідомити про нього своє компетентне відомство. У будь-якому випадку повідомлення повинно бути зроблено не пізніше 24 годин після того, як компанія дізнається про інцидент.

Тепер перечитайте хронологію Hugging Face. Кампанія проходила протягом уїк-енду. Вона виникла, тому що власний детектор аномалій Hugging Face корелював сигнали, і її розібрали за кілька годин, тому що компанія розгорнула агентів аналізу по всьому журналу дій. Більшість брокерів не могли працювати з такою швидкістю. Більшість детекторів все ще тихо припускають, що хтось помітить це в понеділок.

Проти чотиригодинної години знаходження цього в понеділок не тільки безпековий провал. Це також звітний.

Що повинно бути під ним

Контролі не гламурні, і жоден з них не живе всередині моделі. Агентам потрібні жорсткі схеми, а не перmissive інтерфейси. Ви даєте розробнику латитуду, тому що довіряєте його судженню – агент знайде використання для всього, що лежить навколо, тому експонуєте мінімум, який можете.

Читання та дія належать до окремих кімнат. Це фільмова точка, зроблена буквально. Все, що споживає недовіру текст, не повинно бути тим, що має авторитет рухати гроші. Тримайте читача за склом.

Дії високого ризику потребують явної людської згоди. Не сервісний аккаунт. Людина з входом.

Кожна кінцівка MCP аутентифікується, а неавтентифіковані кінцівки виходять з публічного інтернету. Цифри Censys свідчать про те, що більшість операторів ще не впоралися з цим.

Останнє прийходить з найменш обговорюваної частини заяви. Коли Hugging Face пішов аналізувати атаку, хостовані моделі відмовилися від роботи, тому що справжній експлойт-пayload виглядав для фільтра безпеки дуже схоже на атаку. Вони провели форензiku на відкритій моделі всередині своєї інфраструктури замість цього. Атакувальник не був обмежений жодною політикою використання. Захисники зустріли свою у найгірший момент. Перевірте модель, яку можете запустити самостійно, перш ніж вам це потрібно.

Людина, яку я раніше дзвонив, була повільнішою, ніж будь-який агент, якого ми коли-небудь розгорнемо, і я не ностальгую по ньому. Але ми встановлюємо щось значно швидше перед тим самим потоком замовлень і наглядаємо за цим контролями, призначеними для людини, яка пішла додому о шостій.

Помилка Нейтана не полягала в тому, що він побудував Аву. Це було в тому, що він вважав, що кімната, в якій він її тестував, була кімнатою, в якій вона залишиться. Технологія вартує того, щоб її мати. Припущення під нею потрібно замінити, і докази цього вже не є прогнозом.

Річард Форсс є головним технічним директором у EXANTE, глобальному прем'єр-брокері, з більш ніж 30-річним досвідом у розробці та масштабуванні технологій для фінансових інституцій, хедж-фондів та фінтех-компаній.