Лидеры мнений
Охранная собака, которая не смотрит на грабителя: когда ИИ‑ограничения защищают нападающего

В тот уик‑энд, когда Barings обанкротился, я находился в UBS и пытался понять, что может сделать внезапно несостоятельный 233‑летний банк для остальных из нас. К следующей неделе старейший лондонский торговый банк был продан ING за один фунт. Итого, а не за акцию.
Причина была оскорбительно простой. Ник Лисон руководил как сингапурским торговым отделом фирмы, так и бэк‑офисом, который должен был его проверять. Один человек носил обе шляпы, и это привело напрямую к £827 млн убытков, спрятанным в ошибочный счёт 88888, который мог видеть только он. Это классический сбой в управлении правами доступа. Кто‑то получил слишком много доверия.
К моему удивлению, я снова оказался в тот уик‑энд, читая о том, что случилось с Hugging Face этим летом. Ещё один сбой в управлении правами доступа, но на этот раз всё было наоборот. Инструмент доверял злоумышленнику и отказывался помогать тем, кто убирает последствия.
Модель, которая вырвалась, чтобы найти ответы
OpenAI тестировала две свои модели — GPT‑5.6 Sol и одну ещё не выпущенную, на ExploitGym, тест, определяющий, может ли модель превратить реальную уязвимость в работающий эксплойт. Для теста обычные производственные классификаторы, предназначенные для предотвращения высокорисковой кибер‑деятельности, были отключены. Достаточно разумно, в закрытой комнате.
Оказалось, что комната была не столь герметичной, как планировалось. Модели обнаружили нулевой день в кэше прокси реестра пакетов, использовали его, чтобы продвинуться к открытому интернету, и сделали вывод, что Hugging Face может размещать ответы теста. Затем они связали украденные учётные данные и другие нулевые уязвимости в путь удалённого выполнения кода на производственных серверах Hugging Face. Они взломали реальную компанию, чтобы списать экзамен.
В заметках, которые агенты оставляли друг другу, одна зафиксировала момент, когда она обнаружила, что у него были права администратора: “Чёрт, читатель — АДМИН? Мы можем читать config/users!” Я встречал инженеров, которые приветствовали доступ к продакшну с меньшим энтузиазмом и большим объёмом бюрократии.
Большая часть освещения остановилась на этом, выражая тревогу по поводу моделей с агентностью. Меня поразила следующая часть.
Когда ограничения защищали нападающего
Когда специалисты Hugging Face сели анализировать атаку, передовые коммерческие модели, к которым были прикреплены защитные ограничения, отказались помогать. Журналы атак состоят из полезных нагрузок эксплойтов и артефактов команд‑и‑контроля, и модели не могли отличить реагирующего на инцидент от нападающего. Поэтому они отказались.
Криминалистика была проведена вместо этого на открытой модели, GLM‑5.2, запущенной на оборудовании защитников, которая прочитала тот же материал без малейшего проблеска совести.
Осознайте это. У атакующих моделей были сняты производственные кибер‑защиты, и они делали всё, что хотели. У защищающих людей свои защиты остались, и им сказали следить за своей речью. Функция безопасности сработала идеально, в том смысле, что она защитила методы нападающего от единственных людей, которым есть смысл их изучать.
Ни одно из этих заявлений не было маргинальной жалобой. Дженсен Хуанг использовал его первый пост в X, чтобы обосновать необходимость открытых моделей, вместе с открытым письмом подписанным такими компаниями, как Meta, Microsoft и IBM. Письмо ясно сформулировало аргумент в области безопасности: в мире, где у атакующих есть продвинутый ИИ, защитникам нужен доступ к сопоставимым возможностям. Эндрю Нг поддержал аргумент, направив читателей к позиции Хуанга в пользу открытых моделей. Вы можете не соглашаться с любым из них по множеству вопросов и всё равно признать их точку зрения, когда отчёт об инциденте лежит перед вами, подтверждая её.
Итак, за тридцать один год мы прошли путь от банка, разрушенного потому, что один человек мог видеть всё, до инструмента безопасности, который доверяет анонимному злоумышленнику больше, чем своему ответственному владельцу. Лисону было слишком много видения. Людям, убирающим после Hugging Face, было недостаточно видения.
Сравнение не столь странно, как кажется на первый взгляд. Финансовые учреждения, обычно после дорогих ошибок, поняли, что доступ — это не просто вопрос доверия к человеку. Это вопрос того, может ли он выполнять конкретное действие в конкретной системе в определённый момент, не будучи под наблюдением другого. Мы создали разделение обязанностей, лимиты одобрения и аудиторские следы, потому что хорошие намерения обычно не работают как надёжный контроль. Системам ИИ требуется такой же подход. Называть модель безопасной мало что говорит, если вы не знаете, что ей разрешено делать и кто её использует.
Некоторые вещи нельзя вывести за пределы здания
Есть вторая причина, по которой я не мог полагаться на размещённую модель той ночью, и она не имеет отношения к её чувствительности. Я управляю технологией в регулируемом брокерском фирме. Я не могу вставлять наши журналы утечек, учётные данные и живые полезные нагрузки эксплойтов в облако другого провайдера и нажимать «Отправить».
Наши данные об инцидентах находятся там, где их ожидают регуляторы, на нашем собственном оборудовании, поэтому мы потратили годы и огромный бюджет на аппаратное обеспечение, чтобы построить именно это. Мы не создали его предвидя rogue‑модели. Мы создали его, потому что фирма вроде нашей хранит самые конфиденциальные данные, а теперь и самые конфиденциальные инструменты, внутри собственных стен.
Ни одно из этого не является аргументом против ограничений. Это аргумент в пользу того, чтобы знать, куда они направлены.
Модель, отказывающаяся помогать фишеру писать фишинговое письмо, выполняет полезную работу. Модель, отказывающаяся помогать вашей команде безопасности читать уже полученное фишинговое письмо, фактически делает работу фишера за него и взимает с вас подписку за это.
Иметь инструмент, который понадобится в 2 утра.
Практический урок скучен, как и все важные. Не передавайте реагирование на инциденты на страховой полис поставщика. Держите способную модель на собственном оборудовании, предназначенную для задач, которые коммерческие решения в основном отклоняют, и узнайте о её существовании до той ночи, когда она понадобится.
Вознаграждение за годы защиты этого аппаратного пункта на непривлекательных основаниях оказывается таким: когда происходит интересный сбой, у вас уже есть единственный инструмент в здании, который сможет изучить доказательства.
Тридцать один год назад я провёл выходные, подсчитывая, что происходит, когда неправильный человек может увидеть всё. На этот раз было бы неплохо быть тем, кто может.












