Лидеры мнений

Контроль ИИ имеет три слепых пятна — и большинство компаний не смотрят ни на одно из них

mm
Добавьте Unite.AI в избранные источники в Google

Большинство разговоров о безопасности ИИ внутри компаний направлено на неправильную цель. Команды тратят недели на обсуждение того, какую модель использовать, затем подключают эту модель к своей электронной почте, платежам, базе данных клиентов и коду, не останавливаясь, чтобы задать гораздо более простой вопрос: когда эта вещь делает что-то, кто за этим наблюдает, и может ли кто-то остановить это?

Цифры говорят о том, что это скоро станет дорогим. Gartner считает, что как минимум 15% рутинных решений будут приняты автономно с помощью ИИ в 2028 году, по сравнению с почти нулевым показателем в 2024 году. В том же исследовании предупреждается, что более 40% проектов по агентскому ИИ будут отменены к концу 2027 года, и одной из причин, которую он называет, является слабый контроль над рисками. Перечитайте это еще раз. Проекты не умирают потому, что модели плохие. Они умирают потому, что никто не построил способ управления ими.

Я строю системы управления ИИ для жизни, поэтому я вижу одни и те же пробелы снова и снова. Их три. Большинство компаний правильно наблюдают за ни одним из них, и многие наблюдают за нулем.

Агенты — это громкий вариант

Все беспокоятся об автономных агентах, и они правы, что беспокоятся. Но большинство людей беспокоятся о неправильной части. Неуютная вещь об агенте заключается не в том, что он рассуждает. А в том, что он действует. Он не предлагает возврат; он платит его. Он не проект электронного письма; он отправляет его. Дайте модели набор инструментов, и вы дали ему возможность дотянуться до реальных систем и изменить их.

Если вы ошибетесь, неудача не будет состоять в неуклюжем предложении. Это деньги, которые выбрасываются, или таблица, тихо удаленная из базы данных. И есть более острая сторона: инъекция подсказки находится прямо на вершине списка рисков OWASP для приложений LLM, и по хорошей причине: если вы покормите модель неправильным текстом, ее можно убедить сделать что-то, о чем никто не просил. Когда модель может только говорить, это досадная вещь. Когда модель может вызвать инструменты, это атакующий, держащий ваши ключи API.

Стандартный ответ — записать все, что делает агент, и наблюдать за следами. Хорошо. Но след — это описание того, что уже произошло. Это запись с камеры наблюдения после того, как касса была опустошена, полезная для расследования, бесполезная для остановки кражи.

Тихий вариант, о котором никто не упоминает

Второе слепое пятно никогда не попадает на слайд, потому что оно скучно. Это простой вызов API. Не агент, не фреймворк, просто кусок кода где-то в службе, который собирает подсказку и отправляет ее в модель.

Большинство ИИ в производстве на самом деле выглядит так, и это наименее управляемая часть всего стека именно потому, что это так обыденно. Это HTTP-запрос, закопанный на три слоя глубоко в какой-то службе, написанный инженером, который никогда не слышал о вашей политике ИИ и не знает, где ее найти. Этот один вызов может отправить данные клиента в модель третьей стороны или запустить действие вниз по потоку, и ничего не проверяет, должен ли он это сделать, и ничего независимого не записывает, что он это сделал.

Сложный вариант — это люди

Третье слепое пятно — это люди, и это почему это худшее. Ваш персонал уже давно выяснил, что вставка задачи в ChatGPT или Claude делает ее быстрее, поэтому они делают это весь день, обычно из личных учетных записей, которые вы не можете видеть. Это не гипотетический сценарий. Взгляд Cyberhaven на реальное использование на рабочем месте показал, что значительная доля сотрудников вставила конфиденциальные данные компании в ChatGPT, большую часть из которых через учетные записи, в которые компания не имеет доступа.

Если вы хотите предостерегающую историю, это Samsung. В 2023 году она запретила генеративный ИИ внутри компании после того, как инженеры вставили проприетарный исходный код в ChatGPT, три отдельных раза за менее чем месяц. Это были не злонамеренные акторы. Это были хорошие инженеры, которые пытались отладить быстрее. Это вся ловушка: утечка выглядит идентично производительности. И ваши старые инструменты обнаружения утечек данных не поймают это, потому что это копирование и вставка в вкладку браузера, а не файл, покидающий здание.

Итак, что на самом деле работает

Выстроив три, исправление перестает быть специфичным для агентов и превращается в одну идею: управлять тем, что делает любой ИИ, прежде чем он это сделает, а не после. Несколько вещей, которые действительно имеют значение, выученные в основном тяжелым путем.

Сидите перед действием, а не за ним. Это вся игра, и это почему я настаиваю на том, что наблюдаемость и управление — это не одно и то же слово. Панель, которая говорит вам, что агент переместил 40 000 фунтов вчера, — это отчет о потере. То, что может удержать этот перевод для человека, чтобы он посмотрел на него, прежде чем он уйдет, — это контроль. Если ваша установка может только сказать вам, что произошло, у вас нет надзора. У вас есть взгляд назад.

Используйте одну проверку, а не одну на инструмент. Агенты, вызовы API и сотрудники, вставляющие в чат-бот, кажутся тремя отдельными проблемами, поэтому компании покупают три отдельных инструмента и в итоге получают три набора пробелов между ними. Плохие вещи живут в пробелах. Все, что делает ИИ, откуда бы он ни пришел, должно пройти одну и ту же проверку.

Сохраните журнал, который ИИ не может переписать. Если система, делающая вещь, также является единственной вещью, записывающей, что она сделала вещь, у вас нет записи. У вас есть дневник, который он может редактировать. Это именно то, куда движутся правила. Требование к ведению учета Закона об ИИ ЕС, Статья 12, существует, чтобы то, что сделала высокорисковая система, можно было восстановить кем-то другим, кроме системы. На практике это означает журнал, ведущийся вне вещи, которую регистрируют, который нельзя тихо изменить после факта.

Поместите человека на большие, необратимые звонки. Не все, делайте это, и вы утопите людей в одобрениях, пока они не поставят штамп на все. Но звонки, которые вы не можете вернуть, перевод денег, экспорт данных, удаление записей, должны остановиться и ждать. Закон об ИИ ЕС уже делает мандаторным человеческий надзор для высокорисковых систем, Статья 14. Ловушка, которую стоит помнить, заключается в том, что надзор имеет значение только в том случае, если у человека есть время и контекст, чтобы действительно сказать нет. Одобрение, которое никто не читает, — это просто театр.

Честный проверка интуиции

Ни один из этих трех — это угловой случай. Это обычный способ, которым большинство компаний запускают ИИ прямо сейчас, тихо, без большого сети. Команды, которые пройдут через следующие пару лет без неприятного инцидента, не будут теми, у которых есть самые красивые графики. Они будут теми, кто решил рано, что все, что делает их ИИ, агент, вызов API, вставленный абзац, проходит через одну проверку, прежде чем это произойдет, а не после.

Если вы хотите быстрый тест своей собственной установки, ответьте на два вопроса честно. Из этих трех поверхностей, сколько вы можете действительно видеть? И из тех, которые вы можете видеть, сколько вы можете остановить? Для многих компаний честный ответ на второй вопрос — ноль. Это число, которое нужно исправить первым.

Соджи Мэтью Джозеф является основателем и генеральным директором TrustLoop, где он работает над управлением и контролем в области искусственного интеллекта. Он более 15 лет занимается технологиями и операциями с людьми в компаниях с высоким темпом роста.