Лидеры мнений
AI-Первый – это Безопасность-Первая

Купите ребенку совершенно новый велосипед, и велосипед будет привлекать все внимание – не блестящий шлем, который сопровождает его. Но родители ценят шлем.
Боюсь, что многие из нас сегодня похожи на детей, когда речь идет об ИИ. Мы сосредоточены на том, насколько он крут и насколько быстро мы можем ехать с ним. Не так много на то, что мы можем сделать, чтобы остаться в безопасности, пока используем его. Это жаль, потому что вы не можете получить пользу от одного без другого.
Просто nói, применение ИИ без тщательного планирования безопасности сначала не только рискованно. Это прямой путь со скалы.
Что такое Безопасность ИИ?
Безопасность ИИ включает в себя множество шагов. Но, возможно, наиболее важным элементом является когда их предпринимать. Чтобы быть эффективными, безопасность ИИ должна быть по дизайну.
Это означает, что мы думаем о том, как предотвратить вред, прежде чем мы его протестируем. Мы выясняем, как убедиться, что ИИ работает и генерирует результаты в соответствии с нашими ценностями и социальными ожиданиями сначала – не после того, как мы получим ужасные результаты.
Проектирование безопасности ИИ также включает в себя размышления о том, как сделать его прочным, или способным работать предсказуемо даже в неблагоприятных ситуациях. Это означает сделать ИИ прозрачным, так что решения ИИ понятны, проверяемы и не предвзяты.
Но это также включает в себя взгляд на мир, в котором ИИ будет функционировать. Какие институциональные и правовые меры безопасности нам нужны, особенно для соблюдения применимых государственных правил? И я не могу переоценить человеческий компонент: какой будет воздействие использования ИИ на людей, которые взаимодействуют с ним?
Безопасность по дизайну означает внедрение безопасности ИИ во все наши процессы, рабочие процессы и операции, прежде чем мы наберем первый запрос.
Риски Перевешивают Заботы
Не все согласны. Когда они слышат “безопасность-сначала”, некоторые слышат “шагайте так осторожно и медленно, что вы отстаете”. Конечно, это не то, что означает безопасность-сначала. Это не обязательно тормозит инновации или замедляет время выхода на рынок. И это не означает бесконечный поток пилотов, которые никогда не масштабируются. Напротив.
Это означает понимание рисков не проектирования безопасности в ИИ. Рассмотрите всего лишь несколько.
- Центр финансовых услуг Deloitte прогнозирует, что GenAI может быть ответственен за убытки от мошенничества в размере 40 миллиардов долларов в США к 2027 году, по сравнению с 12,3 миллиардами долларов в 2023 году, что представляет собой рост на 32% в год.
- Предвзятые решения. Документальные дела предвзятого медицинского ухода из-за ИИ, который был обучен на предвзятых данных.
- Плохие решения, которые вдохновляют еще более плохие решения. Хуже, чем первоначальное плохое решение, вызванное неисправным ИИ, исследования показывают, что эти неисправные решения могут стать частью того, как мы думаем и принимаем будущие решения.
- Реальные последствия. ИИ, который дает плохие медицинские советы, был ответственен за смертельные исходы пациентов. Юридические проблемы возникли из-за цитирования галлюцинации ИИ как юридического прецедента. И программные ошибки, возникшие из-за того, что помощник ИИ давал неверную информацию, испортили продукты компании и ее репутацию и привели к широкому недовольству пользователей.
И вещи вот-вот станут еще более интересными.
Наступление и быстрое принятие агентного ИИ, ИИ, который может функционировать автономно для принятия решений на основе решений, которые он принял, увеличит важность проектирования безопасности ИИ.
Агент ИИ, который может действовать от вашего имени, может быть чрезвычайно полезен. Вместо того, чтобы рассказывать вам о лучших рейсах для поездки, он может найти их и забронировать для вас. Если вы хотите вернуть продукт, агент ИИ компании может не только рассказать вам о политике возврата и том, как подать заявку на возврат, но и обработать всю транзакцию для вас.
Отлично – пока агент не галлюцинирует рейс или не обработает вашу финансовую информацию неправильно. Или не получит политику возврата компании неправильно и не откажет в действительных возвратах.
Это не слишком сложно увидеть, как настоящие риски безопасности ИИ могут легко каскадировать с помощью команды агентов, принимающих решения и действующих, особенно поскольку они вряд ли будут действовать в одиночку. Большая часть реальной ценности агентного ИИ будет заключаться в командах агентов, где отдельные агенты обрабатывают части задач и сотрудничают – агент с агентом – для выполнения работы.
Итак, как вы можете принять безопасность ИИ по дизайну, не препятствуя инновациям и не убивая его потенциальной ценности?
Безопасность по Дизайну в Действии
Ад-хок проверки безопасности не являются ответом. Но интеграция практик безопасности в каждую фазу реализации ИИ является.
Начните с данных. Убедитесь, что данные помечены, аннотированы при необходимости, свободны от предвзятости и имеют высокое качество. Это особенно верно для обучающих данных.
Обучайте свои модели с помощью обратной связи человека, поскольку суждение человека является важным для формирования поведения модели. Обучение с помощью обратной связи человека (RLHF) и другие подобные методы позволяют аннотаторам оценивать и направлять ответы, помогая языковым моделям генерировать выходные данные, которые являются безопасными и соответствуют человеческим ценностям.
Затем, прежде чем выпустить модель, протестируйте ее. Красные команды, которые пытаются спровоцировать не安全ное поведение с помощью противоречивых запросов, краевых случаев и попыток побега, могут раскрыть уязвимости. Исправление их до того, как они достигнут публики, сохраняет безопасность до того, как возникнет проблема.
Пока это тестирование гарантирует, что ваши модели ИИ являются прочными, продолжайте мониторить их с учетом новых угроз и корректировок, которые могут быть необходимы для моделей.
Аналогично, регулярно мониторьте источники контента и цифровые взаимодействия на предмет признаков мошенничества. Критически, используйте гибридный подход ИИ-человека, позволяя автоматизации ИИ заниматься огромным объемом данных для мониторинга, и квалифицированным людям заниматься обзорами для обеспечения соблюдения и точности.
Применение агентного ИИ требует еще большей осторожности. Основное требование: обучите агента знать его ограничения. Когда он сталкивается с неопределенностью, этическими дилеммами, новыми ситуациями или особенно важными решениями, убедитесь, что он знает, как попросить о помощи.
Кроме того, спроектируйте прослеживаемость в ваши агенты. Это особенно важно, чтобы их взаимодействия происходили только с проверенными пользователями, чтобы избежать влияния мошеннических акторов на действия агента.
Если они, кажется, работают эффективно, может быть заманчиво отпустить их и позволить им делать свое дело. Наш опыт говорит о том, чтобы продолжать мониторить их и задачи, которые они выполняют, чтобы следить за ошибками или неожиданным поведением. Используйте как автоматические проверки, так и обзор человека.
На самом деле, важнейшим элементом безопасности ИИ является регулярное участие человека. Люди должны быть намеренно вовлечены в места, где критическое суждение, сочувствие или нюансы и двусмысленности участвуют в решении или действии.
Снова, чтобы быть ясным, это все практики, которые вы строите в реализацию ИИ заранее, по дизайну. Они не являются результатом того, что что-то пошло не так, и затем спешат выяснить, как минимизировать ущерб.
Сработает ли Это?
Мы применяли философию безопасности ИИ-сначала и рамки “по дизайну” с нашими клиентами на протяжении всего возникновения GenAI и теперь на быстром пути к агентному ИИ. Мы обнаружили, что, вопреки опасениям о том, что это замедлит все, это на самом деле помогает ускорить все.
Агентный ИИ имеет потенциал снизить стоимость поддержки клиентов на 25-50%, например, при этом увеличивая удовлетворенность клиентов. Но все это зависит от доверия.
Люди, использующие ИИ, должны доверять ему, и клиенты, взаимодействующие с агентами, обладающими ИИ, или с реальными агентами ИИ, не могут испытать ни одного взаимодействия, которое бы подорвало их доверие. Один плохой опыт может уничтожить доверие к бренду.
Мы не доверяем тому, что не является безопасным. Итак, когда мы строим безопасность в каждый слой ИИ, который мы собираемся выпустить, мы можем сделать это с уверенностью. И когда мы готовы масштабировать его, мы можем сделать это быстро – с уверенностью.
Хотя введение безопасности ИИ-сначала в практику может показаться подавляющим, вы не одни. Есть много экспертов, которые могут помочь, и партнеры, которые могут поделиться тем, что они узнали и учатся, так что вы можете использовать ценность ИИ безопасно, не замедляя вас.
ИИ был захватывающей поездкой до сих пор, и когда поездка ускоряется, я нахожу ее волнующей. Но я также рад, что я ношу свой шлем.












