Лидеры мнений

Есть ли четкое решение проблемам конфиденциальности, создаваемым генеративным ИИ?

mm
Добавьте Unite.AI в избранные источники в Google

Риски конфиденциальности, создаваемые генеративным ИИ, очень реальны. От увеличения слежки и раскрытия до более эффективных фишинговых и вишинговых кампаний, чем когда-либо, генеративный ИИ подрывает конфиденциальность массово, без разбора, предоставляя злоумышленникам, будь то преступники, спонсируемые государством или правительство, инструменты, необходимые для нацеливания на отдельных лиц и группы.

Самое ясное решение этой проблемы заключается в том, что потребители и пользователи коллективно отвергают ажиотаж вокруг ИИ, требуют прозрачности от тех, кто разрабатывает или реализует так называемые функции ИИ, и эффективного регулирования со стороны государственных органов, которые контролируют их деятельность. Хотя это стоит стремиться к этому, вряд ли это произойдет в ближайшее время.

Что остается, так это разумные, хотя и необходимые, подходы к смягчению рисков конфиденциальности генеративного ИИ. Долгосрочный, гарантированный, хотя и скучный прогноз заключается в том, что чем более образованными становятся люди в отношении конфиденциальности данных в целом, тем меньше рисков конфиденциальности, создаваемых массовым внедрением генеративного ИИ.

Понимаем ли мы все концепцию генеративного ИИ правильно?

Ажиотаж вокруг ИИ так повсеместен, что опрос того, что люди понимают под генеративным ИИ,几乎 не нужен. Конечно, ни одна из этих «функций ИИ», возможностей и продуктов на самом деле не представляет собой примеры истинного искусственного интеллекта, как бы он ни выглядел. Скорее, они в основном представляют собой машинообучение (ML), глубокое обучение (DL) и большие языковые модели (LLM).

Генеративный ИИ, как следует из названия, может генерировать новый контент – будь то текст (включая языки программирования), аудио (включая музыку и голоса, похожие на человеческие) или видео (с звуком, диалогами, монтажом и сменой камер). Все это достигается путем обучения LLM выявлять, сопоставлять и воспроизводить закономерности в контенте, созданном человеком.

Давайте рассмотрим ChatGPT в качестве примера. Как и многие LLM, он обучается в трех широких этапах:

  • Предобучение: На этом этапе LLM «питается» текстовым материалом из интернета, книг, академических журналов и всего, что содержит потенциально актуальный или полезный текст.
  • Обучение с учителем: Модели обучаются отвечать более связно на инструкции, используя высококачественные пары «вопрос-ответ», обычно полученные от людей.
  • Обучение с подкреплением от человека: LLM, такие как ChatGPT, часто проходят этот дополнительный этап обучения, на котором взаимодействия с человеческими пользователями используются для уточнения соответствия модели типичным случаям использования.

Все три этапа процесса обучения включают данные, будь то огромные запасы предварительно собранных данных (как те, которые используются на этапе предобучения) или данные, собранные и обработанные почти в режиме реального времени (как те, которые используются на этапе обучения с подкреплением от человека). Именно эти данные несут основную часть рисков конфиденциальности, создаваемых генеративным ИИ.

Каковы риски конфиденциальности, создаваемые генеративным ИИ?

Конфиденциальность нарушается, когда личная информация, касающаяся отдельного лица (субъекта данных), становится доступной другим лицам или организациям без согласия субъекта данных. LLM обучается на чрезвычайно широком спектре данных, который может и часто включает личные данные. Эти данные обычно собираются из публично доступных источников, но не всегда.

Даже когда эти данные берутся из публично доступных источников, их агрегация и обработка LLM, а также возможность их поиска через интерфейс LLM, можно рассматривать как дальнейшее нарушение конфиденциальности.

Этап обучения с подкреплением от человека (RLHF) усложняет ситуацию. На этом этапе обучения реальные взаимодействия с человеческими пользователями используются для итеративного исправления и уточнения ответов LLM. Это означает, что взаимодействия пользователя с LLM могут быть просмотрены, поделены и распространены кем-либо, кто имеет доступ к данным обучения.

В большинстве случаев это не является нарушением конфиденциальности, поскольку большинство разработчиков LLM включают политики конфиденциальности и условия использования, которые требуют от пользователей согласия перед взаимодействием с LLM. Риск конфиденциальности здесь заключается в том, что многие пользователи не осознают, что они согласились на такую сбор и использование данных. Такие пользователи, вероятно, раскроют конфиденциальную и чувствительную информацию во время взаимодействия с этими системами, не осознавая, что эти взаимодействия не являются конфиденциальными или частными.

Таким образом, мы приходим к трем основным способам, которыми генеративный ИИ создает риски конфиденциальности:

  • Большие запасы данных предобучения, потенциально содержащие личную информацию, уязвимы для компрометации и эксплуатации.
  • Личная информация, включенная в данные предобучения, может быть раскрыта другим пользователям одной и той же LLM через ее ответы на запросы и инструкции.
  • Личная и конфиденциальная информация, предоставленная во время взаимодействия с LLM, может оказаться в распоряжении сотрудников LLM и, возможно, подрядчиков третьих сторон, откуда она может быть просмотрена или раскрыта.

Все это представляет собой риски для конфиденциальности пользователей, но вероятность того, что личная идентифицирующая информация (PII) окажется в неправильных руках, кажется относительно низкой. По крайней мере, до тех пор, пока на сцену не выйдут брокеры данных. Эти компании специализируются на поиске PII и сборе, агрегации и распространении, если не прямом вещании ее.

С учетом того, что PII и другие личные данные стали своего рода товаром, а индустрия брокеров данных возникла, чтобы извлечь из этого прибыль, любая личная информация, которая «попадает туда», очень вероятно будет собрана брокерами данных и распространена далеко и широко.

Риски конфиденциальности генеративного ИИ в контексте

Прежде чем рассматривать риски конфиденциальности, создаваемые генеративным ИИ в контексте конкретных продуктов, услуг и корпоративных партнерств, давайте шагнем назад и рассмотрим полный спектр рисков генеративного ИИ. Написав для IAPP, Moraes и Previtali использовали подход, основанный на данных, для уточнения «Таксономии конфиденциальности» Solove 2006 года, сократив 16 рисков конфиденциальности, описанных в ней, до 12 рисков конфиденциальности, специфичных для ИИ.

Вот 12 рисков конфиденциальности, включенных в пересмотренную таксономию Moraes и Previtali:

  • Слежка: ИИ усугубляет риски слежки, увеличивая масштаб и повсеместность сбора личных данных.
  • Идентификация: Технологии ИИ позволяют автоматически связывать идентификаторы через различные источники данных, увеличивая риски, связанные с раскрытием личной идентичности.
  • Агрегация: ИИ объединяет различные части информации о человеке, чтобы сделать выводы, создавая риски вторжения в конфиденциальность.
  • Френология и физиогномика: ИИ выводит личность или социальные атрибуты из физических характеристик, что представляет собой новый вид риска, не описанный в таксономии Solove.
  • Вторичное использование: ИИ усугубляет использование личных данных для целей, отличных от тех, для которых они были изначально собраны, путем повторного использования данных.
  • Исключение: ИИ делает хуже ситуацию, когда пользователи не информируются или не контролируют, как их данные используются, через непрозрачные практики обработки данных.
  • Небезопасность: Требования ИИ к данным и практики хранения данных создают риск утечки данных и несанкционированного доступа.
  • Раскрытие: ИИ может раскрыть чувствительную информацию, например, с помощью методов генеративного ИИ.
  • Искажение: Способность ИИ генерировать реалистичный, но фальшивый контент, увеличивает распространение ложной или вводящей в заблуждение информации.
  • Раскрытие: ИИ может привести к неправильному обмену данными, когда он выводит дополнительную чувствительную информацию из сырых данных.
  • Увеличение доступности: ИИ делает чувствительную информацию более доступной для более широкой аудитории, чем предполагалось.
  • Вторжение: Технологии ИИ вторгаются в личное пространство или уединение, часто через меры слежки.

Это довольно тревожное чтение. Важно отметить, что эта таксономия, к ее заслуге, учитывает тенденцию генеративного ИИ галлюцинировать – генерировать и уверенно представлять фактически неточную информацию. Это явление, хотя оно редко раскрывает реальную информацию, также представляет собой риск конфиденциальности. Распространение ложной и вводящей в заблуждение информации влияет на конфиденциальность субъекта способами, более тонкими, чем в случае точной информации, но все же влияет на нее.

Давайте рассмотрим некоторые конкретные примеры того, как эти риски конфиденциальности проявляются в контексте реальных продуктов ИИ.

Прямые взаимодействия с текстовыми генеративными системами ИИ

Самый простой случай – это тот, который включает прямое взаимодействие пользователя с генеративной системой ИИ, такой как ChatGPT, Midjourney или Gemini. Взаимодействия пользователя с многими из этих продуктов регистрируются, хранятся и используются для RLHF (обучения с подкреплением от человека), обучения с учителем и даже предобучения других LLM.

Анализ политики конфиденциальности многих таких сервисов также показывает другие виды деятельности по обмену данными, обусловленные совершенно khácными целями, такими как маркетинг и брокеридж данных. Это другой вид риска конфиденциальности, создаваемый генеративным ИИ: эти системы можно охарактеризовать как огромные воронки данных, собирающие данные, предоставленные пользователями, а также те, которые генерируются через их взаимодействие с основной LLM.

Взаимодействия с встроенными генеративными системами ИИ

Некоторые пользователи могут взаимодействовать с интерфейсами генеративного ИИ, встроенными в тот или иной продукт, который они, якобы, используют. Пользователь может знать, что он использует «функцию ИИ», но он менее вероятно знает, что это означает в плане рисков конфиденциальности данных. То, что выходит на первый план при встроенных системах, – это отсутствие понимания того факта, что личные данные, общие с LLM, могут оказаться в распоряжении разработчиков и брокеров данных.

Здесь есть два уровня отсутствия осведомленности: некоторые пользователи понимают, что они взаимодействуют с продуктом генеративного ИИ; и некоторые считают, что они используют тот или иной продукт, в который встроен генеративный ИИ. В любом случае пользователь, возможно, (и, вероятно, так) технически согласился с условиями и положениями, связанными с его взаимодействием с встроенной системой.

Другие партнерства, которые подвергают пользователей генеративным системам ИИ

Некоторые компании встраивают или иным образом включают интерфейсы генеративного ИИ в свое программное обеспечение способами, которые менее очевидны, оставляя пользователей взаимодействующими – и делящимися информацией – с третьими сторонами, не осознавая этого. К счастью, «ИИ» стал таким эффективным маркетинговым инструментом, что вряд ли компания будет скрывать такие реализации.

Другое явление в этом контексте – это растущая реакция против таких компаний, которые пытались поделиться данными пользователей или клиентов с компаниями генеративного ИИ, такими как OpenAI. Компания по удалению данных Optery, например, недавно отменила решение поделиться данными пользователей с OpenAI на основе опт-аут, то есть пользователи были включены в программу по умолчанию.

Не только клиенты быстро выразили свое разочарование, но служба удаления данных компании была немедленно исключена из списка рекомендуемых служб удаления данных Privacy Guides. К заслуге Optery, она быстро и прозрачно отменила свое решение, но именно общая реакция против этого имеет значение здесь: люди начинают понимать риски, связанные с обменом данными с «компаниями ИИ».

Пример Optery является хорошим примером здесь, потому что его пользователи, в некотором смысле, находятся на переднем крае растущего скептицизма по поводу так называемых реализаций ИИ. Люди, которые выбирают службу удаления данных, также, как правило, те, кто будет обращать внимание на изменения условий обслуживания и политики конфиденциальности.

Свидетельства растущего сопротивления использованию данных генеративного ИИ

Потребители, заботящиеся о конфиденциальности, не были единственными, кто выразил обеспокоенность по поводу систем генеративного ИИ и связанных с ними рисков конфиденциальности данных. На законодательном уровне ЕС Закон об искусственном интеллекте классифицирует риски по их тяжести, при этом конфиденциальность данных является явно или неявно заявленным критерием для присвоения тяжести в большинстве случаев. Закон также решает проблемы информированного согласия, которые мы обсуждали ранее.

США, известные своей медленной адаптацией к комплексному федеральному законодательству о конфиденциальности данных, имеют, по крайней мере, некоторые ограничения благодаря Исполнительному приказу 14110. Опять же, проблемы конфиденциальности данных находятся на переднем плане целей, заявленных в Приказе: «безответственное использование [технологий ИИ] может усугубить социальные вреды, такие как мошенничество, дискриминация, предвзятость и дезинформация» – все связано с доступностью и распространением личных данных.

Возвращаясь к потребительскому уровню, не только потребители, заботящиеся о конфиденциальности, отреагировали на вторжения в конфиденциальность, создаваемые генеративным ИИ. «ИИ-ориентированная» функция Recall от Microsoft, предназначенная для операционной системы Windows 11, является ярким примером. Как только была раскрыта степень рисков конфиденциальности и безопасности, реакция была достаточной, чтобы заставить технологического гиганта отступить. К сожалению, Microsoft, кажется, не отказался от этой идеи, но первоначальная общественная реакция все же обнадеживает.

Оставаясь с Microsoft, ее программа Copilot была широко раскритикована за проблемы как конфиденциальности, так и безопасности данных. Поскольку Copilot был обучен на данных GitHub (в основном исходном коде), также возникла контроверсия вокруг предполагаемых нарушений Microsoft соглашений о лицензировании программного обеспечения разработчиков и программистов. В случаях, подобных этому, границы между конфиденциальностью данных и интеллектуальной собственностью начинают стираться, придавая первой денежную стоимость – что не так просто сделать.

Возможно, самым большим указанием на то, что ИИ становится красным флагом в глазах потребителей, является сдержанная, если не прямо осторожная, общественная реакция на первоначальный запуск ИИ Apple, особенно в отношении соглашений об обмене данными с OpenAI.

Пiecemeal-решения

Законодатели, разработчики и компании могут предпринять шаги для смягчения некоторых рисков, создаваемых генеративным ИИ. Это специализированные решения конкретных аспектов общей проблемы, ни одно из этих решений не ожидается быть достаточным, но все они, работающие вместе, могут действительно иметь значение.

  • Минимизация данных. Минимизация количества собираемых и хранящихся данных является разумной целью, но она прямо противоположна желанию разработчиков генеративного ИИ получить данные для обучения.
  • Прозрачность. Учитывая текущее состояние дел в области машинного обучения, это может быть даже не технически возможно во многих случаях. Взгляд на то, какие данные обрабатываются и как при генерации данного вывода, является одним из способов обеспечения конфиденциальности при взаимодействии с генеративным ИИ.
  • Анонимизация. Любая личная идентифицирующая информация (PII), которую нельзя исключить из данных обучения (через минимизацию данных), должна быть анонимизирована. Проблема заключается в том, что многие популярные методы анонимизации и псевдонимизации легко обходятся.
  • Согласие пользователя. Требование от пользователей согласия на сбор и обмен их данными является необходимым, но слишком открытым для злоупотребления и слишком склонным к потребительской самодовольству, чтобы быть эффективным. Здесь необходимо информированное согласие, и большинство потребителей, должным образом проинформированные, не согласились бы на такой обмен данными, поэтому стимулы не выровнены.
  • Защита данных при передаче и хранении. Другой фундамент как конфиденциальности, так и безопасности данных, защита данных через криптографические и другие средства может всегда быть улучшена. Однако системы генеративного ИИ склонны к утечкам данных через свои интерфейсы, что делает это только частью решения.
  • Принудительное соблюдение авторского права и закона об интеллектуальной собственности в контексте так называемого ИИ. Машинное обучение может работать в «черном ящике», что делает трудным, если не невозможно, отслеживать, какая защищенная авторским правом информация и интеллектуальная собственность окажется в каком выводе генеративного ИИ.
  • Аудиты. Другая важная мера предосторожности, сорванная «черным ящиком» LLM и систем генеративного ИИ, которые они поддерживают. Это внутреннее ограничение усугубляется закрытым исходным кодом большинства продуктов генеративного ИИ, что ограничивает аудиты только теми, которые выполняются по усмотрению разработчика.

Все эти подходы к проблеме являются действенными и необходимыми, но ни один из них не является достаточным. Все они требуют законодательной поддержки, чтобы иметь значимый эффект, что означает, что они обречены отставать от этой динамичной области, которая продолжает развиваться.

Ясное решение

Решение проблем конфиденциальности, создаваемых генеративным ИИ, не является революционным и не является интересным, но, доведенное до логического вывода, его результаты могут быть и тем, и другим. Ясное решение заключается в том, что обычные потребители становятся осведомленными о ценности своих данных для компаний и о бесценности конфиденциальности данных для себя.

Потребители являются источниками и двигателями за личной информацией, которая питает так называемую современную экономику слежки. Как только критическая масса потребителей начинает ограничивать поток личных данных в публичную сферу и начинает требовать отчетности от компаний, которые торгуют личными данными, система должна сама себя исправить.

Поощряющим аспектом генеративного ИИ является то, что, в отличие от текущих моделей рекламы и маркетинга, он не обязательно должен включать личную информацию на любом этапе. Данные предобучения и уточнения не должны включать личную идентифицирующую информацию или другие личные данные, и пользователи не должны раскрывать такую информацию во время взаимодействия с системами генеративного ИИ.

Чтобы удалить свою личную информацию из данных обучения, люди могут пойти прямо к источнику и удалить свои профили из различных брокеров данных (включая сайты поиска людей), которые агрегируют публичные записи, выводя их в обращение на открытом рынке. Службы удаления личных данных автоматизируют этот процесс, делая его быстрым и простым. Конечно, удаление личных данных из баз данных этих компаний имеет много других преимуществ и не имеет недостатков.

Люди также генерируют личные данные, когда взаимодействуют с программным обеспечением, включая генеративный ИИ. Чтобы ограничить поток этих данных, пользователям придется быть более осведомленными о том, что их взаимодействия записываются, просматриваются, анализируются и делятся. Их варианты для избежания этого сводятся к ограничению того, что они раскрывают онлайн-системам, и использованию локальных, открытых LLM, где это возможно. Люди, в целом, уже делают хорошую работу по модуляции того, о чем они говорят в публичной сфере – нам просто нужно расширить эти инстинкты в область генеративного ИИ.

Дэвид Балабан - исследователь компьютерной безопасности с более чем 17-летним опытом в области анализа вредоносного ПО и оценки антивирусного программного обеспечения. Дэвид управляет проектами MacSecurity.net и Privacy-PC.com, которые представляют собой экспертные мнения по современным вопросам информационной безопасности, включая социальную инженерию, вредоносное ПО, тестирование на проникновение, интеллект угроз, онлайн-приватность и белую хакерскую атаку. Дэвид имеет сильный опыт в решении проблем с вредоносным ПО, с недавним акцентом на противодействии программам-вымогателям.