Лидеры мнений
Как предвзятость убьет вашу стратегию ИИ/МЛ и что с этим делать
«Предвзятость» в моделях любого типа описывает ситуацию, в которой модель реагирует неточно на запросы или входные данные, потому что она не была обучена на достаточно высококачественных и разнообразных данных, чтобы обеспечить точный ответ. Одним из примеров может служить функция распознавания лиц в телефоне Apple, которая не справлялась с людьми с более темным цветом кожи. Модель не была обучена на достаточно большом количестве изображений людей с темным цветом кожи. Это был относительно низкорисковый пример предвзятости, но именно поэтому Европейский Союз ввел требования к моделям ИИ для обеспечения их эффективности и контроля перед выходом на рынок. Модели, которые оказывают влияние на бизнес, финансовые, медицинские или личные ситуации, должны быть достоверными, или они не будут использоваться.
Преодоление предвзятости с помощью данных
Большие объемы высококачественных данных
Среди многих важных практик управления данными ключевым компонентом для преодоления и минимизации предвзятости в моделях ИИ/МЛ является получение больших объемов высококачественных, разнообразных данных. Это требует сотрудничества с несколькими организациями, которые имеют такие данные. Традиционно приобретение данных и сотрудничество осложнены проблемами конфиденциальности и защиты интеллектуальной собственности – конфиденциальные данные не могут быть отправлены владельцу модели, а владелец модели не может рисковать утечкой своей интеллектуальной собственности владельцу данных. Одним из способов решения этой проблемы является работа с模拟ными или синтетическими данными, что может быть полезно, но также имеет ограничения по сравнению с использованием реальных, полноконтекстных данных. Именно здесь технологии, повышающие конфиденциальность (PETs), предоставляют необходимые ответы.
Синтетические данные: близко, но не совсем
Синтетические данные искусственно генерируются для имитации реальных данных. Это сложно, но становится немного проще с помощью инструментов ИИ. Хорошие синтетические данные должны иметь те же расстояния между признаками, что и реальные данные, или они не будут полезны. Качественные синтетические данные можно использовать для эффективного увеличения разнообразия обучающих данных, заполняя пробелы для меньших, маргинализированных популяций или для популяций, для которых поставщик ИИ просто не имеет достаточно данных. Синтетические данные также можно использовать для решения крайних случаев, которые могут быть трудно найти в достаточном количестве в реальном мире. Кроме того, организации могут сгенерировать набор синтетических данных, чтобы удовлетворить требованиям резидентности и конфиденциальности данных, которые блокируют доступ к реальным данным. Это звучит хорошо, но синтетические данные – это только часть пазла, а не решение.
Одним из очевидных ограничений синтетических данных является отсоединение от реального мира. Например, автономные транспортные средства, обученные только на синтетических данных, будут бороться с реальными, непредвиденными условиями дорог. Кроме того, синтетические данные наследуют предвзятость от реальных данных, использованных для их генерации – что практически сводит на нет цель нашего обсуждения. В заключение, синтетические данные – это полезный вариант для тонкой настройки и решения крайних случаев, но значительные улучшения в эффективности моделей и минимизации предвзятости все еще зависят от доступа к реальным данным.
Лучший способ: реальные данные через рабочие процессы, использующие PETs
PETs защищают данные во время их использования. Когда речь идет о моделях ИИ/МЛ, они также могут защищать интеллектуальную собственность модели – «два зайца, одна пуля». Решения, использующие PETs, предоставляют возможность обучать модели на реальных, конфиденциальных наборах данных, которые ранее были недоступны из-за проблем конфиденциальности и безопасности данных. Это разблокирование потоков данных к реальным данным – лучший вариант для снижения предвзятости. Но как это будет работать?
На данный момент ведущие варианты начинаются с конфиденциальной вычислительной среды. Затем происходит интеграция с программным решением на основе PETs, которое делает его готовым к использованию сразу после установки, а также решает требования к управлению данными и безопасности, которые не входят в стандартную доверенную среду выполнения (TEE). С помощью этого решения модели и данные шифруются перед отправкой в защищенную вычислительную среду. Среда может быть размещена где угодно, что важно при решении определенных требований к локализации данных. Это означает, что как интеллектуальная собственность модели, так и безопасность входных данных поддерживаются во время вычислений – даже поставщик доверенной среды выполнения не имеет доступа к моделям или данным внутри нее. Зашифрованные результаты затем отправляются обратно для проверки, и доступны для проверки журналы.
Этот поток разблокирует лучшие данные, независимо от того, где они находятся или кто ими владеет, создавая путь к минимизации предвзятости и высокоэффективным моделям, которым мы можем доверять. Этот поток также является тем, о чем говорил Европейский Союз в своих требованиях к регулирующему песочнице ИИ.
Обеспечение этического и правового соответствия
Получение хороших, реальных данных – сложно. Требования к конфиденциальности и локализации данных сразу ограничивают наборы данных, к которым могут получить доступ организации. Для инноваций и роста данные должны течь к тем, кто может извлечь из них ценность.
Статья 54 Закона ЕС об ИИ устанавливает требования для «высокорисковых» типов моделей в отношении того, что должно быть доказано перед их выходом на рынок. Коротко говоря, командам необходимо использовать реальные данные внутри регулирующей песочницы ИИ, чтобы продемонстрировать достаточную эффективность модели и соответствие всем контролям, изложенным в главе III, разделе 2. Контроли включают мониторинг, прозрачность, объяснимость, безопасность данных, защиту данных, минимизацию данных и защиту модели – можно сказать, DevSecOps + Data Ops.
Первым вызовом будет найти реальный набор данных для использования – поскольку это по своей сути чувствительные данные для таких типов моделей. Без технических гарантий многие организации могут колебаться, доверять ли поставщику модели свои данные, или не смогут этого сделать. Кроме того, определение регулирующей песочницы ИИ в соответствии с законом является вызовом само по себе. Некоторые из требований включают гарантию того, что данные удаляются из системы после выполнения модели, а также механизмы управления, принудительного выполнения и отчетности для доказательства этого.
Многие организации пытались использовать готовые комнаты для очистки данных (DCR) и доверенные среды выполнения (TEE). Но сами по себе эти технологии требуют значительного опыта и работы для операционализации и выполнения требований регулирования данных и ИИ.
DCR проще в использовании, но пока не полезны для более сложных потребностей ИИ/МЛ. TEE – это защищенные серверы и все еще требуют интегрированной платформы сотрудничества, чтобы быть полезными быстро. Это, однако, выявляет возможность для платформ технологий, повышающих конфиденциальность, интегрироваться с TEE, чтобы удалить эту работу, тривиализируя настройку и использование регулирующей песочницы ИИ, и, следовательно, приобретение и использование конфиденциальных данных.
Позволяя использовать более разнообразные и полные наборы данных в сохраняющей конфиденциальность форме, эти технологии помогают обеспечить, чтобы практики ИИ и МЛ соответствовали этическим стандартам и правовым требованиям, связанным с конфиденциальностью данных (например, GDPR и Закон ЕС об ИИ в Европе). В заключение, хотя требования часто встречаются с слышимыми стонами и вздохами, эти требования просто направляют нас на построение лучших моделей, которым мы можем доверять и полагаться на важные решения, основанные на данных, защищая при этом конфиденциальность субъектов данных, используемых для разработки и настройки моделей.












