Модели и платформы ИИ

Монокультуры данных в ИИ: угрозы для разнообразия и инноваций

mm
Добавьте Unite.AI в избранные источники в Google

ИИ меняет мир, от трансформации здравоохранения до реформирования образования. Он решает давние проблемы и открывает возможности, которые мы никогда не считали возможными. Данные находятся в центре этой революции – это топливо, которое питает каждую модель ИИ. Это то, что позволяет этим системам делать прогнозы, находить закономерности и предоставлять решения, которые влияют на нашу повседневную жизнь.

Но, хотя это изобилие данных стимулирует инновации, доминирование унифицированных наборов данных – часто называемых монокультурами данных – представляет значительные риски для разнообразия и творчества в разработке ИИ. Это похоже на сельскохозяйственную монокультуру, где посадка одного и того же культуры на больших полях делает экосистему хрупкой и уязвимой для вредителей и болезней. В ИИ использование унифицированных наборов данных создает жесткие, предвзятые и часто ненадежные модели.

Эта статья углубляется в понятие монокультур данных, изучая, что они такое, почему они сохраняются, какие риски они несут, и какие шаги мы можем предпринять, чтобы построить системы ИИ, которые умнее, справедливее и более инклюзивны.

Понимание монокультур данных

Монокультура данных возникает, когда один набор данных или узкий набор источников данных доминирует в обучении систем ИИ. Распознавание лиц – хорошо документированный пример монокультуры данных в ИИ. Исследования из MIT Media Lab показали, что модели, обученные в основном на изображениях людей с более светлой кожей, испытывали трудности с лицами людей с более темной кожей. Коэффициенты ошибок для женщин с более темной кожей достигали 34,7%, по сравнению с 0,8% для мужчин с более светлой кожей. Эти результаты подчеркивают влияние обучающих данных, которые не включали достаточно разнообразия по типам кожи.

Аналогичные проблемы возникают в других областях. Например, большие языковые модели (LLM) такие как OpenAI GPT и Google Bard обучаются на наборах данных, которые в значительной степени полагаются на контент на английском языке, в основном из западных контекстов. Этот недостаток разнообразия делает их менее точными в понимании языковых и культурных нюансов из других частей мира. Страны как Индия разрабатывают LLM, которые лучше отражают местные языки и культурные ценности.

Эта проблема может быть критической, особенно в таких областях как здравоохранение. Например, медицинский диагностический инструмент, обученный в основном на данных из европейских популяций, может работать плохо в регионах с разными генетическими и экологическими факторами.

Откуда берутся монокультуры данных

Монокультуры данных в ИИ возникают по разным причинам. Популярные наборы данных такие как ImageNet и COCO являются огромными, легко доступными и широко используемыми. Но они часто отражают узкий, западно-центричный взгляд. Сбор разнообразных данных не является дешевым, поэтому многие небольшие организации полагаются на эти существующие наборы данных. Эта зависимость укрепляет отсутствие разнообразия.

Стандартизация также является ключевым фактором. Исследователи часто используют широко признанные наборы данных для сравнения своих результатов, непреднамеренно отпугивая изучение альтернативных источников. Этот тренд создает обратную связь, где все оптимизируют одни и те же бенчмарки вместо решения реальных проблем.

Иногда эти проблемы возникают из-за отсутствия внимания. Создатели наборов данных могут непреднамеренно оставить без внимания определенные группы, языки или регионы. Например, ранние версии голосовых помощников как Siri не обрабатывали не западные акценты хорошо. Причина заключалась в том, что разработчики не включили достаточно данных из этих регионов. Эти упущения создают инструменты, которые не удовлетворяют потребностям глобальной аудитории.

Почему это важно

Когда ИИ принимает на себя более заметные роли в принятии решений, монокультуры данных могут иметь реальные последствия. Модели ИИ могут укреплять дискриминацию, когда они наследуют предвзятости от своих обучающих данных. Алгоритм найма, обученный на данных из мужских отраслей, может непреднамеренно отдавать предпочтение мужским кандидатам, исключая из рассмотрения квалифицированных женщин.

Культурное представительство является еще одной проблемой. Системы рекомендаций как Netflix (NFLX ) и Spotify часто предпочитали западные предпочтения, отодвигая контент из других культур. Эта дискриминация ограничивает пользовательский опыт и ограничивает инновации, сохраняя идеи узкими и повторяющимися.

Системы ИИ также могут стать хрупкими, когда обучаются на ограниченных данных. Во время пандемии COVID-19 медицинские модели, обученные на до-пандемийных данных не смогли адаптироваться к сложностям глобального кризиса здравоохранения. Эта жесткость может сделать системы ИИ менее полезными, когда они сталкиваются с неожиданными ситуациями.

Монокультура данных также может привести к этическим и юридическим проблемам. Компании как Twitter и Apple (AAPL ) столкнулись с общественной критикой за предвзятые алгоритмы. Инструмент обрезки изображений Twitter был обвинен в расовой предвзятости, а алгоритм кредитной карты Apple якобы предлагал более низкие лимиты женщинам. Эти скандалы наносят ущерб доверию к продуктам и вызывают вопросы об ответственности в разработке ИИ.

Как исправить монокультуры данных

Решение проблемы монокультур данных требует расширения диапазона данных, используемых для обучения систем ИИ. Для этого необходимо разработать инструменты и технологии, которые сделают сбор данных из различных источников проще. Проекты как Mozilla Common Voice, например, собирают образцы голосов людей со всего мира, создавая более богатый набор данных с различными акцентами и языками – аналогично, инициативы как UNESCO Data for AI фокусируются на включении недопредставленных сообществ.

Установление этических руководств является еще одним важным шагом. Фреймворки как Торонтская декларация продвигают прозрачность и инклюзивность, чтобы обеспечить, что системы ИИ являются справедливыми по конструкции. Сильные политики управления данными, вдохновленные GDPR регуляциями, также могут сделать большую разницу. Они требуют четкой документации источников данных и держат организации ответственных за обеспечение разнообразия.

Открытые платформы также могут сделать разницу. Например, Hugging Face Datasets Repository позволяет исследователям получить доступ и поделиться разнообразными данными. Эта коллаборативная модель продвигает экосистему ИИ, уменьшая зависимость от узких наборов данных. Прозрачность также играет значительную роль. Использование объяснимых систем ИИ и реализация регулярных проверок может помочь выявить и исправить предвзятости. Это объяснение имеет решающее значение для того, чтобы модели были как справедливыми, так и адаптируемыми.

Создание разнообразных команд может быть наиболее эффективным и простым шагом. Команды с различными фоновыми данными лучше выявляют слепые пятна в данных и проектируют системы, которые работают для более широкого круга пользователей. Инклюзивные команды приводят к лучшим результатам, делая ИИ более интеллектуальным и справедливым.

Основная мысль

ИИ имеет невероятный потенциал, но его эффективность зависит от качества данных. Монокультуры данных ограничивают этот потенциал, производя предвзятые, негибкие системы, оторванные от реальных потребностей. Чтобы преодолеть эти проблемы, разработчикам, правительствам и сообществам необходимо сотрудничать, чтобы диверсифицировать наборы данных, реализовать этические практики и способствовать инклюзивным командам.
Решая эти проблемы напрямую, мы можем создать более интеллектуальный и справедливый ИИ, отражающий разнообразие мира, который он стремится обслужить.

Доктор Техсин Зия является доцентом в университете COMSATS в Исламабаде, имеющим степень PhD в области ИИ в Венском техническом университете, Австрия. Специализируясь в области искусственного интеллекта, машинного обучения, науки о данных и компьютерного зрения, он внес значительный вклад с публикациями в авторитетных научных журналах. Доктор Техсин также возглавлял различные промышленные проекты в качестве основного исследователя и служил консультантом по ИИ.