Модели и платформы ИИ

Дatasets веб-скрапинга и защита данных: почему CommonPool заслуживает внимания

mm
Добавьте Unite.AI в избранные источники в Google
Web-Scraped AI Datasets and Privacy: Why CommonPool Deserves a Look

Искусственный интеллект (ИИ) стал частью нашей повседневной жизни. Он виден в медицинских чат-ботах, которые руководят пациентами, и в генеративных инструментах, которые помогают художникам, писателям и разработчикам. Эти системы кажутся продвинутыми, но они зависят от одного важного ресурса: данных.

Большая часть данных, используемых для обучения систем ИИ, поступает из публичного интернета. Автоматизированные программы собирают большие объемы текста, изображений и аудио с онлайн-платформ. Эти коллекции образуют основу известных моделей, таких как GPT-4, Stable Diffusion и многие другие. Однако эта огромная коллекция вызывает нерешенные проблемы с защитой данных, правом собственности и информированным согласием.

Рынок обучающих наборов данных отражает масштаб этой деятельности. На данный момент глобальная стоимость наборов данных ИИ оценивается в 3,2 миллиарда долларов. Согласно прогнозам, она может вырасти до 16,3 миллиарда долларов к 2034 году, с годовым темпом роста 20,5%. За этими цифрами стоит важная задача. Значительная часть собранного материала получена без явного разрешения. Часто это содержит личные данные, защищенные авторским правом работы и другие чувствительные сведения, которые никогда не предназначались для систем ИИ.

В ответ на эти проблемы исследуются альтернативные подходы к управлению данными. Одним из примеров является CommonPool, выпущенный в апреле 2023 года в рамках бенчмарка DataComp. Это большой набор данных из 12,8 миллиардов пар изображений и текста, предназначенный для исследования многомодального ИИ. В отличие от традиционных усилий по скрапингу, он применяет методы фильтрации, подчеркивает прозрачность и включает участие сообщества в своем развитии. Хотя это仍ается предметом обсуждения, CommonPool указывает на попытку построить более ответственные и аудиторные практики для обучающих данных ИИ. Такие инициативы подчеркивают необходимость этических стандартов в будущем искусственного интеллекта.

Роль веб-скрапинга в развитии искусственного интеллекта

Данные являются центральными для ИИ, а производительность системы тесно связана с количеством и разнообразием доступной информации для обучения. В последние годы веб-скрапинг стал стандартным методом для сборки больших наборов данных в масштабе. Собирая публично доступный онлайн-контент, исследователи и разработчики получили огромные и разнообразные ресурсы данных.

Популярным примером является Common Crawl, который к 2025 году хранил петабайты текста, собранного через ежемесячные поиски более 250 терабайт каждый. Этот набор данных широко используется для обучения текстовых моделей ИИ. Другим примером является LAION-5B, который содержит около 5,85 миллиардов пар изображений и текста. Он был важен для приложений, таких как Stable Diffusion, который может создавать реалистичные изображения из письменных подсказок.

Эти наборы данных ценны, потому что они увеличивают точность модели, улучшают обобщение через разнообразный контент и позволяют меньшим группам, включая университеты, участвовать в разработке ИИ. Индекс ИИ Стэнфорда 2025 года показывает, что большинство передовых моделей все еще полагаются на данные, собранные методом скрапинга, при этом размер наборов данных растет быстро. Этот спрос также привел к значительным инвестициям, достигшим более 57 миллиардов долларов в 2024 году для центров данных и вычислительной мощности.

В то же время веб-скрапинг не свободен от проблем. Он вызывает вопросы о защите данных, праве собственности и юридических правах, поскольку большая часть собранного контента не была создана для использования в машинах. Судебные дела и обсуждения политики показывают, что эти проблемы становятся все более срочными. Будущее сбора данных ИИ будет зависеть от нахождения баланса между прогрессом и этической ответственностью.

Проблема защиты данных в скрапированных данных

Инструменты веб-скрапинга собирают информацию без четкого разделения между общим контентом и чувствительными деталями. Вместе с текстом и изображениями они часто захватывают личную идентифицирующую информацию (ЛИИ), такую как имена, адреса электронной почты и фотографии лиц.

Аудит набора данных CommonPool в июле 2025 года показал, что даже после фильтрации 0,1% образцов все еще содержали идентифицируемые лица, государственные идентификаторы и документы, такие как резюме и паспорта. Хотя процент кажется небольшим, в масштабе миллиардов записей это переводится в сотни миллионов затронутых лиц. Обзоры и аудиты безопасности подтверждают, что присутствие такого материала не является необычным, и его риски включают кражу личности, целевую преследование и непреднамеренное раскрытие частных данных.

Юридические споры также увеличиваются, поскольку проблемы с правом собственности и справедливым использованием переходят в суд. Между 2023 и 2024 годами компании, такие как OpenAI и Stability AI, столкнулись с судебными исками за использование личных и защищенных авторским правом данных без согласия. В феврале 2025 года федеральный суд США постановил, что обучение ИИ на нелицензированной личной информации является нарушением. Это решение привело к увеличению количества коллективных исков. Авторское право является еще одной серьезной проблемой. Многие скрапированные наборы данных содержат книги, статьи, произведения искусства и код. Писатели и художники утверждают, что их работа используется без одобрения или оплаты. Продолжающийся судебный процесс New York Times против OpenAI ставит под вопрос, являются ли системы ИИ незаконным воспроизведением защищенного контента. Визуальные художники высказали аналогичные претензии, утверждая, что ИИ копирует их индивидуальный стиль. В июне 2025 года один суд США поддержал компанию ИИ по справедливому использованию, но эксперты говорят, что решения остаются не последовательными, а правовая база все еще неясна.

Отсутствие согласия в обучении ИИ ослабило общественное доверие. Многие люди обнаруживают, что их блоги, творческая работа или код включены в наборы данных без их ведома. Это вызвало этические проблемы и призывы к большей прозрачности. В ответ правительства переходят к более строгому надзору через законы, которые способствуют справедливому развитию моделей ИИ и осторожному использованию данных.

Почему скрапированные наборы данных трудно заменить

Даже с проблемами защиты данных и согласия скрапированные наборы данных остаются необходимыми для обучения ИИ. Причина заключается в масштабе. Современные модели ИИ требуют триллионов токенов из текста, изображений и других медиа. Создание таких наборов данных только через лицензированные или отобранные источники обошлось бы в сотни миллионов долларов. Это не является практичным для большинства стартапов или университетов.

Высокая стоимость не является единственной проблемой с отобранными наборами данных. Они часто лишены разнообразия и склонны фокусироваться на конкретных языках, регионах или сообществах. Это узкое покрытие делает модели ИИ менее сбалансированными. В отличие от этого, скрапированные данные, несмотря на то, что они шумные и несовершенные, захватывают более широкий диапазон культур, тем и взглядов. Это разнообразие позволяет системам ИИ работать лучше при применении к реальным приложениям.

Риск, однако, заключается в том, что строгие правила могут ограничить доступ к скрапированным данным. Если это произойдет, меньшие организации могут столкнуться с трудностями. Большие компании с частными или проприетарными наборами данных, такие как Google (GOOGL ) или Meta, продолжат продвигаться. Это несоответствие может уменьшить конкуренцию и замедлить открытую инновацию в ИИ.

На данный момент скрапированные наборы данных являются центральными для исследований ИИ. В то же время проекты, такие как CommonPool, исследуют способы построения обширных, этически полученных коллекций. Эти усилия необходимы для того, чтобы сохранить экосистему ИИ более открытой, справедливой и ответственной.

CommonPool: к ответственной крупномасштабной инженерии данных

CommonPool является одним из наиболее технически амбициозных усилий по созданию открытого, крупномасштабного многомодального набора данных. С примерно 12,8 миллиардами пар изображений и текста он соответствует масштабу LAION-5B, но включает более сильные механизмы инженерии и управления данными. Основной целью конструкции было не только максимизировать масштаб, но и соответствовать принципам воспроизводимости, происхождения данных и соблюдения правил.

Строительство набора данных CommonPool следует структурированному трехэтапному конвейеру. Первый этап включает в себя извлечение сырых образцов из снимков Common Crawl, собранных между 2014 и 2022 годами. И изображения, и связанный с ними текст, такой как подписи или окружающие отрывки, собираются. Для оценки семантического соответствия поддерживаются используются оценки подобия на основе CLIP, отбрасывая пары с слабым соответствием между изображением и текстовыми вложениями. Этот ранний этап фильтрации существенно уменьшает шум по сравнению с наивными конвейерами скрапинга.

На втором этапе набор данных проходит крупномасштабную дедупликацию. Техники перцептивного хеширования и MinHash используются для выявления и удаления почти дубликатов изображений, предотвращая доминирование избыточности в обучении модели. Дополнительные фильтры применяются для исключения поврежденных файлов, сломанных ссылок и изображений низкого разрешения. На этом этапе конвейер также включает нормализацию текста и автоматическое определение языка, позволяя создавать доменные или языковые подмножества для целевого исследования.

Третий этап фокусируется на безопасности и соблюдении правил. Автоматическое обнаружение лиц и размытие применяются, в то время как изображения, связанные с детьми, и личные идентификаторы, такие как имена, адреса электронной почты и почтовые адреса, удаляются. Конвейер также пытается обнаружить защищенные авторским правом материалы. Хотя ни один автоматизированный метод не может гарантировать идеальную фильтрацию на уровне Веба, эти меры безопасности представляют собой значительное техническое улучшение по сравнению с LAION-5B, где фильтрация в основном ограничивалась контентом для взрослых и токсичными эвристиками.

За пределами обработки данных CommonPool вводит модель управления, которая отличает его от статических выпусков наборов данных. Он поддерживается как живой набор данных с версионными выпусками, структурированными метаданными и задокументированными циклами обновления. Каждый образец включает информацию о лицензировании, когда это возможно, поддерживая соблюдение правил авторского права. Протокол удаления позволяет лицам и учреждениям запрашивать удаление чувствительного контента, решая проблемы, вызванные актом ИИ ЕС и связанными нормативными рамками. Метаданные, такие как URL-адреса источников и баллы фильтрации, улучшают прозрачность и воспроизводимость, позволяя исследователям отслеживать решения об включении и исключении.

Результаты бенчмаркинга инициативы DataComp иллюстрируют технические эффекты этих конструктивных решений. Когда идентичные архитектуры видения и языка были обучены на LAION-5B и CommonPool, последний произвел модели с более стабильной производительностью внизу, особенно на задачах извлечения и классификации с нуля. Эти результаты предполагают, что более высокое качество соответствия CommonPool компенсирует некоторые масштабные преимущества менее отфильтрованных наборов данных. Тем не менее, независимые аудиты в 2025 году показали остаточные риски: около 0,1% набора данных все еще содержали неразмытые лица, чувствительные личные документы и медицинские записи. Это подчеркивает пределы даже самых передовых автоматизированных конвейеров фильтрации.

В целом, CommonPool представляет собой сдвиг в инженерии наборов данных от приоритета сырого масштаба к балансу масштаба, качества и соблюдения правил. Для исследователей он предоставляет воспроизводимую и относительно более безопасную основу для крупномасштабной предварительной подготовки. Для регулирующих органов он демонстрирует, что механизмы защиты данных и подотчетности могут быть встроены непосредственно в конструкцию набора данных. В отличие от LAION, CommonPool показывает, как конвейеры фильтрации, практики управления и рамки бенчмаркинга могут преобразовать крупномасштабные веб-данные в более технически прочный и этически ответственный ресурс для многомодального ИИ.

Сравнение CommonPool с традиционными веб-скрапированными наборами данных

В отличие от более ранних крупномасштабных веб-скрапированных наборов данных, таких как LAION-5B (5,85 миллиардов образцов), COYO-700M (700 миллионов образцов) и WebLI (400 миллионов образцов), CommonPool подчеркивает структуру, воспроизводимость и управление. Он сохраняет метаданные, такие как URL-адреса и временные метки, которые поддерживают прослеживаемость и частичные проверки лицензий. Кроме того, он применяет фильтрацию на основе CLIP для удаления пар изображений и текста с низким качеством или слабым соответствием, в результате чего улучшается качество данных.

В сравнении с этим LAION-5B и COYO были собраны из Common Crawl с ограниченной фильтрацией и без подробной документации лицензирования. Эти наборы данных часто содержат чувствительный материал, включая медицинские записи, документы удостоверения личности и неразмытые лица. WebLI, используемый внутренне OpenAI, также лишен прозрачности, поскольку он никогда не выпускался для внешнего обзора или воспроизведения.

CommonPool стремится решить эти проблемы, исключая личную идентифицирующую информацию и нецензурный контент, признавая, что полное согласие пользователей остается нерешенной проблемой. Это делает его относительно более надежным и этически выровненным, чем более ранние альтернативы.

Итог

Разработка CommonPool отражает важный переход в том, как крупномасштабные наборы данных ИИ концептуализируются и поддерживаются. Хотя более ранние коллекции, такие как LAION-5B и COYO, отдали приоритет масштабу с ограниченным надзором, CommonPool демонстрирует, что прозрачность, фильтрация и управление могут быть интегрированы в конструкцию набора данных без ущерба для его применимости для исследований.

Сохраняя метаданные, применяя проверки семантического соответствия и встраивая меры безопасности, он предлагает более воспроизводимый и подотчетный ресурс. В то же время независимые аудиты напоминают нам, что автоматизированные меры безопасности не могут полностью исключить риски, подчеркивая необходимость продолжения бдительности.

Доктор Ассад Аббас, доцент COMSATS University Islamabad, Пакистан, получил степень доктора философии в Северодакотском государственном университете, США. Его исследования сосредоточены на передовых технологиях, включая облачные, туманные и краевые вычисления, анализ больших данных и ИИ. Доктор Аббас внес значительный вклад с публикациями в авторитетных научных журналах и конференциях. Он также является основателем MyFastingBuddy.