Моделі та платформи ШІ

Веб-скрейпінгові набори даних AI та конфіденційність: чому CommonPool заслуговує на увагу

mm
Додайте Unite.AI до бажаних джерел у Google
Web-Scraped AI Datasets and Privacy: Why CommonPool Deserves a Look

Штучний інтелект (AI) став частиною нашого повсякденного життя. Його можна побачити в медичних чат-ботах, які допомагають пацієнтам, та в генеративних інструментах, які допомагають художникам, письменникам та розробникам. Ці системи здаються просунутими, але вони залежать від одного важливого ресурсу: даних.

Більшість даних, які використовуються для навчання систем AI, походять з публічного Інтернету. Автоматизовані програми збирають великі об’єми тексту, зображень та аудіо з онлайн-платформ. Ці колекції утворюють основу відомих моделей, таких як GPT-4, Stable Diffusion та багатьох інших. Ця величезна колекція, однак, піднімає нерозв’язані питання щодо конфіденційності, власності та інформованої згоди.

Ринок навчальних наборів даних відображає масштаб цієї діяльності. На даний момент, глобальна вартість наборів даних AI оцінюється в 3,2 мільярда доларів. За прогнозами, він може зростати до 16,3 мільярдів доларів до 2034 року, з річним темпом зростання 20,5%. За цими цифрами лежить важлива проблема. Значна частина зібраного матеріалу отримується без явної згоди. Часто це містить особисті дані, авторські роботи та інші чутливі дані, які ніколи не призначалися для систем машинного навчання.

У відповідь на ці питання, досліджуються альтернативні підходи до управління даними. Одним з прикладів є CommonPool, випущений у квітні 2023 року як частина бенчмарку DataComp. Це великий набір даних із 12,8 мільярдів пар зображень та тексту, призначений для дослідження багатопланового AI. На відміну від традиційних зусиль зі скрейпінгу, він застосовує методи фільтрації, підкреслює прозорість та включає участь спільноти у своєму розвитку. Хоча це залишається предметом дискусій, CommonPool вказує на спробу створити більш відповідальні та аудитовані практики для навчальних даних AI. Такі ініціативи підкреслюють необхідність етичних стандартів у майбутньому штучного інтелекту.

Роль веб-скрейпінгових даних у розвитку штучного інтелекту

Дані є центральними для AI, а продуктивність системи тісно пов’язана з кількістю та різноманітністю інформації, доступної для навчання. Останнім часом веб-скрейпінг став стандартним методом для збірки великих наборів даних у масштабі. Збираючи публічно доступний онлайн-контент, дослідники та розробники отримали величезні та різноманітні ресурси даних.

Популярним прикладом є Common Crawl, який до 2025 року зберіг петабайти тексту, зібраного через щомісячні збори понад 250 терабайт кожен. Цей набір даних широко використовується для навчання текстових моделей AI. Іншим прикладом є LAION-5B, який містить близько 5,85 мільярдів пар зображень та тексту. Він був важливим для застосунків, таких як Stable Diffusion, який може створювати реалістичні зображення з написаних提示в.

Ці набори даних цінні, оскільки вони підвищують точність моделі, покращують узагальнення через різноманітний контент та дозволяють меншим групам, включаючи університети, брати участь у розвитку AI. Індекс штучного інтелекту Стенфорда 2025 року показує, що більшість просунутих моделей все ще залежить від скрейпінгових даних, а набори даних швидко зростають у розмірі. Цей попит також спонукав великі інвестиції, досягнувши понад 57 мільярдів доларів у 2024 році для центрів даних та обчислювальної потужності.

У той же час веб-скрейпінг не позбавлений викликів. Він піднімає питання щодо конфіденційності, власності та юридичних прав, оскільки більша частина зібраного контенту не була створена для використання машинами. Судові справи та політичні дискусії показують, що ці виклики стають все більш нагальними. Майбутнє збору даних AI залежатиме від знаходження балансу між прогресом та етичною відповідальністю.

Проблема конфіденційності зі скрейпінговими даними

Інструменти веб-скрейпінгу збирають інформацію без чіткого розрізнення між загальним контентом та чутливими даними. Разом з текстом та зображеннями, вони часто захоплюють особисті дані, такі як імена, адреси електронної пошти та фотографії обличчя.

Аудит набору даних CommonPool у липні 2025 року показав, що навіть після фільтрації 0,1% зразків все ще містили нерозмиті обличчя, урядові ідентифікатори та документи, такі як резюме та паспорти. Хоча цей відсоток здається малим, у масштабі мільярдів записів це перекладається у сотні мільйонів постраждалих осіб. Перегляди та аудити безпеки підтверджують, що присутність такого матеріалу не є незвичайним, а ризики включають крадіжку особистості, цільову харассмент та нежадану публікацію приватних даних.

Юридичні спори також зростають, оскільки питання щодо власності даних та справедливого використання переходять до суду. Між 2023 та 2024 роками компанії, такі як OpenAI та Stability AI, зіткнулися з судовими позовами за використання особистих та авторських даних без згоди. У лютому 2025 року федеральний суд США постановив, що навчання AI на нелицензованих особистих даних є порушенням авторських прав. Це рішення спонукало до更多 колективних позовів. Авторське право також є великою проблемою. Багато скрейпінгових наборів даних містять книги, статті, мистецтво та код. Письменники та художники стверджують, що їхня робота використовується без погодження чи оплати. Триває справа New York Times проти OpenAI, яка ставить під сумнів, чи системи AI незаконно відтворюють захищений контент. Візуальні художники також висунули подібні претензії, стверджуючи, що AI копіює їхній індивідуальний стиль. У червні 2025 року один суд США підтримав компанію AI під fair use, але експерти кажуть, що рішення залишаються несумісними, а юридична база все ще нечітка.

Відсутність згоди у навчанні AI підірвала публічну довіру. Багато людей виявляють, що їхні блоги, творчі роботи чи код включаються до наборів даних без їхнього відома. Це підняло етичні питання та призвело до вимог більшої прозорості. У відповідь, уряди рухаються до суворішого нагляду через закони, які сприяють справедливому розвитку моделей AI та ретельному використанню даних.

Чому скрейпінгові набори даних важко замінити

Хоча існують питання щодо конфіденційності та згоди, скрейпінгові набори даних залишаються необхідними для навчання AI. Причина полягає в масштабі. Сучасні моделі AI вимагають трильйонів токенів з тексту, зображень та інших медіа. Будівництво таких наборів даних лише через ліцензовані чи кураторські джерела коштувало б сотень мільйонів доларів. Це не є практичним для більшості стартапів чи університетів.

Висока вартість не є єдиною проблемою з кураторськими наборами даних. Вони часто缺ують різноманітності та зосереджуються на певних мовах, регіонах чи спільнотах. Це вузьке покриття робить моделі AI менш балансированими. Натомість, скрейпінгові дані, попри те, що вони шумові та неідеальні, захоплюють ширший діапазон культур, тем та поглядів. Ця різноманітність дозволяє системам AI працювати краще при застосуванні до реальних завдань.

Ризик, однак, полягає в тому, що суворі регуляції можуть обмежити доступ до скрейпінгових даних. Якщо це станеться, менші організації можуть боротися за конкуренцію. Великі компанії з приватними або власними наборами даних, такі як Google (GOOGL ) чи Meta, продовжать прогресувати. Ця дисбаланс може зменшити конкуренцію та сповільнити відкриту інновацію в AI.

На даний момент, скрейпінгові набори даних залишаються центральними для дослідження AI. У той же час, проекти, такі як CommonPool, досліджують способи будівництва великомасштабних, етично джерелених колекцій. Ці зусилля необхідні для підтримання екосистеми AI більш відкритою, справедливою та відповідальною.

CommonPool: До відповідального великомасштабного інженерії даних

CommonPool є одним з найбільш технічно амбіційних зусиль зі створення відкритого, великомасштабного багатопланового набору даних. З приблизно 12,8 мільярдами пар зображень та тексту, він відповідає масштабу LAION-5B, але інтегрує сильніше інженерію даних та механізми управління. Основною метою проекту було не тільки максимізувати масштаб, але й відповідати принципам репродуктивності, походження даних та нормативної відповідності.

Будівництво набору даних CommonPool відбувається у трьох етапах. Перший етап включає витягування сирого матеріалу з Common Crawl за період з 2014 по 2022 рік. Збираються як зображення, так і їхній асоційований текст, такий як підписи чи оточуючі пасажі. Для оцінки семантичної відповідності застосовується оцінка подібності на основі CLIP, а пари з слабкою відповідністю між зображенням та текстовими вкладеннями відкидаються. Цей ранній етап фільтрації суттєво зменшує шум порівняно з наївними пайплайнами скрейпінгу.

На другому етапі набір даних проходить великомасштабну дедуплікацію. Використовуються техніки перцептивного хешування та MinHash для ідентифікації та видалення майже дублікатів зображень, що запобігає домінуванню моделі тренування надлишковим матеріалом. Додаткові фільтри застосовуються для виключення пошкоджених файлів, розбитих посилань та низькорозширених зображень. На цьому етапі пайплайн також включає нормалізацію тексту та автоматичну ідентифікацію мови, що дозволяє створювати домен-специфічні чи мовно-специфічні підмножини для цільового дослідження.

Третій етап зосереджується на безпеці та відповідності. Автоматичне виявлення облич та розмиття застосовуються, а дитячі зображення та особисті ідентифікатори, такі як імена, адреси електронної пошти та поштові адреси, видаляються. Пайплайн також намагається виявити матеріали, що підлягають авторському праву. Хоча жодний автоматичний метод не може гарантувати ідеальне фільтрування у масштабі Інтернету, ці заходи безпеки представляють суттєве технічне покращення порівняно з LAION-5B, де фільтрування було в основному обмежено контентом для дорослих та токсичністю.

Поза обробкою даних, CommonPool вводить модель управління, яка відрізняє його від статичних випусків наборів даних. Він підтримується як живий набір даних з версіонованими випусками, структурованою метаданими та задокументованими циклами оновлення. Кожен зразок включає інформацію про ліцензування, якщо доступна, що підтримує відповідність вимогам законодавства про авторське право. Протокол видалення дозволяє особам та установам запитувати видалення чутливого контенту, що відповідає на питання, порушені законодавством ЄС про AI та пов’язаними нормативними рамками. Метадані, такі як джерельні URL та оцінки фільтрації, покращують прозорість та репродуктивність, дозволяючи дослідникам відстежувати рішення щодо включення та виключення.

Результати бенчмаркінгу ініціативи DataComp ілюструють технічні ефекти цих дизайнерських рішень. Коли ідентичні архітектури бачення-мови були треновані на LAION-5B та CommonPool, останній виробив моделі з більш стабільною продуктивністю внизу, особливо на завданнях витягування та класифікації з нуля. Ці результати свідчать про те, що вища якість відповідності CommonPool компенсує деякі переваги масштабу менш фільтрованих наборів даних. Тим не менш, незалежні аудити у 2025 році показали залишкові ризики: близько 0,1% набору даних все ще містили нерозмиті обличчя, чутливі особисті документи та медичні записи. Це підкреслює обмеження навіть найсучасніших автоматичних пайплайнів фільтрування.

Загалом, CommonPool представляє зміну в інженерії наборів даних від пріоритету суто масштабу до балансу масштабу, якості та відповідності. Для дослідників він забезпечує репродуктивну та порівняно безпечнішу основу для великомасштабної попередньої підготовки. Для регуляторів він демонструє, що механізми конфіденційності та підзвітності можуть бути вбудовані безпосередньо у будівництво набору даних. На відміну від LAION, CommonPool показує, як пайплайни фільтрування, практики управління та рамки бенчмаркінгу можуть перетворити великомасштабні веб-дані на більш технічно надійний та етично відповідальний ресурс для багатопланового AI.

Порівняння CommonPool з традиційними веб-скрейпінговими наборами даних

На відміну від попередніх великомасштабних веб-скрейпінгових наборів даних, таких як LAION-5B (5,85 мільярдів зразків), COYO-700M (700 мільйонів зразків) та WebLI (400 мільйонів зразків), CommonPool підкреслює структуру, репродуктивність та управління. Він зберігає метадані, такі як URL та часові мітки, що підтримує відстежуваність та часткову перевірку ліцензій. Крім того, він застосовує фільтрацію на основі CLIP для видалення низькоякісних або слабо пов’язаних пар зображень та тексту, що покращує якість даних.

На відміну від цього, LAION-5B та COYO були зібрані з Common Crawl з обмеженим фільтруванням та без докладної документації ліцензій. Ці набори даних часто містять чутливі матеріали, включаючи медичні записи, документи ідентифікації та нерозмиті обличчя. WebLI, який використовується внутрішньо компанією OpenAI, також не має прозорості, оскільки він ніколи не випускався для зовнішнього огляду чи реплікації.

CommonPool намагається вирішити ці питання, виключивши особисті дані та контент для дорослих, визнаючи, що повна згода користувачів залишається нерозв’язаною. Це робить його порівняно більш надійним та етично відповідальним, ніж попередні альтернативи.

Висновок

Розробка CommonPool відображає важливу трансформацію в тому, як великомасштабні набори даних AI концептуалізуються та підтримуються. Хоча раніше колекції, такі як LAION-5B та COYO, пріоритезували масштаб з обмеженим наглядом, CommonPool демонструє, що прозорість, фільтрація та управління можуть бути інтегровані у будівництво набору даних без підтримки його придатності для дослідження.

Зберігаючи метадані, застосовуючи семантичні перевірки відповідності та вбудовуючи заходи безпеки, він пропонує більш репродуктивний та підзвітний ресурс. У той же час незалежні аудити нагадують нам, що автоматичні заходи безпеки не можуть повністю усунути ризики, підкреслюючи необхідність продовжувати нагляд.

Доктор Ассад Аббас, доцент COMSATS University Islamabad, Пакистан, отримав ступінь доктора філософії в Північному державному університеті Дакоти, США. Його дослідження зосереджені на передових технологіях, включаючи хмарні, туманні та краєві обчислення, великі дані та аналіз штучного інтелекту. Доктор Аббас зробив суттєві внески з публікаціями в авторитетних наукових журналах та конференціях. Він також є засновником MyFastingBuddy.