Modelos y plataformas de IA

Conjuntos de datos de inteligencia artificial obtenidos mediante scraping web y privacidad: ¿Por qué CommonPool merece una mirada

mm
Añade Unite.AI a tus fuentes preferidas en Google
Web-Scraped AI Datasets and Privacy: Why CommonPool Deserves a Look

La inteligencia artificial (IA) se ha convertido en parte de la vida cotidiana. Es visible en chatbots médicos que guían a los pacientes y en herramientas generativas que asisten a artistas, escritores y desarrolladores. Estos sistemas parecen avanzados, pero dependen de un recurso esencial: los datos.

La mayoría de los datos utilizados para entrenar sistemas de IA provienen de Internet. Programas automatizados recopilan grandes cantidades de texto, imágenes y audio de plataformas en línea. Estas colecciones forman la base de modelos conocidos como GPT-4, Stable Diffusion y muchos otros. Sin embargo, esta vasta colección plantea preocupaciones no resueltas sobre privacidad, propiedad y consentimiento informado.

El mercado de conjuntos de datos de entrenamiento refleja la escala de esta actividad. Actualmente, el valor global de los conjuntos de datos de IA se estima en 3.2 mil millones de dólares. Según las proyecciones, puede crecer a 16.3 mil millones de dólares para 2034, con una tasa de crecimiento anual del 20,5%. Detrás de estas cifras se esconde un desafío importante. Una parte significativa del material recopilado se obtiene sin permiso explícito. A menudo contiene datos personales, obras con derechos de autor y otro contenido sensible que nunca estuvo destinado a sistemas de aprendizaje automático.

En respuesta a estos problemas, se están explorando enfoques alternativos para la gobernanza de los datos. Un ejemplo es CommonPool, lanzado en abril de 2023 como parte del benchmark DataComp. Es un conjunto de datos grande de 12.8 mil millones de pares de imagen-texto diseñado para la investigación de IA multimodal. A diferencia de los esfuerzos de scraping tradicionales, aplica métodos de filtrado, enfatiza la transparencia y incluye la participación de la comunidad en su desarrollo. Aunque sigue siendo objeto de debate, CommonPool indica un intento de construir prácticas más responsables y auditables para los datos de entrenamiento de IA. Estas iniciativas resaltan la necesidad de estándares éticos en el futuro de la inteligencia artificial.

El papel de los datos obtenidos mediante scraping web en el avance de la inteligencia artificial

Los datos son fundamentales para la IA, y el rendimiento del sistema está estrechamente vinculado a la cantidad y variedad de información disponible para el entrenamiento. En los últimos años, el scraping web se ha convertido en un método estándar para ensamblar conjuntos de datos grandes a escala. Al recopilar contenido en línea accesible públicamente, investigadores y desarrolladores han obtenido vastos y diversos recursos de datos.

Un ejemplo popular es Common Crawl, que para 2025 ha almacenado petabytes de texto recopilado a través de crawls mensuales de más de 250 terabytes cada uno. Este conjunto de datos se utiliza ampliamente para entrenar modelos de IA basados en texto. Otro ejemplo es LAION-5B, que contiene alrededor de 5.85 mil millones de pares de imagen-texto. Ha sido importante para aplicaciones como Stable Diffusion, que puede crear imágenes realistas a partir de prompts escritos.

Estos conjuntos de datos son valiosos porque aumentan la precisión del modelo, mejoran la generalización a través de contenido variado y permiten que grupos más pequeños, incluyendo universidades, participen en el desarrollo de IA. El índice de IA de Stanford 2025 muestra que la mayoría de los modelos avanzados aún dependen de datos obtenidos mediante scraping, con conjuntos de datos que crecen rápidamente en tamaño. Esta demanda también ha impulsado una gran inversión, que alcanzó más de 57 mil millones de dólares en 2024 para centros de datos y potencia de cómputo.

Al mismo tiempo, el scraping web no está exento de desafíos. Plantea preguntas sobre privacidad, propiedad y derechos legales, ya que gran parte del contenido recopilado no fue creado originalmente para uso de máquinas. Los casos judiciales y las discusiones de políticas muestran que estos desafíos se están volviendo más urgentes. El futuro de la recopilación de datos de IA dependerá de encontrar un equilibrio entre el progreso y la responsabilidad ética.

El problema de privacidad con los datos obtenidos mediante scraping

Las herramientas de scraping web recopilan información sin una separación clara entre contenido general y detalles sensibles. Junto con texto e imágenes, a menudo capturan información personal identificable (PII) como nombres, direcciones de correo electrónico y fotografías faciales.

Una auditoría del conjunto de datos CommonPool en julio de 2025 reveló que incluso después del filtrado, el 0,1% de las muestras aún contenían caras identificables, identificaciones gubernamentales y documentos como currículos y pasaportes. Si bien el porcentaje parece pequeño, a escala de miles de millones de registros, se traduce en cientos de millones de personas afectadas. Las revisiones y auditorías de seguridad confirman que la presencia de dicho material no es inusual, y sus riesgos incluyen robo de identidad, acoso dirigido y la exposición no deseada de datos personales.

Los litigios legales también están aumentando a medida que las preocupaciones sobre la propiedad de los datos y el uso justo se trasladan a los tribunales. Entre 2023 y 2024, empresas como OpenAI y Stability AI enfrentaron demandas por usar datos personales y con derechos de autor sin consentimiento. En febrero de 2025, un tribunal federal de EE. UU. dictaminó que entrenar IA con información personal no licenciada constituye una infracción. Esta decisión ha alentado más demandas colectivas. La propiedad intelectual es otro problema importante. Muchos conjuntos de datos obtenidos mediante scraping contienen libros, artículos, arte y código. Los escritores y artistas argumentan que su trabajo se utiliza sin aprobación o pago. El caso en curso de The New York Times contra OpenAI cuestiona si los sistemas de IA reproducen contenido protegido ilegalmente. Los artistas visuales han planteado quejas similares, alegando que la IA copia su estilo individual. En junio de 2025, un tribunal de EE. UU. apoyó a una empresa de IA bajo el uso justo, pero los expertos dicen que las sentencias siguen siendo inconsistentes y el marco legal sigue siendo poco claro.

La falta de consentimiento en el entrenamiento de IA ha debilitado la confianza pública. Muchas personas descubren que sus blogs, trabajos creativos o código se incluyen en conjuntos de datos sin su conocimiento. Esto ha planteado preocupaciones éticas y llamados a una mayor transparencia. En respuesta, los gobiernos se están moviendo hacia una supervisión más estricta a través de leyes que promueven el desarrollo justo de modelos de IA y el uso cuidadoso de los datos.

Por qué los conjuntos de datos obtenidos mediante scraping son difíciles de reemplazar

Incluso con preocupaciones sobre privacidad y consentimiento, los conjuntos de datos obtenidos mediante scraping siguen siendo necesarios para el entrenamiento de IA. La razón es la escala. Los modelos de IA modernos requieren billones de tokens de texto, imágenes y otros medios. Construir dichos conjuntos de datos solo a través de fuentes licenciadas o curadas costaría cientos de millones de dólares. Esto no es práctico para la mayoría de las startups o universidades.

El alto costo no es el único desafío con los conjuntos de datos curados. A menudo carecen de diversidad y tienden a centrarse en lenguajes, regiones o comunidades específicas. Esta cobertura limitada hace que los modelos de IA sean menos equilibrados. En contraste, los datos obtenidos mediante scraping, a pesar de ser ruidosos e imperfectos, capturan una gama más amplia de culturas, temas y puntos de vista. Esta diversidad permite que los sistemas de IA funcionen mejor cuando se aplican a situaciones del mundo real.

El riesgo, sin embargo, es que las regulaciones estrictas puedan restringir el acceso a los datos obtenidos mediante scraping. Si esto sucede, las organizaciones más pequeñas pueden tener dificultades para competir. Las grandes empresas con conjuntos de datos privados o propietarios, como Google (GOOGL ) o Meta, seguirán avanzando. Este desequilibrio podría reducir la competencia y frenar la innovación abierta en IA.

Por ahora, los conjuntos de datos obtenidos mediante scraping son centrales para la investigación de IA. Al mismo tiempo, proyectos como CommonPool están explorando formas de construir colecciones extensas y éticamente obtenidas. Estos esfuerzos son necesarios para mantener el ecosistema de IA más abierto, justo y responsable.

CommonPool: Hacia la ingeniería de datos a gran escala responsable

CommonPool es uno de los esfuerzos más ambiciosos técnicamente para construir un conjunto de datos multimodal abierto y a gran escala. Con aproximadamente 12.8 mil millones de pares de imagen-texto, coincide con la escala de LAION-5B pero integra mecanismos de ingeniería de datos y gobernanza más sólidos. El objetivo de diseño clave no fue solo maximizar la escala, sino también alinearse con los principios de reproducibilidad, procedencia de los datos y cumplimiento normativo.

La construcción del conjunto de datos CommonPool sigue una estructura de tres etapas. La primera etapa implica la extracción de muestras crudas de instantáneas de Common Crawl recopiladas entre 2014 y 2022. Se recopilan tanto imágenes como texto asociado, como subtítulos o pasajes circundantes. Para evaluar la alineación semántica, los responsables aplican una puntuación de similitud basada en CLIP, descartando pares con correspondencia débil entre la imagen y las incrustaciones de texto. Este paso de filtrado inicial reduce sustancialmente el ruido en comparación con las tuberías de scraping ingenuas.

En la segunda etapa, el conjunto de datos sufre una deduplicación a gran escala. Se utilizan técnicas de hashing perceptual y MinHash para identificar y eliminar imágenes casi idénticas, evitando que la redundancia domine el entrenamiento del modelo. Se aplican filtros adicionales para excluir archivos corruptos, enlaces rotos y imágenes de baja resolución. En este punto, la tubería también incluye la normalización de texto y la identificación automática de idioma, lo que permite la creación de subconjuntos específicos de dominio o idioma para investigación dirigida.

La tercera etapa se centra en la seguridad y el cumplimiento. Se aplica la detección y desenfoque automático de caras, mientras que se eliminan identificadores personales como nombres, direcciones de correo electrónico y direcciones postales. La tubería también intenta detectar materiales con derechos de autor. Aunque ningún método automatizado puede garantizar un filtrado perfecto a escala web, estas salvaguardias representan una mejora técnica significativa en comparación con LAION-5B, donde el filtrado se limitaba principalmente a contenido para adultos y toxicidad.

Más allá del procesamiento de datos, CommonPool introduce un modelo de gobernanza que lo distingue de las versiones estáticas de conjuntos de datos. Se mantiene como un conjunto de datos en vivo con versiones, metadatos estructurados y ciclos de actualización documentados. Cada muestra incluye información de licencia cuando está disponible, lo que apoya el cumplimiento de las regulaciones de derechos de autor. Un protocolo de retiro permite a individuos e instituciones solicitar la eliminación de contenido sensible, abordando preocupaciones planteadas por la Ley de IA de la UE y marcos regulatorios relacionados. Los metadatos como URLs de origen y puntuaciones de filtrado mejoran la transparencia y la reproducibilidad, lo que permite a los investigadores rastrear decisiones de inclusión y exclusión.

Los resultados de las pruebas del initiative DataComp ilustran los efectos técnicos de estas decisiones de diseño. Cuando se entrenaron arquitecturas de visión-lenguaje idénticas en LAION-5B y CommonPool, este último produjo modelos con un rendimiento más estable en tareas de recuperación y clasificación de cero disparos. Estos resultados sugieren que la calidad de alineación más alta de CommonPool compensa algunas de las ventajas de escala de los conjuntos de datos menos filtrados. Sin embargo, las auditorías independientes en 2025 revelaron riesgos residuales: alrededor del 0,1% del conjunto de datos aún contenía caras sin desenfocar, documentos personales sensibles y registros médicos. Esto destaca los límites de incluso las tuberías de filtrado automatizadas de última generación.

En general, CommonPool representa un cambio en la ingeniería de conjuntos de datos de priorizar la escala cruda a equilibrar la escala, la calidad y el cumplimiento. Para los investigadores, proporciona una base más reproducible y segura para el preentrenamiento a gran escala. Para los reguladores, demuestra que los mecanismos de privacidad y responsabilidad pueden integrarse directamente en la construcción del conjunto de datos. En contraste con LAION, CommonPool ilustra cómo las tuberías de filtrado, las prácticas de gobernanza y los marcos de benchmarking pueden transformar datos web a gran escala en un recurso más técnica y éticamente responsable para la IA multimodal.

Comparación de CommonPool con conjuntos de datos obtenidos mediante scraping web tradicionales

A diferencia de los conjuntos de datos obtenidos mediante scraping web a gran escala como LAION-5B (5.85 mil millones de muestras), COYO-700M (700 millones de muestras) y WebLI (400 millones de muestras), CommonPool enfatiza la estructura, la reproducibilidad y la gobernanza. Conserva metadatos como URLs y marcas de tiempo, lo que apoya la trazabilidad y las verificaciones de licencia parciales. Además, aplica un filtrado semántico basado en CLIP para eliminar pares de imagen-texto de baja calidad o con alineación débil, lo que resulta en una mejora de la calidad de los datos.

En comparación, LAION-5B y COYO se ensamblaron a partir de Common Crawl con un filtrado limitado y sin documentación detallada de licencia. Estos conjuntos de datos frecuentemente contienen material sensible, incluyendo registros médicos, documentos de identificación y caras sin desenfocar. WebLI, utilizado internamente por OpenAI, también carece de transparencia, ya que nunca se lanzó para revisión o replicación externa.

CommonPool busca abordar estos problemas excluyendo la información personal identificable (PII) y el contenido NSFW, mientras reconoce que el consentimiento del usuario sigue sin resolverse. Esto lo hace más confiable y alineado éticamente que las alternativas anteriores.

Conclusión

El desarrollo de CommonPool refleja una transición importante en la forma en que se conciben y mantienen los conjuntos de datos de IA a gran escala. Mientras que las colecciones anteriores como LAION-5B y COYO priorizaban la escala con una supervisión limitada, CommonPool demuestra que la transparencia, el filtrado y la gobernanza pueden integrarse en la construcción del conjunto de datos sin comprometer la utilidad para la investigación.

Al conservar los metadatos, aplicar controles de alineación semántica y incorporar salvaguardias de privacidad, ofrece un recurso más reproducible y responsable. Al mismo tiempo, las auditorías independientes nos recuerdan que las salvaguardias automatizadas no pueden eliminar completamente los riesgos, lo que destaca la necesidad de una vigilancia continua.

El Dr. Assad Abbas, profesor asociado con titularidad en la Universidad COMSATS de Islamabad, Pakistán, obtuvo su doctorado en la Universidad Estatal de Dakota del Norte, EE. UU. Su investigación se centra en tecnologías avanzadas, incluyendo computación en la nube, niebla y borde, análisis de macrodatos y IA. El Dr. Abbas ha hecho contribuciones sustanciales con publicaciones en revistas científicas y conferencias reputadas. También es el fundador de MyFastingBuddy.