Ética

Google revela el uso de datos web públicos en el entrenamiento de su IA

mm
Añade Unite.AI a tus fuentes preferidas en Google

En una actualización reciente de su política de privacidad, Google (GOOGL ) ha admitido abiertamente el uso de información pública disponible en la web para entrenar sus modelos de IA. Esta divulgación, detectada por Gizmodo, incluye servicios como Bard y Cloud AI. La portavoz de Google, Christa Muldoon, declaró a The Verge que la actualización simplemente aclara que los servicios más nuevos, como Bard, también están incluidos en esta práctica, y que Google incorpora principios y salvaguardas de privacidad en el desarrollo de sus tecnologías de IA.

La transparencia en las prácticas de entrenamiento de IA es un paso en la dirección correcta, pero también plantea una serie de preguntas. ¿Cómo garantiza Google la privacidad de los individuos al utilizar datos públicamente disponibles? ¿Qué medidas están en lugar para prevenir el mal uso de estos datos?

Las implicaciones de los métodos de entrenamiento de IA de Google

La política de privacidad actualizada ahora establece que Google utiliza la información para mejorar sus servicios y desarrollar nuevos productos, características y tecnologías que beneficien a sus usuarios y al público. La política también especifica que la empresa puede utilizar información pública disponible para entrenar los modelos de IA de Google y crear productos y características como Google Translate, Bard y capacidades de Cloud AI.

Sin embargo, la política no aclara cómo Google evitará que los materiales con derechos de autor se incluyan en el conjunto de datos utilizado para el entrenamiento. Muchos sitios web accesibles públicamente tienen políticas que prohíben la recopilación de datos o el scraping web con el fin de entrenar grandes modelos de lenguaje y otros conjuntos de herramientas de IA. Este enfoque podría potencialmente entrar en conflicto con regulaciones globales como el GDPR que protegen a las personas contra el mal uso de sus datos sin su permiso expreso.

El uso de datos públicamente disponibles para el entrenamiento de IA no es inherentemente problemático, pero se vuelve así cuando infringe las leyes de derechos de autor y la privacidad individual. Es un equilibrio delicado que las empresas como Google deben navegar con cuidado.

El impacto más amplio de las prácticas de entrenamiento de IA

El uso de datos públicamente disponibles para el entrenamiento de IA ha sido un tema controvertido. Sistemas de IA generativos populares como GPT-4 de OpenAI han sido reticentes sobre sus fuentes de datos y si incluyen publicaciones en redes sociales o obras con derechos de autor de artistas y autores humanos. Esta práctica actualmente se encuentra en un área gris legal, lo que ha generado varias demandas y ha llevado a los legisladores de algunas naciones a introducir leyes más estrictas para regular cómo las empresas de IA recopilan y utilizan sus datos de entrenamiento.

El mayor editor de periódicos de Estados Unidos, Gannett, está demandando a Google y su empresa matriz, Alphabet (GOOG ), alegando que los avances en la tecnología de IA han ayudado al gigante de la búsqueda a mantener un monopolio en el mercado publicitario digital. Mientras tanto, plataformas sociales como Twitter y Reddit han tomado medidas para evitar que otras empresas cosechen libremente sus datos, lo que ha generado una reacción en sus respectivas comunidades.

Estos desarrollos subrayan la necesidad de directrices éticas sólidas en IA. A medida que la IA continúa evolucionando, es crucial que las empresas equilibren el avance tecnológico con consideraciones éticas. Esto incluye respetar las leyes de derechos de autor, proteger la privacidad individual y garantizar que la IA beneficie a toda la sociedad, no solo a unos pocos elegidos.

La reciente actualización de la política de privacidad de Google ha arrojado luz sobre las prácticas de entrenamiento de IA de la empresa. Sin embargo, también plantea preguntas sobre las implicaciones éticas del uso de datos públicamente disponibles para el entrenamiento de IA, la posible infracción de las leyes de derechos de autor y el impacto en la privacidad del usuario. A medida que avanzamos, es esencial que continuemos esta conversación y trabajemos hacia un futuro en el que la IA se desarrolle y se utilice de manera responsable.

Alex McFarland es un periodista y escritor de inteligencia artificial que explora los últimos desarrollos en inteligencia artificial. Ha colaborado con numerosas startups y publicaciones de inteligencia artificial en todo el mundo.