Modelos y plataformas de IA
El Problema del Plagio: CÃģmo los Modelos de Inteligencia Artificial Generativa Reproducen Contenido con Derechos de Autor
Los rÃĄpidos avances en la inteligencia artificial generativa han despertado entusiasmo sobre el potencial creativo de la tecnologÃa. Sin embargo, estos poderosos modelos tambiÃĐn plantean riesgos preocupantes en torno a la reproducciÃģn de contenido con derechos de autor o plagio sin la debida atribuciÃģn.
CÃģmo las Redes Neuronales Absorben los Datos de Entrenamiento
Los sistemas de inteligencia artificial modernos, como GPT-3, se entrenan a travÃĐs de un proceso llamado aprendizaje de transferencia. Ingestan grandes conjuntos de datos extraÃdos de fuentes pÚblicas como sitios web, libros, artÃculos acadÃĐmicos y mÃĄs. Por ejemplo, los datos de entrenamiento de GPT-3 abarcaron 570 gigabytes de texto. Durante el entrenamiento, el modelo de inteligencia artificial busca patrones y relaciones estadÃsticas en este vasto conjunto de datos. Aprende las correlaciones entre palabras, oraciones, pÃĄrrafos, estructura del lenguaje y otras caracterÃsticas.
Esto permite que el modelo de inteligencia artificial genere nuevo texto coherente o imÃĄgenes prediciendo secuencias que probablemente sigan a una entrada o prompt dada. Sin embargo, tambiÃĐn significa que estos modelos absorben contenido sin considerar los derechos de autor, la atribuciÃģn o los riesgos de plagio. Como resultado, los modelos de inteligencia artificial generativa pueden reproducir involuntariamente pasajes idÃĐnticos o parafrasear texto con derechos de autor de sus corpus de entrenamiento.
Ejemplos Clave de Plagio de Inteligencia Artificial
Las preocupaciones sobre el plagio de inteligencia artificial surgieron prominentemente desde 2020 despuÃĐs del lanzamiento de GPT.
Investigaciones recientes han demostrado que los grandes modelos de lenguaje (LLM) como GPT-3 pueden reproducir pasajes idÃĐnticos sustanciales de sus datos de entrenamiento sin citaciÃģn (Nasr et al., 2023; Carlini et al., 2022). Por ejemplo, una demanda de The New York Times revelÃģ que el software de OpenAI generaba artÃculos de The New York Times casi idÃĐnticos (The New York Times, 2023).
Estos hallazgos sugieren que algunos sistemas de inteligencia artificial generativa pueden producir salidas plagio sin solicitar, lo que arriesga la infracciÃģn de derechos de autor. Sin embargo, la prevalencia sigue siendo incierta debido a la naturaleza de âcaja negraâ de los LLM. La demanda de The New York Times argumenta que tales salidas constituyen infracciÃģn, lo que podrÃa tener implicaciones importantes para el desarrollo de la inteligencia artificial generativa. En general, la evidencia indica que el plagio es un problema inherente a los grandes modelos de redes neuronales que requiere vigilancia y salvaguardas.
Estos casos revelan dos factores clave que influyen en los riesgos de plagio de la inteligencia artificial:
- TamaÃąo del modelo â Los modelos mÃĄs grandes como GPT-3.5 son mÃĄs propensos a regenerar pasajes de texto idÃĐnticos en comparaciÃģn con los modelos mÃĄs pequeÃąos. Sus conjuntos de datos de entrenamiento mÃĄs grandes aumentan la exposiciÃģn a material fuente con derechos de autor.
- Datos de entrenamiento â Los modelos entrenados con datos de Internet raspados o obras con derechos de autor (incluso si estÃĄn licenciadas) son mÃĄs propensos a plagiar en comparaciÃģn con los modelos entrenados con conjuntos de datos cuidadosamente curados.
Sin embargo, medir directamente la prevalencia de salidas plagio es desafiante. La naturaleza de âcaja negraâ de las redes neuronales hace que sea difÃcil rastrear completamente el enlace entre los datos de entrenamiento y las salidas del modelo. Las tasas probablemente dependen mucho de la arquitectura del modelo, la calidad del conjunto de datos y la formulaciÃģn de la entrada. Pero estos casos confirman que el plagio de la inteligencia artificial ocurre inequÃvocamente, lo que tiene implicaciones legales y ÃĐticas crÃticas.
Sistemas de DetecciÃģn de Plagio Emergentes
En respuesta, los investigadores han comenzado a explorar sistemas de inteligencia artificial para detectar automÃĄticamente el texto y las imÃĄgenes generadas por modelos versus creadas por humanos. Por ejemplo, los investigadores de Mila propusieron GenFace, que analiza patrones lingÞÃsticos indicativos de texto escrito por inteligencia artificial. La startup Anthropic tambiÃĐn ha desarrollado capacidades de detecciÃģn de plagio internas para su inteligencia artificial conversacional Claude.
Sin embargo, estas herramientas tienen limitaciones. Los datos de entrenamiento masivos de modelos como GPT-3 hacen que sea difÃcil, si no imposible, identificar las fuentes originales de texto plagio. Se necesitarÃĄn tÃĐcnicas mÃĄs robustas a medida que los modelos generativos continÚen evolucionando rÃĄpidamente. Hasta entonces, la revisiÃģn manual sigue siendo esencial para filtrar las salidas de inteligencia artificial potencialmente plagio o infractoras antes de su uso pÚblico.
Mejores PrÃĄcticas para Mitigar el Plagio de la Inteligencia Artificial Generativa
Aquà hay algunas mejores prÃĄcticas que tanto los desarrolladores de inteligencia artificial como los usuarios pueden adoptar para minimizar los riesgos de plagio:
Para los desarrolladores de inteligencia artificial:
- Verificar cuidadosamente las fuentes de los datos de entrenamiento para excluir material con derechos de autor o licenciado sin permisos adecuados.
- Desarrollar procedimientos rigurosos de documentaciÃģn de datos y seguimiento de la procedencia. Registrar metadatos como licencias, etiquetas, creadores, etc.
- Implementar herramientas de detecciÃģn de plagio para marcar contenido de alto riesgo antes de su lanzamiento.
- Proporcionar informes de transparencia que detallen las fuentes de los datos de entrenamiento, licencias y orÃgenes de las salidas de la inteligencia artificial cuando surjan preocupaciones.
- Permitir que los creadores de contenido opten por salir fÃĄcilmente de los conjuntos de datos de entrenamiento. Cumplir rÃĄpidamente con las solicitudes de retiro o exclusiÃģn.
Para los usuarios de inteligencia artificial generativa:
- Examinar exhaustivamente las salidas para cualquier pasaje potencialmente plagio o sin atribuciÃģn antes de implementar a gran escala.
- Evitar tratar a la inteligencia artificial como sistemas creativos completamente autÃģnomos. Tener revisores humanos que examinen el contenido final.
- Favorecer la creaciÃģn asistida por humanos sobre la generaciÃģn de contenido completamente nuevo desde cero. Usar modelos para parafrasear o idear en lugar de crear.
- Consultar los tÃĐrminos de servicio, polÃticas de contenido y salvaguardias contra el plagio de los proveedores de inteligencia artificial antes de su uso. Evitar modelos opacos.
- Citar fuentes claramente si aparece material con derechos de autor en la salida final a pesar de los mejores esfuerzos. No presentar el trabajo de la inteligencia artificial como completamente original.
- Limitar la comparticiÃģn de salidas de forma privada o confidencial hasta que los riesgos de plagio puedan ser evaluados y abordados mÃĄs a fondo.
Las regulaciones mÃĄs estrictas sobre los datos de entrenamiento pueden ser necesarias a medida que los modelos generativos continÚan proliferando. Esto podrÃa involucrar requerir el consentimiento de los creadores antes de que su trabajo se agregue a los conjuntos de datos. Sin embargo, la responsabilidad recae en ambos, desarrolladores y usuarios, para emplear prÃĄcticas ÃĐticas de inteligencia artificial que respeten los derechos de los creadores de contenido.
Plagio en la V6 Alpha de Midjourney
DespuÃĐs de una limitada entrada de prompts, el modelo V6 de Midjourney generÃģ imÃĄgenes casi idÃĐnticas a pelÃculas, programas de televisiÃģn y capturas de pantalla de videojuegos con derechos de autor, probablemente incluidas en sus datos de entrenamiento.
Estos experimentos confirman aÚn mÃĄs que incluso los sistemas de inteligencia artificial visual de vanguardia pueden plagiar involuntariamente contenido protegido si la procedencia de los datos de entrenamiento no se controla. Subraya la necesidad de vigilancia, salvaguardas y supervisiÃģn humana al implementar modelos generativos comercialmente para limitar los riesgos de infracciÃģn.
Respuesta de las Empresas de Inteligencia Artificial sobre Contenido con Derechos de Autor
Las lÃneas entre la creatividad humana y la de la inteligencia artificial se estÃĄn desdibujando, creando complejas preguntas sobre los derechos de autor. Las obras que combinan la entrada humana y la de la inteligencia artificial pueden ser solo copyrightables en aspectos ejecutados Únicamente por el ser humano.
La Oficina de Derechos de Autor de los Estados Unidos recientemente denegÃģ los derechos de autor a la mayorÃa de los aspectos de una novela grÃĄfica de inteligencia artificial humana, considerando el arte de la inteligencia artificial como no humano. TambiÃĐn emitiÃģ orientaciÃģn que excluye a los sistemas de inteligencia artificial de la âautorÃaâ. Los tribunales federales confirmaron esta postura en un caso de derechos de autor de arte de inteligencia artificial.
Mientras tanto, las demandas alegan que la inteligencia artificial generativa infringe, como Getty v. Stability AI y artistas v. Midjourney/Stability AI. Pero sin âautoresâ de inteligencia artificial, algunos cuestionan si las reclamaciones de infracciÃģn se aplican.
En respuesta, las principales empresas de inteligencia artificial como Meta, Google (GOOGL ), Microsoft (MSFT ) y Apple (AAPL ) argumentaron que no deberÃan necesitar licencias o pagar regalÃas para entrenar modelos de inteligencia artificial con datos con derechos de autor.
Aquà hay un resumen de los argumentos clave de las principales empresas de inteligencia artificial en respuesta a las posibles nuevas reglas de derechos de autor de los Estados Unidos sobre la inteligencia artificial, con citas:
Meta argumenta que imponer licencias ahora causarÃa caos y proporcionarÃa poco beneficio a los titulares de derechos de autor.
Google afirma que el entrenamiento de la inteligencia artificial es anÃĄlogo a actos no infractores como leer un libro (Google, 2022).
Microsoft advierte que cambiar la ley de derechos de autor podrÃa desventajar a los pequeÃąos desarrolladores de inteligencia artificial.
Apple quiere copyright el cÃģdigo generado por la inteligencia artificial controlado por desarrolladores humanos.
En general, la mayorÃa de las empresas se oponen a los nuevos mandatos de licencia y minimizan las preocupaciones sobre los sistemas de inteligencia artificial que reproducen obras protegidas sin atribuciÃģn. Sin embargo, esta postura es controvertida dado los recientes litigios y debates sobre los derechos de autor de la inteligencia artificial.
Camino hacia la InnovaciÃģn Responsable de la Inteligencia Artificial Generativa
A medida que estos poderosos modelos generativos continÚan avanzando, es crucial abordar los riesgos de plagio para lograr una aceptaciÃģn generalizada. Se requiere un enfoque multifacÃĐtico:
- Reformas de polÃticas sobre la transparencia de los datos de entrenamiento, licencias y consentimiento de los creadores.
- TecnologÃas de detecciÃģn de plagio mÃĄs fuertes y una mejor gobernanza interna por parte de los desarrolladores.
- Mayor conciencia de los usuarios sobre los riesgos y la adhesiÃģn a los principios ÃĐticos de la inteligencia artificial.
- Precedentes legales claros y jurisprudencia en torno a los problemas de derechos de autor de la inteligencia artificial.
Con las salvaguardas adecuadas, la creaciÃģn asistida por la inteligencia artificial puede florecer de manera ÃĐtica. Pero los riesgos no controlados de plagio podrÃan socavar significativamente la confianza pÚblica. Abordar directamente este problema es clave para realizar el inmenso potencial creativo de la inteligencia artificial generativa mientras se respetan los derechos de los creadores. Lograr el equilibrio correcto requerirÃĄ confrontar activamente el punto ciego del plagio construido en la naturaleza misma de las redes neuronales. Pero hacerlo garantizarÃĄ que estos poderosos modelos no socaven la ingenuidad humana que pretenden aumentar.













