Ángulo de Anderson
Métodos de lavado de IP en IA

Si hay un ajuste de cuentas legal por el uso de la propiedad intelectual en el entrenamiento de la IA, también hay varios métodos para ocultar dicho uso.
Opinión La actual revolución en la IA generativa que se está desarrollando es la más precaria desde el punto de vista legal que ha acompañado a cualquier desarrollo tecnológico transformador desde el siglo XIX.
Hasta hace 3-4 años, la comunidad de investigación de aprendizaje automático disfrutaba de un permiso tácito (a menudo explícito) para explotar material protegido por derechos de autor en el curso del desarrollo de nuevos sistemas; desde que estos sistemas no eran aún exitosos, en términos de ser maduros o viables comercialmente, los resultados eran, en todos los sentidos, académicos.
En ese período, el éxito repentino de una nueva generación de modelos de lenguaje grandes basados en difusión (LLMs, como ChatGPT y Claude) y modelos de visión-lenguaje (VLMs, como Sora) señaló que estas líneas de investigación abstractas y hasta entonces “inofensivas” se habían desarrollado en viabilidad comercial y habían superado su “pase libre” en cuanto a la explotación de la propiedad intelectual de otras personas.
A partir de ahora, los titulares de derechos buscarían una participación en los frutos de los sistemas de IA entrenados en gran medida o en parte con sus datos protegidos por derechos de autor o de otro tipo, lo que llevó a una avalancha continua de casos legales que requiere algunos esfuerzos para simplemente mantenerse al día.

Aquí limitado solo a los casos presentados en los EE. UU., nuevos casos surgen a un ritmo frenético en los Estados Unidos y más allá. Fuente
Exigiendo un “Almuerzo Gratis”
El compromiso financiero actualmente en curso en cuanto a la infraestructura de IA ha sido sugerido por algunas voces como un esfuerzo para enterrar la IA “peligrosa para los derechos de autor” tan profundamente en la economía de la sociedad que se convierta no solo en “demasiado grande para fallar”, sino también en “demasiado poderosa para ser demandada” – o demasiado poderosa, al menos, para que se permitan demandas exitosas que puedan desbaratar la revolución.
Hacia este sentimiento general, el presidente actual de los Estados Unidos está comprometiendo en política su visión de que ‘No se puede esperar que tenga un programa de IA exitoso cuando cada artículo, libro o cualquier otra cosa que haya leído o estudiado, se supone que debe pagar por ello’.
¿Realmente? Nada remotamente similar o comparable ha ocurrido en la era industrial occidental, y esto representa un movimiento que se opone severamente a la cultura tradicional de los EE. UU. de litigio y reparación; quizás las posiciones más similares son la expiración obligatoria de las patentes de medicamentos después de 20 años (que en sí está frecuentemente bajo ataque), y la limitación de las expectativas de privacidad en lugares públicos.
Sin embargo, los tiempos cambian; en ausencia de cualquier garantía de que la tendencia actual hacia el “dominio eminente” contra las protecciones de la propiedad intelectual no fracasará, o de lo contrario se revertirá más tarde, hay varios enfoques secundarios que se están convirtiendo en práctica estándar en el desarrollo de sistemas de IA, y el tratamiento de los datos de entrenamiento controvertidos que los alimentan.
Conjuntos de datos por delegación
Uno de estos enfoques adopta un enfoque notablemente similar a la defensa (no siempre exitosa) de los sitios que enumeran torrents, que no almacenan ni sirven ningún material controvertido – o ningún material en absoluto.
Además de evitar la necesidad de almacenar y servir grandes cantidades de datos de imagen o video mínimamente comprimibles, estas colecciones permiten una actualización rápida – como la eliminación de material a petición de los titulares de los derechos de autor – y versionado.
Al igual que los torrents son solo señales de dónde se puede encontrar material protegido por derechos de autor, una serie de conjuntos de datos muy influyentes son en sí mismos solo listas de estilo “puntero” de datos existentes; si el usuario final desea utilizar estas listas como una lista de descarga para su propio conjunto de datos, eso es responsabilidad de ellos, en lo que respecta a la responsabilidad de los curadores.
Entre ellos se encuentra el conjunto de datos Conceptual 12M de Google Research, que proporciona subtítulos para imágenes, pero solo apunta a ubicaciones en la web donde existen (o existían en el momento de la curación) estas imágenes:

Dos ejemplos de la curación de Conceptual 12M de Google Research. Fuente
Otro ejemplo destacado, y que ahora tiene un reclamo válido a la reverencia en la historia de la IA, es el conjunto de datos LAION que facilitó el advenimiento del sistema generativo de difusión estable en 2022 – el primer marco de este tipo que ofreció imágenes generativas de código abierto poderosas a los usuarios finales, justo cuando los sistemas propietarios parecían establecer estos servicios como un dominio comercial puramente acotado:

Una de las muchas variantes del proyecto LAION, con obras de arte modernas y protegidas por derechos de autor. Fuente
En muchos casos, los tamaños de archivo grandes de algunas de estas “colecciones de punteros” indican la inclusión de contenido de imagen en un archivo descargable y alojado; sin embargo, los tamaños de descarga no triviales a menudo se deben al gran volumen de contenido de texto y, a veces, a la inclusión de embeddings extraídos o características – resúmenes o nodos derivados de contenido aplicable de otro modo extraído de los datos de origen durante el proceso de entrenamiento.
El premio de video
Los conjuntos de datos de video presentan un caso aún más fuerte para el enfoque de “conjunto de datos por delegación” o de punteros, ya que el gran volumen de datos de almacenamiento necesarios para agregar una cantidad significativa y útil de videos en una sola colección descargable es prohibitivo, y un método “distribuido” es deseable.
Sin embargo, en ambos casos – pero particularmente con el video – las URL de origen descargables representan datos que necesitarán una atención significativa adicional antes de ser utilizados en los procesos de entrenamiento. Tanto las imágenes como los videos necesitarán ser redimensionados, o bien se tomarán decisiones de recorte, para crear muestras que quepan en el espacio de GPU disponible. Incluso los videos muy reducidos también requerirán cortes a longitudes muy cortas, como 3-5 segundos, típicamente.
Los conjuntos de datos de video notables que utilizan referencias a videos en línea (en lugar de la curación y el empaquetado directo de video) incluyen el conjunto de datos de video de acción humana Kinetics de Google y la colección YouTube-8M de la empresa, que utiliza anotación de segmentos para indicar cómo tratar cada video una vez descargado – pero que una vez más deja al usuario final obtener los videos de las URL proporcionadas.
Cerrar y abrir
Finalmente, en esta categoría, los datos de VFX “abiertos” pueden generarse con plataformas cerradas que luego publican y ponen a disposición el conjunto de datos resultante. Es razonable preguntarse por qué sucede esto y considerar si puede ser porque la empresa originadora desea sanear un modelo de aguas arriba no amigable con la propiedad intelectual para su propio uso; o que se solicitó un conjunto “lavado” desde fuera.
Un caso de “lavado generacional” es, argumentablemente, el conjunto de datos Omni-VFX, que incorpora muchos puntos de datos del conjunto de datos Open-VFX (que a su vez hace referencia a muchas plataformas cerradas y semicerradas, como Pika y PixVerse).
Para ser honesto, Omni-VFX ni siquiera está tratando de hacerlo:

En el conjunto de datos de código abierto Omni-VFX, una cara familiar. Fuente
Responsabilidad ancestral
El segundo enfoque importante para el lavado de IP es a través del uso de material con derechos de autor a una o varias eliminaciones. Uno de los métodos en esta categoría es el uso de datos sintéticos que se han entrenado, en algún momento aguas arriba, con datos con derechos de autor. En tales casos, más particularmente donde los datos sintéticos pueden obtener resultados auténticos, el trabajo con derechos de autor suministra transformaciones que no podrían razonablemente adivinarse o aproximarse mediante modelos generales del mundo o modelos no especializados.
Esto es enfáticamente el caso donde se requieren sistemas generativos de video para generar “imposibles” eventos y eventos que caerían generalmente en la categoría de “efectos visuales” (VFX).
De hecho, lo que trajo este tema a mi mente fue el último de una serie de artículos de investigación que ofrecen la capacidad de “abstraer” diversos tipos de efectos visuales, como producir haces de láser de partes improbables del cuerpo, ya sea mediante el entrenamiento en clips de VFX personalizados o “de código abierto” (en lugar de la fuente más obvia, como los costosos disparos de VFX encontrados en la salida del universo cinematográfico de Marvel):
Ejemplos del sitio web EffectMaker, donde la “acción” en el clip de origen (lejos a la izquierda) se aplica a una imagen de origen (centro). Fuente
Los ejemplos anteriores provienen de la página del proyecto para el proyecto EffectMaker. EffectMaker no es el primer ofrecimiento de este año que busca extraer dinámicas de VFX de un clip de video y transponerlas a un clip nuevo, y de hecho esto se está convirtiendo en una tarea subordinada en la investigación de VFX de IA*.
Conscientes de que los gigantes de los medios como Marvel tienen una mayor probabilidad de ganar casos legales sobre la propiedad intelectual (incluso en el clima mencionado de “tolerancia forzada”), las empresas de efectos visuales y las startups están actualmente tomando medidas notables para asegurarse de que sus marcos generativos de VFX estén libres de la propiedad intelectual corporativa de otras empresas.
Primero entre ellos es Meta, que ha sido informado en el subreddit r/vfx de haber ido a una racha de contratación bien remunerada en el invierno de 2026, ofreciendo a los artistas de VFX trabajo para entrenar modelos de IA para producir disparos de efectos visuales de nivel de Hollywood. Aunque el pago no se especificó en varios posts, uno lo describió como “dinero para la jubilación”.
Sigue el dinero
Sin embargo, uno se pregunta cuánto dinero están dispuestos a pagar incluso los como Meta por una verdadera diversidad y abundancia de disparos de VFX ad hoc, considerando que el disparo de VFX promedio para una película de gran presupuesto está alrededor de $42,000 USD – y muchos cuestan mucho más.
Además, es razonable suponer que los modelos de IA generativos de VFX personalizados accederán a la demanda popular, incluyendo varios efectos estándar de tropos de las categorías de películas más populares y costosas.
Aparte del punto de vista de que los profesionales de VFX “restantes” podrían terminar recreando disparos que trabajaron en un catálogo de películas existente† – lo que en sí mismo contextualiza el trabajo de datos personalizados como imitativo – no hay garantía de que estas muestras nuevas y costosas se entrenarán “desde cero” en una arquitectura completamente nueva.
De hecho, si estas recreaciones se desvían en módulos adjuntos como LoRAs, que dependen de un modelo base, entonces el proceso es solo tan defendible como el modelo base es “limpio de IP” – y no muchos lo son.
De manera similar, si el “nuevo” proceso utiliza otras técnicas “híbridas” como afinación, donde el valor del efecto visual depende de modelos, priores, o embeddings de colecciones o modelos anteriores de integridad no comprobada, la originalidad del trabajo es arguablemente cosmética y está sujeta a desafío.
Misiones imposibles
El dominio de la salida de VFX es un caso de estudio particularmente interesante en cuanto al posible lavado de IP en los conjuntos de datos de IA, ya que los disparos de efectos visuales a menudo representan “imposibles” cosas para las que no habrá alternativas de código abierto disponibles.
Por ejemplo, mientras que la demolición de un edificio podría entrenarse en un modelo generativo a partir de varios clips de dominio público o de otro modo asequibles, si desea entrenar un modelo para producir haces de láser humanos, tendrá que entrenarlo en clips de VFX, robados o encargados; cosas como esas no suceden en ningún otro lugar.
Incluso en el caso de otros tipos de desastres naturales, como inundaciones dramáticas, el material de origen real disponible es poco probable que pueda reproducir puntos de vista dramáticos sobre eventos catastróficos, porque (con algunas excepciones) la gente no suele transmitir en vivo desde lugares catastróficos. Por lo tanto, las “vistas frescas” en desastres son raras en conjuntos de datos del mundo real, y cualquier modelo de IA que pueda generarlos probablemente obtuvo la información de otra parte.
La mayoría de los flujos de trabajo de tareas de IA deseables no tienen este nivel de especificidad, y en tales casos la ocultación de los beneficios de los datos protegidos por derechos de autor puede no requerir tanto esfuerzo.
Conclusión: Red entrelazada
Solo aquellos que han utilizado la IA generativa extensivamente y durante un período sostenido entenderán instintivamente que dichos sistemas luchan por combinar múltiples conceptos cuando no existen ejemplos comparables en sus datos de entrenamiento.
Esta limitación se conoce como entrelazamiento, en el que los diversos aspectos de los conceptos entrenados tienden a agruparse con elementos relacionados, en lugar de descomponerse en bloques de construcción de estilo Lego que puedan organizarse en cualquier nueva configuración que el usuario desee.
El entrelazamiento es un pozo de gravedad arquitectónica que es prácticamente imposible de escapar, al menos para los enfoques basados en difusión que caracterizan a todos los marcos de IA de generación actual. Sin embargo, puede ser que surjan nuevos enfoques en los próximos años que sean mejores para discretizar conceptos entrenados para que puedan unirse más hábilmente y ofrezcan menos indicios de su procedencia.
* No hago acusaciones contra EffectMaker, pero comento aquí sobre la generalidad de una práctica emergente en la investigación de video de IA.
† Porque estos disparos, en este tipo de películas, han generado y siguen generando dinero.
Publicado por primera vez el lunes 16 de marzo de 2026












