Entrevistas
Denas Grybauskas, Chief Governance and Strategy Officer en Oxylabs – Serie de entrevistas

Denas Grybauskas es el Chief Governance and Strategy Officer en Oxylabs, un líder global en la recopilación de inteligencia web y soluciones de proxy de alta calidad.
Fundada en 2015, Oxylabs ofrece una de las redes de proxy más grandes y éticamente obtenidas del mundo, con más de 177 millones de IPs en 195 países, junto con herramientas avanzadas como Web Unblocker, Web Scraper API y OxyCopilot, un asistente de scraping de IA que convierte lenguaje natural en consultas de datos estructuradas.
Ha tenido un impresionante recorrido legal y de gobernanza en el espacio de tecnología legal de Lituania. ¿Qué lo motivó personalmente a abordar uno de los desafíos más polémicos de la IA, la ética y el copyright, en su rol en Oxylabs?
Oxylabs siempre ha sido el abanderado de la innovación responsable en la industria. Fuimos los primeros en defender la obtención ética de proxy y los estándares de la industria de scraping web. Ahora, con la IA avanzando tan rápido, debemos asegurarnos de que la innovación esté equilibrada con la responsabilidad.
Vimos este problema como un gran desafío para la industria de la IA y también vimos la solución. Al proporcionar estos conjuntos de datos, estamos permitiendo que las empresas de IA y los creadores estén en la misma página en cuanto al desarrollo de IA justo, lo que es beneficioso para todos los involucrados. Sabíamos lo importante que era mantener los derechos de los creadores en primer plano, pero también proporcionar contenido para el desarrollo de futuros sistemas de IA, así que creamos estos conjuntos de datos como algo que puede satisfacer las demandas del mercado actual.
El Reino Unido se encuentra en medio de una batalla por el copyright, con voces fuertes en ambos lados. ¿Cómo interpreta el estado actual del debate entre la innovación de la IA y los derechos de los creadores?
Mientras es importante que el gobierno del Reino Unido priorice la innovación tecnológica productiva, es vital que los creadores se sientan mejorados y protegidos por la IA, no robados. El marco legal actualmente debatido debe encontrar un punto medio entre fomentar la innovación y, al mismo tiempo, proteger a los creadores, y espero que en las próximas semanas encuentren una forma de equilibrar esto.
Oxylabs acaba de lanzar los primeros conjuntos de datos éticos de YouTube, que requieren el consentimiento del creador para el entrenamiento de la IA. ¿Cómo funciona exactamente este proceso de consentimiento y cuán escalable es para otras industrias como la música o la publicación?
Todos los millones de videos originales en los conjuntos de datos tienen el consentimiento explícito de los creadores para ser utilizados para el entrenamiento de la IA, conectando a los creadores y a los innovadores de manera ética. Todos los conjuntos de datos ofrecidos por Oxylabs incluyen videos, transcripciones y metadatos ricos. Si bien estos datos tienen muchos posibles usos, Oxylabs los ha refinado y preparado específicamente para el entrenamiento de la IA, que es el uso al que los creadores de contenido han acordado explícitamente.
Muchos líderes tecnológicos argumentan que requerir el consentimiento explícito de todos los creadores podría “matar” a la industria de la IA. ¿Cuál es su respuesta a esa afirmación y cómo demuestra el enfoque de Oxylabs lo contrario?
Requerir que, para cada uso de material para el entrenamiento de la IA, haya un consentimiento explícito previo presenta importantes desafíos operativos y supondría un costo significativo para la innovación de la IA. En lugar de proteger los derechos de los creadores, podría incentivarse involuntariamente a las empresas a trasladar las actividades de desarrollo a jurisdicciones con una aplicación menos rigurosa o con regímenes de copyright diferentes. Sin embargo, esto no significa que no haya un punto medio en el que el desarrollo de la IA se fomente mientras se respeta el copyright. Por el contrario, lo que necesitamos son mecanismos prácticos que simplifiquen la relación entre las empresas de IA y los creadores.
Estos conjuntos de datos ofrecen un enfoque para avanzar. El modelo de opt-out, según el cual el contenido se puede utilizar a menos que el propietario del copyright se oponga explícitamente, es otro. La tercera forma sería facilitar la negociación entre editores, creadores y empresas de IA a través de soluciones tecnológicas, como plataformas en línea.
En última instancia, cualquier solución debe operar dentro de los límites de las leyes de copyright y protección de datos aplicables. En Oxylabs, creemos que la innovación de la IA debe perseguirse de manera responsable, y nuestro objetivo es contribuir a marcos legales y prácticos que respeten a los creadores mientras permiten el progreso.
¿Cuáles fueron los mayores obstáculos que su equipo tuvo que superar para hacer que los conjuntos de datos basados en el consentimiento fueran viables?
El camino para nosotros se abrió con YouTube, que permitió a los creadores de contenido licenciar su trabajo para el entrenamiento de la IA de manera fácil y conveniente. Después de eso, nuestro trabajo fue principalmente técnico, involucrando la recopilación de datos, la limpieza y la estructuración de los mismos para preparar los conjuntos de datos, y la construcción de todo el entorno técnico para que las empresas puedan acceder a los datos que necesitan. Pero esto es algo que hemos estado haciendo durante años, de una u otra manera. Por supuesto, cada caso presenta sus propios desafíos, especialmente cuando se trata de algo tan grande y complejo como los datos multimodales. Pero teníamos el conocimiento y la capacidad técnica para hacerlo. Dado esto, una vez que los autores de YouTube tuvieron la oportunidad de dar su consentimiento, lo demás fue solo cuestión de invertir tiempo y recursos en ello.
Más allá del contenido de YouTube, ¿imagina un futuro en el que otros tipos de contenido importantes, como la música, la escritura o el arte digital, también puedan ser licenciados sistemáticamente para su uso como datos de entrenamiento?
Desde hace un tiempo, hemos estado señalando la necesidad de un enfoque sistemático para la concesión de consentimiento y la licencia de contenido para permitir la innovación de la IA mientras se equilibra con los derechos de los creadores. Solo cuando haya una forma conveniente y cooperativa para que ambas partes logren sus objetivos, habrá un beneficio mutuo.
Esto es solo el comienzo. Creemos que proporcionar conjuntos de datos como los nuestros en una variedad de industrias puede ofrecer una solución que finalmente lleve el debate sobre el copyright a un cierre amistoso.
¿Varía la importancia de ofertas como los conjuntos de datos éticos de Oxylabs según los diferentes enfoques de gobernanza de la IA en la UE, el Reino Unido y otras jurisdicciones?
Por un lado, la disponibilidad de conjuntos de datos basados en el consentimiento explícito nivelan el campo de juego para las empresas de IA con sede en jurisdicciones donde los gobiernos se inclinan hacia una regulación más estricta. La principal preocupación de estas empresas es que, en lugar de apoyar a los creadores, las reglas estrictas para obtener el consentimiento solo darán una ventaja injusta a los desarrolladores de la IA en otras jurisdicciones. El problema no es que estas empresas no se preocupen por el consentimiento, sino que, sin una forma conveniente de obtenerlo, están condenadas a quedarse atrás.
Por otro lado, creemos que si el otorgamiento de consentimiento y el acceso a datos licenciados para el entrenamiento de la IA se simplifican, no hay razón por la que este enfoque no deba convertirse en el preferido a nivel global. Nuestros conjuntos de datos construidos a partir de contenido de YouTube licenciado son un paso hacia esta simplificación.
Con el creciente desconfianza pública hacia cómo se entrena a la IA, ¿cómo cree que la transparencia y el consentimiento pueden convertirse en ventajas competitivas para las empresas tecnológicas?
Aunque la transparencia a menudo se ve como un obstáculo para la ventaja competitiva, también es nuestra mayor arma para luchar contra la desconfianza. Cuanta más transparencia puedan proporcionar las empresas de IA, más evidencia habrá de un entrenamiento de la IA ético y beneficioso, lo que a su vez reconstruye la confianza en la industria de la IA. Y, a su vez, los creadores que ven que pueden obtener valor de la innovación de la IA tendrán más razones para dar su consentimiento en el futuro.
Oxylabs a menudo se asocia con el scraping de datos y la inteligencia web. ¿Cómo se ajusta esta nueva iniciativa ética a la visión más amplia de la empresa?
El lanzamiento de conjuntos de datos éticos de YouTube continúa nuestra misión en Oxylabs de establecer y promover prácticas éticas de la industria. Como parte de esto, cofundamos la Iniciativa de Recopilación de Datos Web Ética (EWDCI) y presentamos un marco de nivel transparente para la obtención de proxy. También lanzamos el Proyecto 4β como parte de nuestra misión para permitir que los investigadores y académicos maximicen su impacto de investigación y mejoren la comprensión de los datos web críticos.
¿Cree que los gobiernos deben exigir el consentimiento por defecto para los datos de entrenamiento, o debería seguir siendo una iniciativa voluntaria de la industria?
En una economía de mercado libre, generalmente es mejor dejar que el mercado se corrija a sí mismo. Al permitir que la innovación se desarrolle en respuesta a las necesidades del mercado, continuamente reinventamos y renovamos nuestra prosperidad. La legislación pesada nunca es una buena primera opción y solo debe recurrirse a ella cuando todos los demás caminos para garantizar la justicia mientras se permite la innovación hayan sido agotados.
No parece que hayamos llegado a ese punto en el entrenamiento de la IA. Las opciones de licencia de YouTube para los creadores y nuestros conjuntos de datos demuestran que este ecosistema está buscando activamente formas de adaptarse a las nuevas realidades. Así, mientras se necesita una regulación clara para garantizar que todos actúen dentro de sus derechos, los gobiernos podrían querer proceder con cautela. En lugar de requerir el consentimiento explícito en cada caso, podrían querer examinar las formas en que las industrias pueden desarrollar mecanismos para resolver las tensiones actuales y tomar sus señales de esto cuando legislen para fomentar la innovación en lugar de obstaculizarla.
¿Qué consejo ofrecería a las startups y desarrolladores de IA que desean priorizar el uso ético de los datos sin frenar la innovación?
Una forma en que las startups pueden ayudar a facilitar el uso ético de los datos es desarrollando soluciones tecnológicas que simplifiquen el proceso de obtención del consentimiento y la derivación de valor para los creadores. A medida que surgen opciones para adquirir datos con origen transparente, las empresas de IA no necesitan comprometer la velocidad; por lo tanto, les aconsejo que mantengan los ojos abiertos para estas ofertas.
Gracias por la gran entrevista, los lectores que deseen aprender más pueden visitar Oxylabs.












