Entrevistas
Or Lenchner, CEO de Bright Data – Serie de entrevistas

Or Lenchner, CEO de Bright Data, ha liderado la plataforma de recolección de datos web líder en el mercado desde 2018, impulsando su expansión, innovación y crecimiento a más de 100 millones de dólares en ingresos anuales. Bright Data permite a las corporaciones Fortune 500, empresas líderes, universidades renombradas y entidades del sector público acceder a datos web públicos en tiempo real y a gran escala. Lenchner es un firme defensor de mantener los datos web públicos abiertos y accesibles, enfatizando su papel crucial en la impulsión de la innovación.
¿Qué inspiró su viaje en el mundo de los datos y la IA, y desde que se convirtió en CEO en 2018, cómo ha dado forma a la misión y visión de Bright Data?
Siempre me ha fascinado el poder de los datos, particularmente con cómo pueden impulsar decisiones y alimentar la innovación. Cuando se utilizan correctamente, los datos también pueden impulsar la transparencia en los negocios. Convertirme en CEO de Bright Data en 2018 me dio la oportunidad de ayudar a dar forma a cómo los investigadores de IA y las empresas van sobre la recolección y utilización de datos web públicos.
¿Cuáles son los desafíos clave que enfrentan los equipos de IA al recolectar grandes cantidades de datos web públicos, y cómo aborda Bright Data estos desafíos?
La escalabilidad sigue siendo uno de los mayores desafíos para los equipos de IA. Dado que los modelos de IA requieren grandes cantidades de datos, la recolección eficiente no es una tarea menor. Y dado que los modelos de IA solo son tan buenos como los datos en los que se entrenan, asegurarse de que los equipos tengan acceso a datos frescos y de alta calidad es un desafío constante. Esto es especialmente cierto a medida que la web evoluciona en tiempo real.
Otra preocupación importante es el cumplimiento. Las leyes y requisitos de privacidad de datos continúan evolucionando, por lo que los equipos de IA necesitan estar siempre al tanto de estos cambios. También deben entender cómo lidiar con sitios web que aplican mecanismos anti-bot, lo que puede complicar el proceso de recolección de datos.
La plataforma que hemos construido en Bright Data aborda estos desafíos. Proporcionamos recolección de datos automatizada y escalable que entrega datos en tiempo real y estructurados. Nuestras herramientas impulsadas por IA limpian y validan los datos para garantizar la precisión. Tenemos estrictas medidas en lugar para garantizar la recolección de datos legales y éticos para el cumplimiento. La idea es empoderar a los equipos de IA para que se concentren en construir grandes modelos, mientras que nosotros manejamos las complejidades de la recolección de datos.
¿Cómo contribuyen los datos web de alta calidad al rendimiento de los modelos de IA, y cuáles son las mejores prácticas para garantizar la precisión de los datos?
Los datos de alta calidad significan datos que son completos, libres de sesgos y, lo más importante, precisos. Si los datos son deficientes o están llenos de inconsistencias y errores, el modelo de IA resultante no funcionará según lo esperado.
Para lograr la precisión, es mejor obtener datos de una variedad de fuentes públicas que hayan establecido su confiabilidad. Utilizar solo unas pocas, o peor, una sola fuente de datos, resulta en problemas como la incompletitud. Tener múltiples fuentes proporciona la capacidad de cruzar datos y construir un conjunto de datos más equilibrado y representado. Además, las organizaciones deben considerar la validación y limpieza de datos automatizadas para eliminar eficientemente los datos erróneos e inconsistentes.
En Bright Data, tenemos en cuenta todos estos factores. Proporcionamos a los equipos de IA datos estructurados y en tiempo real que han sido validados para garantizar la precisión. De esa manera, pueden entrenar modelos con confianza.
¿Cuáles son las mayores preocupaciones éticas en la recolección de datos web públicos hoy en día?
La privacidad sigue siendo una de las mayores preocupaciones en la recolección de datos web públicos. La gente se preocupa por que sus datos se expongan al abuso y mal uso. Para asegurarse de que los datos permanezcan privados, es vital enfatizar la transparencia. Las organizaciones que acumulan datos deben ser transparentes sobre los datos que recopilan. Es importante asegurar al público de que sus datos se utilizan bajo estrictas pautas éticas.
Otra preocupación importante es la monopolización. Ciertas grandes empresas tienen el control de una gran cantidad de datos, lo que crea un campo de juego desigual en el que solo unos pocos tienen acceso a la información necesaria para entrenar modelos de IA y impulsar la innovación. Esto no es como debería ser. Los datos web públicos deben permanecer accesibles para las empresas, investigadores y desarrolladores. De esa manera, el desarrollo de IA no se concentra en las manos de solo unos pocos jugadores importantes.
La ética no es un pensamiento posterior en Bright Data. Están incorporadas en cada decisión que tomamos. No solo seguimos los estándares de la industria, los establecemos. Lideramos en la industria de la recolección de datos al definir los estándares éticos correctos. Queremos asegurarnos de que los datos web públicos se accedan de manera responsable, transparente y en cumplimiento con las regulaciones globales.
¿Cómo garantiza Bright Data el cumplimiento con las regulaciones globales de privacidad de datos mientras permite la recolección de datos a gran escala?
Nuestra organización se compromete a cumplir con los requisitos legales y regulatorios globales sobre la recolección y utilización de datos. Nos aseguramos de cumplir con los requisitos del GDPR, CPRA, CCPA y otras regulaciones relevantes. Importante, seguimos estrictamente los protocolos de Conozca a su Cliente (KYC) para asegurarnos de que solo los usuarios legítimos accedan a nuestra plataforma. Nuestras soluciones de datos solo pueden ser accedidas por empresas y investigadores legítimos.
Nuestra Política de Uso Aceptable también es clara al definir qué datos se pueden y no se pueden recopilar. Esto incluye el uso responsable. Tenemos un equipo de cumplimiento dedicado a la supervisión continua de las regulaciones para asegurarnos de que estamos al día con los últimos requisitos legales y regulatorios.
Aun así, creemos que los datos web públicos deben permanecer accesibles. Nuestro objetivo es proporcionar a los equipos de IA los datos que necesitan mientras garantizamos el cumplimiento con los estándares de privacidad y legales.
¿Cómo equilibra el crecimiento empresarial con la práctica ética de la recolección de datos?
Siempre pensamos en la ética y el crecimiento como no mutuamente excluyentes. La confianza de nuestros clientes y la relación que construimos con ellos son preocupaciones primordiales. Entendemos que solo podemos lograr el éxito a largo plazo si recopilamos datos en términos transparentes y de acuerdo con las leyes aplicables.
Por lo tanto, establecemos un protocolo de verificación estricto para nuestros usuarios. Esto está diseñado para asegurarnos de que los datos que recopilamos se utilicen de manera ética. Asignamos tiempo, esfuerzo y recursos a la cumplimiento y la seguridad para proteger a nuestros clientes y al público en general. Al observar la práctica ética de la recolección de datos, tenemos éxito en los negocios mientras contribuimos a la creación de un ecosistema de IA transparente y responsable.
¿Cómo se mantiene Bright Data al tanto de los cambios regulatorios en la privacidad de los datos?
Entendemos que nuestros procesos y políticas de uso de datos inevitablemente deben cambiar para reflejar los cambios en las leyes y regulaciones relevantes. Como tal, consultamos regularmente con expertos legales y nos comunicamos con los organismos regulatorios. También participamos en discusiones con legisladores y otros involucrados en la creación de políticas, brindando comentarios en la elaboración de regulaciones de datos significativas. Nos esforzamos por encontrar un equilibrio entre la innovación y la privacidad de los datos.
Nuestro marco de recolección y uso de datos evoluciona a medida que se emiten nuevas leyes y se revisan las regulaciones. Tenemos un equipo de cumplimiento que actualiza proactivamente nuestras políticas de uso de datos para asegurarnos de que nuestra plataforma siempre esté completamente en cumplimiento. Además, operamos iniciativas de educación del cliente para promover el uso ético de los datos.
¿Cuáles son las tendencias emergentes en la recolección de datos de IA que las empresas deben conocer?
La recolección de datos en tiempo real se está convirtiendo en una necesidad para los modelos de IA de hoy en día. Es crucial que accedan a los datos más recientes o frescos para ofrecer un alto nivel de precisión y brindar mejores experiencias de usuario.
Otra tendencia notable es la dependencia de los datos sintéticos utilizados para la ampliación de datos, en los que la IA genera datos que complementan los conjuntos de datos recopilados de escenarios del mundo real.
También veo un fuerte interés en la búsqueda de la IA explicativa. La mayoría de los modelos de IA actuales sufren del efecto de la caja negra, o la falta de transparencia en sus procesos de toma de decisiones. Las empresas están buscando cambiar este paradigma creando modelos de IA que puedan detallar cómo llegaron a las salidas o decisiones que toman.
Finalmente, las empresas son conscientes de las crecientes preocupaciones sobre la privacidad de los datos. Es por eso que las técnicas de IA destinadas a preservar la privacidad de los datos, como el aprendizaje federado, están en demanda. Las organizaciones quieren maximizar el entrenamiento de los modelos de IA sin comprometer la privacidad de los datos de los usuarios.
Nos aseguramos de estar al tanto de estas tendencias para que podamos construir soluciones que permitan a los equipos de IA mantener una ventaja competitiva.
¿Cómo ve la transformación del paisaje de la recolección de datos con la llegada de los agentes y la automatización impulsados por IA?
Actualmente, los modelos de IA utilizan conjuntos de datos estructurados que se recopilan principalmente de manera manual. Estos conjuntos de datos también pasan por procesos de preprocesamiento, limpieza y otros que generalmente involucran la intervención humana. Esto está a punto de cambiar en el futuro cercano con el surgimiento de los agentes de IA para la recolección y procesamiento autónomos de datos para el entrenamiento de IA. Hacen posible aprender de los datos web en tiempo real a una escala sin precedentes.
Hemos creado infraestructura que admite el despliegue y la evolución de los agentes de IA, permitiendo un acceso suave a datos web de alta calidad y en tiempo real. Esta tecnología permite que los sistemas de IA sofisticados interactúen continuamente con los datos web dinámicos, aprendan de ellos y crezcan más grandes y mejores.
Los agentes de IA pueden transformar industrias al permitir que los sistemas de IA accedan y aprendan de conjuntos de datos en constante cambio en la web en lugar de depender de datos estáticos y procesados manualmente. Esto puede llevar a chatbots de banca o ciberseguridad de IA, por ejemplo, que son capaces de tomar decisiones que reflejan las realidades más recientes. Esto resulta en avances masivos en la eficiencia y más áreas para la automatización.
En Bright Data, no solo estamos permitiendo esta transformación en el paisaje de la recolección de datos. Creemos que estamos a la vanguardia, introduciendo una tecnología que anuncia la próxima generación de inteligencia artificial. Estamos emocionados de ayudar a las empresas y los equipos de IA a aprovechar al máximo el potencial de los agentes de IA para sus operaciones.
Gracias por la gran entrevista, los lectores que deseen aprender más pueden visitar Bright Data.












