Entrevistas

Gil Elbaz, Co-fundador y CTO de Datagen – Serie de Entrevistas

mm
Añade Unite.AI a tus fuentes preferidas en Google

Gil Elbaz es el CTO y co-fundador de Datagen, con sede en Tel Aviv. Obtuvo su licenciatura y maestría en el Technion. La investigación de su tesis se centró en visión por computadora 3D y ha sido publicada en CVPR, la principal conferencia de investigación en visión por computadora del mundo. Datagen es pionera en el nuevo campo de los datos simulados, un subconjunto de los datos sintéticos, que se centra en recrear fotorealísticamente el mundo que nos rodea. La empresa salió de la clandestinidad con más de 18 millones de dólares en financiamiento en marzo de 2021 y ahora trabaja con varias empresas Fortune 100 en realidad aumentada/virtual, robótica y automoción, incluida la mayoría de los gigantes tecnológicos de EE. UU.

¿Qué te atrajo inicialmente a la robótica y el aprendizaje automático?

Los libros de ciencia ficción, como la serie Fundación de Isaac Asimov y Yo, robot, siempre me hicieron pensar en un futuro en el que los robots serían una parte integral de nuestra vida diaria. Hay muchas tareas aburridas y repetitivas que las personas realizan; sabía que no quería hacerlas, y no podía imaginar que nadie más las quisiera hacer. Considerando que la robótica es una inevitabilidad tecnológica, pensé que ir en esa dirección sería una decisión de carrera inteligente y “a prueba de futuro”.

Así que, inicialmente, me acerqué al campo centrándome en los aspectos físicos de la materia, y obtuve mi título en ingeniería mecánica en el Technion de Haifa, Israel. Hacia el final de mi carrera, comencé a sumergirme en el mundo de las herramientas CAD y sus capacidades. Estas son las herramientas que permiten a los ingenieros mecánicos diseñar estructuras y dispositivos mecánicos (desde un puente hasta un coche). Vi una enorme oportunidad para hacer un gran impacto sin tener que lidiar con las iteraciones lentas del mundo físico. En la práctica, estos programas tenían muy pocas, si es que tenían, capacidades de aprendizaje automático/visión por computadora integradas, que ayudaran a los ingenieros a crear sistemas mecánicos más simples, más baratos y más estables (esto fue en 2015). Me dirigí hacia la visión por computadora en datos 3D con aprendizaje profundo (muy nuevo en ese momento) con el objetivo de crear programas CAD más inteligentes. Trabajar en los primeros días del aprendizaje automático moderno se sentía como estar en una parte de algo que podría ser realmente grande, similar a Internet.

En la práctica, mi investigación fue la primera en traer la revolución del aprendizaje profundo a nuestra facultad en el Technion. Esto más tarde se convirtió en un artículo aceptado en la principal conferencia de visión por computadora del mundo, CVPR, y volé a Hawái para CVPR 2017. Presentar mi artículo y conocer a las personas realmente abrió mis ojos a la escala de la comunidad de visión por computadora (que hoy es al menos 10 veces más grande), miles de participantes que trabajan apasionadamente en investigación en el campo. Ese evento prácticamente selló mi dirección, mostrándome el poder de la visión por computadora y el potencial que espera ser desbloqueado.

¿Podrías compartir la historia de génesis detrás de Datagen?

Datagen fue fundada en 2018 con la misión de transformar la forma en que los equipos obtienen sus datos para el entrenamiento de redes de visión por computadora. El año anterior, vimos una demostración de Oculus Rift, que consistía en un visor de realidad virtual y un dispositivo de control remoto portátil. Después de la demostración, nos encontramos preguntándonos: “con cámaras sofisticadas incrustadas en el visor, ¿por qué se necesitaba un dispositivo portátil para conectar el espacio virtual al espacio físico (es decir, para rastrear el movimiento de la mano)?” Las redes neuronales ya eran lo suficientemente sofisticadas como para manejarlo, así que ¿cuál era el problema? Y eso fue cuando se encendió la bombilla — ¡Datos! Inmediatamente vimos la enorme oportunidad de resolver desafíos de presencia espacial 3D utilizando visión por computadora avanzada y metadatos 3D. En lugar de centrarnos únicamente en la realidad virtual/aumentada, tomamos un enfoque más holístico, centrándonos en el aparentemente intractable problema de generar datos de entrenamiento suficientes (y precisos) para permitir aplicaciones de IA 3D en el mundo real.

Con un enfoque en humanos y la interacción humano-entorno, Datagen es pionera en el nuevo campo de los datos simulados, un subconjunto de los datos sintéticos, que se centra en recrear fotorealísticamente el mundo que nos rodea. Hoy en día, trabajamos con las empresas más innovadoras del mundo para impulsar y acelerar su desarrollo de visión por computadora y estamos respaldados por algunos de los inversores más respetados en el espacio.

Para los lectores que no están familiarizados, ¿podrías explicar qué son específicamente los datos sintéticos?

Los datos sintéticos son cualquier dato de entrenamiento que, en lugar de ser recopilado a través de la medición directa o la observación del mundo real, es generado ya sea algorítmicamente o a través de simulación. En el contexto de la visión por computadora, los datos sintéticos son imágenes generadas por computadora con metadatos asociados necesarios para el entrenamiento de inteligencias artificiales. Con problemas de privacidad y limitaciones físicas y económicas reales en los datos de imágenes del mundo real, es difícil exagerar la importancia de los datos sintéticos para el aprendizaje automático y la IA. En un informe reciente, Gartner predijo que, para 2024, la mayoría de los datos utilizados en el campo de la IA serán generados artificialmente por esas razones.

¿Cuáles son algunos beneficios de los datos sintéticos en comparación con la adquisición de datos manual?

La respuesta corta es, piensa en cada aspecto de la adquisición de datos manual que es indeseable y elimínalos del proceso — esos son los beneficios de los datos sintéticos.

Generar conjuntos de datos diversos a gran escala para el entrenamiento de visión por computadora es un proceso costoso y que consume mucho tiempo, y la variabilidad es muy limitada por el simple hecho de que situar a las personas en ubicaciones específicas y fotografiarlas es un proceso complicado — mucho más complicado y costoso que hacerlo en un entorno simulado. Otro beneficio importante es la eliminación efectiva de la necesidad de anotación manual, que es tediosa, consume mucho tiempo y propensa a errores humanos.

Datagen se refiere a los datos simulados como un subconjunto de los datos sintéticos. ¿Podrías elaborar sobre qué son los datos simulados?

Los datos simulados son datos sintéticos que se generan a través de simulación. Utilizamos GANs (así como algunos otros métodos de aprendizaje automático de vanguardia) para generar objetos 3D y colocarlos dentro de simulaciones 3D altamente realistas del mundo real. Lo que esto significa es un proceso de “tomar fotos virtuales” en primera persona, pero operando dentro de un sistema basado en la física y fotorealista. Estas simulaciones producen datos visuales (como si se hubieran recopilado en el mundo real), junto con una amplia gama de anotaciones (física, iluminación, etc.). Así que, los datos simulados son datos sintéticos que son fotorealistas, generados contextualmente, imágenes 3D, recopiladas en un entorno simulado.

¿Cómo genera Datagen datos simulados personalizados?

La tecnología de Datagen genera datos simulados que son escalables y personalizados para abordar las necesidades únicas de cada aplicación del cliente. Hacemos esto teniendo en cuenta cada aspecto de cada proyecto — desde el sistema de visión por computadora que se está utilizando hasta la composición demográfica de la región en la que operará. Ya sea trabajando directamente con nuestros clientes o simplemente permitiendo que sus propios ingenieros trabajen, el proceso de Datagen comienza con el establecimiento de parámetros clave para cada caso de uso específico, como especificaciones de lente, iluminación, entorno, distribución demográfica, etc. Datagen utiliza GANs y otras herramientas y técnicas de vanguardia para generar una inmensa variedad de activos, que incluyen todo, desde cabezas humanas con expresiones faciales dinámicas para entrenar a la IA en análisis de emociones, hasta interiores de vehículos para monitoreo de pasajeros en el interior, y entornos domésticos para aplicaciones de videoconferencia, por nombrar algunos. Para cada tipo de activo, Datagen introduce variabilidad a lo largo de innumerables ejes discretos (desde el tono de piel y la altura de las cejas, hasta el tamaño, el color y la forma del mobiliario doméstico), utilizando parámetros que se ajustan finamente para reflejar la aplicación específica en cuestión.

Gracias a estas capacidades, los conjuntos de datos de Datagen no solo son grandes y muy variados, sino también optimizados para los fines de entrenar un sistema único para realizar una tarea única (o un conjunto de tareas) en el entorno único o configuración en la que se empleará — todo sin comprometer la capacidad de escalar. También tenemos en cuenta los requisitos específicos de anotación/metadatos de cada aplicación.

¿Cuáles son algunos ejemplos de soluciones en robótica donde se utilizan datos sintéticos y/o simulados?

Una de las mayores ventajas de utilizar datos simulados en robótica es la capacidad de generar imágenes de hardware que aún está en desarrollo. De esta manera, el cerebro de tu robot (IA) y su cuerpo (hardware) pueden desarrollarse lado a lado. Ahora, el entrenamiento puede evolucionar a medida que las especificaciones evolucionan, en lugar de esperar hasta que el producto final esté completamente prototipado antes de que puedas tomar fotos de él y comenzar a desarrollar la IA.

Además, porque los datos simulados se generan en contexto, puedes tener en cuenta la interacción entre tu robot y su entorno mucho más fácilmente. Así que, si imaginas un robot que agarra y elimina productos defectuosos de una línea de ensamblaje, los datos simulados te permitirían generar datos no solo para cada defecto físico imaginable en el producto, sino también desde la perspectiva del robot para capturar el rango completo de movimiento del brazo robótico, su interacción con el objeto que está agarrando. Además, los metadatos 3D significan que no hay necesidad de anotar laboriosamente imagen tras imagen para asegurarte de que el robot pueda identificar correctamente el producto, los defectos, su brazo o cualquier otra cosa en su campo de visión.

¿Cuáles son algunos casos de uso para utilizar datos simulados en coches inteligentes?

Los datos simulados en el desarrollo de coches inteligentes hacen que sea infinitamente más fácil desarrollar conjuntos de datos para modelos de coches específicos a medida que se diseñan, iterando en concierto con el coche mientras avanza a través de las diversas fases de diseño y producción. Con datos de imagen simulados, los ingenieros también pueden utilizar la visión en el interior del coche de manera más efectiva para identificar a los conductores somnolientos o distraídos, si un conductor ha quitado la mano del volante, o cualquier número de casos de borde para tener en cuenta la seguridad del conductor. También permite a los ingenieros tener en cuenta una mayor diversidad en los conductores y pasajeros, e introducir variabilidad en la forma de ángulo de imagen y iluminación — todo sin infringir la privacidad de personas reales.

Recientemente, Datagen anunció una gran cantidad de nuevas contrataciones emocionantes, ¿qué significa esto para el futuro de la empresa?

Las recientes incorporaciones a nuestro consejo asesor y liderazgo ejecutivo incluyen a algunos de los profesionales más brillantes y logrados en el campo de la IA y la visión por computadora. Su conocimiento, perspicacia y experiencia ayudarán a orientar y acelerar el crecimiento de Datagen a medida que navegamos por una industria que todavía es joven y llena de oportunidades. En un campo con tantas incertidumbres, nada es más valioso que el conocimiento.

¿Hay algo más que te gustaría compartir sobre Datagen?

Con sede en Tel Aviv, Datagen es parte de un gran cambio económico y cultural que ha tenido lugar en Israel, y estamos orgullosos de ser parte de ello. En un corto período de tiempo, Israel (Tel Aviv en particular) ha crecido hasta convertirse en un importante centro tecnológico global, con un ecosistema de startups en auge y una comunidad de inversores enérgica. Aunque Israel a menudo se considera un centro tecnológico centrado en la ciberseguridad, la tecnología centrada en la IA y los datos ha crecido exponencialmente en los últimos años aquí. Hoy en día, hay más de 680 empresas de inteligencia artificial en Israel, que han recaudado colectivamente $4.5 mil millones. Esta explosión de crecimiento en los últimos años se debe en gran parte a la alta concentración de ingenieros y a las universidades de renombre mundial de Israel. Estas instituciones académicas proporcionan acceso a talento y a la última tecnología de vanguardia en el espacio. En los últimos dos meses, Datagen ha contratado a más de 20 empleados y planea incorporar a más miembros del equipo en las áreas de ventas y marketing, software y DevOps, y departamentos de productos.

Gracias por la gran entrevista, los lectores que deseen aprender más pueden visitar Datagen.

Antoine es un líder visionario y socio fundador de Unite.AI, impulsado por una pasión inquebrantable por dar forma y promover el futuro de la IA y la robótica. Como empresario serial, cree que la IA será tan disruptiva para la sociedad como la electricidad, y a menudo se le escucha hablando con entusiasmo sobre el potencial de las tecnologías disruptivas y la AGI.

Como futurista, está dedicado a explorar cómo estas innovaciones darán forma a nuestro mundo. Además, es el fundador de Securities.io, una plataforma enfocada en invertir en tecnologías de vanguardia que están redefiniendo el futuro y remodelando sectores enteros.