Entrevistas

Lior Hakim, Co-fundador y Director Técnico de Hour One – Serie de Entrevistas

mm
Añade Unite.AI a tus fuentes preferidas en Google

Lior Hakim, co-fundador y Director Técnico de Hour One, un líder en la industria en la creación de humanos virtuales para comunicaciones de video profesionales. Los personajes virtuales realistas, modelados exclusivamente a partir de personas reales, transmiten expresividad humana a través del texto, lo que permite a las empresas elevar su mensaje con una facilidad y escalabilidad sin precedentes.

¿Podrías compartir la historia de origen detrás de Hour One?

El origen de Hour One se remonta a mi participación en el dominio de la criptografía. Después de esa empresa, comencé a reflexionar sobre qué sería lo próximo grande que la computación en la nube podría aprovechar y, a medida que el aprendizaje automático ganaba popularidad en recomendaciones y análisis predictivos, estuve trabajando en algunos proyectos relacionados con la infraestructura de ML. A través de este trabajo, me familiaricé con los primeros trabajos generativos y me interesé especialmente en los GAN en ese momento. Estaba utilizando toda la capacidad de cálculo que podía obtener para probar esas tecnologías nuevas. Cuando le mostré mis resultados a un amigo que tenía una empresa en el campo, me dijo que debía conocer a Oren. Cuando le pregunté por qué, me dijo que tal vez ambos dejáramos de desperdiciar su tiempo y nos desperdiciáramos el tiempo mutuamente. Oren, mi co-fundador y CEO de Hour One, era un inversor temprano en IA en ese momento, y aunque estábamos en lugares diferentes, ambos nos movíamos en la misma dirección, y la fundación de Hour One como el Hogar del Humano Virtual fue un viaje inevitable.

¿Cuáles son algunos de los algoritmos de aprendizaje automático que se utilizan, y qué parte del proceso es la IA Generativa?

En el ámbito de la creación de videos, los algoritmos de aprendizaje automático son fundamentales en cada etapa. En la fase de scripting, los Grandes Modelos de Lenguaje (LLM) ofrecen un apoyo invaluable, creando o perfeccionando el contenido para garantizar narrativas atractivas. A medida que avanzamos hacia el audio, los algoritmos de Texto a Voz (TTS) transforman el texto en voces orgánicas y emotivas. Al pasar a la representación visual, nuestro modelo Multimodal fundacional de humano virtual ocupa el centro del escenario. Este modelo, mejorado con Redes Generativas Adversarias (GAN) y Autoencoders Variacionales (VAE), es capaz de transmitir emociones contextuales, enunciación y una entrega articulada, cautivadora y auténtica. Tales técnicas generativas convierten el texto y las señales de audio en visuales realistas de humanos virtuales, lo que conduce a salidas de video hiperrealistas. La orquestación de LLM, TTS, GAN, VAE y nuestro modelo Multimodal hace que la IA Generativa no sea solo una parte, sino la columna vertebral de la producción de video moderna.

¿Cómo se diferencia Hour One de los generadores de video competidores?

En Hour One, nuestra distinción de otros generadores de video no proviene de una obsesión con la competencia, sino de una filosofía profundamente arraigada que gobierna nuestro enfoque de la calidad, el diseño del producto y la estrategia de mercado. Nuestro principio rector es priorizar siempre el elemento humano, asegurando que nuestras creaciones resuenen con autenticidad y emoción. Nos enorgullecemos de ofrecer la mejor calidad de la industria sin compromisos. Al utilizar renderizado de video 3D avanzado, brindamos a nuestros usuarios una experiencia cinematográfica genuina. Además, nuestra estrategia es única y opinada; comenzamos con un producto pulido y luego iteramos rápidamente hacia la perfección. Este enfoque garantiza que nuestras ofertas estén siempre un paso adelante, estableciendo nuevos estándares en la generación de video.

Con su amplia experiencia en GPU, ¿podría compartir con nosotros algunas ideas sobre su visión de la plataforma de superchip NVIDIA Next-Generation GH200 Grace Hopper (NVDA )?

La arquitectura Grace Hopper es verdaderamente un cambio de juego. Si la GPU puede funcionar efectivamente desde la RAM del host sin bloquear completamente el cálculo, desbloquea ratios de modelo y acelerador actualmente imposibles en el entrenamiento, y como resultado, una flexibilidad muy deseada en los tamaños de los trabajos de entrenamiento. Asumiendo que todo el stock de GH200 no será consumido por el entrenamiento de LLM, esperamos utilizarlo para reducir significativamente los costos de prototipado para nuestras arquitecturas multimodales en el futuro.

¿Hay otros chips que estén en su radar en este momento?

Nuestro objetivo principal es brindar al usuario contenido de video que sea competitivo en términos de precio. Dada la demanda actual de GPU con gran memoria, estamos optimizando constantemente y probando cualquier oferta de GPU en los principales proveedores de servicios en la nube. Además, nos esforzamos por ser al menos parcialmente independientes de la plataforma en algunas de nuestras cargas de trabajo. Por lo tanto, estamos observando los TPU y otros ASIC, y también estamos prestando atención a AMD. Eventualmente, cualquier ruta de optimización liderada por hardware que pueda resultar en una mejor relación FLOPs/dólar será explorada.

¿Cuál es su visión para los avances futuros en la generación de video?

En 24 meses, no podremos distinguir entre un humano generado y uno capturado. Eso cambiará muchas cosas, y estamos aquí en la vanguardia de esos avances.

En este momento, la mayoría de los videos generados son para computadoras y dispositivos móviles, ¿qué necesita cambiar antes de que tengamos avatares y mundos generados fotorealistas para la realidad aumentada y virtual?

Actualmente, poseemos la capacidad de generar avatares y mundos fotorealistas para la realidad aumentada (AR) y la realidad virtual (VR). El principal obstáculo es la latencia. Mientras que la entrega de gráficos de alta calidad en tiempo real a dispositivos de borde como cascos de AR y VR es vital, lograr esto de manera fluida depende de varios factores. Primero, dependemos de avances en la fabricación de chips para garantizar un procesamiento más rápido y eficiente. Junto con esto, la optimización del consumo de energía es crucial para garantizar un uso más prolongado sin comprometer la experiencia. Por último, anticipamos avances en software que puedan eficientemente cerrar la brecha entre la generación y el renderizado en tiempo real. A medida que estos elementos se unen, veremos un aumento en la utilización de avatares y entornos fotorealistas en ambas plataformas de AR y VR.

¿Qué espera que sea el próximo gran avance en IA?

Cuando se trata del próximo avance significativo en IA, siempre hay un aire de emoción y anticipación. Mientras que he aludido a algunos avances anteriormente, lo que puedo compartir es que estamos trabajando activamente en varias innovaciones innovadoras en este momento. Me encantaría profundizar en detalles, pero por ahora, les animo a que sigan atentos a nuestras próximas publicaciones. El futuro de la IA promete mucho, y estamos emocionados de estar a la vanguardia de estos esfuerzos pioneros. ¡Manténganse atentos!

¿Hay algo más que le gustaría compartir sobre Hour One?

Definitivamente debe echar un vistazo a nuestro canal de Discord y API, nuevas incorporaciones a nuestra oferta de plataforma en Hour One.

Antoine es un líder visionario y socio fundador de Unite.AI, impulsado por una pasión inquebrantable por dar forma y promover el futuro de la IA y la robótica. Como empresario serial, cree que la IA será tan disruptiva para la sociedad como la electricidad, y a menudo se le escucha hablando con entusiasmo sobre el potencial de las tecnologías disruptivas y la AGI.

Como futurista, está dedicado a explorar cómo estas innovaciones darán forma a nuestro mundo. Además, es el fundador de Securities.io, una plataforma enfocada en invertir en tecnologías de vanguardia que están redefiniendo el futuro y remodelando sectores enteros.