Entretiens
Lior Hakim, Co-fondateur et Directeur technique d’Hour One – Série d’entretiens

Lior Hakim, co-fondateur et directeur technique d’Hour One, un leader de l’industrie dans la création de personnages virtuels pour les communications vidéo professionnelles. Les personnages virtuels réalistes, modélisés exclusivement à partir de personnes réelles, transmettent une expressivité humaine à travers le texte, permettant aux entreprises de rehausser leur messagerie avec une facilité et une scalabilité inégalées.
Pouvez-vous partager l’histoire de la création d’Hour One ?
L’origine d’Hour One remonte à mon implication dans le domaine des crypto-monnaies. Après cette aventure, j’ai commencé à réfléchir à ce qui pourrait être la prochaine grande chose que le cloud computing pourrait aborder et, comme l’apprentissage automatique gagnait en popularité dans les recommandations et l’analyse prédictive, j’ai travaillé sur quelques projets liés à l’infrastructure de l’apprentissage automatique. Grâce à ce travail, je me suis familiarisé avec les premiers travaux génératifs et j’étais particulièrement intéressé par les GAN à cette époque. J’utilisais tous les calculs que je pouvais obtenir pour tester ces nouvelles technologies. Lorsque j’ai montré mes résultats à un ami qui avait une entreprise dans le domaine, il m’a dit que je devais rencontrer Oren. Lorsque je lui ai demandé pourquoi, il m’a dit que peut-être que nous allions cesser de gaspiller son temps et gaspiller le nôtre à la place. Oren, mon co-fondateur et PDG d’Hour One, était un investisseur précoce dans l’IA à cette époque et, bien que nous soyons à des endroits différents, nous allions dans la même direction, et la création d’Hour One pour devenir la Maison de l’Humain Virtuel était un voyage inévitable.
Quels sont certains des algorithmes d’apprentissage automatique utilisés, et quelle est la partie du processus qui implique l’IA générative ?
Dans le domaine de la création de vidéos, les algorithmes d’apprentissage automatique sont instrumentaux à chaque étape. Au stade de l’écriture du scénario, les grands modèles de langage (LLM) offrent un soutien inestimable, créant ou affinant le contenu pour garantir des récits captivants. Lorsque nous passons à l’audio, les algorithmes de synthèse vocale (TTS) transforment le texte en voix organiques et émotives. En passant à la représentation visuelle, notre modèle multimodal fondamental de l’humain virtuel prend le centre de la scène. Ce modèle, amélioré avec les réseaux antagonistes génératifs (GAN) et les encodeurs variationnels (VAE), est capable de transmettre des émotions contextuelles, des énonciations et une livraison captivante et authentique. De telles techniques génératives transforment le texte et les signaux audio en visuels réalistes d’humains virtuels, aboutissant à des sorties vidéo hyper-réalistes. L’orchestration des LLM, TTS, GAN, VAE et de notre modèle multimodal rend l’IA générative non seulement une partie, mais la colonne vertébrale de la production vidéo moderne.
Comment Hour One se différencie-t-il des autres générateurs de vidéos ?
Chez Hour One, notre différence avec les autres générateurs de vidéos ne provient pas d’une obsession pour la concurrence, mais plutôt d’une philosophie profondément enracinée qui régit notre approche de la qualité, de la conception de produits et de la stratégie de marché. Notre principe directeur est de toujours donner la priorité à l’élément humain, en veillant à ce que nos créations résonnent avec authenticité et émotion. Nous sommes fiers de fournir la meilleure qualité de l’industrie sans compromis. En utilisant un rendu vidéo 3D avancé, nous offrons à nos utilisateurs une expérience cinématographique authentique. De plus, notre stratégie est unique et orientée ; nous commençons par un produit poli, puis nous itérons rapidement vers la perfection. Cette approche garantit que nos offres sont toujours une étape en avant, établissant de nouvelles références dans la génération de vidéos.
Avec votre expérience approfondie dans les GPU, pouvez-vous partager avec nous vos points de vue sur la plate-forme NVIDIA Next-Generation GH200 Grace Hopper Superchip (NVDA ) ?
L’architecture Grace Hopper est vraiment un changement de jeu. Si le GPU peut fonctionner efficacement à partir de la mémoire RAM de son hôte sans créer de goulet d’étranglement dans les calculs, cela débloque des ratios modèle/accélérateur actuellement impossibles dans la formation, et, par conséquent, une flexibilité très souhaitable dans les tailles des travaux de formation. En supposant que tout le stock de GH200 ne sera pas englouti par la formation de LLM, nous espérons l’utiliser pour réduire considérablement les coûts de prototypage de nos architectures multimodales plus tard.
Y a-t-il d’autres puces qui sont actuellement sur votre radar ?
Notre objectif principal est de fournir au utilisateur du contenu vidéo qui est compétitif en termes de prix. Étant donné la demande actuelle pour des GPU à grande mémoire, nous optimisons et essayons constamment toutes les offres de GPU dans les principaux fournisseurs de services cloud. De plus, nous nous efforçons d’être au moins partiellement indépendants de la plate-forme pour certaines de nos charges de travail. Ainsi, nous surveillons les TPU et d’autres ASIC, et nous prêtons également une attention particulière à AMD. Finalement, toute voie d’optimisation basée sur le matériel qui peut aboutir à un meilleur rapport FLOPS/$ sera explorée.
Quelle est votre vision pour les progrès futurs dans la génération de vidéos ?
Dans 24 mois, nous ne pourrons pas distinguer un humain généré d’un humain capturé. Cela changera beaucoup de choses, et nous sommes ici à l’avant-garde de ces progrès.
Actuellement, la plupart des vidéos générées sont pour les ordinateurs et les appareils mobiles, qu’est-ce qui doit changer avant d’avoir des avatars et des mondes générés photo-réalistes pour la réalité augmentée et la réalité virtuelle ?
Actuellement, nous possédons la capacité de générer des avatars et des mondes photo-réalistes pour la réalité augmentée (AR) et la réalité virtuelle (VR). L’obstacle principal est la latence. Alors que la fourniture de graphiques de haute qualité en temps réel aux appareils de bord tels que les casques AR et VR est cruciale, la réalisation de cela de manière fluide dépend de plusieurs facteurs. Tout d’abord, nous dépendons des progrès de la fabrication de puces pour garantir un traitement plus rapide et plus efficace. Parallèlement, l’optimisation de la consommation d’énergie est cruciale pour assurer une utilisation plus longue sans compromettre l’expérience. Enfin, nous anticipons des avancées logicielles qui peuvent efficacement combler le fossé entre la génération et le rendu en temps réel. À mesure que ces éléments se combinent, nous verrons une augmentation de l’utilisation d’avatars et d’environnements photo-réalistes sur les plateformes AR et VR.
Qu’est-ce que vous attendez comme prochaine grande percée dans l’IA ?
Lorsqu’il s’agit de la prochaine grande percée dans l’IA, il y a toujours une atmosphère d’excitation et d’anticipation. Alors que j’ai mentionné certaines avancées plus tôt, ce que je peux partager, c’est que nous travaillons activement sur plusieurs innovations révolutionnaires en ce moment. J’aimerais m’immerger dans les détails, mais pour l’instant, je vous encourage à suivre nos prochaines sorties. Le futur de l’IA recèle d’immenses promesses, et nous sommes ravis d’être à l’avant-garde de ces efforts pionniers. Restez à l’écoute !
Y a-t-il autre chose que vous aimeriez partager sur Hour One ?
Vous devriez définitivement vérifier notre canal Discord et notre API, de nouvelles additions à notre offre de plate-forme sur Hour One.












