Interviews
Lior Hakim, mede-oprichter en CTO van Hour One – Interviewreeks

Lior Hakim, mede-oprichter en Chief Technical Officer van Hour One, een industrieleider in het creëren van virtuele mensen voor professionele videocommunicaties. De levensechte virtuele personages, die uitsluitend zijn gemodelleerd naar echte mensen, dragen menselijke expressiviteit over via tekst, waardoor bedrijven hun boodschap kunnen verhogen met ongeëvenaarde gemak en schaalbaarheid.
Kunt u het verhaal achter Hour One delen?
De oorsprong van Hour One kan worden herleid tot mijn betrokkenheid bij de crypto-domein. Na dat avontuur begon ik na te denken over wat het volgende grote ding zou zijn waar massale cloud-computing op kon worden toegepast, en omdat machine learning aan populariteit won in aanbevelingen en predictieve analyse, werkte ik aan enkele ML-infrastructuur-gerelateerde projecten. Door dit werk raakte ik vertrouwd met vroege generatieve werken en was ik vooral geïnteresseerd in GANs op dat moment. Ik gebruikte alle compute die ik kon krijgen om die toen-nieuwe technologieën te testen. Toen ik mijn resultaten liet zien aan een vriend die een bedrijf had in het veld, zei hij dat ik Oren moest ontmoeten. Toen ik vroeg waarom, zei hij dat we misschien allebei zouden stoppen met het verspillen van elkaars tijd en elkaars tijd verspillen. Oren, mijn mede-oprichter en CEO van Hour One, was een vroege investeerder in AI op dat moment, en terwijl we op verschillende plaatsen stonden, bewogen we allebei in dezelfde richting, en de oprichting van Hour One als het Huis van de Virtuele Mens was een onvermijdelijke reis.
Welke machine learning-algoritmes worden gebruikt, en welk deel van het proces is Generatieve AI?
In het rijk van video-creatie zijn machine learning-algoritmes instrumenteel in elke fase. In de scriptfase bieden Large Language Models (LLM’s) onmisbare ondersteuning, door inhoud te creëren of te verfijnen om verleidelijke verhalen te garanderen. Als we overgaan naar audio, transformeren Text-to-Speech (TTS)-algoritmes tekst in organische, emotionele stemmen. Bij de visuele weergave komt ons propriëtaire Multimodal fundamentmodel van de virtuele mens centraal te staan. Dit model, versterkt met Generatieve Adversarial Networks (GANs) en Variational Autoencoders (VAEs), is in staat om contextuele emoties, articulatie en een gearticuleerde, boeiende en authentieke levering over te brengen. Dergelijke generatieve technieken zetten tekst en audio-aanwijzingen om in levensechte visuele weergaven van virtuele mensen, waardoor hyperrealistische video-uitvoer ontstaat. De orkestratie van LLM’s, TTS, GANs, VAEs en ons Multimodal model maakt Generatieve AI niet alleen een deel, maar de ruggengraat van de moderne video-productie.
Hoe onderscheidt Hour One zich van concurrerende video-generators?
Bij Hour One onderscheidt ons onderscheid van andere video-generators zich niet van een obsessie met concurrentie, maar van een diep gewortelde filosofie die onze aanpak van kwaliteit, productontwerp en marktstrategie beheerst. Ons leidende principe is om altijd de menselijke factor te prioriteren, waardoor onze creaties authentiek en emotioneel resonerend zijn. We zijn trots op het leveren van de beste kwaliteit in de industrie zonder compromis. Door geavanceerde 3D-video-rendering te gebruiken, bieden we onze gebruikers een echte cinematische ervaring. Bovendien is onze strategie uniek van mening; we beginnen met een gepolijst product en itereren dan snel naar perfectie. Deze aanpak garandeert dat onze aanbiedingen altijd een stap vooruit zijn, waardoor nieuwe benchmarks in video-generatie worden gezet.
Met uw uitgebreide achtergrond in GPUs, kunt u ons enkele inzichten delen over uw mening over NVIDIA Next-Generation GH200 Grace Hopper Superchip Platform (NVDA )?
De Grace Hopper-architectuur is echt een game-changer. Als een GPU effectief kan werken vanuit het RAM van de host zonder volledig te bottlenecken, ontgrendelt dit momenteel onmogelijke model/versneller-verhoudingen in training, en als gevolg daarvan veel gewenste flexibiliteit in trainingsjobgroottes. Onder voorbehoud dat het volledige GH200-aanbod niet wordt opgeslokt door LLM-training, hopen we het te gebruiken om de prototyping-kosten voor onze multi-modale architectuur aanzienlijk te verlagen.
Zijn er andere chips die momenteel op uw radar staan?
Ons hoofddoel is om de gebruiker video-inhoud te bieden die prijsconcurrerend is. Gezien de vraag naar grote geheugengrote GPUs op dit moment, zijn we constant aan het optimaliseren en proberen we elke GPU-cloudaanbieding op de top-cloudserviceproviders. Bovendien streven we ernaar om ten minste gedeeltelijk platformonafhankelijk te zijn voor sommige van onze workloads. Daarom letten we op TPUs en andere ASICs, en letten we ook nauwlettend op AMD. Uiteindelijk zal elke hardware-geleide optimalisatieroute die kan resulteren in een betere FLOPs/$-verhouding worden onderzocht.
Wat is uw visie op toekomstige vooruitgang in video-generatie?
Over 24 maanden zullen we niet in staat zijn om een gegenereerde mens van een opgenomen mens te onderscheiden. Dat zal veel dingen veranderen, en we staan hier aan de vooravond van die vooruitgang.
Op dit moment zijn de meeste gegenereerde video’s voor computers en mobiele apparaten, wat moet er veranderen voordat we foto-realistische gegenereerde avatars en werelden hebben voor zowel augmented reality als virtual reality?
Op dit moment beschikken we over de mogelijkheid om foto-realistische avatars en werelden te genereren voor zowel augmented reality (AR) als virtual reality (VR). Het primaire obstakel is latentie. Terwijl de levering van hoge kwaliteit, real-time graphics aan edge-apparaten zoals AR- en VR-headsets essentieel is, is het bereiken hiervan afhankelijk van verschillende factoren. Allereerst zijn we afhankelijk van vooruitgang in chipfabricage om snellere en efficiëntere verwerking te garanderen. Naast dit is het optimaliseren van energieverbruik cruciaal om een langere gebruiksduur zonder compromissen te garanderen. Ten slotte verwachten we software-innovaties die de kloof tussen generatie en real-time rendering efficiënt kunnen overbruggen. Als deze elementen samenkomen, zullen we een toename zien in het gebruik van foto-realistische avatars en omgevingen in zowel AR- als VR-platforms.
Wat verwacht u als de volgende grote doorbraak in AI?
Wanneer het gaat om de volgende significante doorbraak in AI, is er altijd een sfeer van opwinding en verwachting. Terwijl ik enkele vooruitgang heeft genoemd, kan ik delen dat we op dit moment actief werken aan enkele baanbrekende innovaties. Ik zou graag specifiek ingaan, maar voor nu moedig ik iedereen aan om onze komende releases in de gaten te houden. De toekomst van AI belooft veel, en we zijn verheugd om aan de vooravond van deze pioniersinspanningen te staan. Blijf op de hoogte!
Is er nog iets anders dat u over Hour One wilt delen?
U moet zeker ons Discord-kanaal en API bekijken, nieuwe toevoegingen aan ons platformaanbod bij Hour One.












