Intervjuer

Lior Hakim, medgrundare och teknisk chef för Hour One – Intervjuserie

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Lior Hakim, medgrundare och teknisk chef för Hour One, en branschledare inom skapandet av virtuella människor för professionella videokommunikationer. De verklighetstrogna virtuella karaktärerna, som är modellerade efter riktiga människor, uttrycker mänsklig uttrycksfullhet genom text, vilket gör det möjligt för företag att höja sin kommunikation med oöverträffad enkelhet och skalbarhet.

Kan du dela med dig av ursprunget till Hour One?

Ursprunget till Hour One kan spåras tillbaka till min inblandning i kryptodomänen. Efter det företaget började jag fundera på vad som skulle vara nästa stora sak som molnberäkning kunde ta sig an, och eftersom maskinlärning var på väg att bli populär inom rekommendationer och prediktiv analys, arbetade jag med några ML-infrastrukturrelaterade projekt. Genom det arbetet blev jag bekant med tidiga generativa verk och var särskilt intresserad av GANs vid den tiden. Jag använde all beräkningskraft jag kunde få tag på för att testa dessa då nya tekniker. När jag visade mina resultat för en vän som hade ett företag inom området, sa han att jag måste träffa Oren. När jag frågade varför, sa han att kanske skulle vi båda sluta slösa bort hans tid och slösa bort varandras tid. Oren, min medgrundare och VD för Hour One, var en tidig investerare i AI vid den tiden, och medan vi stod på olika platser, rörde vi oss i samma riktning, och grundandet av Hour One för att vara hemmet för den virtuella människan var en oundviklig resa.

Vilka är några av de maskinlärningsalgoritmer som används, och vilken del av processen är Generative AI?

I videokreationens värld är maskinlärningsalgoritmer avgörande i varje skede. I skriptfasen erbjuder stora språkmodeller (LLM) ovärderligt stöd, skapar eller finslipar innehåll för att säkerställa övertygande berättelser. När vi går över till ljud, förvandlar text-till-tal-algoritmer (TTS) text till organiska, uttrycksfulla röster. När vi övergår till den visuella representationen, tar vår egenutvecklade multimodala grundmodell för den virtuella människan centerplatsen. Denna modell, förbättrad med Generative Adversarial Networks (GANs) och Variational Autoencoders (VAEs), är skicklig på att uttrycka kontextuella känslor, uttal och en artikulerad, fängslande och äkta leverans. Sådana generativa tekniker omvandlar text och ljudsignaler till verklighetstrogna visuella representationer av virtuella människor, vilket leder till hyperrealistiska videoresultat. Orkestreringen av LLM, TTS, GANs, VAEs och vår multimodala modell gör Generative AI till inte bara en del, utan ryggraden i modern videoproduktion.

Hur skiljer sig Hour One från andra videogenereringsverktyg?

Vid Hour One skiljer sig vår differentiering från andra videogenereringsverktyg inte från en fixering vid konkurrens, utan snarare från en djupt rotad filosofi som styr vår tillvägagångssätt för kvalitet, produktutformning och marknadsstrategi. Vår ledande princip är att alltid prioritera det mänskliga inslaget, säkerställa att våra skapelser vibrerar av äkthet och känslor. Vi är stolta över att leverera den bästa kvaliteten i branschen utan kompromiss. Genom att använda avancerad 3D-videorendering, erbjuder vi våra användare en äkta biografisk upplevelse. Dessutom är vår strategi unikt bestämd; vi börjar med en polerad produkt och itererar sedan snabbt mot fulländning. Detta tillvägagångssätt säkerställer att våra erbjudanden alltid ligger ett steg före, sätter nya standarder inom videogenerering.

Med din omfattande bakgrund inom GPU, kan du dela med dig av dina synpunkter på NVIDIA Next-Generation GH200 Grace Hopper Superchip Platform (NVDA )?

Grace Hopper-arkitekturen är verkligen en spelväxlare. Om GPU kan arbeta effektivt från dess värd-RAM utan att helt flaskhalsa beräkningen, låser det upp nu omöjliga modell/accelerator-förhållanden vid träning, och som ett resultat, mycket önskad flexibilitet i träningsjobbstorlekar. Antagande att hela GH200-lagret inte kommer att slukas av LLM-träning, hoppas vi att använda det för att kraftigt minska prototypkostnaderna för våra multimodala arkitekturer längre fram.

Finns det några andra chip som för närvarande är på din radar?

Vårt huvudmål är att erbjuda användaren videoinnehåll som är priskonkurrenskraftigt. Med tanke på efterfrågan på stora minnes-GPU just nu, optimerar och testar vi ständigt alla GPU-molnerbjudanden från de ledande molntjänsteleverantörerna. Dessutom strävar vi efter att vara åtminstone delvis plattformsoberoende för vissa av våra arbetsbelastningar. Därför är vi intresserade av TPUs och andra ASICs, och vi följer också noga AMD. Till slut kommer alla hårdvaruledda optimeringsvägar som kan resultera i bättre FLOPs/$-förhållande att undersökas.

Vad är din vision för framtida framsteg inom videogenerering?

Om 24 månader kommer vi inte att kunna skilja en genererad människa från en inspelad. Det kommer att förändra många saker, och vi är här i framkanten av dessa framsteg.

För tillfället är de flesta genererade videor avsedda för datorer och mobila enheter, vad behöver ändras innan vi har fotorealistiska genererade avatarer och världar för både förstärkt verklighet och virtuell verklighet?

För närvarande har vi förmågan att generera fotorealistiska avatarer och världar för både förstärkt verklighet (AR) och virtuell verklighet (VR). Det primära hindret är latency. Medan leveransen av högkvalitativa, realtidsgrafik till edge-enheter som AR- och VR-huvudenheter är viktig, är det beroende av flera faktorer. Främst är vi beroende av framsteg inom chip-tillverkning för att säkerställa snabbare och mer effektiv bearbetning. Utöver detta är optimering av effektförbrukning avgörande för att säkerställa längre användning utan att kompromissa med upplevelsen. Sist men inte minst förväntar vi oss programvarubaserade genombrott som kan effektivt överbrygga gapet mellan generering och realtidsrendering. När dessa element kommer samman, kommer vi att se en ökning av användningen av fotorealistiska avatarer och miljöer över både AR- och VR-plattformar.

Vad förväntar du dig kommer att vara nästa stora genombrott inom AI?

När det gäller nästa signifikanta genombrott inom AI, finns alltid en luft av spänning och förväntan. Medan jag har antytt vissa framsteg tidigare, kan jag dela med mig av att vi för närvarande arbetar med flera banbrytande innovationer. Jag skulle älska att gå in på specifika detaljer, men för tillfället uppmuntrar jag alla att hålla ögonen på våra kommande utgåvor. Framtiden för AI bär på outtömliga löften, och vi är glada över att vara i framkanten av dessa banbrytande ansträngningar. Håll ögonen öppna!

Finns det något annat du vill dela med dig om Hour One?

Du bör definitivt kolla in vår Discord-kanal och API, nya tillägg till vår plattformserbjudande på Hour One.

Antoine är en visionär ledare och medgrundare av Unite.AI, driven av en outtröttlig passion för att forma och främja framtidens AI och robotik. En serieentreprenör, han tror att AI kommer att vara lika störande för samhället som elektricitet, och han fångas ofta i att prata om potentialen för störande teknologier och AGI.

Som en futurist är han dedikerad till att utforska hur dessa innovationer kommer att forma vår värld. Dessutom är han grundare av Securities.io, en plattform som fokuserar på att investera i banbrytande teknologier som omdefinierar framtiden och omformar hela sektorer.