Interviews

Lior Hakim, medstifter og teknisk direktør i Hour One – Interviewserie

mm
Føj Unite.AI til dine foretrukne kilder på Google

Lior Hakim, medstifter og teknisk direktør i Hour One, en industrijætteleder inden for udvikling af virtuelle mennesker til professionelle video-kommunikationer. De livlige virtuelle karakterer, der er modelleret efter rigtige mennesker, formidler menneskelignende udtryk gennem tekst, hvilket giver virksomheder mulighed for at forbedre deres beskeder med en uhørt letthed og skalerbarhed.

Kan du dele historien om Hour Ones oprindelse?

Hour Ones oprindelse kan spores tilbage til min involvering i krypto-domænet. Efter dette foretagende begyndte jeg at overveje, hvad der ville være den næste store ting, som massiv sky-computing kunne udnytte, og da maskinlæring var på vej op i anbefalinger og prædiktionanalyse, arbejdede jeg på nogle ML-infrastruktur-relaterede projekter. Gennem dette arbejde blev jeg bekendt med tidlige generative værker og var især interesseret i GANs på det tidspunkt. Jeg brugte alle de computere, jeg kunne få fat i, til at teste disse dengang nye teknologier. Da jeg viste mine resultater til en ven, der havde et firma i branchen, sagde han, at jeg måtte møde Oren. Da jeg spurgte hvorfor, sagde han, at måske ville vi begge to stoppe med at spilde hans tid og i stedet spilde hinandens tid. Oren, min medstifter og administrerende direktør i Hour One, var en tidlig investor i AI på det tidspunkt, og selvom vi stod på forskellige steder, bevægede vi os i samme retning, og grundlæggelsen af Hour One som hjemsted for den virtuelle menneske var en uundgåelig rejse.

Hvad er nogle af de maskinlæringsalgoritmer, der bruges, og hvilken del af processen er Generative AI?

I video-skabningsdomænet er maskinlæringsalgoritmerne afgørende på hvert trin. I manuskriptfasen tilbyder Large Language Models (LLMs) uvurderlig støtte ved at skabe eller forfine indhold for at sikre overbevisende narrativer. Når vi går over til lyd, forvandler Text-to-Speech (TTS)-algoritmer tekst til organisk, udtryksfuld stemme. Når vi går over til den visuelle repræsentation, tager vores proprietære Multimodal grundlæggende model af den virtuelle menneske centrumscenen. Denne model, som er forbedret med Generative Adversarial Networks (GANs) og Variational Autoencoders (VAEs), er i stand til at formidle kontekstuelle følelser, udtale og en artikuleret, fængende og autentisk levering. Sådanne generative teknikker omdanner tekst og lyd-signaler til livlige visuelle af virtuelle mennesker, hvilket resulterer i hyper-realistiske video-outputs. Orkestreringen af LLMs, TTS, GANs, VAEs og vores Multimodal model gør Generative AI til ikke blot en del, men rygmarven af moderne video-produktion.

Hvordan adskiller Hour One sig fra andre video-genereringsværktøjer?

Hour One adskiller sig ikke fra andre video-genereringsværktøjer på grund af en besættelse af konkurrence, men snarere på grund af en dybt rodnet filosofi, der styrer vores tilgang til kvalitet, produkt-design og markedsstrategi. Vores retningslinje er altid at prioritere det menneskelige element, så vores skabninger resonerer med autenticitet og følelse. Vi tager pride i at levere den bedste kvalitet i branchen uden kompromis. Ved at bruge avanceret 3D-video-rendering giver vi vores brugere en ægte kinematisk oplevelse. Desuden er vores strategi unikt holdt; vi starter med et poleret produkt og itererer herefter hurtigt mod perfektion. Denne tilgang sikrer, at vores tilbud altid er et skridt foran, og sætter nye standarder for video-generering.

Med din omfattende baggrund inden for GPU’er, kan du dele nogle indsigt i dine synspunkter på NVIDIA Next-Generation GH200 Grace Hopper Superchip Platform (NVDA )?

Grace Hopper-arkitekturen er virkelig en spilvender. Hvis GPU kan arbejde effektivt fra sin værts RAM uden at være fuldstændig bottlenecket i beregningen, låser det op for nu umulige model/accelerator-forhold i træning, og som følge heraf, en meget ønsket fleksibilitet i træningsjob-størrelser. Antag, at hele lagret af GH200 ikke vil blive slugt af LLM-træning, håber vi at bruge det til at reducere prototyperingsomkostningerne for vores multimodale arkitekturer længere nede ad vejen.

Er der andre chips, der er på din radar lige nu?

Vores hovedmål er at give brugeren video-indhold, der er pris-konkurrencedygtigt. Givet efterspørgslen efter store hukommelses-GPU’er på nuværende tidspunkt, optimerer og afprøver vi konstant enhver GPU-cloud-tjeneste på de førende cloud-tjenesteudbydere. Desuden stræber vi efter at være mindst delvist platform-uafhængige på nogle af vores arbejdslaster. Derfor følger vi TPUs og andre ASIC’er, og betragter også AMD nøje. Til sidst vil enhver hardware-ledet optimeringsrute, der kan resultere i en bedre FLOPs/$-ratio, blive undersøgt.

Hvad er din vision for fremtidige fremskridt inden for video-generering?

Om 24 måneder vil vi ikke være i stand til at skelne mellem en genereret menneske og en optaget en. Det vil ændre mange ting, og vi er her på forkanten af disse fremskridt.

For øjeblikket er de fleste genererede videoer til computere og mobile enheder, hvad skal ændres, før vi har fotorealistiske genererede avatarer og verdener til både forstærket virkelighed og virtuel virkelighed?

For nuværende har vi evnen til at generere fotorealistiske avatarer og verdener til både forstærket virkelighed (AR) og virtuel virkelighed (VR). Det primære hinder er forsinkelse. Mens leveringen af højkvalitets, realtids-grafik til kantenheder som AR- og VR-headsets er afgørende, er det at opnå dette samtidigt afhængigt af flere faktorer. Først og fremmest er vi afhængige af fremskridt i chip-fabrikation for at sikre hurtigere og mere effektiv bearbejdning. Samtidig er det afgørende at optimere strømforbrug for at sikre længere brug uden at gå på kompromis med oplevelsen. Til sidst forventer vi software-gennembrud, der kan brobygge mellem generering og realtids-rendering effektivt. Når disse elementer kommer sammen, vil vi se en stigning i brugen af fotorealistiske avatarer og miljøer på tværs af både AR- og VR-platforme.

Hvad forventer du at være det næste store gennembrud inden for AI?

Når det kommer til det næste betydningsfulde gennembrud inden for AI, er der altid en luft af spænding og forventning. Selvom jeg har nævnt nogle fremskridt tidligere, kan jeg dele, at vi aktivt arbejder på flere banebrydende innovationer på nuværende tidspunkt. Jeg ville elske at gå i detaljer, men for nuværende opfordrer jeg alle til at holde øje med vores kommende udgivelser. Fremtiden for AI lover at være fuld af løfter, og vi er begejstrede for at være på forkanten af disse pionerende bestræbelser. Hold øje!

Er der noget andet, du gerne vil dele om Hour One?

DU skal absolut tjekke vores Discord-kanal og API, nye tilføjelser til vores platformtilbud på Hour One.

Antoine er en visionær leder og medstifter af Unite.AI, drevet af en urokkelig passion for at forme og fremme fremtiden for AI og robotteknologi. En serieiværksætter, han tror, at AI vil være lige så omvæltende for samfundet som elektricitet, og han bliver ofte fanget i at tale om potentialet for omvæltende teknologier og AGI.

Som en futurist, er han dedikeret til at udforske, hvordan disse innovationer vil forme vores verden. Derudover er han grundlægger af Securities.io, en platform, der fokuserer på at investere i skarp teknologi, der gendefinerer fremtiden og omformer hele sektorer.