Wywiady
Lior Hakim, współzałożyciel i dyrektor techniczny Hour One – seria wywiadów

Lior Hakim, współzałożyciel i dyrektor techniczny Hour One, lidera branży w tworzeniu wirtualnych ludzi do profesjonalnych komunikacji wideo. Te prawdziwe wirtualne postacie, opracowane wyłącznie na podstawie prawdziwych ludzi, przekazują ludzkie wyrażenia poprzez tekst, umożliwiając firmom podniesienie jakości swoich komunikatów z niezrównaną łatwością i skalowalnością.
Czy mógłbyś podzielić się historią powstania Hour One?
Początki Hour One sięgają mojego zaangażowania w dziedzinie kryptowalut. Po tym przedsięwzięciu zacząłem myśleć o tym, co może być następną wielką rzeczą, którą może wykorzystać masowa chmura obliczeniowa, a ponieważ machine learning zyskiwał na popularności w dziedzinie rekomendacji i analizy predykcyjnej, pracowałem nad kilkoma projektami związanymi z infrastrukturą ML. Przez tę pracę zapoznałem się z wczesnymi pracami generatywnymi i byłam szczególnie zainteresowany GANami w tym czasie. Wykorzystywałem całą dostępną moc obliczeniową, aby przetestować te nowe technologie. Kiedy pokazałem swoje wyniki przyjacielowi, który miał firmę w tej dziedzinie, powiedział mi, że muszę się spotkać z Orenem. Kiedy zapytałem, dlaczego, powiedział, że może będziemy marnować czas nawzajem, zamiast marnować czas jego. Oren, mój współzałożyciel i CEO Hour One, był wczesnym inwestorem w AI w tym czasie i chociaż staliśmy w różnych miejscach, poruszaliśmy się w tym samym kierunku, a założenie Hour One jako domu wirtualnego człowieka było nieuniknioną podróżą.
Jakie są niektóre z algorytmów machine learning, które są wykorzystywane, a jaki jest udział Generative AI w tym procesie?
W dziedzinie tworzenia wideo algorytmy machine learning są niezwykle ważne na każdym etapie. W fazie tworzenia scenariusza duże modele językowe (LLM) oferują niezwykle ważne wsparcie, tworząc lub udoskonalając treści, aby zapewnić przekonywujące narracje. Przechodząc do audio, algorytmy Text-to-Speech (TTS) przekształcają tekst w organiczne, emocjonalne głosy. Przechodząc do reprezentacji wizualnej, nasz własny, wielomodalny model wirtualnego człowieka zajmuje centralne miejsce. Ten model, ulepszony przez Generative Adversarial Networks (GANs) i Variational Autoencoders (VAEs), jest zdolny do przekazywania kontekstowych emocji, wymowy i artykułowanego, fascynującego i autentycznego przekazu. Takie techniki generatywne przekształcają tekst i sygnały audio w prawdziwie wizualne obrazy wirtualnych ludzi, prowadząc do hiperrealistycznych wyników wideo. Orkiestracja LLM, TTS, GANów, VAE i naszego wielomodalnego modelu sprawia, że Generative AI nie jest tylko częścią, ale kręgosłupem nowoczesnej produkcji wideo.
Jak Hour One wyróżnia się na tle innych generatorów wideo?
W Hour One nasza różnica w stosunku do innych generatorów wideo nie wynika z zajmowania się konkurencją, ale raczej z głęboko zakorzenionej filozofii, która kieruje naszym podejściem do jakości, projektowania produktu i strategii rynkowej. Naszym przewodnim założeniem jest zawsze priorytet dla ludzkiego elementu, zapewniając, że nasze kreacje rezonują z autentycznością i emocjami. Chwalimy się dostarczaniem najlepszej jakości w branży bez kompromisów. Wykorzystując zaawansowane techniki renderowania wideo 3D, zapewniamy naszym użytkownikom prawdziwe doświadczenie kinowe. Ponadto, nasza strategia jest wyjątkowo opinijna; zaczynamy od wykończonego produktu, a następnie szybko iterujemy w kierunku doskonałości. To podejście zapewnia, że nasze oferty są zawsze o krok przed innymi, ustanawiając nowe standardy w generowaniu wideo.
Czy mógłbyś podzielić się z nami swoimi spostrzeżeniami na temat platformy NVIDIA (NVDA ) Next-Generation GH200 Grace Hopper Superchip?
Architektura Grace Hopper jest prawdziwym przełomem. Jeśli GPU może skutecznie współpracować z pamięcią RAM hosta bez całkowitego zawężania obliczeń, odblokowuje to obecnie niemożliwe stosunki modelu do przyspieszacza w treningu, a w efekcie, bardzo pożądaną elastyczność w rozmiarach zadań treningowych. Zakładając, że cały zapas GH200 nie zostanie całkowicie pochłonięty przez trening LLM, mamy nadzieję, że będziemy mogli go wykorzystać do znacznego obniżenia kosztów prototypowania naszych multimodalnych architektur w przyszłości.
Czy są inne układy scalone, które są obecnie na Twojej liście?
Naszym głównym celem jest dostarczanie użytkownikom treści wideo, które są konkurencyjne cenowo. Biorąc pod uwagę popyt na duże pamięci GPU w chwili obecnej, stale optymalizujemy i testujemy każdą ofertę GPU w najlepszych usługach chmury. Ponadto, staramy się być przynajmniej częściowo niezależnymi od platformy w niektórych naszych obciążeń. Dlatego też zwracamy uwagę na TPUs i inne ASICs, a także ściśle obserwujemy AMD. Ostatecznie każda optymalizacja oparta na sprzęcie, która może prowadzić do lepszego stosunku FLOPs do kosztów, zostanie zbadana.
Jakie jest Twoje wizja przyszłych postępów w generowaniu wideo?
W ciągu 24 miesięcy nie będziemy w stanie odróżnić wygenerowanego człowieka od nagranego. To zmieni wiele rzeczy, a my jesteśmy na czele tych postępów.
W tym momencie większość wygenerowanych wideo jest przeznaczona dla komputerów i urządzeń mobilnych, co musi się zmienić, zanim będziemy mieli fotorealistyczne wygenerowane awatary i światy dla rzeczywistości rozszerzonej i wirtualnej?
Obecnie posiadamy możliwość generowania fotorealistycznych awatarów i światów dla zarówno rzeczywistości rozszerzonej (AR), jak i wirtualnej (VR). Główną przeszkodą jest opóźnienie. Podczas gdy dostarczanie wysokiej jakości, grafiki w czasie rzeczywistym do urządzeń krawędziowych, takich jak okulary AR i VR, jest kluczowe, osiągnięcie tego bezproblemowo zależy od kilku czynników. Przede wszystkim, jesteśmy uzależnieni od postępów w produkcji chipów, aby zapewnić szybsze i bardziej efektywne przetwarzanie. Wraz z tym, optymalizacja zużycia energii jest kluczowa, aby zapewnić dłuższe użytkowanie bez kompromisowania doświadczenia. Na koniec, spodziewamy się przełomów w oprogramowaniu, które mogą efektywnie pomostować lukę między generowaniem a renderowaniem w czasie rzeczywistym. Gdy te elementy się połączą, zobaczymy wzrost wykorzystania fotorealistycznych awatarów i środowisk w obu platformach AR i VR.
Czego spodziewasz się jako następnego wielkiego przełomu w AI?
Gdy chodzi o następny znaczący przełom w AI, zawsze jest powietrze ekscytacji i oczekiwania. Chociaż wspomniałem o niektórych postępach wcześniej, to, co mogę podzielić, to fakt, że aktywnie pracujemy nad kilkoma przełomowymi innowacjami w tym momencie. Chciałbym zagłębić się w szczegóły, ale na razie zachęcam wszystkich do obserwowania naszych nadchodzących wydań. Przyszłość AI obiecuje ogromne możliwości, a my jesteśmy podekscytowani, że jesteśmy na czele tych pionierskich wysiłków. Czekajcie!
Czy jest coś jeszcze, co chciałbyś podzielić o Hour One?
Powinieneś zdecydowanie sprawdzić nasz kanał Discord i API, nowe dodatki do naszej platformy oferowanej przez Hour One.












