Інтерв’ю
Ліор Хакім, співзасновник та технічний директор Hour One – Серія інтерв’ю

Ліор Хакім, співзасновник і технічний директор Hour One, лідера галузі у створенні віртуальних людей для професійного відеоспівробітництва. Живі віртуальні персонажі, створені виключно за образом реальних людей, передають людську виразність через текст, дозволяючи підприємствам підвищити рівень своїх повідомлень з незрівнянною легкістю та масштабованістю.
Чи можете ви поділитися історією походження Hour One?
Походження Hour One можна простежити до моєї участі в криптовалютній галузі. Після цього підприємства я почав розмірковувати, що буде наступною великою річчю, яку можна буде використати за допомогою масового хмарного обчислення, і коли машинне навчання набуло популярності в галузі рекомендацій і прогнозної аналітики, я працював над кількома проектами, пов’язаними з інфраструктурою машинного навчання. Через цю роботу я познайомився з ранніми генеративними роботами і був особливо зацікавлений у GAN на той час. Я використовував весь обчислювальний потенціал, який міг отримати, для тестування цих нових технологій. Коли я показував свої результати своєму другові, який мав компанію в цій галузі, він сказав мені, що мені потрібно зустрітися з Ореном. Коли я запитав, чому, він сказав мені, що можливо ми обоє перестанемо марнувати його час і будемо марнувати час один одного. Орен, мій співзасновник і генеральний директор Hour One, був раннім інвестором у галузі штучного інтелекту на той час, і хоча ми стояли в різних місцях, ми рухались у одному напрямку, і заснування Hour One як будинку віртуальної людини було неминучим шляхом.
Які з них машинні алгоритми використовуються, і яка частина процесу є Генеративним ІІ?
У сфері створення відео машинні алгоритми відіграють важливу роль на кожному етапі. На етапі написання сценарію великі мовні моделі (LLM) пропонують цінну підтримку, створюючи або вдосконалюючи контент, щоб забезпечити привабливі розповіді. Коли ми переходимо до аудіо, алгоритми тексту в мову (TTS) перетворюють текст у органічний, виразний голос. Переходячи до візуального представлення, наш власний багатомодальний фундаментальний модель віртуальної людини займає центральне місце. Ця модель, покращена за допомогою Генеративних суперницьких мереж (GAN) і варіаційних автоенкодерів (VAE), здатна передавати контекстуальні емоції, артикуляцію та виразну, привабливу та автентичну подачу. Такі генеративні техніки перетворюють текст і аудіо сигнали у життєві візуальні зображення віртуальних людей, що призводить до гіперреалістичних відеових виходів. Оркестрування LLM, TTS, GAN, VAE і нашої багатомодальної моделі робить Генеративний ІІ не просто частиною, а хребтом сучасної відеопродукції.
Як Hour One відрізняється від інших відеогенераторів?
У Hour One наша відмінність від інших відеогенераторів не полягає у занадто великому заносі на конкуренцію, а радше у глибоко вкоріненій філософії, яка керує нашим підходом до якості, дизайну продукту та маркетингової стратегії. Наш основний принцип полягає у тому, щоб завжди ставити людський елемент на перше місце, забезпечуючи, щоб наші творіння резонували з автентичністю та емоціями. Ми пишаємось тим, що надаємо найкращу якість у галузі без компромісів. Використовуючи передові 3D відеорендеринги, ми надаємо нашим користувачам справжній кінематографічний досвід. Крім того, наша стратегія є унікально обґрунтованою; ми починаємо з полішеного продукту, а потім швидко ітеруємо до досконалості. Цей підхід забезпечує, що наші пропозиції завжди на крок попереду, встановлюючи нові стандарти у відеогенерації.
З вашим великим досвідом у сфері GPU, чи можете ви поділитися з нами деякими своїми поглядами на NVIDIA Next-Generation GH200 Grace Hopper Superchip Platform (NVDA )?
Архітектура Grace Hopper є справжнім проривом. Якщо GPU може ефективно працювати з оперативною пам’яттю хоста без повного блокування обчислень, це розблокує зараз неможливі співвідношення моделі/прискорювача під час навчання, і як результат, бажану гнучкість у розмірах завдань навчання. Припускаючи, що весь запас GH200 не буде повністю використаний для навчання LLM, ми сподіваємося використовувати його для значного зниження витрат на прототипування наших багатомодальних архітектур у перспективі.
Чи є інші чіпи, які зараз знаходяться на вашому радарі?
Наша основна мета полягає у тому, щоб надати користувачеві відеоконтент, який є конкурентоспроможним за ціною. Ураховуючи попит на великі GPU з великою кількістю пам’яті на даний момент, ми постійно оптимізуємо та пробуємо будь-які пропозиції GPU у провідних хмарних сервісах. Крім того, ми прагнемо бути принаймні частково незалежними від платформи для деяких наших завдань. Тому ми розглядаємо TPU та інші ASIC, а також уважно стежимо за AMD. Зрештою будь-який шлях оптимізації апаратного забезпечення, який може привести до кращого співвідношення FLOPs/долар, буде досліджений.
Яка ваша бачення майбутніх досягнень у сфері відеогенерації?
За 24 місяці ми не зможемо відрізнити згенеровану людину від знятої. Це змінить багато речей, і ми перебуваємо на передовій цих досягнень.
На даний момент більшість згенерованих відео призначені для комп’ютерів і мобільних пристроїв, що потрібно змінити, щоб ми мали фотореалістичні згенеровані аватари та світові для доповненої реальності та віртуальної реальності?
На даний момент ми володіємо можливістю генерувати фотореалістичні аватари та світові для доповненої реальності (AR) та віртуальної реальності (VR). Основна перешкода полягає у затримці. Хоча доставка високоякісних, реальних графіків до пристроїв краю, таких як шоломи AR і VR, є важливою, досягнення цього безперебійно залежить від кількох факторів. По-перше, ми залежимо від досягнень у виробництві чіпів, щоб забезпечити швидше та ефективніше оброблення. Разом з цим оптимізація споживання енергії є важливою для забезпечення довшого використання без компромісів у досвіді. Останнє, але не менш важливе, ми очікуємо програмних проривів, які можуть ефективно зв’язати розрив між генерацією та реальним рендерингом. Коли ці елементи поєднуються, ми побачимо зростання використання фотореалістичні аватари та середовища у сфері AR і VR.
Чи очікуєте ви наступний великий прорив у сфері штучного інтелекту?
Коли мова йде про наступний значний прорив у сфері штучного інтелекту, завжди існує атмосфера збудження та очікування. Хоча я згадував деякі досягнення раніше, те, що я можу поділитися, полягає у тому, що ми активно працюємо над кількома революційними інноваціями на даний момент. Я б хотів зануритися у деталі, але поки що я закликаю всіх стежити за нашими майбутніми релізами. Майбутнє штучного інтелекту обіцяє багато, і ми раді бути на передовій цих піонерських зусиль. Залишайтеся на зв’язку!
Чи є щось інше, про що ви хотіли б поділитися щодо Hour One?
Ви повинні обов’язково відвідати наш канал Discord та API, нові доповнення до нашої платформи на Hour One.












