Интервью

Лior Хаким, сооснователь и технический директор Hour One – Серия интервью

mm
Добавьте Unite.AI в избранные источники в Google

Лior Хаким, сооснователь и технический директор Hour One, лидера отрасли в создании виртуальных людей для профессиональных видеокоммуникаций. Живые виртуальные персонажи, созданные исключительно по образцу реальных людей, передают человеческое выражение через текст, позволяя бизнесу повышать уровень своих сообщений с беспрецедентной легкостью и масштабируемостью.

Можете ли вы рассказать нам историю создания Hour One?

Происхождение Hour One можно отнести к моему участию в криптовалютной области. После этого начинания я начал размышлять о том, что будет следующим большим делом, которое сможет использовать возможности облачных вычислений, и когда машинное обучение набирало популярность в рекомендациях и прогностической аналитике, я работал над несколькими проектами, связанными с инфраструктурой машинного обучения. Через эту работу я познакомился с ранними генеративными работами и был особенно заинтересован в GAN в то время. Я использовал все вычислительные ресурсы, которые мог получить, чтобы протестировать эти новые технологии. Когда я показал свои результаты другу, у которого была компания в этой области, он сказал мне, что мне нужно встретиться с Ореном. Когда я спросил, почему, он сказал мне, что, может быть, мы оба перестанем тратить его время и начнем тратить друг другу время. Орен, мой сооснователь и генеральный директор Hour One, был ранним инвестором в области ИИ в то время, и хотя мы стояли в разных местах, мы оба двигались в одном направлении, и создание Hour One как дома виртуального человека было неизбежным путешествием.

Какие из машинных алгоритмов используются, и какая часть процесса представляет собой Генеративный ИИ?

В области создания видео машинные алгоритмы играют важную роль на каждом этапе. На этапе написания сценария большие языковые модели (LLM) предлагают ценные предложения, создавая или совершенствуя контент, чтобы обеспечить увлекательные повествования. Когда мы переходим к аудио, алгоритмы текст-в-речь (TTS) преобразуют текст в органичные, эмоциональные голоса. Переходя к визуальному представлению, наша проприетарная многомодальная основная модель виртуального человека занимает центральное место. Эта модель, улучшенная с помощью генеративных противостоящих сетей (GAN) и вариационных автоэнкодеров (VAE), способна передавать контекстуальные эмоции, артикуляцию и захватывающую, аутентичную подачу. Такие генеративные методы превращают текст и аудиосигналы в живые визуальные образы виртуальных людей, что приводит к гиперреалистичным видео-выходам. Оркестровка LLM, TTS, GAN, VAE и нашей многомодальной модели делает Генеративный ИИ не просто частью, а основой современного видеопроизводства.

Как Hour One отличается от других генераторов видео?

В Hour One наше отличие от других генераторов видео не заключается в том, чтобы конкурировать с ними, а rather в глубоко укоренившейся философии, определяющей наш подход к качеству, дизайну продукта и рыночной стратегии. Наш руководящий принцип – всегда ставить во главу угла человеческий фактор, обеспечивая, чтобы наши творения резонировали с аутентичностью и эмоциями. Мы гордимся тем, что предоставляем лучшее качество в отрасли без компромиссов. Используя передовые 3D-видеорендеринг, мы предлагаем нашим пользователям настоящий кинематографический опыт. Кроме того, наша стратегия уникальна и убеждена; мы начинаем с отполированного продукта, а затем быстро итерируем к совершенству. Этот подход гарантирует, что наши предложения всегда на шаг впереди, устанавливая новые стандарты в генерации видео.

С вашим обширным опытом в области GPU, можете ли вы поделиться с нами некоторыми мыслями о вашем взгляде на NVIDIA Next-Generation GH200 Grace Hopper Superchip Platform (NVDA )?

Архитектура Grace Hopper действительно является прорывом. Если GPU может эффективно работать из оперативной памяти хоста без полного возникновения узкого места в расчетах, это открывает ранее невозможные соотношения модели и ускорителя в обучении, и, как результат, желаемую гибкость в размерах задач обучения. Предполагая, что весь запас GH200 не будет полностью использован для обучения LLM, мы надеемся использовать его для значительного снижения затрат на прототипирование наших многомодальных архитектур в будущем.

Есть ли другие чипы, которые в настоящее время находятся в вашем поле зрения?

Наша основная цель – предоставить пользователю видеоконтент, который является конкурентоспособным по цене. Учитывая спрос на GPU с большой памятью в настоящее время, мы постоянно оптимизируем и тестируем любое предложение GPU в лучших облачных сервисах. Кроме того, мы стремимся быть хотя бы частично независимыми от платформы на некоторых наших рабочих нагрузках. Таким образом, мы также обращаем внимание на TPU и другие ASIC, а также внимательно следим за AMD. В конечном итоге любой путь оптимизации, основанный на аппаратуре, который может привести к лучшему соотношению FLOPS/доллар, будет исследован.

Каково ваше видение будущих достижений в генерации видео?

Через 24 месяца мы не сможем отличить сгенерированного человека от захваченного. Это изменит многое, и мы находимся на переднем крае этих достижений.

На данный момент большинство сгенерированных видео предназначены для компьютеров и мобильных устройств, что должно измениться, прежде чем мы получим фотореалистичные сгенерированные аватары и миры для дополненной реальности и виртуальной реальности?

В настоящее время у нас есть возможность генерировать фотореалистичные аватары и миры для дополненной реальности (AR) и виртуальной реальности (VR). Основным препятствием является задержка. Хотя доставка высококачественных, реальных графических изображений на устройства, такие как очки AR и VR, имеет решающее значение, достижение этого без проблем зависит от нескольких факторов. Прежде всего, мы зависим от достижений в производстве чипов, чтобы обеспечить более быструю и эффективную обработку. Наряду с этим оптимизация потребления энергии имеет важное значение для обеспечения более длительного использования без ущерба для опыта. Наконец, мы ожидаем программных прорывов, которые могут эффективно мостить разрыв между генерацией и реальным рендерингом. Когда эти элементы объединяются, мы увидим рост использования фотореалистичных аватаров и окружающей среды в платформах AR и VR.

Что вы ожидаете как следующий большой прорыв в ИИ?

Когда речь идет о следующем значительном прорыве в ИИ, всегда есть волнение и ожидание. Хотя я упоминал некоторые достижения ранее, то, что я могу поделиться, – это то, что мы активно работаем над несколькими новаторскими инновациями прямо сейчас. Я бы хотел углубиться в детали, но пока я призываю всех следить за нашими предстоящими выпусками. Будущее ИИ обещает многое, и мы рады быть на переднем крае этих пионерских усилий. Следите за нами!

Есть ли что-то еще, что вы хотели бы поделиться о Hour One?

Вы должны обязательно посетить наш канал Discord и API, новые дополнения к нашей платформе в Hour One.

Антуан - видный лидер и сооснователь Unite.AI, движимый непоколебимой страстью к формированию и продвижению будущего ИИ и робототехники. Как серийный предприниматель, он считает, что ИИ будет столь же разрушительным для общества, как и электричество, и часто увлекается потенциалом разрушительных технологий и ИИ.

Как футуролог, он посвящен исследованию того, как эти инновации будут формировать наш мир. Кроме того, он является основателем Securities.io, платформы, ориентированной на инвестиции в передовые технологии, которые переопределяют будущее и меняют целые сектора.