Інтерв’ю
Віктор Ерухімов, CEO CraftStory – Серія інтерв’ю

Віктор Ерухімов, CEO CraftStory, – інженер-дослідник комп’ютерного зору, який перейшов у підприємництво і допоміг сформувати ранню еволюцію OpenCV, пізніше став співзасновником Itseez і керував ним з технічної стартапу в одну з провідних комп’ютерних команд зору світу перед його придбанням Intel. За понад десятиліття він перейшов від технічного директора до генерального директора, а потім до президента, і продовжував цю траєкторію в Itseez3D, де очолював розробку передових мобільних технологій 3D-сканування та генерації аватарів, а також тривалий час був членом ради директорів OpenCV.org.
У CraftStory він зараз зосереджується на створенні відео з використанням штучного інтелекту, будуючи технології, які перетворюють прості вхідні дані у високореалістичні відео, готові для творців. Під його керівництвом компанія розробляє відеомоделі нового покоління, призначені для маркетингових команд, педагогів та творців продуктів, яким потрібний швидкий, високоякісний контент без студійного надзвуку.
Ви були рухомою силою за деякими з найбільш впливових проектів комп’ютерного зору – від OpenCV до Itseez3D. Що надихнуло вас заснувати CraftStory, і як ваша попередня робота сформувала бачення довгих, студійних відео з використанням штучного інтелекту?
До CraftStory моя команда і я працювали над Avatar SDK – інструментом, який створює реалістичні аватари з селфі для VR/AR, ігор, маркетингу та інших застосунків. Ми вже думали глибоко про цифрових людей протягом декількох років. Потім, близько двох років тому, ми зрозуміли, що технологія генерації відео з використанням штучного інтелекту стає досить доброю, щоб розблокувати абсолютно нову хвилю застосунків, і ми негайно почали працювати над цим.
CraftStory розпочала роботу з творцями OpenCV в своєму ядрі. Як це спільне минуле вплинуло на технічний напрямок і пріоритети досліджень для Моделі 2.0?
Ми живемо в період надзвичайного прогресу в галузі комп’ютерного зору та машинного навчання. Це здається, що всі прориви ранньої квантової механіки – спочатку розкидані по десятиліттям – були стиснуті всього в декілька років. Розуміння зображень та генерація зображень значно перевищили те, з чим ми працювали під час розробки OpenCV. Виконуючи цю еволюцію протягом понад десяти років, роблячи передбачення та бачачи їх успіх чи невдачу, ми здобули глибоке інтуїтивне розуміння того, куди рухається технологія та ринок. Це бачення безпосередньо сформувало наші пріоритети досліджень та дорожню карту для Моделі 2.0.
Модель 2.0 вирішує проблему, з якою борються багато відеомоделей: підтримання ідентичності, емоцій та узгодженості протягом хвилин відео. Які прориви зробили це можливим?
Ідентичність та узгодженість були нашими пріоритетами з самого початку. Декілька архітектурних рішень у мережі були спеціально розроблені для вирішення цих проблем. Але не менш важливим було тонке налаштування моделі на дані, які ми зібрали самостійно. Ми знімали професійних акторів у контрольованому студійному середовищі, використовуючи наші власні камери з високою частотою кадрів, щоб забезпечити, щоб кожен кадр – включаючи швидкі рухи тіла, рук та пальців – залишався чітким. Це високоякісне, рухове дані зробили суттєву різницю.
Ваша команда ввела паралельний дифузійний трубопровід, щоб зберегти довгі послідовності узгодженими. Яку проблему це було призначено для вирішення, і чому це було важливо для відео з людьми тривалістю в декілька хвилин?
Ви ввели паралельний дифузійний трубопровід, щоб зберегти довгі послідовності узгодженими. Яку проблему це було призначено для вирішення, і чому це було важливо для відео з людьми тривалістю в декілька хвилин?
Виконання одного процесу дифузії над довгою послідовністю кадрів надзвичайно складне – це обчислювально дороге та вимагає величезної кількості навчальних даних. Наш паралельний дифузійний трубопровід вирішує це, виконуючи декілька процесів дифузії на різних часових сегментах одночасно. Ключовим проривом було те, щоб знайти спосіб з’єднати ці сегменти так, щоб вони залишалися узгодженими та послідовними протягом довгих періодів. Модель 2.0 тепер може генерувати відео тривалістю до п’яти хвилин, але це в основному технічне обмеження. З додатковою інженерною роботою ми можемо розширити це до відео практично довільної тривалості.
CraftStory підкреслює реалізм як у русі, так і в виразах. Які були найбільшими проблемами у збереженні природної динаміки рук, тіла та обличчя на довших тривалістю?
Найбільша проблема полягає у генерації реалістичного руху тіла та виразу послідовно протягом довгих періодів. Малі деталі – як тонкий рух рук, зміна постави чи мікровирази – схильні до порушення в більшості моделей, коли послідовність стає довшою. Ми вирішили цю проблему, тренуючи нашу модель на власних обширних, високоякісних даних, зібраних з професійними акторами та камерами з високою частотою кадрів. Це контрольоване, рухове відео дало моделі сигнал, необхідний для збереження природної динаміки протягом усієї вистави, а не лише в ізольованих моментах.
Багато компаній застряли між дорогими живими зйомками та короткими, ненадійними кліпами штучного інтелекту. Де ви бачите найбільший комерційний попит на відео з людьми тривалістю в декілька хвилин?
Відео, згенеровані штучним інтелектом, швидко стають непізнаваними від знімків, зроблених камерою, при цьому коштуючи лише частину традиційної продукції. Найбільший ранній попит, який ми бачимо, – це корпоративний контент, особливо навчання та розвиток, де компанії потребують великих обсягів чітких, людських інструктивних відео, які можна оновлювати миттєво. Відео з людьми тривалістю в декілька хвилин – ідеальний варіант для цього.
Ми також бачимо зростаючий інтерес до маркетингових випадків використання, таких як представлення продукту, навчальні матеріали та роз’яснення. По мірі того, як технологія дозріває, довге відео з використанням штучного інтелекту все частіше буде замінювати як дорогі живі зйомки, так і короткі, ненадійні кліпи, які можуть виробляти більшість інструментів сьогодні.
Ви створили розширений системою синхронізації руху губ та виразів. Як далеко ми від повністю переконливого діалогу штучного інтелекту, і що ще потрібно покращити?
Ви створили розширений системою синхронізації руху губ та виразів. Як далеко ми від повністю переконливого діалогу штучного інтелекту, і що ще потрібно покращити?
Я думаю, що ми дуже близько. Ще одна ітерація технології – особливо для того, щоб зробити її швидшою і генерувати відео у форматі 1080p – приведе нас до повністю переконливого діалогу штучного інтелекту.
Модель тексту-відео, яку ви розробляєте, обіцяє довготривалу генерацію безпосередньо з сценаріїв. Які технічні бар’єри вам ще потрібно подолати, перш ніж це стане масовим?
Немає фундаментальних бар’єрів – просто багато інженерної роботи попереду. Відео-відео було нижчою галуззю, тому ми привели це на ринок першими. Тепер ми зосереджені на моделі зображення-відео, яка приймає сценарій та посилання на зображення як вхідні дані. Ми робимо швидкий прогрес і сподіваємося випустити це протягом найближчих тижнів.
Послідовності з рухомою камерою – як сцени “ходьба та розмова” – це великий крок до автоматизації кіно. Як ваша команда підходить до цієї проблеми порівняно з конкурентами, такими як Sora?
Ми зосереджені на генерації довгих послідовностей “ходьба та розмова” – відео тривалістю в декілька хвилин, які здаються кінематографічними та природними. Наша мета – дати клієнтам можливість створювати відео у стилі знаменитої кампанії “Продовжуй рухатись” від Johnnie Walker, але без повної знімальної групи. Ми робимо швидкий прогрес, і дуже скоро ми зможемо виробляти послідовності “ходьба та розмова”, які тривають протягом декількох хвилин з узгодженими персонажами, рухом та динамікою камери.
З OpenAI, Google (GOOGL ) та іншими, що входять у довготривале відео, яку перевагу ви бачите у CraftStory на цьому розвивающомуся ринку?
Ринок відео з використанням штучного інтелекту надзвичайно конкурентний, і ми повністю очікуємо, що великі гравці догонять нас технологічно. Але наша перевага полягає у фокусі та швидкості. У нас дуже амбіційна дорожня карта, і ми – компактна команда, яка може рухатися швидко та швидко ітеруватися. Ця гнучкість – а також наш фокус на довготривалому, людському відео – це те, що відрізняє CraftStory.
По мірі того, як відео з людьми, згенеровані штучним інтелектом, стають все більш реалістичними та масштабованими, які творчі чи етичні заходи захисту, на вашу думку, повинні бути на місці, коли ця технологія пошириться?
По мірі того, як відео з людьми, згенеровані штучним інтелектом, стають все більш реалістичними та масштабованими, які творчі чи етичні заходи захисту, на вашу думку, повинні бути на місці, коли ця технологія пошириться?
Кожна потужна технологія – це двосічний меч, і важливо зрозуміти конкретні ризики, пов’язані з її появою на ринку. У відео з людьми, згенерованими штучним інтелектом, імперсонація – це найзначущіша, хоча не єдина, проблема. Ми провели час, аналізуючи ці ризики, і ввели заходи захисту, які запобігають певним шкідливим випадкам використання. По мірі того, як технологія стає все більш реалістичною та масштабованою, підтримання сильних етичних та творчих заходів захисту буде важливим для всієї галузі.
Дякуємо за велике інтерв’ю. Читачам, які бажають дізнатися більше, рекомендуємо відвідати CraftStory.












