Rozhovory

Victor Erukhimov, CEO CraftStory – Rozhovorová série

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Victor Erukhimov, CEO CraftStory, je inženýr počítačového vidění a vývojář, který se stal podnikatelem a pomáhal formovat ranou evoluci OpenCV, později spoluzakládal Itseez a vedl ji z technického startupu do jednoho z předních světových počítačových výzkumných týmů, než byla získaná společností Intel. Během více než desetiletí se posunul z pozice technického ředitele na CEO a pokračoval v této cestě v Itseez3D, kde vedl vývoj pokročilých mobilních 3D skenovacích a avatar-generačních technologií a současně působil jako dlouholetý člen správní rady OpenCV.org.

V CraftStory se nyní zaměřuje na AI-nativní video tvorbu, buduje technologii, která transformuje jednoduché vstupy do vysoce realistických, tvůrčích videí. Pod jeho vedením společnost vyvíjí nové generativní video modely navržené pro marketingové týmy, pedagogy a produktové vyprávěče, kteří potřebují rychlý, vysoce kvalitní obsah bez studiové režie.

Máte za sebou působení u některých z nejvlivnějších počítačových projektů – od OpenCV po Itseez3D. Co vás inspirovalo k založení CraftStory a jak vaše předchozí práce ovlivnila vizi dlouhých, studiových AI videí?

Před CraftStory můj tým a já pracovali na Avatar SDK – nástroji, který vytváří realistické avatary z fotografií pro VR/AR, hry, marketing a další aplikace. Už jsme několik let hluboce přemýšleli o digitálních lidech. Před dvěma lety jsme si uvědomili, že technologie GenAI pro generování videa je dostatečně dobrá, aby odemkla zcela nové aplikace, a okamžitě jsme se do toho pustili.

CraftStory zahájila činnost se zakladateli OpenCV v jádru. Jak ovlivnila tato společná historie technický směr a výzkumné priority pro Model 2.0?

Žijeme v období mimořádného pokroku v počítačovém vidění a strojovém učení. Zdá se, že všechny průlomy rané kvantové mechaniky – původně rozložené přes desetiletí – byly zkomprimovány do pouhých několika let. Porozumění obrazům a jejich generování pokročilo daleko za to, s čím jsme pracovali při vývoji OpenCV. Díky tomu, že jsme pozorovali tuto evoluci po více než desetiletí, dělali jsme předpovědi a viděli, zda se zdaří nebo ne, jsme získali hlubokou intuici pro to, kam směřuje technologie a trh. Tento pohled přímo ovlivnil naše výzkumné priority a roadmapu pro Model 2.0.

Model 2.0 řeší něco, s čím mnoho video modelů bojuje: zachování identity, emocí a konzistence po několik minut videa. Jaké průlomy to umožnily?

Identita a konzistence byly našimi prioritami od samého začátku. Některé architektonické volby v síti byly speciálně navrženy pro řešení těchto výzev. Ale stejně důležité bylo jemné doladění modelu na data, která jsme sami nasbírali. Natáčeli jsme profesionální herce v kontrolovaném studiovém prostředí pomocí našich vlastních kamer s vysokým snímkovým frekvencem, abychom zajistili, že každá snímka – včetně rychlých pohybů těla, rukou a prstů – zůstala ostrá. Taková vysokokvalitní, pohybově bohatá data udělala významný rozdíl.

Vašemu týmu se podařilo zavést paralelní difuzní pipeline, aby udržoval dlouhé sekvence koherentní. Jaký problém to mělo vyřešit a proč bylo to zásadní pro víceminutová videa s lidmi?

Spustit jeden difuzní proces přes dlouhou sekvenci snímků je extrémně náročné – je to výpočetně nákladné a vyžaduje obrovské množství trénovacích dat. Naše paralelní difuzní pipeline řeší tento problém spuštěním více difuzních procesů na různých časových segmentech současně. Klíčový průlom spočíval v tom, jak propojit tyto segmenty, aby zůstaly koherentní a konzistentní po dlouhou dobu. Model 2.0 může nyní generovat videa až pět minut, ale to je hlavně technické omezení. S dalšími inženýrskými pracemi můžeme tuto délku prodloužit na videa prakticky libovolné délky.

CraftStory klade důraz na realističnost v pohybu i výrazu. Jaké byly největší výzvy při zachování přirozené dynamiky rukou, těla a obličeje při delších délkách?

Největší výzvou je generovat realistické pohyby těla a obličeje konzistentně po dlouhou dobu. Malé detaily – jako jemné pohyby rukou, změny postoje nebo mikro-exprese – mají tendenci se rozpadat v meisten modelech, jak se sekvence prodlužuje. Řešili jsme to tím, že jsme trénovali na našich vlastních rozsáhlých, vysoce kvalitních datech, nasbíraných s profesionálními herci a kamerami s vysokým snímkovým frekvencem. Taková úroveň kontrolovaných, pohybově bohatých snímků dala modelu signál, který potřeboval, aby zachoval přirozenou dynamiku po整个 výkon, ne jen v izolovaných okamžicích.

Mnohé společnosti jsou uvězněny mezi drahými živými natáčkami a krátkými, nespolehlivými AI klipy. Kde očekáváte největší komerční poptávku po víceminutových, lidsky orientovaných videích?

AI-generovaná videa se rychle stávají nerozeznatelnými od kamery-natáčených snímků, zatímco stojí zlomek tradiční produkce. Největší počáteční poptávku vidíme v korporátním obsahu – zejména v oblasti Učení a Rozvoje – kde společnosti potřebují velké množství jasných, lidsky orientovaných instrukčních videí, která lze okamžitě aktualizovat. Víceminutoví, konzistentní AI prezentátoři jsou ideální volbou pro tuto oblast.

Také vidíme rostoucí zájem o marketingové použití, jako jsou produktové představení, tutoriály a vysvětlení. Jakmile se technologie zlepší, dlouhá AI videa budou stále více nahrazovat jak drahé živé natáčení, tak krátké, nespolehlivé klipy, které většina nástrojů může dnes produkovat.

Vyvinuli jste pokročilý systém synchronizace rtů a gest. Jak daleko jsme od plně věrohodného AI dialogu a co ještě potřebuje zlepšení?

Domnívám se, že jsme velmi blízko. Jedna další iterace technologie – zejména aby byla rychlejší a generovala nativní 1080p – nás dostane k plně věrohodnému AI dialogu.

Vašim týmem vyvíjený model text-to-video slibuje generování dlouhých videí přímo ze scénářů. Jaké technické bariéry ještě musíte překonat, aby se toto stalo mainstreamem?

Neexistují žádné fundamentální bariéry – jen spousta inženýrských prací před námi. Video-to-video byla nižší visící ovoce, takže jsme ji jako první uvedli na trh. Nyní se soustředíme na model image-to-video, který vezme scénář a referenční obrazek jako vstup. Dosahujeme rychlého pokroku a doufáme, že ho uvedeme do provozu během několika týdnů.

Sekvence s pohybující kamerou – jako jsou scény, kde herec chodí a mluví – jsou velkým krokem směrem k automatizaci filmového průmyslu. Jak váš tým přistupuje k této výzvě ve srovnání se soutěžícími, jako je Sora?

Soustředíme se na generování dlouhých sekvencí, kde herec chodí a mluví – víceminutových snímků, které vypadají filmově a přirozeně. Naším cílem je dát zákazníkům možnost vytvářet videa ve stylu slavné kampaně „Keep Walking“ od Johnnie Walkera, ale bez plné produkční ekipy. Dosahujeme rychlého pokroku a brzy budeme moci produkovat sekvence, kde herec chodí a mluví, které budou trvat několik minut s konzistentními postavami, pohybem a kamerovými dynamikami.

S OpenAI, Google (GOOGL ) a dalšími, kteří se vrhají do dlouhých videí, co vidíte jako výhodu CraftStory v tomto vznikajícím trhu?

Trh s AI-videem je neuvěřitelně konkurenční a plně očekáváme, že velké hráči technologicky dohánějí. Ale naše výhoda spočívá v zaměření a rychlosti. Máme velmi ambiciózní roadmapu a jsme štíhlým týmem, který může rychle reagovat a iterovat. Tato agilita – a naše zaměření na dlouhá, lidsky orientovaná videa – je to, co odlišuje CraftStory.

Jakmile se AI-generovaná lidská videa stanou více realistickými a škálovatelnými, jaké etické nebo kreativní záruky byste měli mít na místě, aby se tato technologie šířila?

Každá mocná technologie je dvojí meč, a je zásadní pochopit specifické rizika, která přicházejí s jejím uvedením na trh. U AI-generovaných lidských videí je nejvýznamnějším problémem padělání – i když ne jediným. Strávili jsme čas analýzou těchto rizik a implementovali jsme záruky, které brání určitým škodlivým případům použití. Jakmile se technologie stane více realistickou a škálovatelnou, bude zachování silných etických a kreativních ochranných opatření zásadní pro celý průmysl.

Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit CraftStory.

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.