Financování

ShengShu Technology získala přes 86 milionů dolarů ve financování série A+, aby rozšiřovala hranice multimodálního AI

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

ShengShu Technology dokončila kolo financování série A+ ve výši přesahující 600 milionů RMB (přibližně 86 milionů dolarů), což je významný milník pro společnost, která rozšiřuje své multimodální základové modely pro digitální i fyzické aplikace. Kolo bylo vedeno Zhongguancun Science City a LINK-X CAPITAL, se strategickou účastí Wondershare, Visual China Group a TRS. Několik stávajících investorů také zvýšilo své závazky, což dokládá pokračující důvěru ve technologický směr a komerční pokrok ShengShu.

Nové kapitálové prostředky přicházejí v době, kdy multimodální systémy AI přecházejí z experimentálních nástrojů na infrastrukturu, která podporuje reálnou produkci. Trajektoria ShengShu odráží tento posun, s průlomovými výzkumy, které se stále více překládají do nasazených produktů používaných napříč odvětvími.

Od raného výzkumu k modelům komerční třídy

ShengShu Technology byla jednou z prvních týmů na světě, které se zaměřily na multimodální generativní algoritmy jako základní směr výzkumu. V roce 2022 společnost představila architekturu U-ViT, která pomohla vytvořit technickou základnu pro modely schopné rozumět textu, obrazu a videa. Tento výzkum-first přístup stanovil scénu pro spuštění Vidu v polovině roku 2024.

Vidu vstoupil na trh s funkcí Reference-to-Video, která se posunula za hranice konvenční text-to-video nebo image-to-video generace. Místo toho, aby každý snímek byl považován za izolovaný výstup, byl systém navržen tak, aby zachoval konzistenci multi-entity napříč scénami, a řešil tak dlouholetou výzvu v komerční video produkci. Od spuštění ShengShu rychle iteruje, vydává následné verze, které zlepšují semantické porozumění, stabilitu pohybu, vizuální koherenci a rychlost inference.

Nejnovější vydání, Vidu Q3, odráží úmyslné zaměření na vyprávění příběhů. Model podporuje synchronizovanou audio-video generaci až 16 sekund, nativní 1080p výstup, přesné přechody záběrů, multijazyčné textové vykreslování a výstup v několika jazycích. Tyto schopnosti umístily systém blíže k produkčním pracovním postupům, než krátkým experimentálním klipům.

Prostředí, rychlost a otevřená inovace

Mimo kvalitu výstupu ShengShu zdůraznila efektivitu jako konkurenční diferenciátor. Na konci roku 2025 společnost otevřela svůj TurboDiffusion framework, což výrazně snížilo latenci generace videa. S tímto rámcem může být pětisekundové video vygenerováno za méně než dvě sekundy na jednom high-end GPU, což představuje řádově lepší výsledky ve srovnání s předchozími přístupy.

Toto zaměření na rychlost není pouze technickým benchmarkem. Nižší latence a výpočetní požadavky přímo ovlivňují proveditelnost nasazení multimodálních modelů v měřítku, zejména pro interaktivní aplikace a reálné kreativní nástroje. Snížení nákladů a času potřebného pro generování vysoce kvalitního videa ShengShu posouvá multimodální AI blíže k dennímu použití v profesionálních prostředích.

Rozšiřování přijetí napříč kreativními a podnikovými trhy

ShengShu vytvořila širokou ekosystém produktů kolem Vidu, pokrývající spravované služby, nabídky SaaS, aplikace a agentní nástroje. Tyto produkty nyní slouží tvůrcům, studiím a podnikům ve více než 200 zemích a regionech. V roce 2025 společnost oznámila více než desetinásobný růst uživatelů a příjmů, což naznačuje zrychlené přijetí.

V oblasti filmu a zábavy je Vidu používán napříč animací, krátkometrážními produkčními a pracovními postupy, s zapojením vlastníků obsahu, poskytovatelů nástrojů a produkčních studií. Současně internetové platformy a společnosti pro chytrou hardware aplikují technologii na tvorbu marketingových aktiv, interaktivního obsahu a inovací produktů.

Reklama a herní průmysl se objevily jako další oblasti přijetí. Značky a agentury používají Vidu ke škálování produkce videa pro kampaně, zatímco vývojáři her nasazují jej pro reklamy a generaci scén. Mezinárodně platforma získává trakci mezi vývojáři kreativních nástrojů a podnikovými uživateli, s aplikacemi sahajícími do vzdělávání, vysílání, kulturního turismu a dalších oblastí.

Širší implikace multimodálního AI

Pokrok multimodálních základních modelů má implikace daleko za hranice tvorby videa. Integrací textu, obrazu, zvuku a pohybu do jednotných systémů tyto modely umožňují strojům interpretovat kontext způsobem, který se více podobá lidskému vnímání. Pro odvětví to znamená rychlejší produkční cykly, nižší bariéry pro vstup na trh s vysoce kvalitním obsahem a nové formy interakce mezi lidmi a softwarem.

Současně zrání multimodálního AI vyvolává důležité otázky kolem autenticity, duševního vlastnictví a odpovědného nasazení. Jakmile se generované video stane stále realističtějším, technické záruky a rámce governance budou nezbytné pro udržení důvěry v digitální média.

Pohledem do budoucna je pravděpodobné, že multimodální modely budou hrát roli nejen v digitálních pracovních postupech, ale také ve fyzických systémech, od robotiky a simulace po chytré prostředí. ShengShu Technology poslední kolo financování ji позиcionuje pro účast v tomto přechodu, jak multimodální AI přechází z kreativní novinky do základního vrstvy produktivity nové generace.

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.