Finansiering
ShengShu Technology samlar in över 86 miljoner dollar i serie A+-finansiering för att utvidga gränserna för multimodalt AI

ShengShu Technology har slutfört en serie A+-finansieringsrunda som överstiger 600 miljoner RMB (cirka 86 miljoner USD), vilket markerar en stor milstolpe för företaget när det skalar upp sina multimodala grundmodeller för både digitala och fysiska tillämpningar. Rundan leddes av Zhongguancun Science City och LINK-X CAPITAL, med strategiskt deltagande från Wondershare, Visual China Group och TRS. Flera befintliga investerare ökade också sina åtaganden, vilket understryker det fortsatta förtroendet för ShengShus tekniska riktning och kommersiella framsteg.
Den nya kapitalinjektionen kommer vid en tidpunkt då multimodala AI-system flyttar från experimentella verktyg till infrastruktur som utgör grunden för verklig produktion. ShengShus bana speglar den förändringen, med forskningsgenombrott som alltmer översätts till distribuerade produkter som används inom olika branscher.
Från tidig forskning till kommersiella modeller
ShengShu Technology var ett av de första teamen globalt som fokuserade på multimodala genererande algoritmer som en kärnforskningsriktning. 2022 introducerade företaget U-ViT-arkitekturen, vilket hjälpte till att etablera en teknisk grund för modeller som kan resonera över text, bild och video. Denna forskningsbaserade tillvägagångssätt skapade scenen för lanseringen av Vidu i mitten av 2024.
Vidu gick in på marknaden med en Reference-to-Video-funktion som gick utöver konventionell text-till-video eller bild-till-video-generering. Istället för att behandla varje bildruta som en isolerad utdata, var systemet utformat för att bevara multi-entitets-konsekvens över scener, vilket adresserade en långvarig utmaning i kommersiell videogenerering. Sedan lanseringen har ShengShu itererat snabbt, släppt på varandra följande versioner som förbättrat semantisk förståelse, rörelsestabilitet, visuell sammanhängande och inferenshastighet.
Den senaste versionen, Vidu Q3, speglar en medveten fokusering på berättande. Modellen stöder synkroniserad audio-video-generering upp till 16 sekunder, nativ 1080p-utdata, exakta klippövergångar, flerspråkig textrendering och flerspråkig utdata. Dessa funktioner placerar systemet närmare produktionsflöden, snarare än korta experimentella klipp.
Prestanda, hastighet och öppen innovation
Utöver utdatakvalitet har ShengShu betonat effektivitet som en konkurrensfördel. I slutet av 2025 släppte företaget sin TurboDiffusion-ramverk som öppen källkod, ett drag som betydligt reducerade videogenereringsfördröjningen. Med detta ramverk kan en femsekundersvideo genereras på under två sekunder på en enda högpresterande GPU, vilket representerar flera storleksordningar av vinster jämfört med tidigare tillvägagångssätt.
Denna fokusering på hastighet är inte bara en teknisk benchmark. Lägre latens och beräkningskrav påverkar direkt möjligheten att distribuera multimodala modeller i stor skala, särskilt för interaktiva applikationer och realtidskreativa verktyg. Genom att minska kostnaden och tiden som krävs för att generera högkvalitativ video, trycker ShengShu multimodalt AI närmare vardagligt bruk i professionella miljöer.
Utvidgad användning över kreativa och företagsmarknader
ShengShu har byggt ett brett produktsystem kring Vidu, som omfattar hanterade tjänster, SaaS-erbjudanden, applikationer och agentbaserade verktyg. Dessa produkter tjänar nu skapare, studior och företag i över 200 länder och regioner. 2025 rapporterade företaget en mer än tiofaldig tillväxt i både användare och intäkter, vilket indikerar en accelererad adoption.
I film och underhållning används Vidu över hela animation, kortfilmsproduktion och funktionella arbetsflöden, med engagemang över innehållsägare, verktygsleverantörer och produktionsstudior. Samtidigt tillämpas tekniken av internetplattformar och smarta hårdvaruföretag för marknadsföringsresurskapning, interaktivt innehåll och produktinnovation.
Reklam och spel har också dykt upp som ytterligare områden med dragkraft. Varumärken och byråer använder Vidu för att skala upp videoproduktion för kampanjer, medan speltillverkare distribuerar det för reklammaterial och scenegenerering. Internationellt vinner plattformen mark bland kreativa verktygsutvecklare och företagsanvändare, med tillämpningar som sträcker sig in i utbildning, sändning och kulturell turism.
De bredare implikationerna av multimodalt AI
Framstegen inom multimodala grundmodeller har implikationer som går långt utöver videokapning. Genom att integrera text, bild, ljud och rörelse i enhetliga system, möjliggör dessa modeller för maskiner att tolka kontext på ett sätt som liknar mänsklig perception. För branscher innebär detta snabbare produktionscykler, lägre inträdesbarriärer för högkvalitativt innehåll och nya former av interaktion mellan människor och programvara.
Samtidigt väcker mognaden av multimodalt AI viktiga frågor kring autenticitet, immateriella rättigheter och ansvarsfull distribution. När genererad video blir alltmer realistisk, kommer tekniska skyddsåtgärder och styrningsramar att vara avgörande för att upprätthålla förtroendet för digitala medier.
Om man ser framåt, är det troligt att multimodala modeller kommer att spela en roll inte bara i digitala arbetsflöden utan också i fysiska system, från robotik och simulering till smarta miljöer. ShengShu Technologies senaste finansieringsrunda positionerar det för att delta i den övergången, när multimodalt AI skiftar från en kreativ nyhet till en grundläggande skikt av nästa generations produktivitet.












