Finanziamenti
ShengShu Technology raccoglie oltre 86 milioni di dollari in finanziamenti di serie A+ per spingere i confini dell’AI multimodale

ShengShu Technology ha completato un round di finanziamenti di serie A+ che supera i 600 milioni di RMB (circa 86 milioni di dollari USA), segnando un importante traguardo per l’azienda mentre scala i suoi modelli di base multimodali per applicazioni sia digitali che del mondo reale. Il round è stato co-guidato da Zhongguancun Science City e LINK-X CAPITAL, con la partecipazione strategica di Wondershare, Visual China Group e TRS. Diversi investitori esistenti hanno anche aumentato i loro impegni, sottolineando la continua fiducia nella direzione tecnica e nel progresso commerciale di ShengShu.
Il nuovo capitale arriva in un momento in cui i sistemi di AI multimodali stanno passando da strumenti sperimentali a infrastrutture che sostengono la produzione nel mondo reale. La traiettoria di ShengShu riflette questo cambiamento, con break-through di ricerca che si traducono sempre più in prodotti distribuiti utilizzati in vari settori.
Dall’early research ai modelli commerciali
ShengShu Technology è stata tra le prime squadre a livello globale a concentrarsi sugli algoritmi generativi multimodali come direzione di ricerca principale. Nel 2022, l’azienda ha introdotto l’architettura U-ViT, aiutando a stabilire una base tecnica per modelli in grado di ragionare attraverso testo, immagine e video. Questo approccio di ricerca ha preparato il terreno per il lancio di Vidu a metà del 2024.
Vidu è entrato nel mercato con una funzionalità Reference-to-Video che si è spostata oltre la generazione convenzionale di testo-in-video o immagine-in-video. Invece di trattare ogni frame come un output isolato, il sistema è stato progettato per preservare la coerenza multi-entità attraverso le scene, affrontando una sfida a lungo termine nella generazione di video commerciali. Da allora, ShengShu ha iterato rapidamente, rilasciando versioni successive che hanno migliorato la comprensione semantica, la stabilità del movimento, la coerenza visiva e la velocità di inferenza.
L’ultimo rilascio, Vidu Q3, riflette un focus deliberato sulla narrazione. Il modello supporta la generazione di audio-video sincronizzati fino a 16 secondi, output nativo 1080p, transizioni di scena precise, rendering di testo multilingue e output multilingue. Queste capacità posizionano il sistema più vicino ai flussi di lavoro di produzione, piuttosto che ai clip sperimentali a breve termine.
Prestazioni, velocità e innovazione aperta
Oltre alla qualità dell’output, ShengShu ha enfatizzato l’efficienza come differenziale competitivo. Alla fine del 2025, l’azienda ha open-source il suo framework TurboDiffusion, una mossa che ha ridotto significativamente la latenza di generazione del video. Con questo framework, un video di cinque secondi può essere generato in meno di due secondi su una singola GPU di alta gamma, rappresentando guadagni di ordine di grandezza rispetto agli approcci precedenti.
Questo focus sulla velocità non è solo un benchmark tecnico. La latenza e i requisiti di calcolo più bassi influiscono direttamente sulla fattibilità del deploy di modelli multimodali su larga scala, specialmente per applicazioni interattive e strumenti creativi in tempo reale. Riducendo il costo e il tempo necessari per generare video di alta qualità, ShengShu sta spingendo l’AI multimodale più vicino all’uso quotidiano in ambienti professionali.
Estensione dell’adozione in mercati creativi e aziendali
ShengShu ha costruito un’ampia gamma di prodotti intorno a Vidu, che comprende servizi gestiti, offerte SaaS, applicazioni e strumenti basati su agenti. Questi prodotti servono ora creatori, studi e aziende in oltre 200 paesi e regioni. Nel 2025, l’azienda ha segnalato una crescita di oltre dieci volte sia negli utenti che nei ricavi, indicando un’adozione accelerata.
Nel settore del cinema e dell’intrattenimento, Vidu viene utilizzato in animazione, produzione a breve termine e flussi di lavoro di caratteristiche, con coinvolgimento tra proprietari di contenuti, fornitori di strumenti e studi di produzione. In parallelo, piattaforme internet e aziende di hardware intelligente stanno applicando la tecnologia alla creazione di asset di marketing, contenuti interattivi e innovazione di prodotti.
La pubblicità e i giochi sono emersi come aree di trazione aggiuntive. Marchi e agenzie utilizzano Vidu per scalare la produzione di video per campagne, mentre gli sviluppatori di giochi lo utilizzano per contenuti pubblicitari e generazione di scene. A livello internazionale, la piattaforma sta guadagnando trazione tra gli sviluppatori di strumenti creativi e gli utenti aziendali, con applicazioni che si estendono all’istruzione, alla radiodiffusione e al turismo culturale.
Le più ampie implicazioni dell’AI multimodale
Il progresso dei modelli di base multimodali ha implicazioni che vanno ben oltre la creazione di video. Integrando testo, immagine, audio e movimento in sistemi unificati, questi modelli abilitano le macchine a interpretare il contesto in un modo che si avvicina più da vicino alla percezione umana. Per le industrie, ciò significa cicli di produzione più veloci, barriere di ingresso più basse per contenuti di alta qualità e nuove forme di interazione tra esseri umani e software.
Allo stesso tempo, la maturazione dell’AI multimodale solleva importanti questioni relative all’autenticità, alla proprietà intellettuale e al deploy responsabile. Man mano che il video generato diventa sempre più realistico, saranno essenziali salvaguardie tecniche e framework di governance per mantenere la fiducia nei media digitali.
Guardando avanti, i modelli multimodali sono probabilmente destinati a svolgere un ruolo non solo nei flussi di lavoro digitali ma anche nei sistemi del mondo reale, dalla robotica e dalla simulazione agli ambienti intelligenti. ShengShu Technology’s latest funding round positions it to participate in that transition, as multimodal AI shifts from a creative novelty into a foundational layer of next-generation productivity.












