Pendanaan
ShengShu Technology Mengumpulkan Lebih dari $86 Juta dalam Pendanaan Seri A+ untuk Mendorong Batas Multimodal AI

ShengShu Technology telah menyelesaikan putaran pendanaan Seri A+ yang melebihi RMB 600 juta (sekitar $86 juta USD), menandai tonggak penting bagi perusahaan saat ini memperluas model dasar multimodal untuk aplikasi dunia digital dan fisik. Putaran ini dipimpin oleh Zhongguancun Science City dan LINK-X CAPITAL, dengan partisipasi strategis dari Wondershare, Visual China Group, dan TRS. Beberapa investor yang sudah ada juga meningkatkan komitmen mereka, menekankan kepercayaan terus-menerus pada arah teknis dan kemajuan komersial ShengShu.
Modal baru ini tiba pada saat sistem AI multimodal bergerak dari alat eksperimental menuju infrastruktur yang mendukung produksi dunia nyata. Trajectory ShengShu mencerminkan perubahan itu, dengan terobosan penelitian yang semakin diterjemahkan menjadi produk yang diterapkan di seluruh industri.
Dari Penelitian Awal ke Model Komersial
ShengShu Technology adalah salah satu tim pertama secara global yang fokus pada algoritma generatif multimodal sebagai arah penelitian inti. Pada 2022, perusahaan memperkenalkan arsitektur U-ViT, membantu membangun fondasi teknis untuk model yang mampu bernalar di seluruh teks, gambar, dan video. Pendekatan penelitian-terlebih-dahulu ini mempersiapkan peluncuran Vidu pada pertengahan 2024.
Vidu memasuki pasar dengan kemampuan Reference-to-Video yang melampaui generasi video teks-ke-video atau gambar-ke-video konvensional. Daripada mengobati setiap bingkai sebagai output yang terisolasi, sistem ini dirancang untuk mempertahankan konsistensi multi-entitas di seluruh adegan, menangani tantangan lama dalam generasi video komersial. Sejak peluncuran, ShengShu telah mengiterasi dengan cepat, merilis versi berikutnya yang meningkatkan pemahaman semantik, kestabilan gerakan, koherensi visual, dan kecepatan inferensi.
Rilis terbaru, Vidu Q3, mencerminkan fokus yang disengaja pada cerita. Model ini mendukung generasi audio-video yang disinkronkan hingga 16 detik, output asli 1080p, transisi shot yang presisi, rendering teks multibahasa, dan output multibahasa. Kemampuan ini memposisikan sistem lebih dekat dengan alur kerja produksi, bukan klip eksperimental pendek.
Kinerja, Kecepatan, dan Inovasi Terbuka
Di luar kualitas output, ShengShu telah menekankan efisiensi sebagai pembeda kompetitif. Pada akhir 2025, perusahaan membuka sumber TurboDiffusion framework, langkah yang secara signifikan mengurangi latensi generasi video. Dengan kerangka kerja ini, video lima detik dapat dibuat dalam waktu kurang dari dua detik pada satu GPU high-end, mewakili keuntungan beberapa kali lipat dibandingkan dengan pendekatan sebelumnya.
Fokus pada kecepatan ini tidak hanya merupakan benchmark teknis. Latensi dan persyaratan komputasi yang lebih rendah secara langsung mempengaruhi kelayakan penerapan model multimodal pada skala besar, terutama untuk aplikasi interaktif dan alat kreatif waktu nyata. Dengan mengurangi biaya dan waktu yang diperlukan untuk menghasilkan video berkualitas tinggi, ShengShu mendorong AI multimodal lebih dekat ke penggunaan sehari-hari di lingkungan profesional.
Mengembangkan Adopsi di Pasar Kreatif dan Perusahaan
ShengShu telah membangun ekosistem produk yang luas di sekitar Vidu, mencakup layanan yang dikelola, penawaran SaaS, aplikasi, dan alat berbasis agen. Produk ini sekarang melayani kreator, studio, dan perusahaan di lebih dari 200 negara dan wilayah. Pada 2025, perusahaan melaporkan pertumbuhan lebih dari sepuluh kali lipat dalam pengguna dan pendapatan, menunjukkan adopsi yang dipercepat.
Di film dan hiburan, Vidu digunakan di seluruh animasi, produksi bentuk pendek, dan alur kerja fitur, dengan keterlibatan di seluruh pemilik konten, penyedia alat, dan studio produksi. Secara paralel, perusahaan platform internet dan perangkat keras pintar menerapkan teknologi ini untuk pembuatan aset pemasaran, konten interaktif, dan inovasi produk.
Periklanan dan gaming telah muncul sebagai area traksi tambahan. Merek dan agen menggunakan Vidu untuk memperluas produksi video untuk kampanye, sementara pengembang game menerapkan teknologi ini untuk konten iklan dan generasi adegan. Secara internasional, platform ini mendapatkan traksi di kalangan pengembang alat kreatif dan pengguna perusahaan, dengan aplikasi yang meluas ke pendidikan, penyiaran, dan pariwisata budaya.
Implikasi yang Lebih Luas dari Multimodal AI
Kemajuan model dasar multimodal memiliki implikasi jauh melampaui penciptaan video. Dengan mengintegrasikan teks, gambar, audio, dan gerakan ke dalam sistem yang terpadu, model ini memungkinkan mesin untuk menafsirkan konteks dengan cara yang lebih mirip dengan persepsi manusia. Bagi industri, ini berarti siklus produksi yang lebih cepat, hambatan yang lebih rendah untuk memasuki konten berkualitas tinggi, dan bentuk interaksi baru antara manusia dan perangkat lunak.
Pada saat yang sama, pematangan AI multimodal mengangkat pertanyaan penting seputar autentisitas, hak cipta, dan penerapan yang bertanggung jawab. Ketika video yang dihasilkan menjadi semakin realistis, perlindungan teknis dan kerangka tata kelola akan menjadi penting untuk mempertahankan kepercayaan dalam media digital.
Mempandang ke depan, model multimodal kemungkinan akan memainkan peran tidak hanya dalam alur kerja digital tetapi juga dalam sistem dunia nyata, dari robotika dan simulasi hingga lingkungan pintar. ShengShu Technology’s putaran pendanaan terbaru memposisikan perusahaan untuk berpartisipasi dalam transisi tersebut, ketika AI multimodal bergeser dari novelti kreatif menjadi lapisan fondasi produktivitas generasi berikutnya.












