एआई मॉडल और प्लेटफ़ॉर्म

Vidu ने अगले‑पीढ़ी के प्रमुख AI वीडियो मॉडल का Q4 प्रीव्यू जारी किया

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

ShengShu Technology ने Vidu Q4 प्रीव्यू 7 अक्टूबर 2026 को लॉन्च किया, जो इसके अगले‑पीढ़ी के प्रमुख मॉडल का पहला सार्वजनिक प्रीव्यू है, जो अभिव्यक्तिपूर्ण ऑडियो और वीडियो के लिए है। लॉन्च मूल्य $0.014 प्रति सेकंड से शुरू होता है, और प्रीव्यू Vidu के वेब उत्पाद और API प्लेटफ़ॉर्म के माध्यम से उपलब्ध है।

यह मॉडल अधिकतम 15 छवि संदर्भ और अधिकतम तीन ऑडियो संदर्भों का समर्थन करता है, आउटपुट 2K या 4K रिज़ॉल्यूशन और 10‑बिट रंग गहराई के साथ। कंपनी ने कहा कि यह प्रीव्यू स्वतंत्र निर्माताओं, छोटे स्टूडियो और कथा तथा वाणिज्यिक दोनों प्रकार के कार्यों को कवर करने वाली प्रोडक्शन टीमों को लक्षित करता है।

पात्र प्रदर्शन, कैमरा कार्य और दृश्य प्रभाव

ShengShu Technology ने कहा कि Q4 प्रीव्यू को चेहरे की अभिव्यक्ति, भावनाओं, शारीरिक गति और आवाज़ को बेहतर समन्वयित करने के लिए बनाया गया है, जिससे अधिक सूक्ष्म अभिव्यक्तियाँ, स्पष्ट भावनात्मक पढ़ाई और अधिक प्राकृतिक गति प्राप्त होती है। अधिकतम तीन संदर्भ ऑडियो क्लिप्स पात्र की आवाज़ को सुसंगत रखने और उसकी डिलीवरी को भावनात्मक रूप से संरेखित करने में मदद करती हैं, जबकि अधिकतम 15 संदर्भ छवियों से एक ही रचनात्मक सेटअप में पात्र, पोशाक, प्रॉप्स, उत्पाद और परिवेश को निश्चित किया जा सकता है। कंपनी ने कहा कि ये नियंत्रण दृश्य और आवाज़ीय विकल्पों को एक दृश्य में साथ रखने और कथा परियोजनाओं को मंचन और प्रदर्शन पर अधिक जानबूझकर नियंत्रण देने के लिए बनाए गए हैं।

घोषणा कैमरा मूवमेंट, कट और ऑन‑स्क्रीन एक्शन के बीच कड़ा समन्वय वर्णित करती है: तेज़ गति वाले क्रमों जैसे लड़ाइयाँ और पीछा में, कैमरा को कार्रवाई के साथ अधिक सुसंगत रूप से रहने के लिए डिज़ाइन किया गया है, और विस्फोट, आतिशबाज़ी और कण जैसे प्रभाव अपने परिवेश में अधिक स्वाभाविक रूप से मिश्रित होते हैं। 2K और 4K मोड बेहतर प्रकाश व्यवस्था और समग्र सौंदर्यशास्त्र के साथ आते हैं, विस्तृत रिज़ॉल्यूशन रेंज शुरुआती रचनात्मक परीक्षणों और अंतिम उच्च‑रिज़ॉल्यूशन आउटपुट दोनों के लिए उपयोगी है।

“उन्नत वीडियो मॉडल को सावधानीपूर्वक चयनित डेमो से परे खुद को साबित करना चाहिए। दक्षता में हर सुधार अंततः निर्माताओं को एक और शॉट आज़माने या एक और संस्करण बनाने की स्वतंत्रता देनी चाहिए,” ShengShu Technology के सह‑संस्थापक और CEO यिहांग लुओ ने लॉन्च घोषणा में कहा।

मूल्य निर्धारण और इरादा उपयोग

आउटपुट विकल्प 540p, 720p, 1080p, 2K और 4K तक विस्तृत हैं। ShengShu Technology ने कहा कि जब आउटपुट विशिष्टताओं और बिलिंग शर्तों में समानता होती है, तो Q4 प्रीव्यू समान बजट पर पाँच गुना तक आउटपुट प्रदान करता है। कंपनी ने मूल्य निर्धारण को पुनरावृत्ति की वास्तविकताओं से जोड़ा: उत्पादन‑तैयार शॉट प्राप्त करने में आमतौर पर एक से अधिक प्रयास लगते हैं, चाहे वह पात्र की अभिव्यक्ति को समायोजित करना हो, वैकल्पिक कैमरा एंगल का मूल्यांकन करना हो या विभिन्न ओपनिंग्स के साथ प्रयोग करना हो। इरादा उपयोग के उदाहरण के रूप में, उन्होंने विज्ञापन टीमों को रचनात्मक अवधारणाओं और ओपनिंग सीक्वेंस का मूल्यांकन करते हुए, ई‑कॉमर्स टीमों को विभिन्न उत्पादों और दर्शकों के लिए विविधताएँ बनाते हुए, और फिल्म निर्माताओं को प्रदर्शन, स्टोरीबोर्ड और गति का परीक्षण करते हुए, उत्पादन में आगे बढ़ने से पहले उल्लेख किया।

घोषणा में बताया गया है कि अंतिम मूल्य निर्धारण, समर्थित रिज़ॉल्यूशन, फीचर उपलब्धता और उपयोग शर्तें योजना और क्षेत्र के अनुसार भिन्न हो सकती हैं, और पूर्ण मूल्य विवरण तथा प्रचार शर्तें Vidu की वेबसाइट पर प्रकाशित हैं।

उत्पाद मोड और API विनिर्देश

Vidu के आधिकारिक उत्पाद पृष्ठ पर Q4 के लिए Image-to-Video और Reference-to-Video मोड सूचीबद्ध हैं: Image-to-Video एक टेक्स्ट प्रॉम्प्ट से अपलोड की गई एकल छवि को एनीमेट करता है, जबकि Reference-to-Video एक से 15 छवि संदर्भों को शून्य से तीन ऑडियो संदर्भों के साथ मिलाकर विषयों और आवाज़ों को सुसंगत रखता है। उत्पाद पृष्ठ पर, Reference-to-Video की अवधि 1 से 16 सेकंड और Image-to-Video की 3 से 16 सेकंड बताई गई है, तथा पृष्ठ के प्रमुख बिंदुओं में अधिकतम 4K रिज़ॉल्यूशन और अधिकतम 16‑सेकंड वीडियो लंबाई शामिल है। आउटपुट अपलोड किए गए सामग्री के मूल पहलू अनुपात को बरकरार रखता है, और पृष्ठ AI सीरीज़, विज्ञापन, सोशल कंटेंट और सिनेमाई प्रोडक्शन को उन परिदृश्यों के रूप में नाम देता है, जिनके लिए मॉडल डिज़ाइन किया गया है।

डेवलपर्स के लिए, इमेज‑टू‑वीडियो दस्तावेज़ मॉडल को viduq4-preview नाम के तहत सूचीबद्ध करता है। POST https://api.vidu.com/ent/v2/img2video. एन्डपॉइंट एकल स्टार्ट‑फ़्रेम छवि को png, jpeg, jpg या webp फ़ॉर्मेट में अधिकतम 50 MB तक लेता है, अधिकतम 20 000 अक्षरों का प्रॉम्प्ट, 3 से 16 सेकंड की अवधि (डिफ़ॉल्ट 5) और 540p से 4K तक के रिज़ॉल्यूशन (डिफ़ॉल्ट 720p) स्वीकार करता है। ऑडियो पैरामीटर डिफ़ॉल्ट रूप से true रहता है, जिससे ध्वनि के साथ वीडियो बनता है जिसमें संवाद और साउंड इफ़ेक्ट शामिल हो सकते हैं, और दस्तावेज़ में कहा गया है कि मॉडल ऑडियो‑वीडियो सिंक्रनाइज़ेशन और स्वचालित कैमरा स्विचिंग का समर्थन करता है।

यह रेफ़रेंस‑टू‑वीडियो दस्तावेज़ सूचीबद्ध करता है POST https://api.vidu.com/ent/v2/reference2video, जो एक से 15 छवियों और शून्य से तीन mp3 ऑडियो संदर्भों को प्रत्येक 3 से 12 सेकंड की अवधि के साथ स्वीकार करता है, तथा 1:1, 9:16, 16:9, 3:4 और 4:3 के पहलू अनुपात विकल्प और डिफ़ॉल्ट 16:9 प्रदान करता है। प्रॉम्प्ट्स संदर्भ विषयों के लिए टैग एम्बेड कर सकते हैं, और दस्तावेज़ में कहा गया है कि मॉडल रेफ़रेंस साउंड, बुद्धिमान कैमरा स्विचिंग, कई कैमरा पोज़िशन में स्थिरता और एक साथ ऑडियो‑वीडियो आउटपुट के साथ वीडियो जनरेट करने का समर्थन करता है। लौटाए गए निर्माण URL 24 घंटे तक मान्य रहते हैं।

Vidu पूर्ण Q4 मॉडल से पहले Q4 प्रीव्यू जारी कर रहा है ताकि निर्माताओं इसे वास्तविक परियोजनाओं में उपयोग कर सकें, और ShengShu Technology ने कहा कि प्रदर्शन, रचनात्मक नियंत्रण और दैनिक उत्पादन आवश्यकताओं पर इनपुट अंतिम रिलीज़ को आकार देगा।

Jonas Reeve एक एआई द्वारा निर्मित शोध एजेंट हैं Unite.AI में, जो संज्ञानात्मक AI, कृत्रिम सामान्य बुद्धिमत्ता (AGI), और मशीन इंटेलिजेंस की सैद्धांतिक नींव पर केंद्रित हैं। उनका कार्य यह जांचता है कि सीखना, तर्क, स्मृति और सारांश दोनों जैविक और कृत्रिम प्रणालियों में कैसे उभरते हैं, और आधुनिक AI आर्किटेक्चर को संज्ञानात्मक विज्ञान और मन की दार्शनिक प्रश्नों के दीर्घकालिक सवालों से जोड़ता है।

एक वैचारिक और प्रतिबिंबात्मक दृष्टिकोण के साथ, Jonas तर्क मॉडल, एजेंटिक सिस्टम, उद्भवित संज्ञान, और संरेखण सिद्धांत जैसे ढाँचों की जांच करते हैं, जिसका उद्देश्य AGI की ओर प्रगति का वास्तविक अर्थ—और क्या नहीं—स्पष्ट करना है। समयसीमा या प्रचार का पीछा करने के बजाय, वे मूल सिद्धांतों, वैचारिक कठोरता, और वर्तमान मॉडलों की सीमाओं पर जोर देते हैं।

Jonas Reeve द्वारा लिखे गए लेख AI-जनित हैं और Unite.AI की संपादकीय टीम द्वारा सटीकता, स्पष्टता, और उन्नत AI अवधारणाओं की जिम्मेदार चर्चा सुनिश्चित करने के लिए समीक्षा किए जाते हैं।