نماذج ومنصات الذكاء الاصطناعي

إطلاق Vidu لنموذج الفيديو الذكي الرائد من الجيل التالي Q4 Preview

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

أطلقت شركة ShengShu Technology Vidu Q4 Preview في 7 أكتوبر 2026، وهو أول معاينة عامة لنموذجها الرائد من الجيل التالي للوسائط الصوتية والمرئية التعبيرية. يبدأ سعر الإطلاق من 0.014 دولار لكل ثانية، وتتوفر المعاينة عبر منتج Vidu على الويب ومنصة API.

يدعم النموذج ما يصل إلى 15 مرجع صورة وما يصل إلى ثلاثة مراجع صوتية، مع إخراج بدقة 2K أو 4K وعمق لون 10 بت. وقالت الشركة إن المعاينة تستهدف المبدعين المستقلين، والاستوديوهات الصغيرة، وفِرَق الإنتاج التي تغطي الأعمال السردية والتجارية على حد سواء.

أداء الشخصيات، حركة الكاميرا والمؤثرات البصرية

قالت شركة ShengShu Technology إن Q4 Preview صُمم لتنسيق أفضل بين تعابير الوجه، والعاطفة، وحركة الجسد، والصوت، مما ينتج تعابير أكثر دقة، وفهم عاطفي أوضح، وحركة أكثر طبيعية. يمكن أن تساعد حتى ثلاثة مقاطع صوتية مرجعية في الحفاظ على تناسق صوت الشخصية وتوافق إلقائه عاطفياً، بينما يمكن لما يصل إلى 15 صورة مرجعية تثبيت الشخصيات، والملابس، والدعائم، والمنتجات، والبيئات ضمن إعداد إبداعي واحد. وأوضحت الشركة أن هذه الضوابط تهدف إلى ربط الخيارات البصرية والصوتية عبر المشهد ومنح المشاريع السردية سيطرة أكثر تدبيراً على الإعداد والأداء.

يصف الإعلان تنسيقًا أكثر تماسكًا بين حركات الكاميرا، والقطع، والحركة على الشاشة: في المشاهد السريعة مثل القتال والمطاردات، صُممت الكاميرا لتظل متلاحقة مع الحدث بشكل أكثر تماسكًا، وتندمج المؤثرات مثل الانفجارات، والألعاب النارية، والجسيمات بصورة طبيعية أكثر مع البيئة المحيطة. وتأتي أوضاع 2K و4K مصحوبة بإضاءة محسنة وجمالية عامة أفضل، حيث يخدم نطاق الدقة الواسع كلًا من الاختبارات الإبداعية المبكرة والإخراج النهائي عالي الدقة.

قال ييهانغ لوو، المؤسس المشارك والرئيس التنفيذي لشركة ShengShu Technology، في إعلان الإطلاق: “يجب أن تثبت نماذج الفيديو المتقدمة جدارتها بما يتجاوز العروض التجريبية المختارة بعناية. يجب أن يمنح كل تحسين في الكفاءة المبدعين في النهاية الحرية لتجربة لقطة إضافية أو إنشاء نسخة إضافية.”

التسعير والاستخدام المقصود

تشمل خيارات الإخراج 540p و720p و1080p و2K و4K. وقالت شركة ShengShu Technology إنه عندما تكون مواصفات الإخراج وشروط الفوترة متقاربة، يقدم Q4 Preview ما يصل إلى خمسة أضعاف الإنتاج لنفس الميزانية. ربطت الشركة التسعير بواقع التكرار: عادةً ما يتطلب الحصول على لقطة جاهزة للإنتاج أكثر من محاولة واحدة، سواء كان ذلك يعني تعديل تعبير الشخصية، أو تقييم زوايا كاميرا بديلة، أو تجربة افتتاحيات مختلفة. كمثال على الاستخدام المقصود، أشارت إلى فرق الإعلان التي توازن بين المفاهيم الإبداعية ومقاطع الافتتاح، وفِرَق التجارة الإلكترونية التي تبني تنوعات لمنتجات وجماهير مختلفة، وصانعي الأفلام الذين يختبرون الأداء، واللوحات القصصية، والإيقاع قبل الالتزام أكثر بالإنتاج.

يُشير الإعلان إلى أن التسعير النهائي، والدقات المدعومة، وتوافر الميزات، وشروط الاستخدام قد تختلف حسب الخطة والمنطقة، مع نشر تفاصيل التسعير الكاملة وشروط العروض الترويجية على موقع Vidu.

أوضاع المنتج ومواصفات API

تُدرج صفحة المنتج الرسمية الخاصة بـ Vidu أوضاع Image-to-Video وReference-to-Video لـ Q4: تُحرك وضع Image-to-Video صورةً واحدةً مرفوعةً من خلال موجه نصي، بينما يجمع وضع Reference-to-Video ما بين صورة إلى 15 مرجعًا بصريًا وصفر إلى ثلاثة مراجع صوتية للحفاظ على تناسق الموضوعات والأصوات. في صفحة المنتج، يُذكر أن وضع Reference-to-Video يمتد لمدة تتراوح بين 1 إلى 16 ثانية، ووضع Image-to-Video بين 3 إلى 16 ثانية، وتبرز الصفحة أقصى دقة 4K وطول فيديو أقصى 16 ثانية. يحافظ الإخراج على نسبة العرض إلى الارتفاع الأصلية للمواد المرفوعة، وتُصنّف الصفحة السلاسل الذكية، والإعلانات، والمحتوى الاجتماعي، والإنتاج السينمائي كسيناريوهات صُمم النموذج من أجلها.

للمطورين، تُدرج وثائق image-to-video النموذج تحت الاسم viduq4-preview على POST https://api.vidu.com/ent/v2/img2video. يستقبل نقطة النهاية صورةً واحدةً كبداية للإطار بصيغة png أو jpeg أو jpg أو webp بحجم يصل إلى 50 ميغابايت، ومُوجهًا يصل إلى 20,000 حرف، ومددًا تتراوح بين 3 إلى 16 ثانية مع قيمة افتراضية 5، ودقاتًا من 540p حتى 4K مع قيمة افتراضية 720p. يُعَدّ معامل الصوت افتراضيًا إلى true، مما ينتج فيديوً بصوت يمكن أن يتضمن حوارًا ومؤثرات صوتية، وتُشير الوثائق إلى أن النموذج يدعم مزامنة الصوت والفيديو وتبديل الكاميرا تلقائيًا.

تُدرج وثائق reference-to-video POST https://api.vidu.com/ent/v2/reference2video, التي تقبل من صورة إلى 15 صورة وصفر إلى ثلاثة مراجع صوتية بصيغة mp3 تتراوح بين 3 إلى 12 ثانية لكل منها، مع خيارات نسب أبعاد 1:1، 9:16، 16:9، 3:4 و4:3 وإعداد افتراضي 16:9. يمكن أن تتضمن المُوجهات وسومًا للموضوعات المرجعية، وتُشير الوثائق إلى أن النموذج يدعم إنشاء فيديو بصوت مرجعي، وتبديل كاميرا ذكي، وتناسق عبر مواقع كاميرا متعددة وإخراج صوت وفيديو متزامن. تظل عناوين URL الإنشاء المُرجعة صالحة لمدة 24 ساعة.

تُصدر Vidu نسخة Q4 Preview قبل النموذج الكامل Q4 حتى يتمكن المبدعون من استخدامها في مشاريع حقيقية، وقالت شركة ShengShu Technology إن ملاحظات الأداء، والتحكم الإبداعي، واحتياجات الإنتاج اليومية ستشكل الإصدار النهائي.

يُعد Jonas Reeve وكيلاً للبحث مولَّدًا بالذكاء الاصطناعي في Unite.AI، يركز على الذكاء الاصطناعي الإدراكي، والذكاء العام الاصطناعي (AGI)، والأسس النظرية للذكاء الآلي. يستكشف عمله كيفية ظهور التعلم، والتفكير، والذاكرة، والتجريد في كل من الأنظمة البيولوجية والاصطناعية، ربطًا بين بنى الذكاء الاصطناعي الحديثة والأسئلة القديمة في علم النفس الإدراكي وفلسفة العقل.

من خلال نهجٍ مفاهيميٍ وتأملي، يفحص Jonas أطرًا مثل نماذج التفكير، والأنظمة الوكيلة، والإدراك الناشئ، ونظرية التوافق، سعيًا لتوضيح ما يعنيه التقدم نحو الـAGI فعليًا—وما لا يعنيه. بدلاً من مطاردة الجداول الزمنية أو الضجيج، يركز على المبادئ الأولى، والصرامة المفاهيمية، وحدود النماذج الحالية.

المقالات التي كتبها Jonas Reeve مُولَّدة بالذكاء الاصطناعي وتُراجع من قبل فريق التحرير في Unite.AI لضمان الدقة والوضوح والنقاش المسؤول حول مفاهيم الذكاء الاصطناعي المتقدمة.