نماذج ومنصات الذكاء الاصطناعي

هوليوود تنظر إلى كتفها مع دخول Veo 3 إلى الصورة

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

يعيد نموذج Veo 3 الذي كشفت عنه Google تعريف قدرات الفيديو المولد بالذكاء الاصطناعي. أُعلن عنه في Google I/O 2025، وينتج مقاطع واقعية إلى درجة يصعب معها على كثير من المشاهدين تمييزها من التصوير الحي.

قدم Veo 3 قدرات مثل توليد الصوت الأصلي والدقة البصرية السينمائية، ما يخفض بصورة كبيرة حاجز الدخول إلى إنتاج الفيديو بمستوى احترافي.

الخروج من «العصر الصامت» بصوت مدمج

لأول مرة يأتي مولد فيديو بالذكاء الاصطناعي مع مشهد صوتي خاص به. يولد Veo 3 المؤثرات والضوضاء المحيطة وحتى حوار الشخصيات متزامناً مع الحدث. وصف ديميس هاسابيس، الرئيس التنفيذي لـGoogle DeepMind، ذلك بالخروج من العصر الصامت لتوليد الفيديو، إذ يستطيع المبدع تحديد شكل المشهد وصوته معاً.

يحلل النموذج إطاراته المولدة ويزامن معها الصوت المناسب، فتقع الخطوات وتصر الأبواب وتتحدث الشخصيات في اللحظة الصحيحة. كانت النماذج السابقة تنتج لقطات صامتة تتطلب إضافة الصوت يدوياً، بينما ينشئ Veo 3 مقطعاً كاملاً ويتولى دور المصور ومصمم الصوت معاً.

يزيد الصوت الواقعي الانغماس والفائدة. يمكن إعطاء النموذج نصاً أو تركه يبتكر الحوار، فيولد أصواتاً متطابقة مع الصور وحركة شفاه متزامنة. كما ينتج أصوات الخلفية والموسيقى، من زقزقة الطيور إلى موسيقى أوركسترالية في لحظة الذروة.

تقول Google إن التدريب جمع هذه العناصر بسلاسة اعتماداً على أبحاث تحويل الفيديو إلى صوت. يمكن لمبدع منفرد كتابة «عاصفة رعدية في البحر وبحار يصرخ بالأوامر» والحصول في محاولة واحدة على أمواج ورياح وصوت واضح فوق العاصفة، من دون خبرة في تحرير الصوت.

جودة سينمائية وواقعية مقلقة

يقترب Veo 3 من جودة هوليوود أكثر من أي وقت مضى. يخرج فيديو أكثر حدة وتفصيلاً، حتى دقة 4K، ويفهم الفيزياء والإضاءة في العالم الحقيقي بصورة قوية. تبدو الأمثلة المبكرة طبيعية إلى درجة أن كثيراً منها يفتقر إلى العلامات المعتادة للمحتوى الاصطناعي.

الحركة سلسة ومتسقة بين الإطارات، مع عدد أقل من الاهتزازات والتحولات المفاجئة في الشخصيات. عندما تنعطف سيارة بسرعة تتصرف سحب الغبار والظلال بصورة طبيعية، وعندما يركض شخص تحترم الحركة الزخم والجاذبية. حتى اليدين ونسب الجسم وحركات الوجه المتزامنة مع الكلام أصبحت أكثر إقناعاً.

نتجت التحسينات من بيانات تدريب أكبر وتحسينات في النموذج تساعده على تحويل الأوامر المعقدة إلى فيديو مصقول. ويمنح التركيز على الإخراج السينمائي جودة فنية كانت تحتاج سابقاً إلى استوديو، بما في ذلك الخامات والإضاءة وعمق المجال.

مثال مبكر على فيديو مولد بواسطة Veo 3. المصدر: PJ Ace عبر X.
مثال مبكر على فيديو مولد بواسطة Veo 3. المصدر: PJ Ace عبر X.

أوامر دقيقة وتحكم إبداعي سهل

من أبرز نقاط قوة Veo 3 التزامه برؤية المخرج كما ترد في الأمر. يستطيع تفسير أوامر متعددة الأسطر وقصة قصيرة أو لوحة مشاهد، وتتبع تسلسل الأفعال وتغييرات المشاهد بالتوقيت والتفاصيل الصحيحة.

يمكن للمبدع وصف مفهوم كامل: «المشهد الأول: يدخل البطل غرفة مظلمة… المشهد الثاني: انفجار مفاجئ يسبب الفوضى…»، ثم يولد النموذج مقطعاً ينفذ تلك المحطات بالترتيب. إنه يعمل كمشغل كاميرا ومصمم موقع ومحرر يفهم النص وتعليمات الشخصيات وزوايا التصوير.

إلى جانب النموذج قدمت Google تطبيق صناعة الأفلام Flow، الذي يتيح تحكماً افتراضياً بالكاميرا لتحديد الزوايا وحركات المسح السلسة، وأداة Scene Builder لتمديد المشهد مع استمرار الحركة وثبات الشخصيات.

يمكن إنشاء سوق خارجي ثم تمديد المقطع لكشف أجزاء جديدة أو الانتقال بسلاسة إلى مشهد تالٍ. كما يتيح Flow إضافة عناصر أو حذفها وتغيير نسبة العرض، مثل تحويل فيديو رأسي إلى شاشة عريضة، بينما يملأ النموذج الخلفية الجديدة.

تتم هذه العمليات بالأوامر والمنزلقات بدلاً من التحريك اليدوي. يكتب المستخدم الفكرة ويحصل على فيديو ثم يطلب تعديل الكاميرا أو استبدال عنصر. هذا التعاون يجعل اللقطات المعقدة في متناول من لا يملكون خبرة إنتاج أو طاقماً كاملاً.

إتاحة إنتاج الفيديو الاحترافي

يشير Veo 3 إلى عصر تصبح فيه قيم الإنتاج الهوليوودية متاحة لمجموعة أوسع من المبدعين والشركات. أتمتة التصوير والمؤثرات وتصميم الصوت تقلل الموارد المطلوبة لإنتاج فيديو مصقول.

يستطيع منشئ محتوى منفرد أو شركة ناشئة صغيرة صنع مادة تبدو كأن فريق استوديو أنتجها. وهذا يخفض تكلفة الإعلانات والمقاطع الدعائية. يمكن لفريق تسويق إعداد إعلان واقعي مدته ثلاثون ثانية من أمر نصي في اليوم نفسه بدلاً من استئجار ممثلين ومعدات.

عند الإطلاق كانت الميزات الأكثر تقدماً، ومنها الصوت، متاحة عبر اشتراك Google AI Ultra بسعر 249 دولاراً شهرياً وخدمة المؤسسات السحابية. قد يحد السعر من استخدام الهواة مؤقتاً، لكنه يظل جزءاً صغيراً من تكلفة التصوير الاحترافي وما بعد الإنتاج، ومن المرجح أن تصبح القدرات أيسر وأرخص بمرور الوقت.

المصادر والوسائط والروابط المرجعية

https://www.youtube.com/watch?v=mCFMn0UkRt0

https://www.youtube.com/watch?v=2CquRQiDzx8&t=1s

جبهة إبداعية جديدة ومسؤوليات جديدة

وصول Veo 3 مكسب للإبداع والكفاءة، لكنه يجبر الصناعة على مواجهة آثار مهمة. الحد بين الحقيقي والاصطناعي يزداد ضبابية، وقد امتلأ الإنترنت بمقاطع تدهش المشاهدين بواقعيتها وتثير قلقهم من صعوبة الفصل بين الواقع والذكاء الاصطناعي.

يواجه صناع الأفلام مستقبلاً ينتج فيه AI لقطات مقنعة عند الطلب، ما يطرح أسئلة عن الأصالة والملكية والحرفة البشرية. يخشى بعض الفنانين طوفان محتوى منخفض الجودة أو فقدان الوظائف، وهي مخاوف تشبه الاضطراب الذي أحدثه AI في التصوير والتصميم.

يرى المؤيدون أن Veo 3 تطور جديد في التكنولوجيا الإبداعية وأداة للإنسان لا بديلاً عنه. وضعت Google وسائل حماية، منها العلامة المائية غير المرئية SynthID على كل إطار للمساعدة في اكتشاف الفيديو المولد وتسميته. ورفض النموذج في الاختبارات أوامر لإنشاء تضليل سياسي بأسلوب التزييف العميق أو مشاهد ضارة.

يتبنى مبدعون متقدمون الأداة لتوسيع الخيال. تعاونت Google مع صناع أفلام أثناء التطوير كي يدعم النموذج سير العمل، فيتولى اللوجستيات المرهقة ويترك للبشر السرد والأسلوب والأفكار.

توليد الفيديو بالذكاء الاصطناعي باق ويتطور بسرعة. يخفض Veo 3 التكاليف والحواجز، لكنه يتحدى المبدعين لتمييز أعمالهم في عالم يستطيع فيه أي شخص إنتاج صور مذهلة. ستحتاج الصناعة إلى معايير جديدة للمحتوى المدعوم بالذكاء الاصطناعي.

تصف Google التقنية بأنها عامل تمكين يساعد موجة جديدة من صناع الأفلام على رواية قصصهم بسهولة، ويفتح الباب لأصوات وأفكار لم تكن لتصل إلى الشاشة. وسيكون الأكثر نجاحاً من يتعلم استخدام Veo 3 ضمن أدواته الفنية، مستفيداً من كفاءة الفيديو التوليدي مع توجيهه بإبداع ورؤية بشريين مميزين.

يقود أليكس عمليات الأخبار المدعومة بالذكاء الاصطناعي في Unite.AI، حيث يجمع بين الصحافة والبحث والأتمتة لدعم تغطية سريعة وقابلة للتوسع للذكاء الاصطناعي. يساعد عمله في ضمان ظهور التطورات الناشئة في مجال الذكاء الاصطناعي بشكل فعال مع الحفاظ على معايير التحرير في النشرة.