مولدات الفيديو

مراجعة Synthesia: الأفاتار الذكاء الاصطناعي واقعية لدرجة أنني ارتعبت

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
إفصاح:

قد تتلقى Unite.AI تعويضًا عند استخدام روابط لمنتجات نراجعها. لا يؤثر ذلك في تقييماتنا التحريرية. اقرأ إفصاح الشراكات التسويقية.

A woman generating an AI avatar clone that looks just like her.

إذا اضطررت يومًا لإنتاج فيديو تدريبي، فأنت تعلم أن الجزء المزعج ليس كتابة النص. بل هو العثور على شخص لتقديمه، إعداد الكاميرا، تسجيل عدة مشاهد، ثم إعادة كل ذلك عندما يحدث تغيير.

هذه هي المشكلة التي صُممت مولدات الفيديو بالذكاء الاصطناعي مثل Synthesia لحلها. يتيح لك تحويل النص إلى فيديو يقدمه مقدم دون الحاجة إلى كاميرا أو مقدم حقيقي، ثم تحديثه بتغيير النص بدلاً من إعادة التصوير. تقول Synthesia إن أكثر من 90٪ من شركات Fortune 100 تستخدم المنصة، مما يمنحك فكرة واضحة عن الجمهور المستهدف: الشركات التي تحتاج إلى إنشاء الكثير من الفيديوهات التدريبية والداخلية.

لكن ما مدى واقعية هؤلاء المقدمين الذكاء الاصطناعي عندما تستخدمهم فعليًا؟ أجريت على Synthesia خمس اختبارات، بما في ذلك إنشاء فيديو تدريبي من ملف PDF، إنشاء أفاتار لنفسي، دبلجة فيديو إلى الإسبانية، وجعل أفاتار يوضح نصيحة سلامة في المستودع. كانت النتائج مثيرة للإعجاب في بعض الجوانب، لكنني وجدت أيضًا بعض الأمور التي أرغب في إصلاحها قبل النشر.

في هذه المراجعة لـ Synthesia، سأوضح لك كيف عمل، وأين أبدى أداءً مميزًا، وأين أعتقد أنه لا يزال قصيرًا. سأنهي المقال بمقارنته مع أفضل ثلاثة بدائل لدي: HeyGen، AI Studios، وColossyan. في النهاية، ستعرف أي أداة هي الأنسب لك!

النتيجة

Synthesia هي منصة فيديو بالذكاء الاصطناعي تم بناؤها أساسًا للتدريب والاتصالات الداخلية. أكبر نقاط قوتها هي إنشاء الفيديو بسرعة، الأفاتار الواقعية، الدبلجة القوية والتعريب، وسهولة التحديثات. أظهرت اختباراتي أيضًا أن استنساخ الصوت والأفاتار القابلة للتخصيص يمكن أن تكون مقنعة للغاية. ومع ذلك، الخطة المجانية محدودة، ولا تزال الفيديوهات تحتاج إلى مراجعة بشرية لأشياء مثل المشاهد المساعدة (b‑roll)، تنسيق النص، ومقاطع الحركة. أيضًا، الأفاتار الشخصية لا تلتقط الشخص الحقيقي بدقة تامة.

الإيجابيات والسلبيات

  • تحويل النص أو الموجه بسرعة إلى فيديو كامل، احترافي وعالي الجودة دون ممثلين أو مجموعة أو كاميرا.
  • اختر من بين أكثر من 240 أفاتارًا وأكثر من 1,000 صوتًا بأكثر من 160 لغة.
  • أفاتار Express-2 تستخدم إيماءات اليد والجسم بدلاً من مجرد التحدث إلى الكاميرا.
  • إنشاء أزياء، إعدادات، ومقاطع حركة مختلفة لنفس الأفاتار.
  • دبلجة الفيديوهات إلى أكثر من 140 لغة مع مزامنة شفاه واستنساخ الصوت.
  • تغيير النص بدلاً من إعادة تصوير الفيديو بالكامل عند إجراء تحديثات.
  • إضافة اختبارات تفاعلية، أزرار قابلة للنقر، ومسارات مختلفة داخل الفيديو.
  • تصدير الفيديوهات كملفات SCORM لمنصات التعلم لتسهيل التدريب.
  • إنشاء أفاتار شخصي يتطلب تسجيل موافقة مباشر لمنع الآخرين من إنشاء أفاتار لك دون إذنك.
  • يتوافق مع معايير الأمان والخصوصية الرئيسية، بما في ذلك SOC 2 Type II، ISO 42001، وGDPR.
  • خطة مجانية لتجربة Synthesia دون بطاقة ائتمان قبل الدفع.
  • في اختباراتي، كان استنساخ الصوت قريبًا بشكل مدهش من صوتي الحقيقي.
  • الأفاتار القابل للتخصيص في اختبار التدريب على السلامة بدا متسقًا وواقعيًا، حتى أثناء أداء حركة.
  • تشتمل خطة Starter على 10 دقائق من الفيديو شهريًا، بينما تشمل خطة Creator 30 دقيقة.
  • خطة Creator أغلى بكثير من Starter، وهي الخطة التي يبدأ فيها الفروع والوصول إلى API.
  • تحصل فقط على تسعة أفاتار في الخطة المجانية، لذا لا يمكنك تجربة مكتبة الأفاتار بالكامل مجانًا.
  • يجب الترقية لتتمكن من تنزيل الفيديوهات.
  • وجدت اختباراتي مشكلات في المشاهد المساعدة (b‑roll) التي يولدها الذكاء الاصطناعي، تنسيق النص، طول الفيديو، ومقاطع الحركة، لذا لا يزال بعض الفيديوهات يحتاج إلى تنقية.
  • كان الأفاتار الشخصي يبدو واقعيًا، لكنه لم يلتقط وجهي أو سلوكي بدقة كافية لتقليدي.

ما هو Synthesia؟

 

Synthesia هي منصة فيديو بالذكاء الاصطناعي تحول النص إلى فيديوهات تُقدَّم بواسطة أفاتار الذكاء الاصطناعي واقعية.

تأسست في لندن عام 2017 على يد Victor Riparbelli، Steffen Tjerrild، وباحثي الذكاء الاصطناعي Lourdes Agapito وMatthias Niessner. في يناير 2026، جمعت 200 مليون دولار في جولة Series E بقيمة تقييم 4 مليارات دولار، بقيادة GV (Google Ventures). تقول Synthesia إن أكثر من 90٪ من شركات Fortune 100 تستخدمها ولديها أكثر من مليون مستخدم.

تُظهر لك تلك الأرقام من هو الجمهور المستهدف فعليًا لـ Synthesia. ليست أداة إبداعية لصنع مقاطع سينمائية. إنها أداة إنتاج للشركات التي تحتاج إلى الكثير من فيديوهات الشرح المرمّزة، خاصةً للتدريب.

كيف يعمل Synthesia

في الواقع، يبدأ فيديو Synthesia بنص. يمكنك كتابة النص بنفسك، أو يمكنك وصف ما تريد والسماح للمساعد الذكي بصياغة النص وتنسيق المشاهد باستخدام مجموعة علامتك التجارية. كل مشهد يحصل على أفاتار، وتخطيط، ونص على الشاشة، ووسائط، ويقرأ الأفاتار جزءه من النص.

عند التصدير، يولد Synthesia صوت الأفاتار، وحركات الشفاه، والإيماءات. يمكنك بعد ذلك تصدير النتائج كملف MP4، أو تضمين، أو حزمة SCORM لمنصة التعلم الخاصة بك. عندما يتغير تفصيل لاحقًا، تقوم بتحرير النص وإعادة التصدير بدلاً من حجز مقدم جديد.

الأفاتارات تجاوزت مجرد رؤوس تتحدث

أكبر تغيير هو الأفاتارات نفسها. مع إصدار Synthesia 3.0 في أكتوبر 2025، قدمت Synthesia نموذج Express-2، الذي يمنح الأفاتارات إيماءات كاملة للجسم بدلاً من مجرد وجه متحرك.

بعد شهر، أضافت أفاتارات قابلة للتخصيص حيث تصف زيًا (“سترة عالية الوضوح”, “ملابس مستشفى”) وإعدادًا، ثم تطلب مقطع حركة قصير يُعرض مباشرة بعد نطق السطر. في يوليو 2026، أعلنت Synthesia عن Express-3، والتي تسميها أكثر نموذج واقعي حتى الآن، إلى جانب الدبلجة 2.0.

يمكنك أيضًا إنشاء أفاتار لنفسك. حمّل صورة عالية الجودة أو فيديو قصير، واختياريًا استنسخ صوتك، وسجّل بيان موافقة مباشر على الكاميرا. لا يمكن تخطي خطوة الموافقة هذه أو تحميلها من مصدر آخر، وهو إجراء أمان مهم لأداة يمكنها وضع كلمات في فم شخص ما.

من الفيديوهات إلى المحادثات

تتحول Synthesia أيضًا من الفيديوهات أحادية الاتجاه إلى الفيديوهات التفاعلية. يمكن أن تشمل الفيديوهات نداءات إجراءات قابلة للنقر، ومسارات متفرعة، واختبارات. جلسات تمثيل الأدوار (أُطلقت في يوليو 2026) تسمح للموظفين بممارسة محادثات حقيقية مع أفاتار، و واجهة برمجة تطبيقات الأفاتار التفاعلية تمكّن الشركات من دمج أفاتارات متزامنة مع حركة الشفاه في منتجاتها الخاصة.

ما فاجأني أكثر هو مدى جودة الفيديوهات الأساسية للأفاتار بالفعل. كانت الأفاتارات، واستنساخ الأصوات، ومزامنة الشفاه مقنعة بما يكفي للاستخدام في فيديوهات تدريبية حقيقية، لكن التفاصيل المحيطة لا تزال تحتاج إلى مراجعة بشرية.

كان لدى اللقطات الإضافية التي يولدها الذكاء الاصطناعي، وتنسيقات النص، والمدة، ومقاطع الحركة القصيرة مشاكل في اختباراتي، لذا يمكن لـ Synthesia أن يقدّم لك معظم ما تحتاجه. ومع ذلك، لا أنصح بنشر فيديو دون مشاهدته بالكامل أولاً.

من هو الأنسب لاستخدام Synthesia؟

إليك الفئات التي تناسبها Synthesia أكثر:

  • يمكن لفرق التدريب تحويل السياسات والإجراءات القياسية إلى دروس فيديو قصيرة، وإضافة اختبارات، ومشاركتها عبر نظام التعلم الخاص بهم، وتحديث الدروس بتغيير النص بدلاً من إعادة التصوير.
  • يمكن لفرق الموارد البشرية والاندماج إنشاء فيديوهات ترحيبية وأدلة للمزايا، ثم تحديثها كل عام دون الحاجة لحجز مقدم وإعادة التصوير.
  • يمكن للشركات ذات الفرق الدولية إنشاء فيديو مرة واحدة وتدقيقه إلى أكثر من 140 لغة بدلاً من توظيف موهوب صوتي لكل سوق. إنها أداة ترجمة فيديو بالذكاء الاصطناعي عملية للفرق التي تصنع فيديوهات بالفعل في Synthesia.
  • يمكن لفرق المنتجات إنشاء عروض للميزات وتحديثات المنتجات باستخدام نفس المقدم، مع استخدام أفاتارات قابلة للتخصيص لإظهار المنتج قيد الاستخدام.
  • يمكن لفرق دعم العملاء إنشاء فيديوهات إرشادية قصيرة تجيب على الأسئلة الشائعة، وهو ما يعمل بشكل جيد إلى جانب أدوات دعم العملاء بالذكاء الاصطناعي.
  • يمكن لفرق المبيعات ممارسة التعامل مع الاعتراضات باستخدام جلسات تمثيل الأدوار.
  • منشئو الدورات الذين لا يرغبون في الظهور أمام الكاميرا يمكنهم تقديم الدروس بأفاتار مخزون أو بأفاتار شخصي خاص بهم.
  • يمكن للقطاعات المنظمة (المالية، الرعاية الصحية، الصيدلة) الاستفادة من امتثال Synthesia لـ SOC 2 Type II، ISO 42001، وGDPR، بالإضافة إلى إنشاء الأفاتارات بناءً على الموافقة، مما يسهل اجتياز مراجعات الأمان مقارنةً بمعظم المنافسين.
  • يمكن للقطاعات المنظمة مثل المالية والرعاية الصحية والصيدلة الاستفادة من شهادات الأمان والخصوصية الخاصة بـ Synthesia، إلى جانب الأفاتارات القائمة على الموافقة، لتسهيل مراجعات الأمان.

الميزات الرئيسية لـ Synthesia

إليك الميزات الرئيسية التي لفتت انتباهي:

  • المساعد الذكي: يحول طلبًا أو مستندًا أو فكرة إلى مسودة فيديو نصية مشهدًا بعد مشهد تتبع مجموعة علامتك التجارية.
  • أفاتارات مخزنة: أكثر من 240 مقدمًا في النسخة Enterprise (أكثر من 180 في Creator، أكثر من 125 في Starter)، مع إيماءات وتعبيرات واقعية.
  • أفاتارات Express-2 وExpress-3: أحدث نماذج الأفاتار في Synthesia. يضيف Express-2 حركة جسم كاملة وإيماءات يد، ويقدم Express-3 صورًا أكثر وضوحًا ومزامنة شفاه أكثر دقة.
  • أفاتارات قابلة للتخصيص: اطلب زي الأفاتار، الإعداد، ومقاطع الحركة (B-roll) في نفس المحرر مع مقاطع الحديث (A-roll). من هناك، احفظها في مكتبتك لفريقك.
  • منشئ الأفاتار: ينشئ أفاتارًا واقعيًا أو مُصممًا من طلب نصي.
  • أفاتارات شخصية: نسخة رقمية منك، تُصنع من صورة أو فيديو قصير، مع استنساخ صوت اختياري وموافقة حية إلزامية.
  • الأصوات واستنساخ الصوت: أكثر من 1,000 صوت ذكاء اصطناعي عبر أكثر من 160 لغة. ينسخ Express-Voice صوتك مع الحفاظ على لهجتك وأسلوبك في الكلام.
  • التمثيل الصوتي بالذكاء الاصطناعي: حمّل ملف MP4 أو MOV أو WebM (أو الصق رابط يوتيوب) واحصل عليه بأكثر من 140 لغة مع مزامنة الشفاه. يكتشف المتحدثين المتعددين وينسخ كل صوت على حدة.
  • الترجمة بنقرة واحدة: يترجم الفيديوهات التي تُصنع في Synthesia إلى أكثر من 160 لغة.
  • التفاعلية: أزرار دعوة إلى اتخاذ إجراء (CTAs) قابلة للنقر ومسارات متفرعة متاحة على خطة Creator وما فوق، واختبارات خاصة على خطة Enterprise.
  • جلسات تمثيل الأدوار: تدرب على المحادثات مع صورة رمزية واحصل على ملاحظات. تشمل الخطط الذاتية 10 جلسات شهريًا، و25 جلسة شهريًا على خطة Enterprise.
  • مجموعات العلامة التجارية والقوالب: أكثر من 60 قالبًا بالإضافة إلى إمكانية إضافة خطوط العلامة التجارية، الألوان، والشعارات الخاصة بك للحفاظ على تناسق الفيديوهات.
  • التعاون المباشر & التحكم في الإصدارات: تحرير مشترك في الوقت الفعلي (حصريًا على Enterprise) وتحديث بنقرة واحدة للفيديوهات المنشورة.
  • التصدير والتحليلات: MP4 بدقة Full HD، تضمينات، وتصدير SCORM، بالإضافة إلى تحليلات المشاهدات، الانقطاعات، ومعدلات الإكمال.
  • API & واجهة برمجة التطبيقات للصورة الرمزية التفاعلية: إنشاء فيديوهات برمجية من خطة Creator فما فوق، وصور رمزية قابلة للتضمين في الوقت الفعلي للمؤسسات.
  • API & الصور الرمزية التفاعلية: إنشاء فيديوهات باستخدام API على خطط Creator وإضافة صور رمزية مباشرة إلى التطبيقات.

اختبار عملي: ما الذي أنتجه Synthesia فعليًا

إليك الاختبارات التي أجريتها مع Synthesia. لكل اختبار ركزت على الفيديو النهائي: مدى طبيعته في المظهر والصوت، دقته، وكمية التعديل التي يحتاجها قبل النشر.

الاختبار 1: فيديو ترحيبي للموظفين الجدد

في الاختبار الأول، استخدمت المساعد الذكي لإنشاء فيديو تعريف للموظفين الجدد من خلال طلب واحد:

“أنشئ فيديو ترحيبي مدته 90 ثانية للموظفين الجدد في شركة برمجيات متوسطة الحجم. غطِّ قيمنا الثلاث الأساسية، أين يمكن العثور على دليل الموظف، ومن يجب التواصل معه في الأسبوع الأول. نبرة ودية ولكن مهنية.”

اخترت خيار الطول “قصير” وسمحت للمساعد بإنشاء الفيديو.

استغرق الفيديو 9 دقائق للتوليد وظهر بطول 56 ثانية بدلًا من الـ 90 ثانية التي طلبتها في الطلب. أظن أن إعداد الطول “قصير” أخذ الأولوية على الطول المذكور في الطلب، لذا إذا كنت بحاجة إلى مدة محددة، اختر خيار الطول الذي يتطابق معها.

رأيي

كان النص هو الجزء الأفضل. كان مقنعًا، غطى ما طلبته، وأتقن النبرة الودية والمهنية التي حددتها في الطلب.

بدت إيماءات وتعابير الوجه للصورة الرمزية طبيعية، وكان الفيديو نفسه عالي الجودة. تبدو الصورة الرمزية واقعية جدًا، رغم أنني ما زلت أعتقد أن معظم الناس سيستطيعون تمييز أنها مُولدة بالذكاء الاصطناعي. تبدو “مثالية” إلى حد ما، إذا كان ذلك مفهومًا.

أضافت Synthesia أيضًا لقطات ب‑رول مُولدة بالذكاء الاصطناعي تتماشى مع النص، لكن هنا تعطل الفيديو فعليًا. في لقطة واحدة، تفتح الصورة الرمزية دفترًا ثم يختفي الدفتر. في لقطة أخرى، تفتح الصورة الرمزية حاسوبًا محمولًا ثم يختفي أيضًا. كما أن معدل إطارات اللقطات الب‑رول كان أكثر تشويشًا من لقطات الصورة الرمزية، مما جعل الانتقالات بينهما واضحة.

بشكل عام، سأستخدم النص وقطات الصورة الرمزية كما هي بسعادة. لكنني سأستبدل أو أقصّ مقاطع الب‑رول قبل مشاركة الفيديو مع الموظفين الجدد، لأن هذه الأخطاء هي بالضبط ما يجعل المشاهدين يدركون أنهم يشاهدون محتوى ذكاء اصطناعي.

الاختبار 2: تحويل مستند موجود إلى فيديو تدريبي

في الاختبار التالي، حمّلت ملف PDF لسياسة التحرير الخاصة بـ Unite.ai السياسة التحريرية إلى المساعد الذكي وأعطيته هذا الطلب:

“حوّل هذه السياسة التحريرية إلى فيديو تدريبي مدته دقيقتان للكتاب الجدد في Unite.ai. غطِّ أهم القواعد التي يجب عليهم اتباعها، وأنهِه بملخص قصير للنقاط الرئيسية.”

لم أعدّل المخطط قبل التوليد. اختار المساعد نمط “الغسق” وأسلوب تقديم “العرض التقديمي” تلقائيًا. في خطة Starter، لم أستطع إضافة مجموعة علامة تجارية أو اختبار، لأن ذلك يتطلب خطط Enterprise وCreator.

استغرق الفيديو 11 دقيقة للتوليد، أي دقيقتين أكثر من فيديو الترحيب في الاختبار 1. كما ظهر بطول 3 دقائق رغم أنني طلبت دقيقتين.

لذا في الاختبار 1 كان الفيديو قصيرًا جدًا، وهنا كان طويلًا جدًا. لا يمكنك الاعتماد على Synthesia لتحقيق المدة التي تطلبها في طلبك.

رأيي

كان النص هو النقطة البارزة مرة أخرى. كان متماشيًا جيدًا مع سياسة التحرير، وكانت النصوص والرسوميات على الشاشة دقيقة وفقًا للمستند الأصلي. لم ألاحظ أنه يضيف أي قواعد، وهو ما كنت أكثر قلقًا منه عند إعطائه سياسة حقيقية.

ظهر الأفاتار بجودة عالية جدًا، مع تعابير وجه رائعة وإيماءات يد. لكنه بدا شبه مثالي قليلًا، وأعتقد أن هذا هو بالضبط ما سيجعل المشاهدين يدركون أنه ذكاء اصطناعي. كانت حركات الشفاه دقيقة، لكنها بدت مبالغًا فيها قليلًا، كأن الأفاتار يبالغ في نطق كل كلمة.

أكبر عيب بصري كان تخطيط النص. في مشهد واحد، انتقل الحرف “g” في كلمة “Advertising” إلى سطر منفصل، مما بدا فوضويًا. يمكن إصلاح ذلك بسرعة في المحرر، لكنه النوع من الأخطاء الذي يجب اكتشافه قبل مشاركة الفيديو.

بشكل عام، كان هذا الفيديو نتيجة أكثر قابلية للاستخدام مقارنةً بالاختبار الأول. سأثق بالمحتوى، لكنني ما زلت سأشاهد الفيديو من البداية إلى النهاية لاكتشاف مشاكل التخطيط، وسأقوم بقصه للوصول إلى الطول الذي أردته فعليًا.

الاختبار 3: إنشاء أفاتار شخصي لنفسي

بعد ذلك، أنشأت أفاتارًا شخصيًا لنفسي من صورة، مع استنساخ صوت وتسجيل موافقة حية إلزامي من Synthesia. طلبت Synthesia أيضًا أن أصف ملابسي ومحيطي، فقمت بوصف ما كنت أرتديه فعليًا والغرفة التي كنت فيها للحفاظ على عدالة المقارنة.

ثم جعلت الأفاتار يقرأ فقرة قصيرة لم أسجلها من قبل، وصورت نفسي وأنا أقرأ نفس الفقرة لأتمكن من مقارنة الاثنين جنبًا إلى جنب.

هذا هو أنا الحقيقي:

وهذا هو أفاتار Synthesia الخاص بي وهو يقرأ نفس الفقرة:

رأيي

بحد ذاته، يبدو الأفاتار أصيلًا وعالي الجودة. لكن بجوار النسخة الحقيقية مني، لا يبدو فعليًا كأنني أنا.

أشعر أن أكبر فرق جسدي كان فمي. لم يتحرك أو يبدو كفمي الحقيقي، وأشعر أن تصرفات الأفاتار لم تعكس شخصيتي. يبدو الأفاتار متحمسًا أكثر بكثير مما أكون في الواقع.

هذا يتطابق مع ما لاحظته في الاختبار الثاني، حيث بدت حركات شفاه الأفاتار الافتراضي مبالغًا فيها. يبدو أن أفاتارات Synthesia تميل إلى تقديم أداء مبالغ فيه ومتفائل.

مع ذلك، كان استنساخ الصوت هو الجزء الذي شعرت أنه الأكثر فاعلية. فقد كان صوته حقًا يشبه صوتي.

لكن بصراحة، وجدت كل ذلك مخيفًا إلى حد ما. على أي حال، لن أستخدم هذا الأفاتار بدلاً مني أمام الكاميرا. استنساخ الصوت مقنع بما فيه الكفاية، لكن الوجه والتعبيرات ليست قريبة بما يكفي لتُعتبر أنا، خاصةً بالنسبة لأي شخص يعرفني.

الاختبار 4: دبلجة فيديو حقيقي إلى الإسبانية

في الاختبار الرابع، استخدمت دبلجة الذكاء الاصطناعي من Synthesia لترجمة فيديو حديثي بالإنجليزية إلى الإسبانية. إنه نفس الفيديو الذي دبلجته في مراجعة ElevenLabs، حتى أتمكن من مقارنة الأداتين مباشرة.

هذا هو الفيديو الأصلي بالإنجليزية:

 

هذا هو الدبلج الإسباني من Synthesia:

 

وهنا نسخة ElevenLabs للمقارنة:

 

استغرق الدبلج 14 دقيقة على Synthesia، وهو ما كان أطول مما توقعت لفيديو قصير كهذا. استخدم 287 من أصل 800 رصيد شهري لي، لذا كلفني دبلج قصير واحد أكثر من ثلث حصتي.

رأيي

أُعجبت حقًا بمزامنة الشفاه. تطابقت حركات فمي مع الصوت الإسباني بدقة، وحتى الأسنان بدت صحيحة. كان هناك بعض التشويش، لكن بشكل عام بدا الأمر واقعيًا.

هنا كان تفوق Synthesia على ElevenLabs بوضوح. قامت ElevenLabs بدبلجة الفيديو بنجاح، لكنها استبدلت الصوت فقط دون مزامنة شفاه، لذا ظل فمي يُظهر أشكالًا إنجليزية تحت الكلمات الإسبانية. أما Synthesia فقد غيرت طريقة تحرك فمي لتتناسب مع اللغة الجديدة، وهو ما يُحدث فرقًا كبيرًا في مصداقية النتيجة.

مع ذلك، لا يزال الأمر يثير القشعريرة لدي قليلًا. تحرك فمي بطرق لا أتحرك بها عندما أتحدث في الحياة الواقعية، وهو نفس المشكلة التي واجهتها مع الأفاتار الشخصي في الاختبار الثالث.

أيضًا، كان الصوت أضعف. بدا مرتفعًا قليلًا، رغم أنه لم يكن سيئًا. بالنسبة لي، كان صوت ElevenLabs الإسباني أقرب إلى صوتي الحقيقي.

لذا إذا كنت أُدبلج فيديوًا لمشاهد سيشاهدون وجهي فعليًا، سأختار Synthesia لمزامنة الشفاه. أما إذا كان المحتوى صوتيًا فقط (مثل مقطع بودكاست أو تعليق صوتي)، فستكون ElevenLabs هي خياري.

الاختبار 5: أفاتار قابل للتخصيص يوضح نصيحة سلامة

في الاختبار النهائي، أردت أن أرى ما إذا كانت الأفاتارات القابلة للتخصيص من Synthesia يمكنها التعامل مع شيء أقرب إلى لقطات تدريبية حقيقية. كتبت نصًا قصيرًا حول نصيحة سلامة في المستودعات حول رفع الصناديق بشكل صحيح واستوردته كسكريبت خاص بي.

من هناك، خصصت أفاتارًا افتراضيًا من خلال تحديد ملابسه (سترة عاكسة للضوء الصارخ وخوذة أمان) وموقعه (ممر مستودع). كما أنشأت مقطع حركة له وهو يرفع صندوقًا بشكل صحيح، لتشغيله أثناء شرح السرد للتقنية. تُولد مقاطع الحركة القائمة على التوجيه في Synthesia باستخدام نموذج Veo 3 من Google.

 

استغرق الفيديو 7 دقائق للتوليد.

رأيي

كان هذا هو النتيجة المفضلة لدي من جميع اختباراتي. ظهرت الملابس وإعداد المستودع تمامًا كما تخيلتها، وكان الشكل الرقمي واقعيًا للغاية وعالي الجودة. كما بدت مطابقة تمامًا في مشاهد الحديث ومشهد الحركة.

كان رفع الصندوق مقنعًا أيضًا. لم تكن هناك أيدي مشوهة، ولم يختفِ الصندوق (على عكس الدفتر المحمول واللابتوب في الاختبار الأول)، وكانت طريقة رفعه صحيحة، وهذا مهم جدًا في فيديو السلامة.

كان إحباطي مرتبطًا بالتحرير، وليس بالمخرجات.

كان مقطع الحركة لا يتجاوز أربع ثوانٍ، وهو أقصر من السطر الذي يرويه. لذا قامت Synthesia بتكراره مرة واحدة، وظهر ذلك الجزء من الفيديو متقطعًا قليلًا. لم أستطع تجنبه بالسماح للمقطع بالتشغيل تلقائيًا، لأن كل مشهد في Synthesia يحتاج إلى نص. ولا يوجد مشهد فارغ أيضًا، لذا اضطررت لإضافة مشهد قالب وحذف كل ما فيه لإعطاء المقطع شريحة خاصة به.

ولكن حتى مع هذا التكرار، أستطيع أن أرى تمامًا إمكانية استخدامه في تدريب السلامة الفعلي. إذا كنت تُعد واحدًا، فاحرص على مطابقة طول السرد مع مقطع الحركة بحيث يُشغل مرة واحدة فقط.

النتائج وجودة المخرجات

إليك ما لاحظته عبر اختباراتي:

  • الواقعية: بدت الأفاتار واقعية جدًا، مع إيماءات وتعبيرات أصيلة. ومع ذلك، كانت مثالية إلى حدٍ ما ومبالغًا في حركات الشفاه ما يزال يكشف عن كونها ذكاءً اصطناعيًا.
  • جودة الصوت: بدت النصوص مقنعة وكان استنساخ صوتي يبدو حقًا كصوتي. ومع ذلك، ظهر الدبلجة الإسبانية بنبرة أعلى من صوتي الفعلي.
  • الدقة: نجح المساعد الذكي في ضبط النبرة التي طلبتها وبقي مخلصًا لسياسة التحرير التي حمّلتها، دون أي قواعد مختلقة لاحظتها.
  • الاتساق: بدا الأفاتار المخصص لي متطابقًا في مشاهد الحديث ومقطع الحركة. ومع ذلك، لم تكن أوقات التشغيل متسقة على الإطلاق (56 ثانية عندما طلبت 90، ثم 3 دقائق عندما طلبت دقيقتين).
  • السرعة: استغرق كل تصيير ما بين 7 و14 دقيقة، حتى للفيديوهات التي تقل عن دقيقة.
  • التحرير المطلوب: كان فيديو السلامة (الاختبار 5) قابلًا للاستخدام كما هو رغم وجود مقطع متكرر واحد. ومع ذلك، سيتعين علي قص اللقطات المتقطعة من الاختبار 1، وإصلاح انقطاع النص وتقصير الطول في الاختبار 2.
  • الاعتمادات المستخدمة مقابل المخرجات: استهلكت دبلجة فيديو قصير واحد 287 من أصل 800 اعتماد شهري في خطة Starter، لذا ينفد الرصيد سريعًا عند إضافة الدبلجة.
  • نقاط الضعف: شعرت أن الأفاتار المخصص لي لم يلتقط وجهي الحقيقي أو شخصيتي. كما أن اللقطات التلقائية القصيرة والمتكررة جعلت أجزاء من الفيديوهات تبدو متقطعة.

كيفية الحصول على نتائج جيدة في Synthesia

إليك سير العمل الذي وجدته ينتج أكثر الفيديوهات قابلية للاستخدام:

  1. ابدأ بنص محكم، ليس طلبًا غامضًا. يمكن للمساعد الذكي صياغة فيديو من فكرة، لكن تزويده بالمواد المصدرية الفعلية (سياسة، إجراء تشغيلي قياسي، أو صفحة منتج) يمنعه من ملء الفجوات بمحتوى عام.
  2. قم بإعداد مجموعة علامتك التجارية أولاً. الخطوط والألوان والشعارات المطبقة في البداية توفر عليك إعادة تنسيق كل مشهد يدويًا لاحقًا.
  3. اكتب للسمع. الجمل القصيرة وعلامات الترقيم الواضحة تعطي الأفاتار إيقاعًا أفضل. اكتب الاختصارات واسم العلامة التجارية صوتيًا إذا كان الصوت يخطئ نطقها. والأفضل، حدد نطقًا بتمييز الكلمة في محرر النص. اختر النطق لتعديل صوته، واكتب تهجئة صوتية يدويًا أو سجّل نفسك تقول الكلمة، سيحول النظام ذلك إلى تهجئة صوتية.
  4. احفظ المشاهد قصيرة. فكرة واحدة لكل مشهد تجعل من السهل مطابقة الإيماءات والنص على الشاشة، ويسهل تعديلها لاحقًا.
  5. عاين قبل التصيير. كل تصيير كامل يستخدم دقائق من رصيدك الشهري، لذا تحقق من النص والتوقيت أولًا.

أفضل 3 بدائل لـ Synthesia

إليك أفضل بدائل Synthesia التي جربتها وأوصي بها.

HeyGen

HeyGen هو أقرب منافس لـ Synthesia، ويعتمد الاختيار في الغالب على الجمهور المستهدف للفيديوهات.

من ناحية، يميل HeyGen إلى المبدعين والمسوقين. تمنحك خطته المجانية أكثر من 500 أفاتار مخزون وأفاتار مخصص (مقارنةً بـ 9 أفاتارات مجانية في Synthesia). يبدأ تصدير الفيديو بدقة 4K في خطة Pro، ويدعم أكثر من 175 لغة بدءًا من خطة Creator.

في الوقت نفسه، تُبنى Synthesia حول التدريب المؤسسي. تشمل الخطة Creator الفروع وإمكانية الوصول إلى API، بينما يحتفظ HeyGen بالفيديو التفاعلي وSCORM في خطة Business.

اختر HeyGen إذا كنت تُنتج محتوى تسويقي أو فيديوهات اجتماعية. وإلا، اختر Synthesia إذا كنت تُعد محتوى تدريبيًا لنظام إدارة تعلم (LMS).

اقرأ مراجعة HeyGen أو زر HeyGen!

AI Studios

 

AI Studios (من DeepBrain AI) هو البديل الذي سأرشحه للفرق التي تهتم بالميزانية، لأنه لا يحدد عدد الدقائق كما تفعل Synthesia.

على جانب واحد، AI Studios’ الخطة الشخصية يتضمن مقاطع فيديو غير محدودة تصل إلى 30 دقيقة لكل منها، و3 شخصيات مخصصة، وتصدير بدقة 1080p، و120 دقيقة من الدبلجة بالذكاء الاصطناعي شهريًا. خطة Starter من Synthesia تقيدك بـ 10 دقائق من الفيديو. خطة Team من AI Studios تضيف تصدير فيديو بدقة 4K.

في الوقت نفسه، تقدم Synthesia حزمة تدريب أكثر اكتمالًا: اختبارات تفاعلية وتفرعات، جلسات تمثيل أدوار، مكتبة شخصيات أكبر، وأكثر من 140 لغة للدبلجة، مقارنة بـ 73 لغة ولهجة لدى AI Studios. تبيع AI Studios الشخصيات التفاعلية كخطة منفصلة.

اختر AI Studios إذا كنت تنتج الكثير من مقاطع الفيديو وتريد المزيد من الدقائق مقابل أموالك. وإلا، اختر Synthesia إذا كانت التفاعلية والتعريب أهم من الكمية.

اقرأ مراجعة DeepBrain AI أو زر AI Studios!

Colossyan

 

تستهدف Colossyan نفس المشترين مثل Synthesia (فرق التدريب)، لذا فإن هذه المقارنة تتعلق بالميزات مقابل السعر بدلاً من الجمهور.

من ناحية، تضع Colossyan المزيد من ميزات التدريب في المستويات الأدنى. تشمل خطتها المجانية 20 دقيقة شهريًا و10 مقاطع فيديو تفاعلية.

تضيف الخطة Professional تصدير SCORM (5 شهريًا)، و15 مقطع فيديو تفاعلي، وما يصل إلى 3 محررين. للحصول على الفروع، تحتاج إلى خطة Creator بينما الاختبارات متاحة في خطة Enterprise في Synthesia.

في الوقت نفسه، تمتلك Synthesia عددًا أكبر من الأصوات واللغات (أكثر من 160 مقابل أكثر من 100). كما أنها الخيار الأكثر رسوخًا لمراجعات أمان المؤسسات.

اختر Colossyan إذا كنت فريق تدريب صغير يحتاج إلى دورات تفاعلية بميزانية محدودة. وإلا، اختر Synthesia إذا كانت واقعية الشخصيات، والتعريب، والقدرة على التوسع هي الأولوية.

اقرأ مراجعة Colossyan أو زر Colossyan!

مراجعة Synthesia: الأداة المناسبة لك؟

ما أعجبني أكثر في Synthesia هو سهولة تحويل النص إلى فيديو احترافي دون كاميرا أو مقدم حقيقي. في اختباراتي، كانت النصوص قوية، وكانت الشخصيات الجاهزة تبدو واقعية، والشخصية القابلة للتخصيص أنتجت الفيديو المفضل لدي.

ما لم يعجبني هو عملية التنظيف. كان الـ b-roll الذي أنشأه الذكاء الاصطناعي يبدو أكثر تقطعًا من رأس المتحدث، وكانت النصوص بحاجة إلى تعديل، ولم تتطابق أطوال الفيديو دائمًا مع ما طلبته. كما أن شخصيتي الشخصية بدت واقعية لكنها لم تشبهني بما يكفي لتحل محلي أمام الكاميرا.

أنصح باستخدام Synthesia لفرق التدريب والموارد البشرية التي تحتاج إلى إنتاج مقاطع فيديو احترافية بانتظام، خاصةً بـ عدة لغات. ولكن لإنشاء مقاطع فيديو بين الحين والآخر، قد يكون من الصعب تبرير الحدود الشهرية وقد ترغب في النظر إلى هذه البدائل:

  • HeyGen هو الأنسب للمسوقين والمبدعين الذين يرغبون في إخراج بدقة 4K والكثير من الشخصيات الجاهزة.
  • AI Studios هو الأنسب للإنتاج عالي الحجم مع مقاطع فيديو غير محدودة في خطتها الشخصية.
  • Colossyan هو الأنسب لفرق التدريب الصغيرة التي ترغب في تدريب SCORM تفاعلي بتكلفة أقل.

شكرًا لقراءتك مراجعة Synthesia! آمل أن تكون قد وجدت ذلك مفيدًا. إذا رغبت في تجربة Synthesia بنفسك، يمكنك التسجيل مجانًا ورؤية ما يمكنه بناؤه لك.

الأسئلة المتكررة

هل Synthesia مجاني؟

نعم، Synthesia لديها خطة Basic مجانية دون الحاجة إلى بطاقة ائتمان. تشمل 10 دقائق من الفيديو و10 دقائق من الدبلجة شهريًا، و9 شخصيات.

ما مدى واقعية شخصيات Synthesia؟

تبدو شخصيات Synthesia واقعية جدًا. لكن في اختباراتي، حركات الفم وتعبيرات الوجه المبالغ فيها قليلًا لا تزال تجعلها تبدو مولدة بالذكاء الاصطناعي، ولم تُظهر شخصيتي الشخصية وجهي الحقيقي أو سلوكي بدقة كافية لتُعَدّ كأنها أنا.

هل يمكنني إنشاء شخصية AI لنفسي باستخدام Synthesia؟

نعم، يمكنك إنشاء شخصية شخصية من صورة أو فيديو قصير، مع استنساخ صوت اختياري. سيتعين عليك تسجيل بيان موافقة أمام الكاميرا، ولا يمكن تخطيه أو تسجيله مسبقًا. تشمل خطة Starter 3 شخصيات شخصية، وتضم خطة Creator 5، وتكون الخطة Enterprise غير محدودة.

كم عدد اللغات التي يدعمها Synthesia؟

يدعم Synthesia أكثر من 160 لغة وصوتًا لإنشاء مقاطع الفيديو وأكثر من 140 لغة للدبلجة بالذكاء الاصطناعي.

هل يمكن لـ Synthesia دبلجة فيديو موجود؟

نعم، يمكن لـ Synthesia دبلجة فيديو موجود. يمكنك رفع ملف MP4 أو MOV أو WebM (حتى 4K) أو لصق رابط يوتيوب، وستعيد لك نسخة متزامنة مع حركة الشفاه بلغة أخرى باستخدام صوت المتحدث المستنسخ. يمكنك بعد ذلك تصحيح أي سطر مترجم في المحرر.

هل يمكنني استخدام مقاطع Synthesia تجاريًا؟

نعم، يمكنك استخدام مقاطع Synthesia تجاريًا. فهي مصممة للاستخدام التجاري، بما في ذلك مقاطع التدريب والتسويق ومقاطع المبيعات.

هل يعمل Synthesia مع نظام إدارة التعلم الخاص بي؟

نعم، يقوم Synthesia بتصدير الفيديوهات كحزم SCORM، بحيث يمكن تحميلها إلى معظم أنظمة إدارة التعلم. فقط ضع في اعتبارك أن تصدير SCORM متاح حصريًا في خطة Synthesia Enterprise.

هل Synthesia آمن للاستخدام؟

نعم، Synthesia متوافق مع SOC 2 Type II وISO 42001 وGDPR. بالإضافة إلى ذلك، يتطلب الحصول على موافقة حية قبل إنشاء صورة رمزية شخصية.

هل Synthesia يستحق الاستثمار؟

Synthesia يستحق ذلك إذا كان فريقك ينتج فيديوهات تدريبية بانتظام (خاصةً بعدة لغات)، ويحتاج إلى أمان موثوق. إذا كنت تحتاج فقط إلى عدد قليل من الفيديوهات القصيرة، قد تجعل حدود الدقائق الشهرية HeyGen أو AI Studios قيمة أفضل.

جانين هاينريشس هي أخصائية مراجعة برمجيات الذكاء الاصطناعي وقد اختبرت وراجعت أكثر من 250 أداة ذكاء اصطناعي خلال السنوات الثلاث الماضية.