زاوية Anderson

يفضل الذكاء الاصطناعي قراءة الكتاب أكثر من مشاهدة الفيلم

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
AI-generated image of an industrial robot seated in an armchair and reading a book, while ignoring a movie playing on TV. ChatGPT-o4, Nano-Banana; Firefly.

شكل صور ، مثل JPEG و PNG – فإنهم يفضلون أن يقوم المستخدم باستخراج إطاراته الخاصة و تحميلها كصور (التي مستعدون للتعليق عليها). هم في حالة سلسلة OpenAI GPT

 

من المدهش أن يكون من الصعب الحصول على نماذج الذكاء الاصطناعي لمشاهدة ومعلق على المحتوى المرئي الفعلي ، حتى لو تم تصميمها لهذا الغرض. إنهم أكثر اهتماما بالكلمة المكتوبة. إذا كنت قد حاولت تحميل مقطع فيديو صغير إلى ChatGPT أو إلى نموذج رؤية/لغة مشابه ، فقد تفاجأت بمعرفة أنهم لا يستطيعون في الواقع تحليل الفيديو. بينما يمكن للنماذج مثل ChatGPT-4o+ تحليل الإطارات الفردية – في للفيديو: ، يمكن ، بعد بعض الجهد ، استخراج تشغيل كامل من إطار من مقطع فيديو و تغذيته إلى ChatGPT ، لغرض ، على سبيل المثال ، توليد مسار روائي من صنع الذكاء الاصطناعي صور ورمز من درس OpenAI حول تحليل الإطارات

تسلط مخططات التدفق البصري الضوء على كيفية تتبع الحركة عبر الإطارات في تسلسل فيديو، مع إظهار المتجهات الخضراء اتجاه الحركة وكثافتها. توفر هذه التعيينات الاستمرارية الزمنية اللازمة لـ VLMs ويمكن أيضًا أن تكون بمثابة أدلة هيكلية في سير عمل VFX. ( المصدر ) https://www.researchgate.net/figure/Optical-flow-field-vectors-shown-as-green-vectors-with-red-end-points-before-and-after_fig6_290181771 المستخرجة المتعددة لغرض تطوير تعليق من صنع الذكاء الاصطناعي لمقطع فيديو. مصدر لكن يقع على عاتق المستخدم القيام بتحويل الفيديو إلى إطارات ، 

إما عن طريق استدعاء الدوال في روتين أكبر، كما في المثال السابق، أو عن طريق استخراج الإطارات باستخدام FFMPEG أو حلول تحرير الفيديو المجانية والمدفوعة. إلى حد ما، وربما إلى حد كبير، تعتمد قيود تحليل الفيديو في منتجات ضخمة مثل ChatGPT على: مجرد توفير نسخة واحدة من الذكاء الاصطناعي مع خيارات متعددة. الفيديو ،أشهر ترميزات وتخصيص موارد الحاسوب لعملية استخراج الفيديو التي تثقل على القرص وتحد من معالجة الحاسوب ، ليست مسألة تافهة ، إذا قرر مئات الملايين من المستخدمين البدء في استخدام هذه المرافق كل يوم. استخدام الموارد علاوة على ذلك ، يمكن <img class=” wp-image-225176″ src=”https://www.unite.ai/wp-content/uploads/2025/10/optical-flow.jpg” alt=”رسومات flux البصري توضح كيفية تتبع الحركة عبر الإطارات في تسلسل الفيديو، حيث تشير المتجهات الخضراء إلى اتجاه الحركة وشدتها. توفر هذه الخرائط استمرارية الوقت اللازمة لنماذج اللغة المرئية، ويمكن أن تُستخدم أيضًا كدليل هيكلي في سير عمل نماذج اللغة المرئية. يمكن لتحليل الوقت أن يكشف عن صورة مختلفة تمامًا من إطار واحد (تخيل شخصًا يدخل منزلًا). بحالة مزاج جيدة ثم يكتشف جثة) ؛ لذلك ، يجب مراعاة الخلاصة الزمنية الكاملة حتى للفيديو القصير هو مهمة صعبة ومكلفة من

صور ورمز من درس OpenAI حول تحليل الإطارات المستخرجة المتعددة لغرض تطوير تعليق من صنع الذكاء الاصطناعي لمقطع فيديو. ( مصدر ) https://cookbook.openai.com/examples/gpt_with_vision_for_video_understanding حيث الموارد – بالإضافة إلى كونها مجالًا متخصصًا من أدبيات البحث ، على سبيل المثال ، مع التطور المستمر لإطارات مثل الflux البصري – الذي “يفتح” في الواقع مقطعًا من الفيديو حتى يمكن اعتباره واعتباره وكأنه وثيقةثابتة:  مصدر

الاستسلام لمذكرات كليف

على الرغم من ذلك ، منذ أن يمكن لنماذج مثل نموذج لغة دفتر ملاحظات جوجل ومدخلات ChatGPT الحديثة قراءة البيانات الوصفية المرتبطة (أي محتوى نصي مضمن يوفر سياقًا للفيديو)، وهي لا تمنع تحميل مقاطع الفيديو.وأحيانًا، قد يحاولون حتى تفسير فيديو لا يحتوي على بيانات مفيدة: في الحالة التالية، الله ثم قام بتحميل مقطعًا عشوائيًا مدته 6 ثوانٍ من الفيلم الإيطالي (2021) إلى NotebookLM ، مع التأكد من أن المقطع لا يحتوي على نص مفيد ، إما في البيانات الوصفية أو في اسم الملف. يد

لحظة يومية في مقطع فيديو مدته 6 ثوانٍ من فيلم إيطالي يتم تفسيره بشكل خيالي من قبل NotebookLM. مصدر: جوجل NotebookLM NotebookLM بمخاطرة متعمدة لخلق محتوى غير متعلق بالفيديو ، كاملاً مع بودكاست غير منطقي وغير متعلق مدته خمس دقائق: لحظة يومية في مقطع فيديو مدته 6 ثوانٍ من فيلم إيطالي يتم تفسيره بشكل خيالي من قبل NotebookLM. مصدر: جوجل NotebookLM على الرغم من أن Notebook ، مثل ChatGPT ، سيقبل فيديو / YouTube كمدخل ، إلا أنه سيفعل ذلك فقط إذا كان الفيديو يحتوي على طبقة نصية قابلة للتفسير و أو عناوين:بهذه الطريقة ، يتم عملالجهد الشاق لفعلually النظر إلى المحتوى الفعلي للفيديو والاستماع إليه وتنفيذ التفسير الدلالي (الذي هو ضرورة قانونية لشركة YouTube ، بسبب إجراءات حماية حقوق النشر ، و نظامها القادم لتحديد الهوية) بعد تحميل المستخدم ، و عند توافر الموارد اللازمة:

TL;DW

هذا ، وفقًا للاطلاع على ورقة بحثية جديدة من جامعة بريستول في المملكة ألف كلمة (VQA) – تعتمد أيضًاالمتحدة ، بعنوان ، حيث يخلص المؤلفان إلى أن نماذج اللغة البصرية الحالية (VLMs) – النماذج المخصصة لتحليل الفيديو بطرق أكثر جهدًا ، والمشاركة في الفيديو ليسworth من الجودة على المعلومات النصية عند وجودها: إجابة الأسئلة الفيديوية عندما قدم المؤلفون نماذج مع صور متحركة وأسئلة و إجابات متعددة ، وجدوا أن النماذج غالبًا ما اعتمدت على الأنماط في النص ، chứ لا شيء يحدث على الشاشة – وفي العديد من الحالات ، أدت بنفس القدر ما يبدو أنهحتى عند إزالة السؤال . كاملًا في شكل منأشكال الاختصار أو الغش ، ما كان مهمًا للغاية بالنسبة لأغلب النماذج هو القدرة على تحديد الأنماط في الإجابات الممكنة ؛ فقط عندما أصبح المهمة أكثر صعوبة ، من خلال إضافة المزيد من خيارات الإجابة ، بدأت الذكاء الاصطناعي في الاهتمام أكثر بالفيديو: أجرى المؤلفون اختبارات VQA تحت ظروفمختلفة على ست نماذج VLM ذات سمات متنوعة ؛ ووجدوا أن النتائج تشير إلى

مثال من الدراسة يظهر كيف يزن نموذج تحليل الفيديو ما يرى وما يقرأ. يظهر المقطع شخصًا ينسج البامبو ، ومع ذلك ، يخصص النموذج أهمية أكبر للنص السؤال والإجابة أكثر من إطارات الفيديو نفسها. تظهر الألوان الزرقاء الداكنة العناصر التي تدعم الإجابة المختارة ، في حين تظهر الألوان الحمراء الداكنة تلك التي تسحبها في الاتجاه المعاكس ، مما يظهر كيف يركز منطق النموذج على الصياغة أكثر من الصور المتحركة. اعتماد النماذج على النص أكثر من المحتوى الفيديوي: مثال من الدراسة يظهر كيف يزن نموذج تحليل الفيديو ما يرى وما يقرأ. يظهر المقطع شخصًا ينسج البامبو ، ومع ذلك ، يخصص النموذج أهمية أكبر للنص السؤال والإجابة أكثر من إطارات الفيديو نفسها. تظهر الألوان الزرقاء الداكنة العناصر التي تدعم الإجابة المختارة ، في حين تظهر الألوان الحمراء الداكنة تلك التي تسحبها في الاتجاه المعاكس ، مما يظهر كيف يركز منطق النموذج على الصياغة أكثر من الصور المتحركة.

الطريقة

للفهم كيف يساهم كل مدخل في قرار النموذج ، يستخدم العمل الجديد طريقة مننظرية الألعاب تسمى قيم شابلي . تم تصميم هذه الطريقة في الأصل لتوزيع العائد العادل بين اللاعبين في تحالف ، وتخصص قيم شابلي الائتمان لكل “لاعب” بناءً على تأثيره الفردي. بصورة فعالة ، إذن ، “اللاعبون” في هذا السيناريو هم إما إطارات الفيديو أو مكونات النص (التعليقات ، العناوين ، إلخ) لمهمة VQA ؛ و “العائد” هو إجابة النموذج النهائية. من خلال اختبار ما يحدث عند إضافة أو إزالة كل جزء ، تكشف التقنية عن مدى أهمية كل عنصر في الوصول إلى الإجابة المختارة.

المقاييس

تم تعريف مقياسان بسيطان لمقارنة مقدار مساهمة كل نمطية (أي الفيديو أو السؤال أو الإجابة) في قرار النموذج: يقيس مقدار Explanation حقيقة أن الكلي الذي جاء من كل نوع من المدخلات ؛ هنا ، يتم جمع جميع قيم شابلي المتاحة ، ويتم حساب الحصة الخاصة بكل نمطية كنسبة مئوية من الإجمالي. مساهمة النمطية ثانيًا ، يصحح مساهمة لكل ميزة بعض النمطيات ، مثل الفيديو ، تحتوي على العديد من الميزات أكثر من غيرها. بدلاً من ذلك ، يتم حساب قيمة شابلي المتوسطة لكل ميزة ، ويتم مقارنة هذه القيم المتوسطة لتحديد نمطية السائد.

البيانات والاختبارات

قام المؤلفون باختبار النهج على ست نماذج VLM ذات سمات متنوعة ، مصممة لضمان أن مبادئ الاختبارات تكون قابلة للتطبيق بشكل عام: تم اختيار النماذج لطول سياق مختلف ، وعمر مختلف (أي منذ إطلاق الإطار) ، وتكوين بنية مختلف. كان المتسابقون FrozenBiLM ؛ InternVideo ؛ VideoLLaMA2 ؛ VideoLLaMA3 ؛ LLaVa-Video (الذييعتمد علىQwen2 )؛  وLongVA (الذي يستخدم أيضًا Qwen2). منأجل التنوع نفسه ، تم اختيار أربعة مجموعات بيانات مستهدفة: EgoSchema ، وهو مجموعة بيانات VQA مصممة لتكونمستحيلة دون مشاهدة الفيديو المرتبط ؛ HD-EPIC ، وهو مجموعة بيانات تركز على المطبخ وتتميز بفيديوهات غيرعادية الطول ؛ MVBench ، وهي مجموعة محددة من المساهماتمن مجموعات بيانات أخرى ؛ و LVBench ، الذييطرح أسئلة VQA حول فيديوهات طويلة جدًا. منها ، قام المؤلفون بتصميم 60 سؤالاً – عشرة من كل نوع سؤال. أوضحت مقاييس المساهمة أن معظم النماذج تعتمد أقل على الفيديو وأكثر على النص ، خاصة عند الحكم على الإطارات إطارًا إطارًا. حتى عندما كان للفيديو أداء معقول في المساهمة الإجمالية ، كانت تأثيراته لكل ميزة غالبًا ما تكون طفيفة ، مما يشير إلى أن النموذج قد يستخدم الفيديو بشكل عام ، ولكنه يهمل الإطارات الفردية. كان VideoLLaMA3 هو المتميز الرئيسي هنا ، مع اعتماد مرئي أقوى ، خاصة على التسلسلات الأطول في LVBench: درجات مساهمة

درجات مساهمة النمطية (MC) ومساهمة لكل ميزة (PFC) عبر النماذج والمجموعات البيانية ، مما يظهر الوزن النسبي للمدخلات الفيديو (V) ، والسؤال (Q) ، والإجابة (A). تشير الألوان الباردة إلى مساهمات أقوى ، بينما تشير الألوان الدافئة إلى تأثيرات أضعف أو غير مهمة. في معظم الإعدادات ، يهيمن اللغة على الفيديو - خاصة في التأثير لكل إطار. النمطية (MC) ومساهمة لكل ميزة (PFC) عبر النماذج والمجموعات البيانية ، مما يظهر الوزن النسبي للمدخلات الفيديو (V) ، والسؤال (Q) ، والإجابة (A). تشير الألوان الباردة إلى مساهمات أقوى ، بينما تشير الألوان الدافئة إلى تأثيرات أضعف أو غير مهمة. في معظم الإعدادات ، يهيمن اللغة على الفيديو – خاصة في

التأثير لكل إطار. فيما يتعلق بالنص ، كان السؤال يميل إلى أن يكون أكثر أهمية من الإجابة ، خاصة في النماذج الأقوى. كان هذا أكثر وضوحًا في مجموعات بيانات مثل EgoSchema ، حيث كانت الأسئلة أطول وأكثر طبيعية ، بينما كانت الإجابات قصيرة وأحيانًا مخططة. عكس MVBench هذا إلى حد ما ، حيث زادت بنية الإجابة الثنائية من أهمية رمز الإجابة. عبر جميع النماذج والمجموعات البيانية ، ومع ذلك ، تم التخلي عن الرؤية باستمرار

، حيث قامت اللغة بأداء العمل الشاق. ينصPaper على ما يلي: ‘(لنماذج السياق الطويل) ، يظهر الفيديو مساهمات مخفضة بشكل كبير ، مما

ذا صلة بالغ الأهمية ، ولكن هذا يدل على أن قيم شابلي لإطاراته الفردية أكثر مركزًا حول الصفر ، وأن انتباه النموذج إليها أقل توجيهًا من النص.’ لاختبار كيف يساهم كل جزء من المدخل في دقة النموذج ، أجرى الباحثون اختبارات

يعني أن قيم شابلي لكل إطار تكون أصغر بكثير من نظيراتها في ميزات النص. ‘ ‘الفيديو كنمطية برمتها لا يزال الإزالة إضافية باستخدام – إخفاء جزء أو أكثر من المدخل ، ومراقبة مدى تغير دقة النموذج الناتجة: التحويل إذا انخفضت الأداء بشكل حاد عند إزالة مدخل معين ، فإن ذلك المدخل مهم ؛ إذا أدى النموذج بنفس القدر من الجودة ، فذلك يشير إلى أن الجزء المفقود لم يكن يعتمد عليه بشكل كبير. في هذا الصدد ، تعتبر اختبارات التحويل نوعًا من دراسة التكرارية. تأثيرأداء

تأثير أداء إخفاء مدخلات الفيديو أو السؤال أو الإجابة عبر أربعة معايير VQA. تظهر النقاط التغيير من خط القاعدة غير المحجوب. الأحمر يعني دقة أقل ، والأخضر يعني دقة أعلى. غالبًا ما احتفظت النماذج بنقاط عالية بدون فيديو ، ولكن خسروا المزيد عند إزالة الإجابة (النص). يمكن إخفاء السؤال عادةً مع تأثير ضئيل. إخفاء مدخلات الفيديو أو السؤال أو الإجابة عبر أربعة معايير VQA. تظهر النقاط التغيير من خط القاعدة غير المحجوب. الأحمر يعني دقة أقل ، والأخضر يعني دقة أعلى. غالبًا ما احتفظت النماذج بنقاط عالية بدون فيديو ، ولكن خسروا المزيد عند إزالة الإجابة (النص). يمكن إخفاء السؤال عادةً مع

تأثير ضئيل. تشير النتائج (الموضحة أعلاه) إلى أن الإجابات (الإجابات النصية في بيانات الاختيار المتعدد) تحمل أكبر وزن عبر اللوحة. غالبًا ما تسبب إخفاء الإجابة أكبر انخفاض في الدقة ، وأحيانًا يؤدي إلى خفض النماذج إلى أداء عشوائي: ومع الحالات ذلك ، كان لإخفاء تأثير أقل بكثير ، مما يدعم الاكتشاف السابق بأن النماذج تقلل من قيمة السؤال. السؤال في بعض المؤلفون بتحديد ما إذا كان، حتى تحسنت الدقة ، مما يشير إلى أن النماذج كانت في بعض الأحيان مجرد مطابقة للإجابات مع أدلة نصية أو بصرية بدلاً من تقييم السؤال بشكل صحيح. عند إزالة السؤال تختلف النماذج أيضًا في اعتمادها على الفيديو: بعضها احتفظ بأداء معقول بدون فيديو ، مما يؤكد مرة أخرى على مساهمة الفيديو المحدودة في العديد من التكوينات الحالية. ثم قام لكن مع يمكن إجبار النماذج على الاعتماد على الفيديو عن طريق إضافة المزيد من الإجابات الخاطئة إلى خيارات الاختيار المتعدد. عندما كانت الإجابات الخاطئة سهلة ومستعارة من أسئلة أخرى ، تحسنت الأداء ، حيث قامت النماذج بمطابقة الأنماط النصية بدون تفكير كبير.

مساهمة لكل ميزة ودقة لمدخلات الفيديو والسؤال والإجابة ، حيث يتم إضافة إجابات خاطئة إضافية إلى كل اختبار VQA ، مما يظهر أن زيادة عدد الإجابات الخاطئة يقلل من هيمنة النص ويزيد من التأثير النسبي للميزات البصرية والسؤال. عشرة إجابات أو أكثر غير متعلقة ، بدأت في الاعتماد أكثر على الفيديو والسؤال: مساهمة لكل ميزة ودقة لمدخلات الفيديو والسؤال والإجابة ، حيث يتم إضافة إجابات خاطئة إضافية إلى كل اختبار VQA ، مما يظهر أن زيادة عدد الإجابات

يؤدي هذا إلى تقليل هيمنة النص بشكل غير صحيح وزيادة التأثير النسبي للعناصر المرئية والأسئلة.في VideoLLaMA3، أدى إخفاء الفيديو إلى تقليل الدقة بنسبة 40% على EgoSchema و15% على LVBench، مما يشير إلى أن زيادة طفيفة في عدد الاستجابات يمكن أن تحول النماذج بعيدًا عن اختصارات النص ونحو التفكير متعدد الوسائط الحقيقي.كما لاحظ الباحثون أيضًا، من خلال الفحص

خرائط حرارة لقيم شابلي لأربعة مجموعات بيانات ، حيث يظهر كل صف واحد من VQA ، وكل عمود ميزة فردية. تظهر ميزات الفيديو على اليسار ، تليها النص. تؤكد القيم الأقوى في مناطق النص (الحمراء) أن النماذج تعتمد بشكل أكبر على اللغة من الفيديو. كيف يتم توزيع الإسناد عبر المدخلات ، ونرى أدناه خرائط حرارة لقيم شابلي لكل مدخل نموذج: خرائط حرارة لقيم شابلي لأربعة مجموعات بيانات ، حيث يظهر كل صف واحد من VQA ، وكل عمود ميزة فردية. تظهر ميزات الفيديو على اليسار ، تليها النص. تؤكد القيم

الأقوى في مناطق النص (الحمراء) أن النماذج

الإسناد للسؤال والإجابة. هذه الحدود الواضحة هي حيث تنتهي الإطارات الفيديو وتبدأ ميزات النص ، مما يدل على أن مساهمة نمطية الفيديو أقل بكثير من السؤال / الإجابة. ‘ باختصار ، عبر جميع المجموعات البيانية ، تكون القيم أقوى بكثير نحو نهاية النص ، مما يشير بقوة إلى

تعتمد بشكل أكبر على اللغة من الفيديو. في تعليق على النتائج أعلاه ، يشير المؤلفون إلى ما يلي: ‘magnitude قيم شابلي أكبر بكثير على الجانب الأيمن من كل خريطة حرارة ، تمثيل ، أن النماذج تعتمد بشكل أكبر على اللغة من الإشارات البصرية. حتى عندما الفيديو ، تكون المساهمة موزعة بشكل رقيق عبر العديد من الإطارات ، غالبًا بدون نمط متسق. يستخدم نرى أدناه مثالًا موضحًا من EgoSchema. تم تحديد 16 إطارًا “أهم” باستخدام قيم شابلي وتم تلوينها وفقًا لتأثيرها

إسنادات شابلي لمثال واحد من EgoSchema ، مع عرض 16 إطارًا الأكثر تأثيرًا وجميع مدخلات النص. مساهمات الفيديو طفيفة مقارنة بالنص ، الذي يهيمن على منطق النموذج. الأزرق والحمراء تشير إلى التأثير الإيجابي والسلبي على الإجابة المختارة. مع توجيه الأزرق نحو مساهمة إيجابية والحمراء نحو مساهمة سلبية: إسنادات شابلي لمثال واحد من EgoSchema ، مع عرض 16 إطارًا الأكثر تأثيرًا وجميع مدخلات النص. مساهمات الفيديو طفيفة مقارنة بالنص ، الذي يهيمن على منطق النموذج. الأزرق والحمراء تشير إلى

التأثير الإيجابي والسلبي على الإجابة المختارة. النتيجة هي أن كل إطار له تأثير ضعيف فقط مقارنة بالكلمات في السؤال والإجابة. الإشارات البصرية نادرة وغير متسقة ، بينما توجيه الكلمات مثل “كرسي” و “سياج” النموذج نحو الخيار الصحيح – أو بعيدًا عنه ، اعتمادًا على السياق.

الخلاصة

من يعمل في تحرير الفيديو أو تحليله سيعرف بالفعل كم هذه العمليات مكلفة من حيث الموارد ، ويفهم لماذا لا يمكن للشركات التي تتعامل مع ملايين الطلبات القائمة على الذكاء الاصطناعي يوميًا أن تسمح البيانات بمعالجات فيديو تفسيرية و تحريرية عشوائية للمستخدمين. شيء واحد يجب تذكره في هذا الصدد هو أن معظم واجهات API للذكاء الاصطناعي التي ستجربها (باستثناء إصدار تجريبي جديد قصير الأمد لدعم بحث علمي جديد) تسعى إلى تحقيق رغبات المستخدمين على أدنى مستوى من إنفاق الموارد. ذلك يعني الاعتماد على البيانات الوصفية الحالية من البيانات التي قدمها المستخدم أو استرجاع RAG ، إذا كان ذلك ممكنًا ؛ و استخراج الوصفية (إذا لزم الأمر) لمواد قابلة للفهم أكثر مثل PDF و المستندات و الصور الفردية. ما لا يُعتبر هو تشغيل فيديو تم تحميله عبر CLIP أو أحدث إصدار من YOLO ، أو عبر أي نموذج VLM مكلف ومستهلك للزمن يمكنه تحديد ما يوجد في الإطارات وفهم ما يحدث في الفيديو المقدم ، مع مراعاة الزمنية. ومع ذلك ، لا يعني ذلك أن الظواهر التي توثقها الورقة الحالية تنجم عن نهج هندسي مقتصد. يشير المؤلفون إلى أن النص يهيمن على أنماذج التدريب المتعددة الحالية بأي حال ، مما يشير إلى أن “اللغة البصرية” أقل تطورًا أو أقل أهمية أو إعلامية في سياق متعدد الوسائط أو (على الأقل في الوقت الحالي) أقل فهمًا. * من المثير للاهتمام أن يبدو أن المواد التي جاءت بها NotebookLM هي إما أصلية تمامًا أو غير مؤشرة بواسطة جوجل ، لأنني غير قادر على العثور على أي نتائج ويب يمكن أن تكون قد تسربت إلى بيانات التدريب وطورت هذه الإخراج. نشر لأول مرة يوم الجمعة ،

31 أكتوبر 2025 ؛ تم تحريره في الساعة 14:20 لتنسيق

كاتب في مجال تعلم الآلة، متخصص في توليد صور البشر. كان رئيسًا سابقًا لمحتوى البحث في Metaphysic.ai، حتى دمجه في Brahma.ai التابعة لـ DNEG.
Website: martinanderson.ai
Contact: martin@martinanderson.ai