زاوية Anderson

تحدي تقييم الفيديو عند أكثر من 1 إطار في الثانية

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
Trails in a basketball scene - source: https://www.youtube.com/watch?v=ORfjgE6n2Pc

القدرة على أنظمة التعلم الآلي على التعرف على الأحداث التي تحدث داخل الفيديو أمر بالغ الأهمية لمستقبل توليد الفيديو القائم على الذكاء الاصطناعي – لا سيما لأن مجموعات بيانات الفيديو تتطلب تقييمات دقيقة من أجل إنتاج نماذج تتوافق مع طلب المستخدم ، ولا تظهر بشكل مفرط hallucinations.

مثال على مخطط تقييم من مشروع VidReCap التابع لجوجل. مصدر: https://sites.google.com/view/vidrecap

مثال على مخطط تقييم من مشروع VidReCap التابع لجوجل. مصدر: https://sites.google.com/view/vidrecap

تقييم الفيديوهات يدويًا بمقياس يلزم لتحقيق مجموعات بيانات تدريب فعالة هو أمر غير معقول. على الرغم من أنه من الممكن تدريب أنظمة الذكاء الاصطناعي على تقييم الفيديوهات تلقائيًا ، إلا أن هناك حاجة إلى العديد من الأمثلة التي تم إنشاؤها بواسطة الإنسان كحقيقة أساسية ، من أجل التنوع والتغطية.

ما هو أكثر أهمية ، تقريبا كل نموذج تقييم فيديو قائم على الذكاء الاصطناعي الحالي يعمل عند 1 إطار في الثانية ، وهو معدل التقاط غير كثيف بدرجة كافية لتحديد التباين في العديد من السيناريوهات: التغييرات السريعة في التعبيرات الوجهية لتطبيقات التعرف على العواطف ؛ الأحداث السريعة في الرياضات السريعة مثل كرة السلة ؛ الحركات العنيفة ؛ القطع السريعة في الأفلام الدرامية ، حيث قد تفشل أنظمة مثل PySceneDetect في تحديدها (أو لا يتم استخدامها) ؛ ومن السيناريوهات الأخرى التي يتطلب فيها نافذة الانتباه أن تكون أكثر كثافة.

انقر للتشغيل. عمل سريع ولكن حاسم في ما يمكن أن يكون واحدًا من أبطأ الرياضات في العالم ، حيث يفوز أليكس هيغينز بالبطولة العالمية ضد راي ريدون في عام 1982. مصدر: https://www.youtube.com/watch?v=_1PuqKno_Ok

تحرك بسرعة واكسر المنطق

هذا المعدل المنخفض هو المعيار للعديد من الأسباب اللوجستية. من بينها أن تقييم الفيديو هو نشاط مكثف الموارد ، سواء كان النظام يدرس إطارًا متتاليًا في كل مرة ، أو استخدام طرق مختلفة لتحقيق توافق семантиكي ل سلسلة من الإطارات في تسلسل تقييم قابل للفهم.

سبب آخر لكون 1 إطار في الثانية هو المعيار الحالي هو أن الفيديوهات لا تحتوي عادةً على أحداث سريعة ؛ لذلك من غير الضروري إعطاء 300 إطارًا لطاولة بلياردو ساكنة نفس الاهتمام مثل اللحظة التي يتم فيها تسجيل الكرة السوداء والفوز بالبطولة (انظر المثال أعلاه).

من الممكن استخدام إشارات ثانوية أوسع لتحديد اللحظات الحاسمة في فيديو رياضي ، مثل استجابة الجمهور المستدامة لضربة سريعة في مباراة كرة سلة. ومع ذلك ، يمكن أن تحدث هذه الإشارات لأسباب أخرى (مثل إصابات لاعبي كرة سلة غير متوقعين) ، و不能 الاعتماد عليها. هذا هو مثال على كيف يمكن أن يؤدي مجموعة بيانات فيديو ملصقة بشكل خاطئ إلى نموذج فيديو مولد يهلوس أو يفسر الإرشادات بشكل خاطئ ، أي لأن النموذج قد يظهر إصابة لاعب عند سؤاله لإنشاء ضربة.

هذا هو في nhiều طرق مشكلة “ميزانية” ، وفي طرق أخرى مشكلة إجرائية. عملت الإطارات حتى الآن على مبدأ أن الإطارات الرئيسية النادرة يمكن أن تقبض على المعلومات الأساسية بشكل فعال ، ولكن هذا أكثر فعالية في تحديد النوع والجوانب الأخرى لموضوع الفيديو ، منذ أن تظل الأدلة في هذه الحالة على عدة إطارات.

F-16

يقدم بحث جديد من الصين حلاً ، في شكل أول نموذج لغة متعدد الوسائط كبير (MLLM ، أو ببساطة LLM) يمكنه تحليل الفيديو بسرعة 16 إطارًا في الثانية بدلاً من المعيار 1 إطار في الثانية ، مع تجنب الفخاخ الرئيسية لزيادة معدل التحليل.

يزعم المؤلفون في الاختبارات أن النظام الجديد ، الذي يسمى F-16 ، يتفوق على النماذج الحكومية الحالية مثل GPT-4o و Gemini-1.5 pro. على الرغم من أن النماذج الأخرى الحالية كانت قادرة على مطابقة أو تجاوز نتائج F-16 في التجارب ، كانت النماذج المنافسة أكبر وأكثر تعقيدًا.

على الرغم من أن F-16 تم تدريبه على بعض الأجهزة الجادة (كما سنرى قريباً) ، فإن الاستدلال عادة ما يكون أقل demande من التدريب. لذلك يمكننا أن نأمل أن يكون الكود (المpromised للإصدار في المستقبل القريب) قادرًا على التشغيل على وحدات معالجة الرسومات المنزلية متوسطة أو عالية المستوى.

ما هو مطلوب لحيوية مشهد الهواة (والذي يتضمن معظم الوقت مشهد الفيكس الخاص بالمؤسسات) هو نموذج تقييم فيديو من هذا النوع الذي يمكنه العمل ، ربما مكمّل ، على أنظمة المستهلك ، بحيث لا يهاجر مشهد الفيديو التوليدي بالكامل إلى أنظمة تجارية قائمة على واجهة برمجة التطبيقات ، أو يضطر المستهلكون إلى ربط الإطارات المحلية بخدمات وحدات معالجة الرسومات التجارية عبر الإنترنت.

ما وراء التوسيع

يلاحظ المؤلفون أن هذا النوع من النهج هو بديل عملي لتوسيع مجموعات البيانات. يمكننا أيضًا أن نستنتج أنه إذا كنا سنقوم بإلقاء المزيد من البيانات على المشكلة ، فإن هذا النوع من النهج قد يكون مفضلًا ، لأنه يميز الأحداث بطريقة أكثر دقة.

يصرحون ما يلي:

‘يمكن أن يؤدي عينة معدل الإطار المنخفض إلى فقدان المعلومات البصرية الحاسمة ، لا سيما في مقاطع الفيديو التي تحتوي على مشاهد سريعة أو تفاصيل معقدة أو حركة سريعة. بالإضافة إلى ذلك ، إذا تم فقدان الإطارات الرئيسية ، ومع ذلك ، يتم تدريب النموذج على علامات تعتمد على معلومات الإطار الرئيسي ، فقد يجد صعوبة في محاذاة تنبؤاته مع المحتوى المتوقع ، مما قد يؤدي إلى هلوسة وأداء مخفض…

‘… F-16 يحقق أداء SOTA في فهم الفيديو العام بين النماذج من نفس الحجم ويظهر ميزة واضحة في فهم الفيديو عالي الإطار ، متجاوزًا النماذج التجارية مثل GPT-4o. هذا العمل يفتح اتجاهات جديدة لتطوير فهم الفيديو عالي الإطار في أبحاث MLLM.’

البحث الجديد بعنوان تحسين فهم الفيديو في LLM ب 16 إطارًا في الثانية ، ويأتي من ثمانية مؤلفين عبر جامعة تسينغهوا وشركة بايت دانس.

الطريقة

由于 أن الإطارات المتتالية غالبًا ما تحتوي على معلومات مكررة ، يطبق F-16 محاذِرًا عالي الإطار لضغط وتشفير تفاصيل الحركة الرئيسية مع الحفاظ على الدلالات البصرية. يتم معالجة كل إطار أولاً بواسطة محول صورة مسبق التدريب ، الذي يسترجع تمثيلات الميزة قبل تمريرها إلى محاذِر يعتمد على وحدات الخطأ الغاوسية (GELUs).

هندسة F-16 تعالج الفيديو عند 16 إطارًا في الثانية ، مما يسمح بالتقاط المزيد من الإطارات مقارنة بالنماذج منخفضة الإطار التقليدية ، ومحاذِر عالي الإطار يحافظ على الدلالات البصرية مع التشفير الفعال للديناميات الحركية دون إضافة رموز بصرية إضافية. مصدر: https://arxiv.org/pdf/2503.13956

هندسة F-16 تعالج الفيديو عند 16 إطارًا في الثانية ، مما يسمح بالتقاط المزيد من الإطارات مقارنة بالنماذج منخفضة الإطار التقليدية ، ومحاذِر عالي الإطار يحافظ على الدلالات البصرية مع التشفير الفعال للديناميات الحركية دون إضافة رموز بصرية إضافية. مصدر: https://arxiv.org/pdf/2503.13956

لمعالجة عدد الإطارات المتزايد بكفاءة ، يجمع F-16 الإطارات في نوافذ معالجة صغيرة ، ودمج الميزات البصرية باستخدام شبكة عصبونية متعددة الطبقات (MLP) ثلاثية الطبقات ، مما يساعد على الاحتفاظ بأهم تفاصيل الحركة فقط ، وتقليل التكرار غير الضروري ، مع الحفاظ على تدفق الإجراءات الزمني. طبقة تجميع أقصى مساحة spatial max-pooling تقلل أيضًا من عدد الرموز ، مما يحافظ على التكاليف الحسابية ضمن الحدود.

يتم تمرير رموز الفيديو المعالجة إلى Qwen2-7B LLM ، الذي يولد استجابات نصية بناءً على الميزات البصرية المستخرجة وطلب المستخدم المحدد.

من خلال هيكلة إدخال الفيديو بهذه الطريقة ، يتيح F-16 ، كما يصر المؤلفون ، التعرف على الأحداث بدقة أكبر في المشاهد الديناميكية ، مع الحفاظ على الكفاءة.

النسخة القصيرة

يوسع F-16 محول صورة LLM مسبق التدريب ، LLaVA-OneVision ، لمعالجة الفيديو من خلال تحويل خط أنابيب الإدخال البصري. بينما تعالج نماذج LLM الصورية الإطارات المنفصلة ، يعيد محاذِر F-16 عالي الإطار تنسيق الإطارات المتعددة إلى شكل يمكن للنموذج معالجته بكفاءة أكبر؛ هذا يمنع النظام من الإفراط في المعلومات المكررة مع الحفاظ على الإشارات الحركية الرئيسية اللازمة لفهم الفيديو الدقيق.

为了 ضمان التوافق مع أساسه القائم على الصور ، يعيد F-16 هيكلة محاذِره إلى المصفوفات الفرعية. هذا النهج يسمح له بدمج المعرفة من نماذج الإطار الفردي مع التكيف مع إدخال الفيديو المتسلسل.

يضغط المحاذِر أولاً تسلسلات الإطارات إلى تنسيق مُحسّن للنموذج ، مع الحفاظ على الميزات الأكثر إعلامية مع التخلص من التفاصيل غير الضرورية. يتيح تصميم الهندسة للنظام معالجة فيديو عالي الإطار مع الحفاظ على التكاليف الحسابية تحت السيطرة ، مما يجعله يطرح أدلة على أن التوسيع ليس الطريق الوحيد (أو الأفضل) لمعالجة تقييم الفيديو.

تغير سرعة

由于 معالجة الفيديو عند 16 إطارًا في الثانية تحسن من فهم الحركة ولكن تزيد من التكلفة الحسابية ، خاصةً خلال الاستدلال ، يقدم F-16 طريقة فك التشفير بسرعة إطار متغيرة ، مما يسمح له بتغيير معدل الإطار ديناميكيًا دون إعادة التدريب.

المحاذِران الفردي والمتسلسل المتاحان ل F-16.

المحاذِران الفردي والمتسلسل المتاحان ل F-16.

تتيح هذه المرونة للنموذج تشغيله بكفاءة عند معدلات إطار أقل عندما لا تكون الدقة العالية مطلوبة ، وتقلل من التكلفة الحسابية.

عند وقت الاختبار ، عند اختيار معدل إطار أقل ، يعادة F-16 استخدام معلمات المحاذِر المُدرَّبة مسبقًا من خلال تكرار الإطارات الإدخالية لتطابق الأبعاد المتوقعة. هذا يضمن أن النموذج يمكنه معالجة الفيديو بنجاح دون تعديل هيكله.

على عكس العينة البسيطة (أي ، ببساطة إزالة الإطارات) ، التي تrisk خسارة تفاصيل الحركة الحاسمة ، يحافظ هذا الأسلوب على تمثيلات الحركة المكتسبة للمحاذِر ، مع الحفاظ على الدقة حتى عند معدلات إطار مخفضة.对于 فهم الفيديو العام ، يمكن أن يزيد معدل الإطار الأقل من سرعة الاستدلال دون خسارة كبيرة في الأداء ، بينما يمكن أن يستفيد تحليل الحركة السريعة من القدرة الكاملة على 16 إطارًا في الثانية.

البيانات والاختبارات

بني على Qwen2-7B ، يوسع FP-16 LLaVA-OneVision باستخدام SigLIP كمحول صورة. مع عينة إطارات الفيديو عند 16 إطارًا في الثانية ، يمكن الحصول على ما يصل إلى 1,760 إطارًا من كل فيديو.对于 مقاطع الفيديو الأطول ، تم عينة الإطارات بانتظام (أي ، بمعدل أقل كثافة).

للتدريب ، استخدم F-16 نفس مجموعات بيانات الفيديو العامة مثل LLaVA-Video ، بما في ذلك LLaVA-Video-178K ، NExT-QA ، ActivityNet-QA ، و PerceptionTest.

تم أيضًا تعديل F-16 بشكل دقيق على مجموعات بيانات رياضية سريعة FineGym ، Diving48 ، و SoccerNet. كما قام المؤلفون بإنشاء مجموعة من 276 مباراة في الدوري الأمريكي لكرة السلة التي لعبت بين 13 و 25 نوفمبر 2024 ، مع التركيز على ما إذا كان الشوت ناجحًا (مهمة تتطلب معالجة بسرعة إطار عالية).

تم تقييم النموذج باستخدام مجموعة اختبار NSVA ، وتم قياس الأداء بواسطة النسبة F1.

تم تقييم نماذج الجمباز والغوص على دقة التعرف على الأحداث ، بينما تتبع نماذج كرة القدم والسلة ممرات اللعبة ونتائج الركلات.

تم تدريب النموذج لمدة دورة تدريبية واحدة باستخدام 128 وحدة معالجة رسومات NVIDIA H100 (وبالتنسيق مع 80 جيجابايت من ذاكرة الوصول العشوائي لكل وحدة معالجة رسومات ، هذا يعني استخدام 10.24 تيرابايت من ذاكرة الوصول العشوائي لوحدة معالجة الرسومات؛ حتى بمعايير البحث الحديث ، هذا هو أعلى مجموعة معالجة رسومات قد صادفتها في متابعة الأدبيات البحثية في رؤية الكمبيوتر). تم استخدام معدل تعلم من 2×10⁻⁵ خلال التدريب.

بالإضافة إلى ذلك ، تم تعديل LoRA على بيانات رياضية باستخدام محولات LoRA مع 64 وحدة معالجة رسومات لمدة 5 دورات تدريبية. هنا ، تم تدريب النموذج فقط ، تاركًا محول الصورة مجمّدًا.

تم اختبار الإطارات التالية في الجولة الأولى ل “فهم الفيديو العام” GPT-4o؛ Gemini-1.5-Pro؛ Qwen2-VL-7B؛ VideoLLaMA2-7B؛ VideoChat2-HD-7B؛ LLaVA-OV-7B؛ MiniCPM-V2.6-8B؛ LLaVA-Video-7B؛ و NVILA-7B;

تم تقييم النماذج على Video-MME؛ VideoVista؛ TemporalBench؛ MotionBench؛ Next-QA؛ MLVU؛ و LongVideoBench.

مقارنة بين نتائج أسئلة الفيديو عبر النماذج ، مع تحديد حدود الإطار في الثانية وأداء على عدة معايير. يحقق F-16 أداء SOTA بين نماذج 7B على Video-MME و NQA و TPB و MB ، متجاوزًا النماذج التجارية مثل GPT-4o و Gemini-1.5-Pro.

مقارنة بين نتائج أسئلة الفيديو عبر النماذج ، مع تحديد حدود الإطار في الثانية وأداء على عدة معايير. يحقق F-16 أداء SOTA بين نماذج 7B على Video-MME و NQA و TPB و MB ، متجاوزًا النماذج التجارية مثل GPT-4o و Gemini-1.5-Pro.

من بين هذه النتائج ، يصر المؤلفون على ما يلي:

‘على مجموعتي بيانات Video-MME القصيرة والمتوسطة و Next-QA – كلها مصممة لفهم الفيديو القصير – يتجاوز نموذجنا النموذج SOTA السابق 7B بنسبة 3.2٪ و 1.0٪ و 0.9٪ في الدقة ، مما يبرز أداءه القوي على الفيديوهات القصيرة. ‘

‘对于 معايير تقييم فهم الفيديو الطويل ، مثل Video-MME الطويل و LongVideoBench و MLVU ، يكون التحدي أكبر بسبب عينة الإطارات الأقل كثافة ، مما يؤدي إلى تباين أكبر في الإطارات داخل نافذة المعالجة. ‘

‘هذا يزيد من صعوبة محاذِر التماثل لتحقيق التغييرات الزمنية بشكل فعال داخل التمثيل الرمزي المحدود. ونتيجة لذلك ، يختبر F-16 انخفاضًا طفيفًا في الأداء مقارنة بـ [LLaVA-Video-7B] ، الذي تم تدريبه على نفس مجموعة بيانات الفيديو.’

كما أدى معالجة F-16 بسرعة إطار عالية إلى تحسين بنسبة 13.5٪ على TemporalBench وزيادة بنسبة 2.5٪ على MotionBench ، مقارنة بالنماذج الحالية 7B ، وأداء على مستوى النماذج التجارية مثل GPT-4o و Gemini-1.5-Pro.

فهم فيديو الرياضة السريعة

تم اختبار F-16 على FineGym و Diving48 و SoccerNet و مجموعات بيانات الدوري الأمريكي لكرة السلة لتقييم قدرته على فهم إجراءات الرياضة السريعة.

استخدم التدريب 10,000 مقطع فيديو من الدوري الأمريكي لكرة السلة المُحسَّنة يدويًا ، مع التركيز على حركة الكرة وإجراءات اللاعبين ، ومدى قدرة النماذج على تحديد ما إذا كان الشوت ناجحًا ، باستخدام مجموعة اختبار NSVA المقيمة bằng F1 score.

نتائج تحليل فيديو الرياضة السريعة. أداء F-16 مع محاذِر عالي الإطار أفضل من نظيره منخفض الإطار عبر جميع مهام الرياضة. تم تقييم GPT-4o و Gemini-1.5-Pro أيضًا على أسئلة الدوري الأمريكي لكرة السلة و SoccerNet ، حيث لم تكن معرفة التدريب في المجال مطلوبة.

نتائج تحليل فيديو الرياضة السريعة. أداء F-16 مع محاذِر عالي الإطار أفضل من نظيره منخفض الإطار عبر جميع مهام الرياضة. تم تقييم GPT-4o و Gemini-1.5-Pro أيضًا على أسئلة الدوري الأمريكي لكرة السلة و SoccerNet ، حيث لم تكن معرفة التدريب في المجال مطلوبة.

على FineGym ، الذي يقيس تعرف الإجراءات في الجمباز ، أدى F-16 بشكل أفضل بنسبة 13.8٪ من النموذج SOTA السابق 7B ، مما يدل على تحسين فهم الحركة الدقيقة.

تطلب Diving48 تحديد تسلسلات حركة معقدة مثل مراحل الإقلاع واللف والطيران ، وأظهر F-16 دقة أعلى في التعرف على هذه التحولات.

对于 SoccerNet ، قام النموذج بتحليل مقاطع فيديو مدتها 10 ثوان ، وتحديد ممرات الكرة ، وأظهرت النتائج تحسنًا على النماذج الحالية 7B ، مما يشير إلى أن معدل الإطار الأعلى يساهم في تتبع الحركات الصغيرة والسريعة.

في مجموعة بيانات الدوري الأمريكي لكرة السلة ، اقترب أداء F-16 من دقة تحديد نتيجة الشوت من النماذج الأكبر التجارية مثل GPT-4o و Gemini-1.5-Pro ، مما يؤكد أيضًا أن معدل الإطار الأعلى يعزز قدرته على معالجة الحركة الديناميكية.

معدلات الإطار المتغيرة

تم اختبار F-16 عند معدلات إطار مختلفة لقياس مرونته. بدلاً من إعادة التدريب ، يعالج معدلات الإطار الأقل من خلال تكرار الإطارات لتطابق هيكل إدخال المحاذِر. هذا النهج يحافظ على أداء أفضل من ببساطة إزالة الإطارات (التي قد تؤدي إلى خسارة دقة).

تشير النتائج إلى أنخفاض الأداء عند تقليل معدل الإطار ، لكن F-16 لا يزال يتفوق على نماذج منخفضة الإطار ويحافظ على نتائج قوية حتى عند معدلات إطار أقل من 16 إطارًا في الثانية.

الجانب الأيسر ، استهلاك الوقت لوحدات F-16 المختلفة خلال الاستدلال ، مقاس على 300 فيديو من مجموعة Video-MME Long عند معدلات اختبار إطار مختلفة وأطوال تسلسل. اليمين ، مقارنة بين أداء Video-MME للنماذج المدربة والمختبرة عند معدلات إطار مختلفة. تمثل الخط المستمر النماذج المدربة والمختبرة عند نفس معدل الإطار ، بينما يظهر الخط المتقطع الأداء عند اختبار نموذج مدرب عند 16 إطارًا في الثانية عند معدل إطار أقل.

الجانب الأيسر ، استهلاك الوقت لوحدات F-16 المختلفة خلال الاستدلال ، مقاس على 300 فيديو من مجموعة Video-MME Long عند معدلات اختبار إطار مختلفة وأطوال تسلسل. اليمين ، مقارنة بين أداء Video-MME للنماذج المدربة والمختبرة عند معدلات إطار مختلفة. تمثل الخط المستمر النماذج المدربة والمختبرة عند نفس معدل الإطار ، بينما يظهر الخط المتقطع الأداء عند اختبار نموذج مدرب عند 16 إطارًا في الثانية عند معدل إطار أقل.

زيادة معالجة F-16 بسرعة إطار عالية تزيد من المتطلبات الحسابية ، على الرغم من أن محاذِره يساعد في إدارة هذه التكاليف من خلال ضغط الرموز البصرية الزائدة.

يتطلب النموذج المزيد من العمليات الحسابية لكل فيديو مقارنة بالنماذج منخفضة الإطار ، ولكنه يحقق أيضًا دقة أفضل لكل رمز ، مما يشير إلى أن استراتيجيات اختيار الإطار وتقليل الرمز الخاصة به تساعد في تعويض الحساب الإضافي.

الخلاصة

من الصعب المبالغة في أهمية هذا الخيط البحثي أو التحديات – خاصة هذا العام ، الذي من المتوقع أن يكون عامًا كاسحًا للفيديو التوليدي ، مما يلقي بالضوء على عيوب تحضير مجموعات بيانات الفيديو وجودة التقييم.

يجب التأكيد أيضًا على أن التحديات المرتبطة بتحقيق وصفات دقيقة للتفاصيل الداخلية للفيديو لا يمكن حلها حصريًا من خلال رمي وحدات معالجة الرسومات أو الوقت أو مساحة القرص في المشكلة. الطريقة التي يتم بها عزل الأحداث من مسارات فيديو طويلة ومملة (مثل مقاطع فيديو الجولف أو البلياردو ، على سبيل المثال) سوف تستفيد من إعادة التفكير في النهج الدلالي والأليات الحالية التي تسيطر على حلول SOTA.

(بالمناسبة ، حتى لو يبدو 16 إطارًا في الثانية معدل إطار منخفضًا جدًا لعام 2025 ، فمن المثير للاهتمام أن نلاحظ أن هذا هو أيضًا معدل التدريب الأصلي لملفات فيديو النموذج التوليدي للفيديو Wan 2.1 الشهير ، ومعدل التشغيل الذي يعمل به بأقل مشاكل. من المفيد أن يحافظ مشهد البحث على عينيه على ما يسمى “تسوس المعايير” هنا ؛ في بعض الأحيان ، يمكن أن تعزز القيود القديمة معايير المستقبل)

نشر لأول مرة يوم الأربعاء ، 19 مارس 2025

كاتب في التعلم الآلي، متخصص في مجال合成 الصور البشرية. سابقًا رئيس محتوى البحث في Metaphysic.ai، حتى انحلت في DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai