زاوية Anderson

JPEG AI يضيف غموضًا إلى الخط الفاصل بين الصور الحقيقية والاصطناعية

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
Created with ChatGPT-4o and Adobe Firefly

في شهر فبراير من هذا العام، تم نشر معيار JPEG AI الدولي، بعد سنوات عدة من البحث الهادف إلى استخدام تقنيات التعلم الآلي لإنتاج ترميز صورة أصغر وأسهل في النقل والتخزين، دون فقدان في الجودة الحسية.

من تدفق المنشور الرسمي لJPEG AI، مقارنة بين نسبة الإشارة إلى الضوضاء القصوى (PSNR) ونهج JPEG AI المُحسّن بالتعلم الآلي. المصدر: https://jpeg.org/jpegai/documentation.html

من تدفق المنشور الرسمي لJPEG AI، مقارنة بين نسبة الإشارة إلى الضوضاء القصوى (PSNR) ونهج JPEG AI المُحسّن بالتعلم الآلي. المصدر: https://jpeg.org/jpegai/documentation.html

من الممكن أن يكون أحد الأسباب التي تجعل هذا الاكتشاف لا يحظى باهتمام كبير هو أن الوثائق الأساسية لهذا الإعلان لم تكن متاحة من خلال منافذ الوصول المجانية مثل Arxiv. ومع ذلك، قام Arxiv بنشر العديد من الدراسات التي تدرس أهمية JPEG AI من خلال جوانب متعددة، بما في ذلك تشوهات الضغط غير العادية وأهميته للتحقيقات الجنائية.

دراسة قارنت بين تشوهات الضغط، بما في ذلك تلك التي تمت في مسودة سابقة من JPEG AI، ووجدت أن الطريقة الجديدة تميل إلى تقليل وضوح النص - الأمر الذي لا يعتبر أمرًا طفيفًا في الحالات التي قد تساهم فيها في سلسلة الأدلة. المصدر: https://arxiv.org/pdf/2411.06810

دراسة قارنت بين تشوهات الضغط، بما في ذلك تلك التي تمت في مسودة سابقة من JPEG AI، ووجدت أن الطريقة الجديدة تميل إلى تقليل وضوح النص – الأمر الذي لا يعتبر أمرًا طفيفًا في الحالات التي قد تساهم فيها في سلسلة الأدلة. المصدر: https://arxiv.org/pdf/2411.06810

بسبب أن JPEG AI يغير الصور بطريقة تشبه آفات الصور الاصطناعية المولدة، يجد الأدوات الجنائية الحالية صعوبة في التمييز بين الصور الحقيقية والصور المزيفة:

بعد ضغط JPEG AI، لا يمكن للخوارزميات المتقدمة تمييز المحتوى الحقيقي من المناطق المعدلة في خرائط التموضع، وفقًا لمقال حديث (مارس 2025). الأمثلة المصدرية التي تظهر على اليسار هي صور مزيفة، حيث يتم التمييز بوضوح بين المناطق المعدلة باستخدام تقنيات جنائية قياسية (الصورة الوسطى). ومع ذلك، يمنح ضغط JPEG AI الصور المزيفة طبقة من المصداقية (الصورة على اليمين). المصدر: https://arxiv.org/pdf/2412.03261

بعد ضغط JPEG AI، لا يمكن للخوارزميات المتقدمة تمييز المحتوى الحقيقي من المناطق المعدلة في خرائط التموضع، وفقًا لمقال حديث (مارس 2025). الأمثلة المصدرية التي تظهر على اليسار هي صور مزيفة، حيث يتم التمييز بوضوح بين المناطق المعدلة باستخدام تقنيات جنائية قياسية (الصورة الوسطى). ومع ذلك، يمنح ضغط JPEG AI الصور المزيفة طبقة من المصداقية (الصورة على اليمين). المصدر: https://arxiv.org/pdf/2412.03261

واحدة من الأسباب هي أن JPEG AI يتم تدريبه باستخدام هيكل معماري مشابه لتلك المستخدمة في الأنظمة التوليدية التي تهدف الأدوات الجنائية إلى الكشف عنها:

الورقة الجديدة تظهر التشابه بين منهجيات الضغط بالصور المُحسّن بالتعلم الآلي والصور المولدة بالفعل بواسطة الذكاء الاصطناعي. المصدر: https://arxiv.org/pdf/2504.03191

الورقة الجديدة تظهر التشابه بين منهجيات الضغط بالصور المُحسّن بالتعلم الآلي والصور المولدة بالفعل بواسطة الذكاء الاصطناعي. المصدر: https://arxiv.org/pdf/2504.03191

نظرًا لأن كلا النموذجين قد ينتجان بعض السمات البصرية المشتركة من وجهة نظر جنائية،

الكمية

يتسبب هذا الت重م في حدوث تلاقي بسبب الكمية، المشترك بين كلا الهيكلين، والذي يتم استخدامه في التعلم الآلي كطريقة تحويل البيانات المستمرة إلى نقاط بيانات منفصلة، وكتقنية تحسين يمكن أن يقلل بشكل كبير من حجم ملف النموذج المُدرّب (سيعرف هواة توليد الصور بانتظار الإصدار الرسمي للنموذج، ثم الإصدار الذي يمكن تشغيله على الأجهزة المحلية).

في هذا السياق، تشير الكمية إلى عملية تحويل القيم المستمرة في التعرض الباطن للصورة إلى خطوات منفصلة ثابتة. يستخدم JPEG AI هذه العملية للتقليل من كمية البيانات المطلوبة لتخزين أو نقل صورة من خلال تبسيط التمثيل العددي الداخلي.

على الرغم من أن الكمية تجعل التشفير أكثر كفاءة، إلا أنها تفرض أيضًا انتظامًا هيكليًا يمكن أن يشبه الآفات التي تتركها النماذج التوليدية – لطيفًا بدرجة كافية لتفادي الإدراك، ولكنه يُسبب اضطرابًا للأدوات الجنائية.

استجابة لذلك، يقترح مؤلفو عمل جديد بعنوان ثلاثة أدلة جنائية لصور JPEG AI تقنيات غير عصبية تفسرها يمكنها الكشف عن ضغط JPEG AI؛ وتحديد ما إذا كانت الصورة قد تم ضغطها مرة أخرى؛ والتمييز بين الصور الحقيقية المضغوطة والصور التي تم توليدها بالكامل بواسطة الذكاء الاصطناعي.

الطريقة

ارتباطات الألوان

يقترح البحث ثلاثة “أدلة جنائية” مخصصة لصور JPEG AI: ارتباطات القناة اللونية التي تم تقديمها خلال خطوات المعالجة المسبقة لJPEG AI؛ تشوهات قابلة للقياس في جودة الصورة عبر الضغط المتكرر التي تكشف عن أحداث إعادة الضغط؛ وأنماط الكمية في الفضاء الباطن التي تساعد في التمييز بين الصور المضغوطة بواسطة JPEG AI والصور التي تم توليدها بواسطة نماذج الذكاء الاصطناعي.

بخصوص النهج القائم على ارتباطات الألوان، تقدم خط أنابيب المعالجة المسبقة لJPEG AI اعتمادية إحصائية بين قنوات الصورة اللونية، مما يخلق توقيعًا يمكن أن يخدم كدليل جنائي.

يحول JPEG AI الصور RGB إلى فضاء الألوان YUV وينفذ عينة كروم 4:2:0، والتي تتضمن عينة القنوات اللونية قبل الضغط. هذا الإجراء يؤدي إلى ارتباطات لطيفة بين القنوات اللونية – ارتباطات ليست موجودة في الصور غير المضغوطة، وتختلف في القوة عن تلك التي تنتجها الضغط التقليدي أو مولدات الصور الاصطناعية.

مقارنة لكيفية تغيير ضغط JPEG AI لارتباطات الألوان في الصور، باستخدام القناة الحمراء كمثال. اللوحة (أ) تقارن الصور غير المضغوطة بالصور المضغوطة بواسطة JPEG AI، مما يظهر أن الضغط يزيد بشكل كبير من الارتباط بين القنوات. اللوحة (ب) تعزز تأثير المعالجة المسبقة لJPEG AI - فقط التحويل اللوني والتعيين - مما يظهر أن هذه الخطوة وحدها تزيد من الارتباطات بشكل ملحوظ. اللوحة (ج) تظهر أن الضغط التقليدي لJPEG يزيد أيضًا من الارتباطات قليلاً، ولكن ليس بنفس الدرجة. اللوحة (د) تختبر الصور الاصطناعية، مع Midjourney-V5 وAdobe Firefly التي تظهر زيادة معتدلة في الارتباط، في حين تبقى الأخرى أقرب إلى مستويات الصور غير المضغوطة.

مقارنة لكيفية تغيير ضغط JPEG AI لارتباطات الألوان في الصور..

في الأعلى، يمكننا رؤية مقارنة من الورقة تظهر كيف يغير ضغط JPEG AI ارتباطات الألوان في الصور، باستخدام القناة الحمراء كمثال.

اللوحة (أ) تقارن الصور غير المضغوطة بالصور المضغوطة بواسطة JPEG AI، مما يظهر أن الضغط يزيد بشكل كبير من الارتباط بين القنوات؛ اللوحة (ب) تعزز تأثير المعالجة المسبقة لJPEG AI – فقط التحويل اللوني والتعيين – مما يظهر أن هذه الخطوة وحدها تزيد من الارتباطات بشكل ملحوظ؛ اللوحة (ج) تظهر أن الضغط التقليدي لJPEG يزيد أيضًا من الارتباطات قليلاً، ولكن ليس بنفس الدرجة؛ واللوحة (د) تختبر الصور الاصطناعية، مع Midjourney-V5 وAdobe Firefly التي تظهر زيادة معتدلة في الارتباط، في حين تبقى الأخرى أقرب إلى مستويات الصور غير المضغوطة.

معدل التشويه

يحدد دليل معدل التشويه إعادة ضغط JPEG AI عن طريق تتبع كيفية انخفاض جودة الصورة، المقاسة بواسطة نسبة الإشارة إلى الضوضاء القصوى (PSNR)، في نمط قابل للتنبؤ عبر ضغطات متكررة.

يجادل البحث بأن إعادة ضغط الصورة باستخدام JPEG AI يؤدي إلى خسائر تدريجية ولكنها قابلة للقياس في جودة الصورة، كما هو مقاس بواسطة PSNR، وأن هذا التدهور التدريجي ي形成 أساسًا لدليل جنائي للكشف عن إعادة الضغط.

على عكس JPEG التقليدي، حيث تتبع الطرق السابقة التغييرات في كتل الصورة المحددة، يتطلب JPEG AI نهجًا مختلفًا بسبب هيكله العصبي للضغط؛ لذلك يقترح المؤلفون مراقبة كيفية تطور معدل البت وPSNR مع الضغط المتكرر. كل جولة من الضغط يغير الصورة أقل من السابقة، وهذا التغيير المتقلص (عندما يتم رسمه مقابل معدل البت) يمكن أن يكشف عن إعادة الضغط:

تظهر صورة كيفية تأثير الضغط المتكرر على جودة الصورة عبر مختلف الكودات، وتظهر أن JPEG AI وcodec عصبية تم تطويرها في https://arxiv.org/pdf/1802.01436 يعرضان انخفاضًا مستمرًا في PSNR مع كل ضغط إضافي - حتى عند معدلات بت أقل. في المقابل، ي維ن الضغط التقليدي لJPEG جودة مستقرة نسبيًا عبر الضغطات المتعددة، ما لم يكن معدل البت مرتفعًا. هذا النمط يخدم كمثال على كيفية ترك إعادة الضغط أثرًا قابلًا للقياس في الكودات القائمة على الذكاء الاصطناعي، مما يوفر إشارة جنائية محتملة.

تظهر صورة كيفية تأثير الضغط المتكرر على جودة الصورة عبر مختلف الكودات، وتظهر أن JPEG AI وcodec عصبية تم تطويرها في https://arxiv.org/pdf/1802.01436 يعرضان انخفاضًا مستمرًا في PSNR مع كل ضغط إضافي – حتى عند معدلات بت أقل. في المقابل، ي維ن الضغط التقليدي لJPEG جودة مستقرة نسبيًا عبر الضغطات المتعددة، ما لم يكن معدل البت مرتفعًا.

في الصورة أعلاه، نرى منحنيات معدل التشويه لمعرفة تأثير الضغط المتكرر على جودة الصورة عبر مختلف الكودات، حيث يظهر أن JPEG AI وcodec العصبي يعرضان انخفاضًا مستمرًا في PSNR عبر جميع معدلات البت، في حين ي維ن الضغط التقليدي لJPEG جودة مستقرة نسبيًا عبر الضغطات المتعددة، ما لم يكن معدل البت مرتفعًا. هذا السلوك يوفر إشارة كمية يمكن استخدامها لتحديد الصور المضغوطة بإعادة ضغط JPEG AI.

من خلال استخراج كيفية تطور معدل البت وجودة الصورة عبر جولات الضغط المتعددة، بنى المؤلفون بمعنى ذلك توقيعًا يساعد في تحديد ما إذا كانت الصورة قد تم ضغطها مرة أخرى، مما يوفر إشارة جنائية محتملة في سياق JPEG AI.

الكمية

كما رأينا سابقًا، واحدة من أكثر المشاكل الجنائية الصعبة التي يثيرها JPEG AI هي تشابهه البصري مع الصور الاصطناعية المولدة بواسطة نماذج الانتشار. كلا النظامين يستخدمان هيكلاً مكونًا من محول وفك المحول لمعالجة الصور في فضاء باطن مضغوط، وغالبًا ما يتركان وراءهما آفات تحديث لطيفة.

تلك السمات المشتركة يمكن أن تضلل الكاشفين – حتى ceux الذين تم إعادة تدريبهم على صور JPEG AI. ومع ذلك، يبقى فرق هيكلي رئيسي: JPEG AI يطبق الكمية، وهو خطوة تقرب القيم الباطنة إلى مستويات منفصلة من أجل الضغط الفعال، في حين أن النماذج التوليدية عادة لا تفعل ذلك.

استخدمت الورقة الجديدة هذا الفرق لتصميم دليل جنائي يختبر بشكل غير مباشر وجود الكمية. طريقة التحليل لكيفية استجابة تمثيل الصورة الباطن للتقريب، على افتراض أن إذا كانت الصورة قد تم كميتها بالفعل، فإن هيكلها الباطن سيعرض نمطًا قابلًا للقياس من الانحياز نحو القيم المقطوعة.

تلك الأنماط، على الرغم من أنها غير مرئية للعين، تنتج فروقًا إحصائية يمكن أن تساعد في فصل الصور الحقيقية المضغوطة عن الصور الاصطناعية الكاملة.

مثال على متوسط طيف فورييه يظهر أن صور JPEG AI المضغوطة والصور المولدة بواسطة نماذج الانتشار مثل Midjourney-V5 وStable Diffusion XL تعرض أنماطًا شبكية منتظمة في المجال الترددي - آفات مرتبطة عادةً بالتحديث. في المقابل، تفتقر الصور الحقيقية إلى هذه الأنماط. هذا الت重م في الهيكل الطيفي يساعد في تفسير لماذا الأدوات الجنائية غالبًا ما ت混 الصور الحقيقية المضغوطة مع الصور الاصطناعية.

مثال على متوسط طيف فورييه يظهر أن صور JPEG AI المضغوطة والصور المولدة بواسطة نماذج الانتشار مثل Midjourney-V5 وStable Diffusion XL تعرض أنماطًا شبكية منتظمة في المجال الترددي – آفات مرتبطة عادةً بالتحديث. في المقابل، تفتقر الصور الحقيقية إلى هذه الأنماط. هذا الت重م في الهيكل الطيفي يساعد في تفسير لماذا الأدوات الجنائية غالبًا ما ت混 الصور الحقيقية المضغوطة مع الصور الاصطناعية.

من المهم أن يظهر المؤلفون أن هذا الدليل يعمل عبر نماذج توليدية مختلفة ويبقى فعالًا حتى عند ضغط قوي بما يكفي لإلغاء أقسام كاملة من الفضاء الباطن. في المقابل، تظهر الصور الاصطناعية استجابات أقل لاختبار التقريب هذا، مما يوفر طريقة عملية لتمييز بينهما.

النتيجة تهدف إلى أن تكون أداة خفيفة ويمكن تفسيرها تستهدف الفرق الأساسي بين الضغط والتوليد، بدلاً من الاعتماد على آفات سطحية هشة.

البيانات والاختبارات

الضغط

للتحقق من ما إذا كان دليل الارتباط اللوني يمكنه الكشف بشكل موثوق عن ضغط JPEG AI (أي المرور الأول من المصدر غير المضغوط)، قام المؤلفون باختبارها على صور غير مضغوطة عالية الجودة من قاعدة بيانات RAISE، وضغطوها عند مجموعة من معدلات البت، باستخدام تطبيق JPEG AI المرجعي.

قاموا بتدريب غابة عشوائية على الأنماط الإحصائية للارتباطات بين قنوات الألوان (特别 كيفية انحياز الضوضاء المتبقية في كل قناة مع البقية) ومقارنتها بغابة عشوائية خمسين تعلمت مباشرة على بيكسلات الصورة.

دقة الكشف عن ضغط JPEG AI باستخدام ميزات الارتباط اللوني، مقارنة عبر معدلات بت متعددة. الطريقة تكون الأكثر فعالية عند معدلات بت أقل، حيث تكون آفات الضغط أقوى، وتظهر تحسينًا أفضل في التعميم على مستويات الضغط غير المرئية من نموذج ResNet50 المرجعي.

دقة الكشف عن ضغط JPEG AI باستخدام ميزات الارتباط اللوني، مقارنة عبر معدلات بت متعددة. الطريقة تكون الأكثر فعالية عند معدلات بت أقل، حيث تكون آفات الضغط أقوى، وتظهر تحسينًا أفضل في التعميم على مستويات الضغط غير المرئية من نموذج ResNet50 المرجعي.

على الرغم من أن ResNet50 حقق دقة أعلى عندما كانت بيانات الاختبار قريبة من ظروف التدريب، إلا أنه واجه صعوبة في التعميم عبر مستويات الضغط المختلفة. في المقابل، أظهر نهج الارتباط اللوني، على الرغم من بساطته، موثوقية أكبر عبر معدلات البت، خاصة عند معدلات ضغط أقل حيث يكون تأثير المعالجة المسبقة لJPEG AI أقوى.

تؤكد هذه النتائج على أن من الممكن الكشف عن ضغط JPEG AI باستخدام إشارات إحصائية تظل قابلة للتفسير وقوية.

إعادة الضغط

للتحقق من ما إذا كان يمكن الكشف عن إعادة ضغط JPEG AI بشكل موثوق، قام الباحثون باختبار دليل معدل التشويه على مجموعة من الصور المضغوطة عند معدلات بت متنوعة – بعضها مضغوط مرة واحدة فقط والبعض الآخر مضغوط مرة ثانية باستخدام JPEG AI.

تضمن هذا النهج استخراج متجه ميزة ذي 17 بعدًا لتتبع كيفية تطور معدل البت وPSNR للصورة عبر ثلاث جولات من الضغط. هذا المجموعة من الميزات أدرجت كمية الجودة المفقودة في كل خطوة، وكيفية سلوك معدل الباطن ومعدل الهايبيربريور – مقاييس لا يمكن الوصول إليها بسهولة بواسطة أساليب البكسل التقليدية.

قاموا بتدريب غابة عشوائية على هذه الميزات ومقارنتها بنموذج ResNet50 تم تدريبه على قطع الصورة:

نتائج دقة التصنيف لغابة عشوائية تم تدريبها على ميزات معدل التشويه للكشف عن إعادة ضغط JPEG AI. الطريقة تعمل بشكل أفضل عندما يكون الضغط الأولي قويًا (أي عند معدلات بت أقل)، وتفوق باستمرار نموذج ResNet50 القائم على البكسل - خاصة في الحالات التي يكون فيها الضغط الثاني أخف من الأول.

نتائج دقة التصنيف لغابة عشوائية تم تدريبها على ميزات معدل التشويه للكشف عن إعادة ضغط JPEG AI. الطريقة تعمل بشكل أفضل عندما يكون الضغط الأولي قويًا (أي عند معدلات بت أقل)، وتفوق باستمرار نموذج ResNet50 القائم على البكسل – خاصة في الحالات التي يكون فيها الضغط الثاني أخف من الأول.

أثبتت الغابة العشوائية فعاليتها بشكل ملحوظ عندما كان الضغط الأولي قويًا (أي عند معدلات بت أقل)، مما يكشف عن فروق واضحة بين الصور المضغوطة مرة واحدة ومرتين. كما هو الحال مع الدليل السابق، عانى نموذج ResNet50 من صعوبة التعميم، خاصة عند اختباره على مستويات ضغط لم يرها خلال التدريب.

في المقابل، ظلت ميزات معدل التشويه مستقرة عبر مجموعة واسعة من السيناريوهات. ومن الملاحظ أن النهج يعمل حتى عند تطبيقه على codec عصبية آخر، مما يشير إلى أن الأساليب تعمم إلى ما وراء JPEG AI.

JPEG AI والصور الاصطناعية

لجولة الاختبار النهائية، قام المؤلفون باختبار ما إذا كانت ميزات الكمية يمكن أن تميز بين صور JPEG AI المضغوطة والصور الاصطناعية المولدة بواسطة نماذج مثل Midjourney وStable Diffusion وDALL-E 2 وGlide وAdobe Firefly.

لذلك، استخدموا جزءًا من قاعدة بيانات Synthbuster، مخلوطة بالصور الحقيقية من قاعدة بيانات RAISE مع صور مولدة من مجموعة من نماذج الانتشار والGAN.

أمثلة للصور الاصطناعية في Synthbuster، التي تم إنشاؤها باستخدام نصوص محفزة مستوحاة من الصور الطبيعية في قاعدة بيانات RAISE-1k. تم إنشاء الصور باستخدام نماذج انتشار مختلفة، مع نصوص محفزة مصممة لإنتاج محتوى وتنسيقات واقعية بدلاً من صور فنية أو فنية، مما يعكس تركيز القاعدة على اختبار أساليب التمييز بين الصور الحقيقية والمولدة.

أمثلة للصور الاصطناعية في Synthbuster، التي تم إنشاؤها باستخدام نصوص محفزة مستوحاة من الصور الطبيعية في قاعدة بيانات RAISE-1k. تم إنشاء الصور باستخدام نماذج انتشار مختلفة، مع نصوص محفزة مصممة لإنتاج محتوى وتنسيقات واقعية بدلاً من صور فنية أو فنية. المصدر: https://ieeexplore.ieee.org/document/10334046

تم ضغط الصور الحقيقية باستخدام JPEG AI عند عدة مستويات من معدلات البت، وتم صياغة التصنيف على أنه مهمة ثنائية: إما JPEG AI مقابل مولد معين، أو معدل بت معين مقابل Stable Diffusion XL.

تم حساب ميزات الكمية (الارتباطات المستخرجة من التمثيلات الباطنة) من منطقة ثابتة بحجم 256×256 وتم تغذيتها إلى مصنف الغابة العشوائية. كمرجع، تم تدريب نموذج ResNet50 على قطع البكسل من نفس البيانات.

دقة التصنيف لمصنف الغابة العشوائية باستخدام ميزات الكمية لتمييز صور JPEG AI المضغوطة عن الصور الاصطناعية.

دقة التصنيف لمصنف الغابة العشوائية باستخدام ميزات الكمية لتمييز صور JPEG AI المضغوطة عن الصور الاصطناعية.

عبر معظم الظروف، تفوقت الطريقة القائمة على الكمية على نموذج ResNet50 المرجعي، خاصة عند معدلات بت أقل حيث كانت آفات الضغط أقوى.

يقول المؤلفون:

‘نموذج ResNet50 المرجعي يؤدي بشكل أفضل لصور Glide بنسبة دقة 66.1٪، لكنه يعمم أسوأ من ميزات الكمية. ميزات الكمية تظهر تعميمًا جيدًا عبر قوة الضغط ومختلف أنواع المولدين.

‘أهمية المعاملات التي تم كميتها إلى الصفر تظهر في الأداء المتميز للسمات المقطوعة، والتي في العديد من الحالات تؤدي أداءً مشابهًا لمصنف ResNet50.

‘然而، ميزات الكمية التي تستخدم المتجه الكامل غير المقطوع لا تزال تؤدي بشكل أفضل بشكل ملحوظ. هذه النتائج تؤكد أن كمية الصفر بعد الكمية هي دليل هام لتمييز الصور المضغوطة بالذكاء الاصطناعي والصور المولدة بالذكاء الاصطناعي.

‘ومع ذلك، يظهر أيضًا أن عوامل أخرى تساهم. دقة المتجه الكامل لتحديد JPEG AI تتجاوز 91.0٪ لجميع معدلات البت، والضغط الأقوى يؤدي إلى دقة أعلى.’

تمثيل الفضاء المميز باستخدام UMAP أظهر فصلًا واضحًا بين صور JPEG AI والصور الاصطناعية، مع زيادة المسافة بين الطبقات عند معدلات بت أقل. كان Glide هو المخترق المستمر، حيث تم تجميع صوره بشكل مختلف وكان له أقل دقة للكشف.

تمثيل ثنائي الأبعاد لصور JPEG AI والصور الاصطناعية باستخدام ميزات الكمية. اللوحة اليسرى تظهر أن معدلات بت أقل لJPEG AI تزيد من المسافة عن الصور الاصطناعية؛ اللوحة اليمنى، كيف تتشكل صور مختلفة من المولدين بشكل مختلف داخل فضاء الميزات.

تمثيل ثنائي الأبعاد لصور JPEG AI والصور الاصطناعية، باستخدام ميزات الكمية. اللوحة اليسرى تظهر أن معدلات بت أقل لJPEG AI تزيد من المسافة عن الصور الاصطناعية؛ اللوحة اليمنى، كيف تتشكل صور مختلفة من المولدين بشكل مختلف داخل فضاء الميزات.

أخيرًا، قام المؤلفون بتقييم كيفية ثبات الميزات تحت المعالجة اللاحقة الشائعة، مثل إعادة ضغط JPEG أو التقليل من الحجم. على الرغم من أن الأداء انخفض مع المعالجة الأقوى، كان الانخفاض تدريجيًا، مما يشير إلى أن النهج يحتفظ ببعض المتانة حتى في ظروف تدهور.

تقييم متانة ميزات الكمية تحت المعالجة اللاحقة، بما في ذلك إعادة ضغط JPEG (JPG) وتقليل حجم الصورة (RS).

تقييم متانة ميزات الكمية تحت المعالجة اللاحقة، بما في ذلك إعادة ضغط JPEG (JPG) وتقليل حجم الصورة (RS).

الختام

ليس من المؤكد أن JPEG AI سوف يتم تبنيه على نطاق واسع. من بين الأشياء الأخرى، هناك الكثير من الديون الهيكلية التي يمكن أن تفرض احتكاكًا على أي كودك جديد؛ وحتى كودك تقليدي ذو سلالة جيدة ووافقة عامة على قيمته، مثل AV1، يواجه صعوبة في إزاحة الأساليب التقليدية الحالية.

فيما يتعلق بالصراع المحتمل بين النظام والمولدات الذكية، قد تقلل الآفات المميزة للكمية التي تساعد على الكشف عن جيل الذكاء الاصطناعي الحالي في النهاية، أو قد يتم استبدالها بآثار من نوع آخر، في أنظمة لاحقة (افتراضًا أن المولدين الذكاء الاصطناعي سوف يترك دائمًا أثرًا جنائيًا، وهو ما لا يعد أمرًا مؤكدًا).

هذا سوف يعني أن سمات الكمية الخاصة بJPEG AI، ربما جنبًا إلى جنب مع أدلة أخرى تم تحديدها بواسطة الورقة الجديدة، قد لا تتعارض في النهاية مع مسار الأدلة الجنائية لأنظمة الذكاء الاصطناعي الجديدة الأكثر فعالية.

إذا، مع ذلك، استمر JPEG AI في العمل كـ غسيل ذكاء اصطناعي حقيقي، مما يضفي ضبابية كبيرة على الفرق بين الصور الحقيقية والصور المولدة، فسوف يكون من الصعب تقديم حجة مقنعة لاعتماده.

نُشر لأول مرة يوم الثلاثاء، 8 أبريل 2025

كاتب في التعلم الآلي، متخصص في مجال合成 الصور البشرية. سابقًا رئيس محتوى البحث في Metaphysic.ai، حتى انحلت في DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai