زاوية Anderson

حتى النماذج اللغوية الرائدة معرضة للترجمة “التفسيرية”

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
AI-generated image (GPT-2): a construction worker wearing a tool belt stands beneath scaffolding, holding a printed job sheet and scratching his head while facing a large stone wall engraved with a partially completed version of the United States Declaration of Independence in which numerous words have been mistakenly replaced with incorrect alternatives, ending at the word 'foam'. A workbench holding chisels and a hammer stands in the foreground, with stone dust scattered below the unfinished carving. The photorealistic scene is surrounded by a yellow-and-black warning-style border labeled 'AI FANTASY INSIDE' along the top and right edges and 'REALITY OUTSIDE' along the bottom and left edges, with black directional arrows pointing inward.

تظهر الأبحاث الجديدة من أمازون أن النماذج الأذكى أكثر احتمالاً للذهاب “ال额ض” عند الطلب للقيام بتعرف الحروف البصرية.

 

يعتبر تعرف الحروف البصرية (OCR) مشكلة محلة في الغالب. إذا قمت بفحص بعض النص أو تقديم صورة للنص إلى نظام OCR، يقوم بتنفيذ فردية متقنة لكل حرف، مما يجعل أفضل تخمين يمكنه على أساس كل حرف:

الزونينغ من المواقع المميزة في حرف مقسم تم تحديده (مصدر - https://home.nr.no/~eikvil/OCR.pdf)؛ الصورة الرئيسية: نتيجة التجزئة لمخزن مؤسسي (مصدر - https://ijarse.com/ADMIN/admin/postimages/images/fullpdf/1473863345_515_IJARSE.pdf)

الزونينغ من المواقع المميزة في حرف مقسم تم تحديده (مصدر)؛ الصورة الرئيسية: نتيجة التجزئة لمخزن مؤسسي (مصدر).

يقرأ نظام OCR الحروف بشكل فردي؛ تلك الحروف، في قرب كافٍ، قد تشكل كلمات أو هياكل لغوية أخرى. نظام OCR لا يهتم؛ في الوقت الذي تظهر فيه تلك القضايا، يكون قد غادر الباب وانتقل إلى الوظيفة التالية، لأن تصحيح الإملاء لا يقع ضمن نطاقه.

أحد أنظمة OCR الأكثر شعبية هو نظام Tesseract القديم، وهو مترجم خوارزمي صارم، يستخدم على نطاق واسع في مجموعة متنوعة من التطبيقات مفتوحة المصدر والتدفقات العمل. مع مجموعة واسعة من إضافات OCR الخوارزمية “المستوية” المتاحة عبر جميع أنظمة التشغيل، أصبحت القدرة على تحويل نص الصورة مرة أخرى إلى نص قابل للتعديل قد وصلت إلى وضع سلعة مجانية – حتى لو لم يكن هناك نظام خالي من العيوب أو الخدع.

بالإضافة إلى ذلك، من أجل البقاء ذا صلة، قامت المنظمات والمنتجات التجارية التقليدية التي تتنافس في مجال OCR الخوارزمي بتحويل الأنظمة التراثية إلى نظم إدارة المستندات التي تعمل بمساعدة الذكاء الاصطناعي. ومع ذلك، تظل التكنولوجيا الأساسية – إخراج مجموعات مقدرة من الحروف المقسمة والمحددة – دون تغيير.

كلمة lên

إلى جانب عدد متزايد من المهام، يُدار OCR بشكل متزايد بواسطة جيل جديد من نماذج اللغة البصرية (VLMs)؛ عندما يواجهون نصًا غير قابل للتعديل أو مصورًا، يمكن للنسخ الفعّالة من هذه الأنظمة الحديثة قراءة وترجمة كما هو مطلوب.

然而، وفقًا لورقة بحثية جديدة من أمازون، أولئك الذين يعتقدون أن الذكاء الاصطناعي سيتكرر بالضبط نفس الوظيفة مثل OCR قد يكونون في حالة مفاجأة: لقد وجدت الدراسة الجديدة أن نموذج LLM المفضل لديك من المرجح أن “يذهب إلى الأمام” في النسخ، سواء كنت ترغب في ذلك أم لا؛ يتجاوز السياق لكل حرف إلى سياق كل كلمة – وتصحيح أي “أخطاء” يجدونها، بطرق قد يكون لها عواقب غير مرغوب فيها في مجالات مثل القانون والطب والترجمة التاريخية.

يؤكد المؤلفون:

‘نماذج اللغة البصرية (VLMs) تستخدم بشكل متزايد بدلاً من خطوط OCR التقليدية لمعالجة المستندات.

‘نحن نُظهر أنها لا تعمل دائمًا كمنسخين مخلصين: عندما يكون النص غير كامل، غالبًا ما يميلون إلى إعادة كتابته في شكل أكثر قبولًا – سلوك لا يمكن للbenchmarks النظيفة للنص أن تكتشفه.’

يقدم المؤلفون مجموعة بيانات جديدة منضبطة ومعيارية بعنوان FaithC4، والتي اختبروها عبر مجموعة من 15 نموذج مفتوح ومغلق، بما في ذلك إصدارات من ChatGPT وGoogle Gemini.

وجدوا أن نماذج الذكاء الاصطناعي العامة كانت أكثر احتمالاً من أنظمة OCR التقليدية لاستبدال الكلمات غير الكاملة بكلمات أكثر “مثيرة للتصديق”، أحيانًا بإعادة كتابة ما يقرب من 65٪ من الكلمات المضطربة، بينما تسبب الأخطاء المحلية الصغيرة في أخطاء أخرى في النص الصحيح.

الكلمات القصيرة كانت أكثر عرضة بشكل خاص، والتعليمات الصريحة لا لتصحيح الأخطاء قللت من المشكلة، على الرغم من أنها لم تحذفها.

تُشير الورقة إلى*:

‘في حين يمكن أن يكون سلوك الإعادة الكتابة مفيدًا لاستعادة بعض الأخطاء الحقيقية، فقد يكون مشكلة في بعض المجالات التي قد تتطلب نسخًا حرفيًا، مثل المستندات القانونية والسجلات الطبية والمنشورات التاريخية.

‘على الرغم من أهميته، تم تجاهل هذا السلوك إلى حد كبير في أبحاث VLM. benchmarks OCR الحالية تركز على التعرف على النص النظيف وبالتالي ليست كافية لتحقيق كيفية عمل النماذج مع المدخلات غير الكاملة.’

الرسالة المركزية هي أن الأنظمة الذكية الأكثر تقدمًا تعاني من صعوبة في عدم تصحيح الأخطاء التي يمكن أن تؤدي أنظمة OCR الخوارزمية إلى تسليمها “نصًا خامًا”؛ في许多 الحالات، فإن التفسير البشري ضروري لتحديد المشكلة؛ ولكن إذا تم تطبيق “تصحيح” غير صحيح بالفعل، فإن المشكلة تميل إلى الانزلاق تحت رادار معظم أنظمة الفحص.

الورقة الجديدة بعنوان هل تقرأ نماذج VLM أو تكتب؟ حول إخلاص النسخ في نماذج اللغة والرؤية، وتأتي من خمسة باحثين في أمازون.

البيانات والطريقة

为了 ملء قاعدة بياناتهم المعيارية، استخدم المؤلفون Colossal Cleaned Crawled Corpus – المعروف باسم C4 – مجموعة ويب كبيرة تم جمعها في عام 2020. من هذه المجموعة، تم اختيار 1,455 وثيقة فردية عبر اللغات الإنجليزية والصينية والكورية، مع كل مقطع بحجم مناسب لتناسب صفحة واحدة.

احتوى المعيار النهائي على 500 وثيقة إنجليزية و 500 وثيقة صينية و 455 وثيقة كوريا، مما يوفر قاعدة اختبار متعددة اللغات لقياس ما إذا كانت أنظمة الذكاء الاصطناعي تقلد النص بدقة، أو في بعض الطرق تكتبها.

为了 اختبار ما إذا كان النماذج سوف تنسخ بدقة ما تراه، تم إدخال أخطاء خاضعة للسيطرة في الوثائق قبل أن يتم تقديمها كصور، مع تغيير حوالي 8٪ من الكلمات المؤهلة، كل واحدة تحتوي على أربعة أحرف على الأقل. تم استخدام الإصدارات غير المعدلة من هذه الوثائق كحقيقة أساسية.

ثم تم تطبيق ثلاثة متغيرات من التحوير: إخلال يخلط الأحرف الداخلية للكلمات مع الحفاظ على الأحرف الأولى والakhir؛ عشوائي يُستبدل كل حرف بعبارة عشوائية من نفس نظام الكتابة؛ و بصري يحل محل الأحرف البصرية المماثلة التي تظل معقولة للعين، مع تغيير النص الأساسي.

تم استبعاد متغير إخلال في الإصدار الصيني لأن نظام الكتابة الخاص به يفتقر إلى كلمات مفصولة بمسافات، وبدلاً من ذلك يستخدم نوافذ ثابتة من أربعة أحرف للتحويرات الأخرى؛ بالإضافة إلى ذلك، فإن متوسط طول الكلمة الأقصر في اللغة الكورية يعني أن عددًا أقل من الكلمات مؤهلة للتعديل.

ثم تم تقديم كل وثيقة كصفحة PDF إلى أنظمة النسخ المنافسة.

الاختبارات

غطت الاختبارات دراسة شاملة لجميع النماذج العامة المغلقة، وهي GPT-5.4-mini؛ Gemini-3-Flash؛ و Gemini-2.5-Flash؛ والنماذج مفتوحة المصدر، بما في ذلك النماذج العامة Qwen3.5-4B؛ Qwen3-VL-4B؛ InternVL3.5-4B؛ Gemma4-E4B؛ و Gemma4-E2B.

بالإضافة إلى ذلك، تم تضمين نماذج OCR المتخصصة، بما في ذلك olmOCR-2-7B؛ DeepSeek-OCR-2؛ MinerU2.5-Pro؛ PaddleOCR-VL-1.5؛ و LightOnOCR-2-1B. وأخيرًا، تم اختبار محركات OCR التقليدية Tesseract و docTR أيضًا.

تعتمد المجموعات الثلاث على اللغة بدرجات مختلفة: تعتمد نماذج الذكاء الاصطناعي العامة بشكل كبير على المعرفة اللغوية الواسعة المكتسبة خلال التدريب المسبق؛ تضع نماذج OCR المتخصصة تركيزًا أكبر على نسخ المستندات بدقة من خلال التدريب المحدد للمهمة؛ وتعتمد أنظمة OCR التقليدية على التعرف على الأحرف بدلاً من الاستدلال اللغوي.

تم تبني两个 معايير، بدءًا من معدل الخطأ الكلمة (WER)، وهو معيار OCR القياسي لتحديد عدد الكلمات الكاملة التي نسخها النظام بشكل غير صحيح. بدلاً من مجرد حساب الأحرف الخاطئة، يسجل WER الاستبدالات والحذف والإدخال بالنسبة إلى النص الأصلي، مما يجعله حساسًا لكل من الكلمات الخاطئة والكلمات التي تم حذفها أو إضافتها.

对于 الصينية، حيث لا يتم فصل الكلمات بمسافات، تم تطبيق نفس النهج على مستوى الحرف، ك معدل الخطأ الحرف (CER).

为了 التقاط الأخطاء الأكثر دقة، تم استخدام معيار تشابه المسافة التعديلية (EDS). يقارن EDS النص المتوقع بالنص الأصلي على مستوى الحرف، و – على عكس WER – يمكنه التمييز بين كلمة خاطئة تمامًا وكلمة تختلف فقط ب حرف أو حرفين. هذا يجعلها مفيدة لاكتشاف الأخطاء القريبة، بالإضافة إلى إعادة الكتابات الجزئية التي قد تظهر مشابهة.

كما هو موضح في الرسم البياني أدناه، أثبتت أنظمة OCR التقليدية أنها الأكثر مقاومة لجميع أنواع التحوير، مع فقدان قليل في الدقة لأنها تعتمد في الغالب على التعرف على الأحرف الفردية بدلاً من محاولة استنتاج الكلمات من السياق:

التغييرات في معدل الخطأ الكلمة (اليسار) ومتوسط المسافة التعديلية (اليمين) عبر الإنجليزية والصينية والكورية بعد تطبيق ثلاث طرق تحوير النص. أظهرت أنظمة OCR التقليدية انخفاضًا صغيرًا في الأداء بشكل عام، بينما احتلت نماذج OCR المتخصصة وسط الأرض، في حين كانت نماذج الذكاء الاصطناعي العامة الأكثر تأثرًا بالنص التالف.

التغييرات في معدل الخطأ الكلمة (اليسار) ومتوسط المسافة التعديلية (اليمين) عبر الإنجليزية والصينية والكورية بعد تطبيق ثلاث طرق تحوير النص. أظهرت أنظمة OCR التقليدية انخفاضًا صغيرًا في الأداء بشكل عام، بينما احتلت نماذج OCR المتخصصة وسط الأرض، في حين كانت نماذج الذكاء الاصطناعي العامة الأكثر تأثرًا بالنص التالف. مصدر

احتلت نماذج OCR المتخصصة الأرض الوسطى؛ ظلت MinerU و LightOn متينتين؛ وأظهرت olmOCR و DeepSeek-OCR حساسية أكبر للنص التالف، مما يشير إلى أن التدريب المحدد للمهمة قد قلل من، ولكن لم يُزيل، ميلًا إلى إعادة تفسير ما يتم قراءته.

أدت نماذج الذكاء الاصطناعي العامة أسوأ أداء بشكل عام، مع زيادة كبيرة في أخطاء النسخ عند مواجهة نص معيب. تعرض معظمهم لانخفاض أكبر بكثير من أي من نماذج OCR المتخصصة أو أنظمة OCR التقليدية – على الرغم من أن Gemini-3-Flash كان استثناءً ملحوظًا، حيث أدى أداءً مشابهًا لأنظمة OCR التقليدية.

بشكل عام، كانت التصنيفات متوافقة بشكل وثيق مع درجة الاعتماد على المعرفة اللغوية لكل نموذج، مع وجود صلات لغوية أقوى تتوافق مع ميل أكبر لإعادة كتابة النص بدلاً من مجرد نسخة.

أظهرت قائمة أخطاء، كما هو موضح في الجدول أدناه، أن أنظمة OCR التقليدية أنتجت في الغالب أخطاء نسخ تقليدية، مثل الاستبدال والإدخال والحذف:

النتائج من اختبار 'إخلال' الإنجليزي، تظهر كيف وزعت كل نظام نسخ أخطائه عبر إعادة كتابته الدقيقة، ونسخ قريبة ('قريبة'), وأخطاء نسخ أكثر جوهرية ('متوسطة')، وخرافات خاطئة ('خاطئة'). تم ترتيب النماذج حسب معدل إعادة كتابتهم للكلمات التالفة.

النتائج من اختبار ‘إخلال’ الإنجليزي، تظهر كيف وزعت كل نظام نسخ أخطائه عبر إعادة كتابته الدقيقة، ونسخ قريبة (‘قريبة’), وأخطاء نسخ أكثر جوهرية (‘متوسطة’)، وخرافات خاطئة (‘خاطئة’). تم ترتيب النماذج حسب معدل إعادة كتابتهم للكلمات التالفة.

على العكس من ذلك، كانت نماذج الذكاء الاصطناعي العامة أكثر احتمالاً لاستبدال الكلمات التالفة ببدائل معقولة مع الحفاظ على الجملة المحيطة، مما يوفر دليلًا قويًا على أنها لا تقرأ فقط النص التالف، بل تكتب أيضًا باستخدام السياق اللغوي.

كما وجدت الدراسة أن أخطاء النسخ لم تظل محصورة في الكلمات التالفة:

نتائج تحليل انتشار الأخطاء، تظهر معدلات الخطأ للكلمات بعد كل نوع من أنواع التحوير. تغيير حوالي 4.7٪ من الكلمات في وثيقة إنجليزية زاد معدلات الخطأ بشكل كبير في النص غير المعدل المحيط.

نتائج تحليل انتشار الأخطاء، تظهر معدلات الخطأ للكلمات بعد كل نوع من أنواع التحوير. تغيير حوالي 4.7٪ من الكلمات في وثيقة إنجليزية زاد معدلات الخطأ بشكل كبير في النص غير المعدل المحيط.

كما هو موضح في الجدول أعلاه والرسم البياني أدناه، أدى تغيير حوالي 4.7٪ من الكلمات في وثيقة إنجليزية إلى زيادة كبيرة في معدلات الخطأ في النص غير المعدل المحيط:

نتائج إضافية من تحليل انتشار الأخطاء، تظهر زيادة في أخطاء النسخ على كلا النصوص التالفة وغير التالفة بعد كل نوع من أنواع التحوير. أظهرت نماذج الذكاء الاصطناعي العامة أكبر زيادة في معدلات الخطأ، مع انتشار الأخطاء بشكل متكرر إلى ما وراء الكلمات الأصلية التالفة.

نتائج إضافية من تحليل انتشار الأخطاء، تظهر زيادة في أخطاء النسخ على كلا النصوص التالفة وغير التالفة بعد كل نوع من أنواع التحوير. أظهرت نماذج الذكاء الاصطناعي العامة أكبر زيادة في معدلات الخطأ، مع انتشار الأخطاء بشكل متكرر إلى ما وراء الكلمات الأصلية التالفة.

نماذج VLM العامة كانت الأكثر تأثرًا، مع زيادة معدلات الخطأ في الكلمات غير المعدلة بنسبة تصل إلى عشرة أضعاف من الأساس. على العكس من ذلك، أظهرت أنظمة OCR التقليدية زيادات متواضعة فقط. النماذج التي أعادت كتابة أعلى نسبة من الكلمات التالفة أظهرت أيضًا أكبر انتشار للأخطاء، مما يشير إلى أن كلا السلوكين ينبعان من نفس الاعتماد على السياق اللغوي.

في الممارسة العملية، هذا يعني أن كمية صغيرة من النص التالف يمكن أن يؤدي إلى تعريض دقة وثيقة سليمة للخطر، مما يجعل علامات النسخ النظيفة غير موثوقة كدليل على إخلاص النسخ في العالم الحقيقي.

أخيرًا، قام المؤلفون أيضًا بفحص ما إذا كان طول الكلمة يؤثر على سلوك إعادة الكتابة، ووجدوا أن الكلمات القصيرة كانت أكثر عرضة بشكل كبير من الكلمات الأطول.

بسبب احتوائها على أدلة بصرية أقل، تظهر الكلمات القصيرة أنها تشجع نماذج VLM على الاعتماد بشكل أكبر على معرفة اللغة السياقية – مما يزيد من احتمال استبدال النص التالف ببديل معقول بدلاً من نسخها حرفيًا (الذي قد يؤدي إلى تنبيه بشري للرقابة).

كما وجد المؤلفون أن توجيه النماذج لا لتصحيح الأخطاء قلل من هذا الميل، على الرغم من أنه لم يُزيله. هذا يبدو أنه يشير إلى أن النسخ التفسيري هو سمة متأصلة في نماذج VLM الحالية، chứ không سلوك يمكن كبته بشكل موثوق عبر التوجيه فقط.

يخلص المؤلفون إلى:

‘对于 التطبيقات التي تتطلب نسخًا حرفيًا، مثل معالجة المستندات القانونية، وتحويل المخطوطات التاريخية إلى رقمي، والتحقيقات، تظل أنظمة OCR التقليدية أو نماذج VLM المتخصصة في OCR هي الخيار الأكثر أمانًا، في حين تقدم نماذج VLM العامة إعادة كتابة منهجية لا يتم 捕获ها من خلال معايير النص النظيف.’

الاستنتاج

تكرر هذه الدراسة ما يصبح خيطًا متكررًا في أدبيات LLM: أن نماذج VLM الم

كاتب في التعلم الآلي، متخصص في مجال合成 الصور البشرية. سابقًا رئيس محتوى البحث في Metaphysic.ai، حتى انحلت في DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai