زاوية Anderson
ChatGPT-5 و Gemini 2.5 يخلقان هلوسات في 40% من استفسارات الغرف الإخبارية التي تم اختبارها

يتفوق برنامج NotebookLM من جوجل بنسبة 13%، وهي نسبة قد تُؤدي إلى فصل أي صحفي.خلصت الدراسة إلى أن النماذج غالبًا ما تشوه المصادر بتحويل الآراء إلى حقائق وحذف الإسناد، مما يجعلها أدوات غير موثوقة في مجال الصحافة. ويدعو الباحثون إلى تطوير أدوات أفضل وأكثر تخصيصًا لهذه المهام. وقد شهدت نماذج اللغة الكبيرة انتشارًا سريعًا في الصحافة مؤخرًا، في بيئات عمل خفضت التكاليف والميزانيات وتقليص عدد الموظفين منذ تراجع الصحافة التقليدية.
دراسة جديدة تظهر أن ChatGPT-5 و Google Gemini يخلقان هلوسات في 40% من استفسارات الغرف الإخبارية، وغالبًا ما يخترعان ادعاءات متأكدة غير مدعومة بالحقائق القابلة للتحقق. المحلية ثلاثة قرون من التقاليد في عملية لا يمكن إيقافها بدأت في أوائل عام 2000 . في الواقع، كان Terrain بالفعل خصبة، منذ أن اعتادت وسائل الإعلام على تقليص الوظائف من خلال “الابتكار” منذ ما لا يقل عن المدخل المتضطرب للتركيب الرقمي في الثمانينيات، بالإضافة إلى التحديات السابقة من ادخال الراديو والتلفزيون . لم يكن مسار الذكاء الاصطناعي إلى غرف الأخبار ووسائل الإعلام خاليًا من العوائق، ومع ذلك؛ في سياق 55% من الشركات التي تندم على استبدال البشر بالذكاء الاصطناعي، وتتنبأ تتوقع مؤسسة غارتنر أن تُسرّع المؤسسات بشكل ملحوظ خططها لتبني الذكاء الاصطناعي خلال عامين.وقد بدأت بعض المؤسسات الإخبارية بالفعل في ذلك. بإعادة توظيف الصحفيين الذين تم استبدالهم بالذكاء الاصطناعي، حيثأصبحت عيوب واضحة وأحيانًا محرجة للبديل البديل.
الخطأ ليس بشريًا فقط
على الرغم من أن الهلوسات أثبتت أنها مشكلة كبيرة في المجالات التي يتطلب فيها الاقتباس الدقيق، مع الانتباه العام للفشل في الحالات العامة في القانون والبحث و الصحافة ، تظهر دراسة أمريكية جديدة أن الذكاء الاصطناعي في الصحافة يواجه تحديات أوسع مما كان متوقعًا. قيمت أبحاث المؤلفين ChatGPT و Google Geminiو NotebookLM المُركّزعلى الاقتباس على مهمة نمطية في تقرير: باستخدام مجموعة وثائقية تضم 300 وثيقة تركز على القضايا القانونية والسياسية المتعلقة بتطبيق تيك توك في الولايات المتحدة، قام الباحثون بتحليل الوثائق المقدمة وعرضها، ثم قاموا بتحليل النتائج باستخدام تصنيف مصمم لتقييم نوع ومدى الهلوسات. في جميع المخرجات، احتوت 30% منها على هلوسة واحدة على الأقل، بينما أظهر كل من ChatGPT وGemini معدل هلوسة بلغ 40%، أي ما يزيد قليلاً عن ثلاثة أضعاف معدل الهلوسات في معدل الخطأ البالغ 13% ل NotebookLM. بدلاً من اختراع الحقائق أو الكيانات، يشير الباحثون إلى أن النماذج غالبًا ما أظهرت ثقة تفسيرية زائدة ، بإضافة تصنيفات غير مدعومة للمصادر وتحويل الآراءالمنسوبة إلى عبارات عامة: ‘نوعيًا، لم تتضمن معظم الأخطاء اختراع
كيانات أو أرقام؛ بدلاً من ذلك، لاحظنا ثقة تفسيرية زائدة – النماذج أضافت تصنيفات غير مدعومة للمصادر وtransformed الآراء المنسوبة إلى عبارات عامة. ‘ ‘تظهر هذه الأنماط اختلافًا أساسيًا
في المismatch Epistemological: في حين أن الصحافة تتطلب مصدرًا صريحًا لكل ادعاء، فإن النماذج اللغوية تولد نصًا يبدو مسؤولاً بغض النظر عن الدعم الإدلوجي. ‘
تمديدات محددة للصحافة إلى تصنيفات الهلوسات الحالية ونحاجج إلى أن الأدوات الفعالة في غرف الأخبار تحتاج إلى هياكل تفرض الإسناد الدقيق بدلاً من تحسين السلاسة. ‘ الدراسة
‘نقترح الجديدة ،وهي قراءة مثيرة للاهتمام ولكن قصيرة في خمس صفحات، بعنوان ولكن ليس خطأ: تفاخر LLM في الاستفسارات القائمة على الوثائق، وهي تأتي من ثلاثة باحثين عبر جامعة نورث وسترن وجامعة مينيسوتا. غير صحيح،
النظرية والطريقة
يُعتبر السبب الدقيق للهلوسات متنازعًا عليه في أوقات مختلفة؛ على الرغم من أن معظم النظريات توافق على أن جودة البيانات و/أو التوزيعات هي عامل مساهم في وقت التدريب، فقد تم يشير هذا إلى أن 100% من مخرجات LLM قد تكون في جوهرها هلوسات (باستثناء بعض هذه الهلوسات التي تتوافق معالواقع).يشير
المؤلفون إلى ما يلي: † ‘من وجهة النظر الفنية، تنشأ الهلوسات من قدرة LLMs على توليد نص يتبع الأنماط الشائعة دون امتلاك فهم لما هو صحيح. هذا يؤدي إلى استجابات تبدو معقولة ولا تعكس الواقع – على سبيل المثال، قانون LLM مخترع يظهر فيالحجج
. قادرة ‘ قسم البحث، كما يشير الورقة، قد استكشف عددًا من الطرق لتحسين أو فهم هلوسات LLM، والتي تميل إلى أن تقع فيثلاثة
. ‘ ‘و بينما زادت قدرات LLM بشكل كبير خلال الخمس سنوات الماضية، لا تزال الهلوسات مشكلة، وفي بعض الحالات حتى زيادة مع زيادة قدرة النماذج تقولهمجالات رئيسية: أولًا، في ، يمكن أن تكون النماذج مدعومة بمصادر خارجية مثل قواعد البيانات أو مجموعات الوثائق أو محتوى الويب لدعم ادعاءاتها. السياق هذا يعمل جيدًا عندما تكون المواد موثوقة و كاملة، ولكن الفجوات أو المعلومات القديمة أو رديئة الجودة لا تزال تسبب أخطاء؛ كما أن النماذج لديها عادة إصدار تصريحات واثقة تتجاوز ما يقع عبء التحقق المصادر فعليًا. ثانيًا، يشير إلى استخدام تعليمات مدروسة لتقديم النماذج. هذا يمكن أن يشمل طلب من النماذج للتحقق من أدلتهم، أو كسر المهام إلى خطوات أصغر، أو اتباع صيغ أكثر صرامة. في بعض الأحيان، يتم توجيه النماذج لمراجعة عملها الخاص أو مقارنة استجابات متعددة. التحفيز والفك يمكن أن تكتشف هذه التقنيات الأخطاء، ولكنها تزيد أيضًا من التكاليف، وأحيانًا تفشل في اكتشاف الأخطاء الدقيقة؛ لذلك، بدون التحقق الموثوق من الأدلة، لا يزال انتشار المعلومات الكاذبة. على المستخدم. ثالثًا، يشير إلى إعطاء LLMs وصولًا إلى الموارد التي يمكن أن تدعم التحقق، مثل محركات البحث أو الحاسبات – على الرغم من أن الدقة يمكن أن تتحسن أيضًا عند تدريب النماذج على بيانات موثوقة أو عند بناء ميزات الاقتباس. النماذج والأدوات ومع ذلك، هذه التدابير ليست كافية، ولا تزال تعتمد على جودة المصادر ووضوح الإرشادات والرقابة البشرية، لمنع
تيك توك
لتحديد المناهج التي قد تكون مفيدة فعليًا للصحفيين، أجرت الدراسة تقييمات مصممة لتعكس سير العمل ومعايير غرف الأخبار. تم اختبار نماذج رائدة باستخدام استراتيجيات تحفيز شائعة وإعدادات تثبيت المستندات، وذلك لقياس كل من تكرار الأخطاء الناتجة عن الهلوسة وأدائها، بالإضافة إلى تحديد دلالات هذه الأخطاء على دمج الذكاء الاصطناعي في غرف الأخبار. ركز التحليل على نوع الاستقصاء القائم على المستندات، وهو ما يميز الصحافة الاستقصائية والبحثية.سعى الباحثون إلى إعداد مجموعة وثائقية تعكس مشروع غرف الأخبار الصغيرة والمتوسطة الحجم، ولكنها في الوقت نفسه كبيرة بما يكفي لاستيعاب التعقيد الحقيقي للتقارير؛ ولهذا الغرض، اختاروا الجهود القانونية الجارية لحظر تطبيق تيك توك في الولايات المتحدة. تم جمع الوثائق من و واشنطن بوست و نيويورك تايمز و بروكوست ، مما أدى إلى مجموعة تضم 300وثائقية تتكون منوثيقة أوراقخمسة تعتمدأكاديمية و 150 مقالًا صحفيًا و 145 إيداع قانوني (مع توافر المجموعة الكاملة للباحثين الأكاديميين عند الطلب من خلال ويستلو مستودع المشروع). نظرًا لأن استجابات LLM بشكلكبير على كيفية صياغة التحفيز، وكيفية تقديم السياق، صمم المؤلفون خمس استفسارات تتراوح من عامة جدًا إلى محددة جدًا – من أسئلة عامة حول حظر تيك توك إلى تحفيزات مفصلة تطلب شهادة من قضايا محددة. تم تغيير عدد الوثائق المقدمة لكل نموذج عند 10 و 100 – أو جميع 300 من مجموعة الوثائق الكاملة، مع تضمين وثائق رئيسية في كل عينة، لضمان الاتساق. تم إنتاج 15 استجابة لكل نموذج، باستثناء ChatGPT، الذي كان محدودًا عند 10 استجابات.
المنافسون
تم اختبار ثلاثة أدوات، كل منها يعكس نهجًا مختلفًا للاستفسار القائم على الوثائق: تم تقييم ChatGPT-5 باستخدام ميزة المشاريع ،التي قيدت التحميلات عند 100 وثيقة؛ تمكنت Google Gemini 2.5 تم اختبار المعالجة المسبقة لمجموعة كاملة من 300 وثيقة ضمن سياقها (باستخدام نافذة سياقية تضم مليون حرف لاستيعاب جميع الأحرف البالغ عددها 923,000 حرفًا بشكل مباشر). كما تم اختبار Google NotebookLM، الذي يوفر ميزة استرجاع الاقتباسات المدمجة، باستخدام دفاتر ملاحظات مُخصصة لكل عينة. على الرغم من اختلاف طرق معالجة الوثائق، إلا أنها جميعًا تمثل أدوات حقيقية متاحة حاليًا للصحفيين؛ ومع ذلك، فإن الوضع الحالي تجريبي أكثر منه متجانس، مع تباين متساوٍ في الميزات والنطاق بين العروض الحالية.بالنسبة لمجموعة متنوعة من السلوكيات المهلوسة، تم استخدام تصنيف من عمل سابق في عام 2023. ، مع تصنيف الهلوسات بواسطة (التشويه مقابل التطوير)؛ التوجيه الفئة (نوع الخطأ)؛ و أنها (الخطورة المصنفة على ، الدرجة ، خفيفة متوسطةأو مقلقة). تم تحديد جميع مخرجات النموذج بواسطة أحد المؤلفين البشر، الذي راجع كل جملة وطبق هذه التصنيفات. تم تحديد الأخطاء التي لا تغطيها التصنيفات على أنها متفرقة، وتم تحليلها لاحقًا لتطوير فئات محددة للصحافة.
البيانات والاختبارات
في الاختبار الأولي ل ، فقط مناحتوت 12 استجابة من أصل 40 استجابة للنموذج على هلوسة واحدة، مع تباين ملحوظ بين الأدوات. أنتجت كل من ChatGPT وGemini هلوسات في 40% من مخرجاتهما، بينما أنتجت NotebookLM هلوسات في 13%.

معيبة، و NotebookLM ثلاث هلوسات، و ChatGPT 1.5 هلوسة. كانت معظمها معتدلة في الخطورة، ولكن 14% كانت مصنفة على أنها مقلقة . في حالة واحدة، اخترع ChatGPT
هلوسات، فإن اختيار الأداة يصنع فرقًا في مجموعة الوثائق و مجموعة الاستفسارات نفسها.’ نادرًا ما تحدث هلوسات في العزلة؛ أشارت Gemini إلى متوسط أربع هلوسات لكل استجابة دوافعًاانتقامية وراء حظر تيك توك لم يظهر في وثيقة المصدر: ‘(في) استفسار واحد، صوّر ChatGPT حظر تيك
علامات اقتباس أو توسعات غير صحيحة، مما يشير إلى أن الإطارات الحالية قد تكون ضيقة جدًا بالنسبة لمجموعات المواد الصحفية. انخفاض معدل الهلوسة في NotebookLM يوحي بنظام RAG.
إن احتمال أن يكون هذا تكتيكًا للالتفاف من قبل المشرعين الأمريكيين ردًا على السياسة الصينية هو ادعاء غائب تمامًا عن الوثيقة الأصلية. إجمالًا، أدخلت 64% من الردود التي تسببت في الهلوسة أخطاءً أو زوايا غير دقيقة في الحقائق، مما قد يثير تساؤلات حول ما إذا كان استخدام LLM يستغرق وقتًا طويلًا بالفعل في هذا النوع من سير العمل القائم على المعلومات، على الأقل في الوضع الراهن. في هذه التجربة الأولية، لم تتطابق معظم الهلوسات مع فئات التصنيف الموجودة، وغالبًا القائم على الاقتباس يوفر تثبيتًا أكثر موثوقية من ميزة المشاريع في ChatGPT أو معالجة السياق في Gemini، خاصة عند الإشارة إلى وثائق محددة. فيما يتعلق بدراسة الخصائص النوعية للهلوسات الملاحظة في نتائج الاختبار، يشير الباحثون إلى أن الهلوسات نشأت ليس في الغالب من حقائق مخترعة، ولكن من التجاوز التفسيري:
أولًا، أضافت النماذج ادعاءات غير مدعومة حول جمهور الوثيقة أو غرضها، مثل وضع علامة على مقال على أنه “مكتوب للجمهور” أو إيداع على أنه “موجه للمحامين”. ثانيًا، حولت الآراء
‘أضافت النماذج تصنيفات واثقة حول أغراض الوثائق وجماهيرها ونوايا المتحدث التي تبدو مسؤولة ولكنها تفتقر إلى أي أساس في النص الفعلي. لقد حولوا البيانات التفسيرية أو المنسوبة إلى عبارات قاطعة.’ أخذت الثقة الزائدة شكلين: – ومعظم الأخطاءالمنسوبة ، مما يخفي المصدر الأصلي ويضعف تقييم المصدر. إلى عبارات تشبه الحقائق ظهرت هذه السلوكيات عبر جميع الأدوات، ولم تكن مقصورة على هيكل معماري واحد تفسيراتلم تكن اختراعات، ولكن . الحالية؛زائدة تم وضع علامة على معظم الهلوسات على أنها ، لأنها لم تتطابق مع الفئات قضايا شائعة مثل متفرقة نقص الإسناد ووصف المصدر الغامض تشير إلى أن التصنيفات الحالية تفوت الأخطاء التي تهم أكثر في الصحافة، حيث يكون الإسناد الواضح ضروريًا. يشير المؤلفون إلى أن ‘النماذج تضيف تحليلًا واثقًا لا تدعمه الوثائق وتنزع الإسناد’
الاستنتاج
من المعروف أن كل من النماذج الثلاثة التي تمت دراستها في الورقة الجديدة لها نقاط ضعف و نقاط قوة. على الرغم من أن NotebookLM يؤدي بشكل أفضل في الاقتباس من ChatGPT أو Gemini، قد يُعتبر أنه تم بناؤه خصيصًا لهذه الوظيفة، ولا يزال يُنتج معدل خطأ من شأنه أن يُقال إن أي صحفي أو باحث أو محامي قد فُصل، مع تكرار الحوادث. بالإضافة إلى ذلك، يفتقر NotebookLM، الذي يُقدم نفسه كإطار بحثي، إلى العديد من تحسينات UX التي تجعل منصات أخرى تجربة كتابة أكثر سهولة. ومع ذلك، على الأقل يبدو أن NotebookLM يقرأ الوثائق المرفوعة فعلاً بدلاً من الانخراط في عادة ChatGPT المدمرة للافتراض ما قد تقوله وثيقة مرفوعة بناءً على ما يعرفه عن توزيع الوثائق المماثلة. يمكن أن يكون من الصعب الحصول على نسخة من ChatGPT لقراءة نص كامل للوثائق المرفوعة، بدلاً من الاعتماد على البيانات الوصفية أو افتراضاته / هلوساته. للمجالات التي يتطلب فيها الأصل والاقتباس معايير واجهة أفضل صارمة، مثل القانون والصحافة والبحث العلمي، يبدو أن هناك صفرًا من المرافق في السوق الرائدة الحالية من LLMs التي يمكنها تحسين قدراتها المحدودة لاستخراج المعلومات وتحليلها بدقة. المدرّبة بشكل أصلي كما هي الحال، وبالنسبة لوصولها إلى أنظمة مساعدة يمكنها تقديم إلى LLMs من مجردتحفيز النظام أو إعداد MCP ، لا يزال كل ما تنتجه هذه الأنظمة يحتاج إلى التحقق من قبل تلك الكائنات الغير ملائمة والمزعجة، وهي البشر. † تحويلي للاستشهادات المضمنة
للمؤلفين إلى روابط. نُشر لأول مرة يوم الأربعاء، 1
أكتوبر 2025. تم تعديله يوم الخميس، 2 أكتوبر، لتصحيح خطأ في TL: DR وتصحيح خطأ أسلوبي في الفقرة الأولى.












