Погляд Anderson

Навіть базовий ІІ може тепер писати новини, які сприймаються як написані людиною

mm
Додайте Unite.AI до бажаних джерел у Google
AI-generated illustration: a stylized orthographic illustration depicting a woman seated at her home office desk reading a laptop, and a cut-away diagram depicting 'Schrodinger's news source' - a box with a robot writing an article, partitioned from a human writing an article. Each has a stylized journalist appearance. The idea being conveyed is that until you actually know who wrote the piece the woman is reading, it could have been a human or a robot. GPT-1.5

Нові дослідження показують, що навіть маленькі місцеві моделі ІІ можуть тепер писати новини, які люди не можуть відрізнити від справжньої журналістики, дорівнюючи найкращим системам, і залишаючи читачів нездатними сказати, хто написав що.

 

За новим дослідженням, проведеним у співпраці Німеччини та Франції, люди не можуть сказати, чи написана стаття ІІ чи людиною – навіть якщо вона написана відкритими моделями, які можна завантажити та запустити на відносно середніх споживчих комп’ютерах.

У ще одному свідченні того, що маленький ІІ на підйомі, опитування 2 318 суджень, зібраних від 1 054 учасників у спеціальному академічному дослідницькому порталі, показало, що людські читачі не могли ідентифікувати походження статті на вищому рівні, ніж випадковість, навіть якщо вона була виведена відносно скромними моделями з лише сімома мільярдами параметрів, включаючи Mistral і Llama варіанти:

Середні джерельні та автентичності оцінки для тестованих ЛЛМ. 200 мільярдів параметрів GPT-4o не значно перевищують 7B параметрів менших моделей. Джерело - https://arxiv.org/pdf/2604.03755

Середні джерельні та автентичності оцінки для тестованих ЛЛМ. 200 мільярдів параметрів GPT-4o не значно перевищують 7B параметрів менших моделей. Ті, що були протестовані для дослідження, були Gemma 7B, Phi-3 Mini, LLaMA-2 13B, Mistral 7B, GPT-4o і GPT-3.5. Джерело

Автори повертаються до теми, яку вони вперше розглянули у випуску 2024 року release Благословення чи прокляття? Опитування про вплив генеративного ІІ на фейкові новини. Самі результати є новоопублікованими результатами з більш великого проекту, вперше анонсованого у січні, і використовують власну JudgeGPT онлайн-платформу для участі.

Легка потужність

Під назвою Чи можуть люди сказати? Двовісеве дослідження людського сприйняття ЛЛМ-генерованих новин, і походячи від трьох дослідників університету прикладних наук Франкфурта та дослідницької одиниці IRISA в Нанті, нове дослідження робить важливу відмінність між “фейковими новинами” та “новинами, написаними ІІ” (оскільки фейкові новини можуть бути написані людиною або ІІ, і ці два аспекти не обов’язково синонімічні).

Однак, можливо, найбільш цікавим аспектом є висновок статті, що маленькі моделі, включаючи Mistral 7B і Gemma 7B, можуть, з лише сімома мільярдами параметрів, впоратися з такими моделями, як ChatGPT (4o) з 200 мільярдами параметрів:

‘Відкриті моделі з лише 7B параметрами виробляють текст, оцінюваний не інакше, ніж вивід GPT-4o, вказуючи на те, що здатність генерувати текст, який люди не можуть відрізнити, вже не обмежена лише передовими моделями.’

Однак “новини, згенеровані ІІ”, можуть представляти різні види співпраці людини та ІІ, від перевірки орфографії до повної, кар’єрної відкладення зусиль, і дослідження не робить ясним, який саме вид ІІ-контенту був вироблений для тестів (хоча воно описує методологію виробництва – див. нижче).

Метод

Для учасників, залучених до платформи JudgeGPT, кожен фрагмент новин оцінювався за допомогою двовісевої структури, у якій вони надавали три незалежні оцінки на безперервних 0-100 слайдерах;

Портал JudgeGPT, де оцінювачі оцінюють матеріал за джерельною атрибуцією; автентичністю; і знайомістю з темою.

Портал JudgeGPT, де оцінювачі оцінюють матеріал за джерельною атрибуцією; автентичністю; і знайомістю з темою. Будь ласка, зверніться до джерельної статті для кращої роздільності.

Джерельна оцінка захоплювала, чи здається фрагмент написаним машиною чи людиною; оцінка автентичності, чи він сприймається як фейковий чи легітимний; і знайомість з темою, як добре читач знає предмет.

Безперервні шкали використовувалися замість Лайкерт-шкали, щоб захопити ступені впевненості більш точно, і щоб підтримувати статистичний аналіз, включаючи Пірсонівську кореляцію і кластеризацію.

Фрагменти тексту, згенеровані машиною, вироблялися авторами власної RogueGPT-фреймворку, фідер-архітектури для JudgeGPT. RogueGPT оркеструє внески шести великих мовних моделей (ЛЛМ): ChatGPT-4; ChatGPT-3.5; ChatGPT-4o; LLaMA-2 13B; Gemma 7B; і Mistral 7B.

Використовувалася персоналізована підказка для генерації тексту, і генерації ІІ були засновані на реальних новинних темах, і були перевірені людьми.

Навпаки, фрагменти тексту, написані людиною, були вибрані з “установлених новинних видань” і неозначених “інформаційних баз даних”.

Автори спостерігають:

‘Набір стимулів навмисно зміщений у бік фрагментів, згенерованих машиною (98%), з людськими фрагментами, які служать якоріами калібрування.

‘Цей вибір дизайну відображає фокус дослідження на внутрішньо-ІІ-варіації (між моделями) а не порівнянні людина-ІІ; учасники не інформуються про базову частоту, і майже-шансова виявлення [результати] зберігаються при аналізі на підмножині людського походження окремо.’

Учасники спочатку давали інформовану згоду та заповнювали демографічний опитувальник, який охоплював вік, освіту, політичну орієнтацію та знайомість з ІІ, після чого вони оцінювали послідовність фрагментів новин.

Кожна людина переглядала від 5 до 87 предметів, з медіаною 12, тоді як порядок представлення випадковизувався, а призначення моделі балансувалося між учасниками, щоб зменшити упередженість. Платформа реєструвала три оцінки слайдерів поряд з часом відповіді та анонімним ідентифікатором, що дозволяло пов’язувати окремі судження з фоновими факторами.

Автори підкреслюють, що вибірка була зміщена до освічених європейських учасників, з 68% з університетською освітою, і 74% базувалися в Європі – упередженість, яку стаття відзначає як обмеження для більш широкої узагальненості.

Тести

Тести розділені на п’ять типів результатів: розрізнення машинно-генерованого тексту від людського; порівняння виявлення між різними ЛЛМ; дослідження впливу експертизи у галузі та політичної орієнтації на точність; ідентифікація відмінних стратегій відповідей серед учасників; і відстеження того, як точність змінюється під час повторних оцінок, через втому:

Суммарний підсумок п'яти основних результатів з 2 318 суджень серед 1 054 учасників, показуючи, що людське виявлення тексту, написаного ІІ, залишилося на рівні шансу в усіх моделях, що точність була пов'язана з експертизою у галузі, а не з політичною орієнтацією, що учасники кластеризувалися в різні профіль довіри, і що продуктивність знижувалася після приблизно 30 оцінок, через когнітивну втому.

Суммарний підсумок п’яти основних результатів з 2 318 суджень серед 1 054 учасників, показуючи, що людське виявлення тексту, написаного ІІ, залишилося на рівні шансу в усіх моделях, що точність була пов’язана з експертизою у галузі, а не з політичною орієнтацією, що учасники кластеризувалися в різні профіль довіри, і що продуктивність знижувалася після приблизно 30 оцінок, через когнітивну втому.

Тест показав відсутність суттєвої різниці вище шансу в джерельних оцінках між умовами, що, як видається, вказує на те, що учасники не можуть відрізнити текст, згенерований ІІ, від людського виводу:

Джерельні та автентичності оцінки розподілу для машинно- та людського походження фрагментів показують суттєве перекриття, без суттєвого розрізнення між двома умовами, і статистичне тестування – вказуючи на те, що учасники не могли надійно відрізнити текст, згенерований ІІ, від людського вмісту.

Джерельні та автентичності оцінки розподілу для машинно- та людського походження фрагментів показують суттєве перекриття, без суттєвого розрізнення між двома умовами, і статистичне тестування – вказуючи на те, що учасники не могли надійно відрізнити текст, згенерований ІІ, від людського вмісту.

Для другого аспекту, як показано на графіку на початку статті, невдача виявлення не варіювалася за моделлю, оскільки вивід усіх ЛЛМ кластеризувався навколо шанс-рівневих суджень, без суттєвих відмінностей між ними. Навіть менші відкриті системи, такі як Mistral 7B і Gemma 7B, оцінювалися не інакше, ніж GPT-4o, вказуючи на те, що людсько-невідмінний текст вже не обмежується лише найбільшими моделями.

Для третього аспекту точність була більш сильно пов’язана з експертизою у галузі, ніж з політичною орієнтацією, оскільки знайомість з фейковими новинами корелювала з кращими судженнями, тоді як політичні погляди показали відсутність суттєвого впливу, вказуючи на те, що вивчені аналітичні навички можуть мати більше значення, ніж ідеологія:

Результати, пов'язані з третьою лінією дослідження: учасницькі кореляції між фоновими ознаками та точністю суджень показали, що політична орієнтація не мала суттєвого впливу на джерельну атрибуцію чи оцінку автентичності, з лише слабкими, несуттєвими тенденціями в обох мірах. Водночас самозванна знайомість з фейковими новинами була постійно пов'язана з вищою точністю в обох осях, як це відображено в помірних позитивних кореляціях та зростаючих регресійних схилах. Автори стверджують, що це вказує на те, що досвід-основана аналітична майстерність (а не ідеологічна позиція) була сильнішим передбачувачем продуктивності в оцінці ІІ-генерованих та людських новин. Будь ласка, зверніться до джерельної статті для кращої роздільності.

Результати для третьої лінії дослідження показали, що політична орієнтація не мала суттєвого впливу на джерельну атрибуцію чи оцінку автентичності, з лише слабкими, несуттєвими тенденціями, тоді як самозванна знайомість з фейковими новинами була пов’язана з вищою точністю в обох осях. Це вказує на те, що досвід-основана аналітична майстерність була сильнішим передбачувачем продуктивності, ніж ідеологічна позиція. Будь ласка, зверніться до джерельної статті для кращої роздільності.

Четвертий результат показав, що учасники кластеризувалися в два відмінні стилі відповідей, ідентифіковані як ‘Скептики’ – які призначали низьку довіру до вмісту незалежно від походження – і ‘Вірючі’ – які підтримували вищу базову довіру.

Нарешті, щодо п’ятого об’єкта, ролінг-аналіз послідовних суджень показав, що учасники спочатку ставали краще в цій задачі, з точністю, яка покращувалася протягом приблизно перших 15-20 оцінок, оскільки вони адаптувалися до формату:

Ролінг-аверажі джерельних та автентичності оцінок протягом послідовності учасницьких оцінок показують коротку початкову фазу покращення, оскільки користувачі, як видається, адаптуються до завдання протягом перших 15–20 предметів, за якою слідує стабільне зниження в обох мірах після приблизно 30 оцінок. Оцінки знижуються до значення за замовчуванням – шаблон, інтерпретований у дослідженні як когнітивна втома. Будь ласка, зверніться до джерельної статті для кращої роздільності.

Ролінг-аверажі джерельних та автентичності оцінок протягом послідовності учасницьких оцінок показують коротку початкову фазу покращення, оскільки користувачі, як видається, адаптуються до завдання протягом перших 15–20 предметів, за якою слідує стабільне зниження в обох мірах після приблизно 30 оцінок. Будь ласка, зверніться до джерельної статті для кращої роздільності.

Однак, цей ефект був короткочасним, оскільки продуктивність почала знижуватися після приблизно 30 предметів, з учасниками, які все частіше перейшли до маркування вмісту як фейкового – зсув, інтерпретований як когнітивна втома, і вказує на явні обмеження того, як довго підходи, засновані на виявленні, можуть залишатися ефективними на практиці.

Це може представляти деякі емпіричні докази того, що, втомлені перспективою розрізнення фейкових новин від справжніх, ІІ-новин від людських, ми можемо перейти до припущення, що новини ІІ і/або фейкові (не обов’язково те ж саме), щоб бути «на безпечній стороні». Ті, хто вважає це «ленівим», і вважає, що люди повинні самостійно дослідити потенційну фейкову новинну історію, щоб підтвердити її, можуть бути зацікавлені в тому, щоб дізнатися, що дослідження 2024 року вказало, що це тільки погіршує проблему.

Автори пропонують, що невдача людського судження, продемонстрована у результатах, вказує на те, що нам, можливо, потрібно передати такі питання технологіям криптографічного походження, таким як ініціатива C2PA, очолювана Adobe. Інші можливі рішення включають власну OriginLens рамку авторів, і ще один проект, пов’язаний з авторами, під назвою CRED-1.

Автори висновують:

‘Чи можуть люди сказати? Наше двовісеве дослідження 2 318 суджень серед шести ЛЛМ-сімей дає ясну емпіричну відповідь: вони не можуть.

‘Машинно-генерований текст є невідмінним від людського письма незалежно від розміру моделі або сім’ї, експертиза у галузі передбачає точність виявлення сильніше, ніж політична орієнтація, учасники приймають відмінні стратегії довіри, і когнітивна втома обмежує тривале виявлення.

‘Ці результати підтримують зсув від користувацького рівня виявлення до системного рівня протидії, включаючи походження вмісту, адаптивні індикатори довіри та обмежені інтервенції інокуляції.’

Висновок

Бурхливим аспектом цієї статті є навколишня мережа проектів і робіт, які автори – або деякі з авторів, залежно від роботи – походять або мають руку в; і це було б дуже цікаво побачити зразки ІІ- і людського тексту, які дали ці результати, щоб краще зрозуміти вид тексту, який описана методологія генерації виробляє.

Натомість, згідно з сайтом canirun.ai, Mistral 7B (яка була приблизно на рівні з ChatGPT-4o у тестах) ‘працює добре’ на NVIDIA RTX 3080 з 16GB відеопам’яті, і працює ‘пристойно’ на 3060 з 6GB відеопам’яті – далеко не останні та найкращі графічні карти у грі*. Тому будь-хто, хто хоче розробити власну методологію для подання зразків, може, як видається, взяти участь у цих експериментах теж.

 

* Gemma 7B не перелічена на сайті.

Перше опубліковано четвер, 9 квітня 2026

Письменник про машинне навчання, спеціаліст у галузі синтезу зображень людини. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розпуску в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: [email protected]