Погляд Anderson
Штучна мова, створена ІІ, починає забруднювати наукову літературу

Дослідники з Франції та Росії опублікували дослідження, яке вказує на те, що використання імовірнісних текстових генераторів, таких як GPT-3, вводить “катованих мов” та цитування неіснуючої літератури та некредитоване повторне використання зображень у раніше поважних каналах для публікації нових наукових робіт.
Можливо, найбільш турбує те, що статті, які вивчали дослідники, також містять науково неточну або невідтворювану інформацію, представлену як плоди об’єктивних та систематичних досліджень, вказуючи на те, що генеративні мовні моделі використовуються не тільки для поліпшення обмежених англійських навичок авторів, але й фактично для виконання складної роботи (і, як правило, для виконання її погано).
Дослідження звіт, озаглавлений Катані фрази: сумнівний стиль письма, який з’являється в науці, було складено дослідниками з кафедри комп’ютерних наук Університету Тулузи та дослідником Яндекса Олександром Магазіновим, який зараз працює в Тель-Авівському університеті.
Дослідження зосереджується особливо на зростанні безглуздих наукових публікацій, створених штучною мовою, у журналі Elsevier Мікропроцесори та мікросистеми.
Інша назва
Авторегресивні мовні моделі, такі як GPT-3, тренуються на великих обсягах даних і призначені для парафразування, підсумовування, збору та інтерпретації цих даних у згенеровані мовні моделі, які можуть відтворювати природні мовні та письмові моделі, зберігаючи при цьому первинну намір даних.
Оскільки такі моделі часто караються на етапі навчання за прямий і “неабсорбований” викид первинних даних, вони невідворотно шукають синоніми – навіть для добре встановлених фраз.
Найвидніше, штучно створені/допоміжні наукові статті, виявлені дослідниками, включають надзвичайно велику кількість невдалих спроб творчих синонімів для відомих фраз у сфері машинного навчання:
Глибока нейронна мережа: глибока нейронна організація
Штучна нейронна мережа: (фальшива | підробна) нейронна організація
Мобільна мережа: гнучка організація
Атака на мережу: організація (засада | напад)
З’єднання мережі: організаційна асоціація
Великі дані: (енормні | величезні | величезні | колосальні) дані
Сховище даних: інформаційне (склад | розподільчий центр)
Штучний інтелект (ІІ): (фальшивий | створений людиною) свідомість
Високопродуктивне обчислення: елітне обчислення
Обчислення у тумані/місті/хмарі: обчислення у тумані
Графічний процесор (GPU): одиниця підготовки дизайну
Центральний процесор (CPU): фокусна одиниця підготовки
Двигун робочого процесу: двигун робочого процесу
Розпізнавання облич: розпізнавання особи
Розпізнавання голосу: розпізнавання мови
Середньоквадратична похибка: середньоквадратична (помилка | похибка)
Середня абсолютна похибка: середня (безумовна | верховна) (помилка | похибка)
Відношення сигналу до шуму: (рух | прапор | індикатор | знак | сигнал) до (шуму | метушні)
Глобальні параметри: глобальні параметри
Випадковий доступ: (випадковий | нерегулярний) доступ
Випадковий ліс: (випадковий | нерегулярний) (залив | ліс | густий район)
Випадкова величина: (випадкова | нерегулярна) вартість
Колонія мурах: підземна комаха (країна | область | район | регіон | поселення)
Колонія мурах: підземна плазун (країна | область | район | регіон | поселення)
Залишкова енергія: залишкова життєва сила
Кінетична енергія: рухома життєва сила
Наївний Байес: (довірливий | невинний | наївний) Байес
Особистий цифровий асистент (PDA): індивідуальний комп’ютеризований помічник
У травні 2021 року дослідники запитали академічний пошуковий двигун Dimensions у пошуках такого типу спотвореної, автоматичної мови, звернувши увагу на те, щоб виключити легітимні фрази, такі як “енормні дані” (що є дійсною фразою і не є невдалим синонімом для “великих даних”). На цьому етапі вони спостерігали, що журнал Мікропроцесори та мікросистеми мав найбільшу кількість випадків неправильного парафразування.
На даний момент все ще можливо отримати (архивний знімок, 15/07/2021) ряд наукових робіт для безглуздої фрази “глибока нейронна організація” (тобто “глибока нейронна мережа”), і інші фрази з вищезазначеного списку дають подібні результати.

Результати пошуку для ‘глибокої нейронної організації’ (‘глибокої нейронної мережі’) у Dimensions. Джерело: https://app.dimensions.ai/
Журнал Мікропроцесори був заснований у 1976 році і перейменований у Мікропроцесори та мікросистеми два роки по тому.
Ріст безглуздої мови
Дослідники вивчали період з лютого 2018 року по червень 2021 року і спостерігали різкий зростання обсягу подань за останні два роки, і особливо за останні 6-8 місяців;

Кореляція чи причинно-слідковий зв’язок? Зростання кількості подань у журнал Мікропроцесори та мікросистеми, здається, збігається з ростом ‘безглуздої’ мови та синонімів у поважних поданнях. Джерело: https://arxiv.org/pdf/2107.06751.pdf
Остаточний набір даних, зібраний співробітниками, містить 1 078 повних статей, отриманих через підписку Elsevier Університету Тулузи.
Зменшення редакторського нагляду за китайськими науковими роботами
У роботі спостерігається, що період часу, виділений для редакторської оцінки підозрюваних подань, радикально скорочується у 2021 році, впавши нижче 40 днів; шестикратне зниження стандартного часу для рецензування, очевидного з лютого 2021 року.
Найбільша кількість підозрюваних робіт походила від авторів, пов’язаних з материковим Китаєм: з 404 робіт, прийнятих менш ніж за 30 днів, 97,5% були пов’язані з Китаєм. Навпаки, у випадках, коли редакторський процес перевищував 40 днів (615 робіт), китайські підозрювані роботи становили лише 9,5% цієї категорії – десятикратна диспропорція.
У звіті стверджується, що проникнення підозрюваних робіт відбувається через недоліки в редакторському процесі та можливу нестачу ресурсів у face зростаючої кількості подань.
Дослідники припускають, що моделі генерації мови типу GPT, і подібні типи мовних генераційних моделей, були використані для створення великої частини тексту у підозрюваних роботах; однак, спосіб, яким генераційна модель абстрагує свої джерела, робить це важким для доведення, і головний доказ лежить у звичайній оцінці поганих і непотрібних синонімів, і ретельному вивченні логічної послідовності подання.
Дослідники також спостерігають, що генераційні мовні моделі, які, як вони вважають, сприяють цьому потоку безглуздої мови, здатні не тільки створювати проблематичні тексти, але й розпізнавати їх і систематично виділяти їх, так само, як і дослідники самі зробили це вручну. Робота описує таку реалізацію, використовуючи GPT-2, і пропонує рамки для майбутніх систем для ідентифікації проблематичних наукових подань.
Відсоток “забруднених” подань значно вищий у журналі Elsevier (72,1%) у порівнянні з іншими вивченими журналами (13,6% максимум).
Не тільки семантика
Дослідники підкреслюють, що багато журналів не тільки використовують неправильну мову, але й містять науково неточні твердження, вказуючи на те, що генераційні мовні моделі не тільки використовуються для поліпшення обмежених мовних навичок вчених, але й можуть фактично використовуватися для формулювання принаймні деяких основних теорем і даних у роботі.
У інших випадках дослідники припускають ефективну “пересинтез” або “перевертання” абстрактної (і кращої) попередньої роботи, щоб задовольнити тиск “публікуй або гини” академічної культури досліджень, і можливо, щоб поліпшити національні рейтинги глобальної переваги у сфері досліджень ІІ через чисту кількість.

Безглуздий вміст у поданій роботі. У цьому випадку дослідники виявили, що текст був похідним, ad hoc, з статті EDN, звідки також взято супровідну ілюстрацію без посилання. Переписування оригінального вмісту настільки екстремальне, що робить його безглуздим.
Аналізуючи кілька поданих робіт у журналі Elsevier, дослідники виявили речення, для яких їм не вдалося вивести жодного значення; посилання на неіснуючу літературу; посилання на змінні та теореми у формулах, які не фактично з’являються у супровідному матеріалі (що свідчить про мовну абстракцію, або “галюцинацію” очевидно фактичних даних); і повторне використання зображень без визнання їх джерел (що дослідники критикують не з точки зору авторських прав, а радше як індикатор недостатньої наукової суворості).
Помилки цитування
Цитати, призначені для підтримки аргументів у науковій роботі, були виявлені у багатьох з підозрюваних прикладів як “або розбиті, або ведуть до не пов’язаних публікацій”.
Крім того, посилання на “пов’язану роботу” часто включають авторів, яких дослідники вважають “галюцинованими” системою типу GPT.
Блукаюча увага
Іншим недоліком навіть найсучасніших мовних моделей, таких як GPT-3, є їхня схильність втрачати фокус під час довгого дискурсу. Дослідники виявили, що підозрювані роботи часто піднімають тему на початку роботи, яка фактично ніколи не повертається після того, як вона вперше з’являється у попередніх нотатках чи в інших місцях.
Вони також припускають, що деякі з найгірших прикладів відбуваються через багаторазові проходи джерельного тексту через серію машин перекладу, кожна з яких ще більше спотворює значення.
Джерела та причини
При спробі з’ясувати, що стоїть за цим явищем, автори статті пропонують ряд можливостей: що вміст з “фабрик статей” використовується як джерельний матеріал, вводячи неточності вже на ранній стадії процесу, який неминуче призведе до подальших неточностей; що інструменти для обертання статей, такі як Spinbot, використовуються для маскування плагіату; і що надмірний тиск на публікацію регулярно веде недофінансованих дослідників до використання систем типу GPT-3 для доповнення або повної генерації нових наукових робіт.
Дослідники завершують свою роботу зверненням до дії заради більшого нагляду та покращення стандартів у галузі академічної публікації, яка, як здається, стає самої жертвою своєї теми – систем машинного навчання. Вони також закликають Elsevier та інших видавців впровадити більш суворі процедури відбору та огляду, і широко критикують поточні стандарти та практики в цьому відношенні, вказуючи на те, що “обман з допомогою синтетичних текстів загрожує цілісності наукової літератури”.












