Взгляд Anderson

Искусственно сгенерированный язык начинает загрязнять научную литературу

mm
Добавьте Unite.AI в избранные источники в Google

Исследователи из Франции и России опубликовали исследование, указывающее на то, что использование вероятностных текстовых генераторов на основе ИИ, таких как GPT-3, вводит «истязаемый язык», цитаты несуществующей литературы и неавторизованное повторное использование изображений в ранее уважаемых каналах для публикации новых научных работ.

Возможно, наиболее тревожным является то, что изучаемые статьи также содержат научно неточные или нерепродуцируемые данные, представленные как результат объективных и систематических исследований, что указывает на то, что генеративные языковые модели используются не только для улучшения ограниченных английских навыков авторов статей, но и фактически для выполнения сложной работы (и, неизбежно, для ее плохого выполнения).

Отчет назван «Истязанные фразы: сомнительный стиль письма, возникающий в науке», и был составлен исследователями из кафедры информатики Университета Тулузы и исследователем Яндекса Александром Магазинова, в настоящее время работающим в Тель-Авивском университете.

Исследование в первую очередь фокусируется на росте бессмысленных научных публикаций, сгенерированных с помощью ИИ, в журнале Elsevier Микропроцессоры и микросистемы.

Под другим именем

Авторегрессивные языковые модели, такие как GPT-3, обучаются на больших объемах данных и предназначены для перефразировки, суммирования, объединения и интерпретации этих данных в связные генеративные языковые модели, способные воспроизводить естественные речевые и письменные модели, сохраняя при этом исходную цель обучающих данных.

Поскольку такие модели часто наказываются на этапе обучения за предоставление прямого и «неусвоенного» повторения исходных данных, они неизбежно ищут синонимы – даже для хорошо установленных фраз.

Очевидно созданные с помощью ИИ научные статьи, обнаруженные исследователями, включают необыкновенное количество неудачных попыток найти творческие синонимы для известных фраз в области машинного обучения:

Глубокая нейронная сеть: «глубокая нейронная организация»
Искусственная нейронная сеть: «(фальшивая | поддельная) нейронная организация»
Мобильная сеть: «универсальная организация»
Атака на сеть: «организация (засада | нападение)»
Соединение сети: «ассоциация организации»
Большие данные: «(огромная | огромная | огромная | колоссальная) информация»
Хранилище данных: «информация (склад | распределительный центр)»
Искусственный интеллект (ИИ): «(фальшивый | созданный человеком) сознание»
Высокопроизводительные вычисления: «элитные вычисления»
Облачные вычисления: «туманные вычисления»
Графический процессор (GPU): «единица подготовки дизайна»
Центральный процессор (CPU): «фокальная подготовка единицы»
Движок рабочего процесса: «двигатель рабочего процесса»
Распознавание лиц: «распознавание лица»
Распознавание голоса: «распознавание речи»
Среднеквадратическая ошибка: «среднеквадратическая (ошибка | промах)»
Средняя абсолютная ошибка: «средняя (полная | высшая) (ошибка | промах)»
Отношение сигнала к шуму: «(движение | флаг | индикатор | знак | сигнал) к (шум | суматоха)»
Глобальные параметры: «мировые параметры»
Случайный доступ: «(случайный | нерегулярный) доступ»
Случайный лес: «(случайный | нерегулярный) (задний двор | лес | густая территория)»
Случайное значение: «(случайное | нерегулярное) значение»
Колония муравьев: «подземный насекомый (государство | провинция | область | регион | поселение)»
Колония муравьев: «подземный ползучий (государство | провинция | область | регион | поселение)»
Оставшаяся энергия: «оставшаяся жизненность»
Кинетическая энергия: «двигательная жизненность»
Наивный Байес: «(верующий | невинный | наивный) Байес»
Персональный цифровой помощник (PDA): «индивидуальный компьютерный сотрудник»

В мае 2021 года исследователи запросили академический поисковый движок Dimensions в поисках такого искаженного, автоматизированного языка, принимая меры для исключения законных фраз, таких как «огромная информация» (которая является действительной фразой и не является неудачной заменой для «больших данных»). На этом этапе они обнаружили, что Микропроцессоры и микросистемы имели наибольшее количество случаев неправильного парафразирования.

В настоящее время все еще можно получить (архивный снимок, 15/07/2021) ряд научных статей для бессмысленной фразы «глубокая нейронная организация» (т. е. «глубокая нейронная сеть»), и другие фразы из приведенного выше списка дают аналогичные результаты.

Результаты поиска для 'глубокой нейронной организации' ('глубокой нейронной сети') в Dimensions. Источник: https://app.dimensions.ai/

Результаты поиска для ‘глубокой нейронной организации’ (‘глубокой нейронной сети’) в Dimensions. Источник: https://app.dimensions.ai/

Журнал Микропроцессоры был основан в 1976 году и переименован в Микропроцессоры и микросистемы два года спустя.

Рост бессмысленного языка

Исследователи изучали период с февраля 2018 года по июнь 2021 года и обнаружили резкий рост объема подач в последние два года, и особенно в последние 6-8 месяцев:

Корреляция или причинно-следственная связь? Рост подач в журнал Микропроцессоры и микросистемы, кажется, совпадает с ростом 'бессмысленного' текста и синонимов в apparentemente уважаемых подачах. Источник: https://arxiv.org/pdf/2107.06751.pdf

Корреляция или причинно-следственная связь? Рост подач в журнал Микропроцессоры и микросистемы, кажется, совпадает с ростом ‘бессмысленного’ текста и синонимов в apparentemente уважаемых подачах. Источник: https://arxiv.org/pdf/2107.06751.pdf

Окончательный набор данных, собранный сотрудниками, содержит 1078 полных статей, полученных через подписку Elsevier Университета Тулузы.

Уменьшение редакторского надзора для китайских научных статей

В статье отмечается, что время, выделенное для редакторской оценки помеченных подач, радикально сократилось в 2021 году, снизившись до менее 40 дней; шестикратное уменьшение стандартного времени для рецензирования, очевидного с февраля 2021 года.

Большинство помеченных статей исходят от авторов с связями с материковым Китаем: из 404 статей, принятых менее чем за 30 дней, 97,5% связаны с Китаем. Напротив, в случаях, когда процесс редактирования превышал 40 дней (615 статей), китайские подачи составляли только 9,5% этой категории – десятикратный дисбаланс.

Отчет приписывает проникновение помеченных статей недостаткам в редакторском процессе и возможному отсутствию ресурсов перед лицом растущего числа подач.

Исследователи предполагают, что модели генерации языка типа GPT, и подобные типы языковых моделей, были использованы для создания большей части текста в помеченных статьях; однако, способ, которым генеративная модель абстрагирует свои источники, делает это трудным для доказательства, и главные доказательства лежат в оценке плохих и ненужных синонимов и тщательном анализе логической последовательности подачи.

Исследователи также отмечают, что генеративные языковые модели, которые, по их мнению, способствуют этому потоку бессмысленного текста, способны не только создавать проблемные тексты, но и распознавать их и флагировать систематически, так же, как и сами исследователи выполнили это вручную. Работа описывает такое внедрение, используя GPT-2, и предлагает основу для будущих систем для выявления проблемных научных подач.

Частота «загрязненных» подач намного выше в журнале Elsevier (72,1%) по сравнению с другими изученными журналами (13,6% максимум).

Не только семантика

Исследователи подчеркивают, что многие из журналов не только используют неправильный язык, но и содержат научно неточные заявления, что указывает на возможность того, что генеративные языковые модели не только используются для улучшения ограниченных языковых навыков участвующих ученых, но и могут фактически использоваться для формулирования хотя бы некоторых основных теорем и данных в статье.

В других случаях исследователи полагают эффективную «пересинтез» или «спин» абстрагированной (и лучшей) предыдущей работы, чтобы удовлетворить давлению «публикуй или умри» академических исследовательских культур, и возможно, чтобы улучшить национальные рейтинги для глобального превосходства в исследованиях ИИ, посредством чистого объема.

Бессмысленный контент в представленной статье. В этом случае исследователи обнаружили, что текст был получен ad hoc из статьи EDN, откуда иллюстрация также была взята без указания источника. Переписывание исходного контента настолько крайнее, что делает его бессмысленным.

Бессмысленный контент в представленной статье. В этом случае исследователи обнаружили, что текст был получен ad hoc из статьи EDN, откуда иллюстрация также была взята без указания источника. Переписывание исходного контента настолько крайнее, что делает его бессмысленным.

Анализируя несколько представленных статей Elsevier, исследователи обнаружили предложения, для которых они не смогли сделать никаких выводов; ссылки на несуществующую литературу; ссылки на переменные и теоремы в формулах, которые не фактически появлялись в поддерживающем материале (что указывает на абстракцию на основе языка или «галлюцинацию» якобы фактических данных); и повторное использование изображений без признания их источников (что исследователи критикуют не с точки зрения авторского права, а скорее как указание на недостаточную научную строгость).

Неудачи цитирования

Цитаты, предназначенные для поддержки аргументов в научной статье, были обнаружены во многих из помеченных примеров как «либо сломанные, либо ведущие к не связанным публикациям».

Кроме того, ссылки на «связанную работу» часто включают авторов, которых исследователи считают «галлюцинированными» системой типа GPT.

Блуждающее внимание

Другим недостатком даже самых передовых языковых моделей, таких как GPT-3, является их тенденция к потере фокуса в длинном дискурсе. Исследователи обнаружили, что помеченные статьи часто поднимают тему в начале статьи, которая фактически никогда не возвращается после того, как она впервые упоминается в предварительных заметках или в другом месте.

Они также полагают, что некоторые из худших примеров возникают в результате нескольких проходов исходного текста через ряд переводческих двигателей, каждый из которых искажает смысл еще больше.

Источники и причины

Пытаясь понять, что стоит за этим явлением, авторы статьи предлагают несколько возможностей: что контент из «фабрик статей» используется в качестве исходного материала, вводя неточности очень рано в процессе, который неизбежно произведет дальнейшие неточности; что инструменты для спиннинга статей, такие как Spinbot, используются для маскировки плагиата; и что давление на регулярную публикацию приводит недостаточно обеспеченных исследователей к использованию систем типа GPT-3 для либо дополнения, либо полного создания новых академических статей.

Исследователи заканчивают призывом к действию для более строгого надзора и улучшения стандартов в области академической публикации, которая, по-видимому, становится пищей для своей собственной темы – систем машинного обучения. Они также призывают Elsevier и других издателей ввести более строгие процедуры проверки и рецензирования, и широко критикуют текущие стандарты и практики в этом отношении, предлагая, что «обман с помощью синтетических текстов угрожает целостности научной литературы».

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai