Взгляд Anderson

Обнаружение идей ИИ, а не текста ИИ

mm
Добавьте Unite.AI в избранные источники в Google
A vision of Archimedes shouting 'Eureka' as the dynamics of his bath inspire a new method of volume measurement. The image is outpainted laterally by GPT Image 2 in order to fit the format size, but the middle section is original and comes from https://math.nyu.edu/Archimedes/Crown/Vitruvius.html. The attribution there reads 'This illustration and text are from a magazine advertisement for NBC, probably dating from the 1940’s. It was found among the files of the Print and Picture Department of the Free Library of Philadelphia.'

Что если бы существовал детектор ИИ‑текста, способный распознать, что вы написали что‑то, опираясь на идею, предложенную ИИ, — даже если всё фактическое написание (то есть текст) является вашей собственной оригинальной работой?

Мы все знаем о детекторах ИИ‑текста, ставивших в неловкое положение знаменитостей и политиков, среди прочих — алгоритмы, изучившие характеристики текста, созданного ИИ, и способные распознавать эти шаблоны, когда они проявляются.

Эти случаи представляют простую передачу коммуникационной задачи, когда языковые модели, такие как ChatGPT и Google Gemini, предсказывают следующий вероятный токен в ответе на запрос пользователя — не отступая назад и рассматривая широкую картину проблемы или предложения, а просто угадывая следующее наиболее вероятное слово.

Тем не менее, согласно недавним исследованиям, этот лоскутный ковер предсказаний в конечном итоге формирует подлежащую структуру: необходимость согласованности и релевантности соседних текстовых разделов приводит к появлению уникальной подписи в «конспекте» или более высокой размерности работы — тот, кто может распознать следы ИИ, даже когда текст сильно переписан, чтобы «очеловечить» его:

Отличная многомерная 'форма' письма под различными LLM, и — слева — чисто человеческое письмо. Источник — https://arxiv.org/pdf/2609.15369

Отличная многомерная ‘форма’ письма под различными LLM, и — слева — чисто человеческое письмо. Источник

Целенаправленное генерирование идей ИИ

Новое академическое сотрудничество, возглавляемое Университетом Мэриленда, идёт дальше, предлагая методологию, способную определить, возникли ли самих идей с помощью ИИ, независимо от того, кто в конечном итоге написал слова.

Подход, названный IdeaLens и обученный на одном миллионе конспектов, извлечённых из веб‑документов, нацелен на сокращение каждого документа до конспекта, сохраняющего его идеи при удалении формулировок, — и сопровождается онлайн‑демо:

Слева одна из моих собственных статей проходит как человеческая в онлайн‑демо, в то время как другая статья, которую я отправил, кажется, содержит значительный вклад ИИ. Источник — https://ideadetector.ai/

Слева одна из моих собственных статей проходит как человеческая в онлайн‑демо, в то время как другая статья, которую я отправил (написанная другим автором), кажется, содержит значительный вклад ИИ. Источник

Как видно из приведённых выше результатов демонстрации, используемые методы обнаружения могут различать человеческие идеи и человеческую прозу, а также идеи ИИ и прозу ИИ, и оценивать их детально и раздельно — несмотря на то, что оба детектора обучались на одних и тех же документах, метках и базовой архитектуре модели, при этом они предназначены для обнаружения по сути противоположных вещей: происхождения идей и происхождения прозы.

Можно предположить, что такой спектр обнаружения может вызвать тревогу у разных категорий писателей, от политических спичрайтеров до романистов и колумнистов, а также у тех, кто до сих пор ценил свой собственный стиль письма, но позволял ИИ подпитывать их темы.

Одна из причин, почему LLM, вероятно, генерируют узнаваемые (и, следовательно, отслеживаемые) идеи, заключается не только в том, что определённые концепции и тексты статистически доминируют в недостаточно курируемых обучающих данных модели, делая их более вероятными к появлению в широком спектре запросов; но также потому, что LLM обладают загадочными и повторяющимися навязчивыми идеями, которые, кажется, не связаны с конкретными обучающими данными, и всё же часто появляются без приглашения.

Авторы заявляют*:

‘В то время как современные детекторы ИИ определяют, кто написал слова, новые политики использования ИИ всё чаще опираются на иной вопрос: кто придумал идеи? Мы представляем IdeaLens, детектор, который определяет, пришли ли идеи документа от человека или от ИИ (происхождение идей), независимо от того, кто написал его слова.’

‘Сфокусировать IdeaLens на идеях, а не на прозе, мы представляем документы в виде конспектов: списков элементов, каждый из которых сочетает дискурсивную роль с кратким, перефразированным описанием содержания, минимизируя совпадения на уровне слов с исходным текстом.’

Данные и методы

В статье утверждается, что новый метод может выявлять человеческие идеи в документах, сгенерированных ИИ (т.е. кто‑то сказал ИИ ‘Напиши мне эссе на эту тему‘); а также может выявлять идеи ИИ в человеческом тексте (т.е. кто‑то сказал ИИ ‘Предложи что‑нибудь, о чём я могу написать’).

Результаты тестов по четырём комбинациям человеческих и ИИ‑идей и прозы. Все четыре детектора работают эффективно, когда идеи и проза имеют одинаковое происхождение, но резко различаются при смешанном происхождении: IdeaLens правильно распознаёт 94,7 % документов, написанных ИИ на основе человеческих идей, как имеющие человеческое происхождение, и выявляет идеи ИИ в 68 % человеческих историй, по сравнению лишь с 8 % для Pangram 4 и 0 % для ProseLens и EditLens‑3B. Источник – https://arxiv.org/pdf/2610.06778

Результаты тестов по четырём комбинациям человеческих и ИИ‑идей и прозы. Все четыре детектора показывают высокую эффективность, когда идеи и проза имеют одинаковое происхождение, но резко различаются, когда происхождение смешано: IdeaLens правильно распознаёт 94,7 % документов, написанных ИИ на основе человеческих идей, как имеющие человеческое происхождение, и выявляет ИИ‑идеи в 68 % историй, написанных людьми, по сравнению лишь с 8 % для Pangram 4 и 0 % для ProseLens и EditLens‑3B. Source

Обнаружение проще, когда происхождение ясно — например, когда человеческий текст основан на идеях, сгенерированных ИИ, или когда вывод ИИ исходит из человеческой идеи. Когда эти признаки происхождения варьируются, обнаружение становится сложнее.

Исследователи проверяли это различие, постепенно увеличивая долю плана документа, исходящего от человека. В одном эксперименте ИИ‑моделям предоставляли всё более детализированные человеческие планы, начиная от простого топика и заканчивая полным планом.

По мере увеличения человеческого вклада процент срабатывания AI‑флага у IdeaLens падал с 94,9 % до 6,8 %; а традиционные детекторы прозы по‑прежнему почти полностью определяли полученный текст как ИИ:

Результаты тестов, показывающие, что происходит, когда всё более значительная часть базового плана ИИ‑текста предоставляется человеком. IdeaLens всё лучше распознаёт человеческое происхождение идей, при этом процент AI‑флага падает с 94,9 % при запросе только темы до 6,8 % при полном человеческом плане; традиционные детекторы текста ProseLens и Pangram по‑прежнему классифицируют большую часть полученного текста как ИИ.

Результаты тестов, показывающие, что происходит, когда всё более значительная часть базового плана ИИ‑текста предоставляется человеком. IdeaLens всё лучше распознаёт человеческое происхождение идей, при этом процент AI‑флага падает с 94,9 % при запросе только темы до 6,8 % при полном человеческом плане; традиционные детекторы текста ProseLens и Pangram по‑прежнему классифицируют большую часть полученного текста как ИИ.

Поскольку идеи необходимо отделять от языка, на котором они выражаются, и нет большого набора данных, фиксирующего, кто действительно создал идеи в документе, исследователи вместо этого обучали IdeaLens на существующих AI‑писательских labels — но удалили большую часть самого текста:

Как IdeaLens отделяет идеи от прозы во время обучения и тестирования, в отличие от традиционного детектора текста ProseLens. Пример opinion‑статьи объёмом 1 321 слово сводится к плану с пометкой роли, где пункты классифицируются по их функции, например, как отчёт о событии или оценка. Во время обучения эти планы дополнительно перефразировались, чтобы убрать формулировки, унаследованные от исходных документов, прежде чем IdeaLens обучался на существующих AI‑метках Pangram. Для новых документов извлечённый план затем может быть напрямую передан IdeaLens для оценки вероятности того, что идеи являются ИИ‑происхождением. Нижняя часть рисунка показывает второй детектор — «ProseLens», использованный исследователями для сравнения, который вместо этого получает полный текст и оценивает, является ли сама проза сгенерированной ИИ.

Как IdeaLens отделяет идеи от прозы во время обучения и тестирования, в отличие от традиционного детектора текста ProseLens. Пример opinion‑статьи объёмом 1 321 слово сводится к плану с пометкой роли, где пункты классифицируются по их функции, например, как отчёт о событии или оценка. Во время обучения эти планы дополнительно перефразировались, чтобы убрать формулировки, унаследованные от исходных документов, прежде чем IdeaLens обучался на существующих AI‑метках Pangram. Для новых документов извлечённый план затем может быть напрямую передан IdeaLens для оценки вероятности того, что идеи являются ИИ‑происхождением. Нижняя часть рисунка показывает второй детектор — «ProseLens», использованный исследователями для сравнения, который вместо этого получает полный текст и оценивает, является ли сама проза сгенерированной ИИ.

Как показано выше, каждый документ был сведён к плану, описывающему, что говорится, и роли каждой части в документе. Во время обучения эти планы были перефразированы, чтобы ещё больше удалить следы оригинальной формулировки авторов. Таким образом, IdeaLens может делать свои предсказания в основном исходя из оставшихся идей, а не из характерных признаков прозы.

Для проекта были созданы три набора данных: IdeaShift; IdeaShift-X; и TwiceTold. IdeaShift был сформирован из 500 человеческих и ИИ‑сгенерированных исходных документов, отобранных из существующего тестового корпуса исследователей. GPT-5.6 Sol использовался для преобразования каждого в постепенно более детализированные запросы, от «только тема» до полного плана. Затем GPT-5.6 был применён для генерации новых документов.

IdeaShift-X, наоборот, использовал 10 000 документов, написанных людьми в FineWeb2, на 24 языках, применяя вышеупомянутый протокол IdeaShift для создания ИИ‑версий на каждом языке.

Третий набор данных, TwiceTold, был написан академическими студентами под руководством авторов, чтобы избежать возможного использования ИИ неотъемлемый при краудсорсинге таких данных. Было написано пятьдесят историй с нуля, но с использованием 500‑словного плана, предоставленного ChatGPT-5.6 Sol.

Тесты

Собственные детекторы исследователей включали IdeaLens в виде контура и документа; вышеупомянутый ProseLens; версии обеих систем ModernBERT-L; версии IdeaLens на базе Qwen3.5-9B; а также вариант IdeaLens с logistic-classifier.

Их сравнили с Pangram 4; EditLens-Llama-3B; Binoculars; EditLens-RoBERTa; MELD; Desklib-academic; Desklib; Entropy; Fast-DetectGPT; Likelihood; Log-rank; LRR; MAGE; OpenAI-RoBERTa-base; OpenAI-RoBERTa-large; RADAR; и Rank.

Для тестов точность измерялась тем, совпадает ли предсказанная метка AI или человека с источником идей. IdeaLens, ProseLens и EditLens использовали глобальный порог 1 % FPR; метки AI, AI‑assisted и человеческие у Pangram 4 были бинаризованы; Fast‑DetectGPT, Binoculars, MELD и Desklib применяли свои стандартные пороги.

Широкая оценка использовала 19 внешних бенчмарков, включая 14, охватывающих полностью человеческий или полностью AI‑материал, и 10, содержащих человеческое письмо, впоследствии отредактированное AI. Дополнительно было протестировано 50 000 документов внутри домена, а 10 000 документов до эпохи ChatGPT C4 использовались для оценки ложных срабатываний:

Результаты тестов, сравнивающие точность детекторов, когда идеи и проза имеют одинаковое или разное происхождение. IdeaLens сохраняет высокую точность в обоих случаях: 95,3 % при общем происхождении и 81,3 % при смешанном; конкурирующие детекторы показывают существенно худшие результаты, когда источник идей отличается от источника прозы.

Результаты тестов, сравнивающие точность детекторов, когда идеи и проза имеют одинаковое или разное происхождение. IdeaLens сохраняет высокую точность в обоих случаях, достигая 95,3 % при общем происхождении и 81,3 % при смешанном; конкурирующие детекторы показывают существенно худшие результаты, когда источник идей отличается от источника прозы.

По результатам 51 теста из 22 бенчмарков IdeaLens оказался единственным детектором, демонстрирующим сильные показатели, когда идеи и проза исходили из одного или разных источников, набрав соответственно 95,3 % и 81,3 %.

Для сравнения, ProseLens и Pangram 4 набрали более 98 % при общем происхождении идей и прозы, но упали до около 25 % при разных источниках.

Авторы делают следующее заявление относительно этих результатов*:

‘Поскольку ProseLens имеет тот же базовый модуль, обучающие документы и метки обучения, что и IdeaLens, это подчёркивает влияние нашего представления контура, которое ModernBERT-based pair воспроизводит с другим базовым модулем.’

‘IdeaLens также неожиданно хорошо переносится на ввод необработанного текста во время тестирования, демонстрируя высокую точность при общем происхождении и существенно более высокую точность при смешанном происхождении, чем ProseLens.’

Все три детектора успешно идентифицировали почти все оригинальные истории, написанные AI. В наборе TwiceTold IdeaLens обнаружил AI‑происхождённые идеи в 68 % человеческих историй, по сравнению с 0 % у ProseLens и 8 % у Pangram 4:

IdeaLens присваивает схожие вероятности AI оригинальным AI‑написанным историям и версиям TwiceTold, написанным людьми на основе тех же AI‑сгенерированных контуров, тогда как вероятности AI у ProseLens резко падают, как только проза переписывается людьми.

IdeaLens присваивает схожие вероятности AI оригинальным AI‑написанным историям и версиям TwiceTold, написанным людьми на основе тех же AI‑сгенерированных контуров, тогда как вероятности AI у ProseLens резко падают, как только проза переписывается людьми.

Несмотря на обучение на английском, IdeaLens обобщился на 24 языка IdeaShift‑X, пометив 95,3 % документов, основанных на AI‑идеях, но лишь 0,7 % когда идеи предоставлял детальный человеческий план. На 10 000 человеческих документов до эпохи ChatGPT на тех же языках уровень ложных срабатываний составил всего 0,1 %.

Авторы признают, что в будущих работах желателен более крупный набор данных, а также может потребоваться решение проблемы шумности меток. Тем не менее, желающие продолжить эту интересную начальную работу могут воспользоваться GitHub repository, предоставленным авторами статьи; а просто любопытные могут вставить «подозрительные» тесты в demo site проекта и самостоятельно оценить, согласуется ли метод с их собственными оценками или с оценками других подходов.

Заключение

То, будет ли такой метод обнаружения имеет значение, зависит от того, как в течение следующих 6‑12 месяцев будет развиваться принятие, интеграция или отклонение AI (несомненно, по‑разному в разных секторах и обстоятельствах).

Возможно, что публика более снисходительна к использованию политиком AI для полировки и представления собственных оригинальных идей, чем к гладкой презентации идей, сгенерированных LLM (в конце концов, статистически аудитория скорее всего будет благосклонна к использованию AI лишь в качестве вспомогательного инструмента презентации).

Тем не менее, в то же время, чего мы ожидаем от AI, если не того, чтобы он генерировал ракурсы, идеи и альтернативы, которые мы сами могли бы упустить или никогда не рассмотреть; и с этой точки зрения, разве это плохая идея — дать машинному интеллекту шанс взять на себя управление?

Что касается восприятия и учитывая известную и растущую склонность ИИ к ошибкам и — в последнее время — неправильному поведению, возможно, ещё слишком рано позволять большим языковым моделям предлагать политические рекомендации или вообще становиться движущей силой в генерации идей.

 

*Акценты авторов, а не мои, но я преобразовал их внутритекстовые ссылки в гиперссылки, где это необходимо.

Первый раз опубликовано во вторник, 6 октября 2026 г.

Автор в области машинного обучения, специалист по синтезу человеческих изображений. Бывший руководитель отдела исследовательского контента в Metaphysic.ai, до его объединения с Brahma.ai от DNEG.
Веб‑сайт: martinanderson.ai
Контакт: martin@martinanderson.ai