Взгляд Anderson

Борьба ИИ с имитацией исторического языка

mm
Добавьте Unite.AI в избранные источники в Google
ChatGPT-4o and Adobe Firefly.

Сотрудничество между исследователями в США и Канаде показало, что крупные языковые модели (LLM), такие как ChatGPT, испытывают трудности в воспроизведении исторических идиом без обширной предварительной подготовки – дорогостоящего и трудоемкого процесса, который выходит за рамки возможностей большинства академических или развлекательных инициатив, что делает проекты, такие как завершение последнего, незаконченного романа Чарльза Диккенса с помощью ИИ, маловероятным.

Исследователи изучили ряд методов для генерации текста, который звучал исторически точно, начиная с простого подсказывания с помощью ранней прозы XX века и переходя к тонкой настройке коммерческой модели на небольшой коллекции книг из того периода.

Они также сравнили результаты с отдельной моделью, которая была обучена исключительно на книгах, опубликованных между 1880 и 1914 годами.

В первом из тестов, когда ChatGPT-4o был подсказан findesiècle язык, результаты были довольно khácными от результатов меньшей модели GPT2, которая была тонко настроена на литературу того периода:

Когда ChatGPT-4o был попросен завершить реальный исторический текст, даже хорошо подготовленный ChatGPT-4o (внизу слева) не мог не вернуться к «режиму блога», не сумев воспроизвести запрошенный идиом. Напротив, тонко настроенная модель GPT2 хорошо воспроизводила стиль языка, но была менее точной в других отношениях. Источник: https://arxiv.org/pdf/2505.00030

Когда ChatGPT-4o был попросен завершить реальный исторический текст (в центре), даже хорошо подготовленный ChatGPT-4o (внизу слева) не мог не вернуться к «режиму блога», не сумев воспроизвести запрошенный идиом. Напротив, тонко настроенная модель GPT2 (внизу справа) хорошо воспроизводила стиль языка, но была менее точной в других отношениях. Источник: https://arxiv.org/pdf/2505.00030

Хотя тонкая настройка приближает выходной текст к оригинальному стилю, человеческие читатели все еще часто могли обнаружить следы современного языка или идей, что говорит о том, что даже тщательно настроенные модели продолжают отражать влияние их современных тренировочных данных.

Исследователи приходят к разочаровывающему выводу, что нет экономически эффективных способов генерации машинного текста, идiomatically правильного для исторического диалога. Они также предполагают, что сама задача может быть неправильно поставлена:

‘[Мы] также должны рассмотреть возможность того, что анахронизм может быть в некотором смысле неизбежен. Будем ли мы представлять прошлое, обучая исторические модели так, чтобы они могли вести разговоры, или обучая современные модели имитировать более старый период, может потребоваться некоторый компромисс между целями аутентичности и разговорной плавности.

‘Ведь нет «аутентичных» примеров разговора между вопросом XXI века и ответом из 1914 года. Исследователи, пытающиеся создать такой разговор, должны будут подумать о [предпосылке] того, что интерпретация всегда включает в себя переговоры между настоящим и [прошлым]’

Новая статья озаглавлена Могут ли языковые модели представлять прошлое без анахронизма? и исходит от трех исследователей из Университета Иллинойса, Университета Британской Колумбии и Корнелльского университета.

Полный провал

Первоначально, в трехчастном исследовательском подходе, авторы проверили, могут ли современные языковые модели быть подтолкнуты к имитации исторического языка с помощью простого подсказывания. Используя реальные отрывки из книг, опубликованных между 1905 и 1914 годами, они попросили ChatGPT-4o продолжить эти отрывки в том же идиоме.

Оригинальный периодический текст был:

‘В этом последнем случае экономятся около пяти или шести долларов за минуту, поскольку более двадцати ярдов пленки необходимо перемотать, чтобы проецировать в течение одной минуты объект в покое или пейзаж. Таким образом, получается практическая комбинация фиксированных и движущихся картинок, которая производит наиболее художественные эффекты.

‘Она также позволяет нам работать с двумя кинематографами, проецирующими попеременно, чтобы избежать мерцания, или проецирующими одновременно красные и зеленые изображения и воспроизводящими естественные цвета, тем самым облегчая человеческий глаз, привыкший получать фундаментальные цвета одновременно, от всех физиологических нагрузок. Слово теперь об применении холодного света к мгновенной фотографии.’

Чтобы оценить, соответствует ли сгенерированный текст историческому стилю, и осознав, что люди не особенно умело угадывают дату, когда текст был написан, исследователи тонко настроили модель RoBERTa для прогнозирования даты публикации, используя подмножество Корпуса исторического американского английского, охватывающего материал с 1810 по 2009 год.

Модель RoBERTa затем была использована для оценки продолжений, сгенерированных ChatGPT-4o, которые были подсказаны реальными отрывками из книг, опубликованных между 1905 и 1914 годами.

Системная подсказка (т.е. контекстные инструкции для ChatGPT о том, как подойти к задаче) была:

‘Ваша задача — завершить отрывки из книг начала XX века. Вам будет дан отрывок из книги, опубликованной в 1913 году. Продолжите этот отрывок в том же стиле, не менее 200 слов. Только предоставьте это продолжение; не делайте никаких рамочных замечаний, типа „вот продолжение“.’

Несмотря на однократное и 20-кратное подсказывание, выходные данные ChatGPT-4o постоянно отклонялись в сторону стилистического регистра XXI века.

Пример, приведенный в статье, представляет собой одну из попыток ChatGPT-4o завершить реальный периодический текст о фотографии:

‘Использование холодного света в мгновенной фотографии революционизировало подход к захвату изображений в различных условиях освещения. Традиционно фотографы боролись с жесткостью и изменчивостью естественного света или навязчивым характером вспышки, который мог нарушить атмосферу сцены или естественное поведение объектов, особенно в дикой природе и в фотографиях людей.

‘Холодный свет, с его мягким и более рассеянным характером… позволяет получить более естественное представление цветов и текстур, которое часто теряется при жестком искусственном освещении.’

Как мы легко можем видеть, этот общий, стиль Вики текста не соответствует многословному и сложному стилю оригинального периодического текста. Кроме того, он не продолжает оригинальный контент, а запускает в побочную, абстрактную размышление о одной из подсубтем.

Команда также протестировала GPT-1914, меньшую модель GPT-2, обученную с нуля на 26,5 миллиардах токенов литературы, датированной между 1880 и 1914 годами.

Хотя его выходные данные были менее связными, чем у ChatGPT-4o, они были более последовательными со стилем исходного периода. Единственный пример, приведенный в статье, представляет собой завершение реального периодического текста о фотографии:

‘Принцип его действия уже был объяснен (стр. 4). Мы здесь только упомянем, что его можно применить с пользой, когда мы хотим получить очень быстрые фотографии на бумаге, покрытой коллодием, а также те, которые получены с помощью желатиновых пластин.

‘В таких случаях воздействие не должно превышать одну секунду; но если картина желательно развить за более короткое время — скажем, за половину секунды — то температура не должна падать ниже 20° C; в противном случае изображение станет слишком темным после развития; кроме того, пластина потеряет свою чувствительность при этих условиях.

‘Для обычных целей, однако, достаточно просто подвергнуть чувствительную поверхность низкой степени тепла без каких-либо особых мер предосторожности, кроме как сохранять ее’ [sic]

Поскольку даже реальный и оригинальный материал архаичен и довольно трудно понять, трудно понять, в какой степени GPT-1914 точно воспроизвел оригинал; но выходные данные, безусловно, звучат более периодически.

Однако авторы заключили из этого эксперимента, что простое подсказывание делает мало, чтобы преодолеть современные предубеждения крупной предварительно обученной модели, такой как ChatGPT-4o.

Сюжет загустевает

Чтобы измерить, насколько близко выходные данные модели походили на аутентичное историческое письмо, исследователи использовали статистический классификатор для оценки вероятной даты публикации каждого образца текста. Затем они визуализировали результаты с помощью графика плотности ядра, который показывает, где модель считает, что каждый отрывок находится на исторической временной шкале.

Оцененные даты публикации для реального и сгенерированного текста, основанные на классификаторе, обученном распознавать исторический стиль (тексты-источники 1905-1914 годов, сравненные с продолжениями GPT-4o с помощью однократного и 20-кратного подсказывания, и GPT-1914, обученной только на литературе 1880-1914 годов).

Оцененные даты публикации для реального и сгенерированного текста, основанные на классификаторе, обученном распознавать исторический стиль (тексты-источники 1905-1914 годов, сравненные с продолжениями GPT-4o с помощью однократного и 20-кратного подсказывания, и GPT-1914, обученной только на литературе 1880-1914 годов).

Тонко настроенная модель RoBERTa, использованная для этой задачи, не идеальна, но все же смогла подчеркнуть общие стилистические тенденции. Отрывки, написанные GPT-1914, модели, обученной на периодической литературе, кластеризовались вокруг начала XX века — подобно исходному материалу.

Напротив, выходные данные ChatGPT-4o, даже при подсказывании несколькими историческими примерами, склонялись к стилю письма XXI века, отражая данные, на которых она была первоначально обучена.

Исследователи количественно оценили это несоответствие с помощью расхода Дженсена-Шеннона, меры того, насколько различны две вероятностные распределения. GPT-1914 получил близкий результат 0,006 по сравнению с реальным историческим текстом, в то время как выходные данные ChatGPT-4o, однократное и 20-кратное подсказывание, показали гораздо более широкие разрывы, на уровне 0,310 и 0,350 соответственно.

Авторы утверждают, что эти результаты указывают на то, что подсказывание само по себе, даже с несколькими примерами, не является надежным способом производства текста, который убедительно имитирует исторический стиль.

Завершение отрывка

Статья затем исследует, может ли тонкая настройка дать лучший результат, поскольку этот процесс включает прямое влияние на веса модели с помощью пользовательских данных — процесса, который может повлиять на исходную базовую функциональность модели, но значительно улучшить ее производительность в области, которая «внедряется» в нее или подчеркивается во время тонкой настройки.

В первом эксперименте по тонкой настройке команда обучила GPT-4o-mini на около двух тысяч пар завершения отрывков, взятых из книг, опубликованных между 1905 и 1914 годами, с целью проверки того, может ли тонкая настройка модели с меньшим масштабом сдвинуть выходные данные модели в сторону более исторически точного стиля.

Используя тот же классификатор RoBERTa, который выступал в качестве судьи в предыдущих тестах для оценки стилистической «даты» каждого выходного текста, исследователи обнаружили, что в новом эксперименте тонко настроенная модель произвела текст, тесно связанный с основным текстом.

Его стилистическое расхождение с исходными текстами, измеренное расходом Дженсена-Шеннона, снизилось до 0,002, в целом соответствуя GPT-1914:

Оцененные даты публикации для реального и сгенерированного текста, показывающие, насколько близко GPT-1914 и тонко настроенная версия GPT-4o-mini соответствуют стилю начала XX века (на основе книг, опубликованных между 1905 и 1914 годами).

Оцененные даты публикации для реального и сгенерированного текста, показывающие, насколько близко GPT-1914 и тонко настроенная версия GPT-4o-mini соответствуют стилю начала XX века (на основе книг, опубликованных между 1905 и 1914 годами).

Однако исследователи предупреждают, что эта метрика может захватить только поверхностные особенности исторического стиля, а не более глубокие концептуальные или фактические анахронизмы.

‘[Это] не очень чувствительный тест. Модель RoBERTa, использованная здесь в качестве судьи, обучена предсказывать только дату, а не различать аутентичные отрывки и анахронизмы. Она, вероятно, использует грубые стилистические доказательства для этого прогноза. Человеческие читатели или более крупные модели все еще могут обнаружить анахронистический контент в отрывках, которые поверхностно звучат «в период».’

Человеческий фактор

Наконец, исследователи провели тесты оценки с участием человека, используя 250手обранных отрывков из книг, опубликованных между 1905 и 1914 годами, и они отмечают, что многие из этих текстов, вероятно, будут интерпретированы совершенно иначе сегодня, чем в момент написания:

‘Наш список включал, например, статью об Эльзасе (который тогда был частью Германии) и одну о бери-бери (который тогда часто объяснялся как грибковое заболевание, а не как заболевание, вызванное дефицитом питательных веществ). Хотя это различия фактов, мы также выбрали отрывки, которые бы показали более тонкие различия в отношении, риторике или воображении.

‘Например, описания неевропейских мест в начале XX века склонны скользить в расовые обобщения. Описание восхода солнца на луне, написанное в 1913 году, представляет богатые хроматические явления, поскольку никто еще не видел фотографий мира без атмосферы.’

Исследователи создали короткие вопросы, на которые каждый исторический отрывок мог бы ответить, затем тонко настроили GPT-4o-mini на эти пары вопрос-ответ. Чтобы укрепить оценку, они обучили пять отдельных версий модели, каждую раз держа разную часть данных для тестирования.

Затем они сгенерировали ответы, используя как исходные версии GPT-4o и GPT-4o-mini, так и тонко настроенные варианты, каждая из которых оценивалась на части данных, которую она не видела во время обучения.

Заблудился во времени

Чтобы оценить, насколько убедительно модели могли имитировать исторический язык, исследователи попросили трех экспертных аннотаторов просмотреть 120 сгенерированных ИИ завершений и оценить, кажется ли каждое из них правдоподобным для писателя в 1914 году.

Этот прямой подход к оценке оказался более сложным, чем ожидалось: хотя аннотаторы согласились в своих оценках почти восемьдесят процентов времени, дисбаланс в их суждениях (с «правдоподобным» выбранным в два раза чаще, чем «не правдоподобным») означал, что их фактический уровень согласия был только умеренным, измеренный коэффициентом Коэна 0,554.

Оценщики сами описали задачу как сложную, часто требующую дополнительных исследований для оценки того, соответствует ли заявление тому, что было известно или верилось в 1914 году.

Некоторые отрывки вызвали трудные вопросы о тоне и перспективе — например, был ли ответ достаточно ограничен в своем мировоззрении, чтобы отразить то, что было бы типично в 1914 году. Этот тип суждения часто зависел от уровня этноцентризма (т.е. тенденции рассматривать другие культуры через предположения или предубеждения своей собственной).

В этом контексте задача заключалась в том, чтобы решить, выражает ли отрывок достаточно культурного предубеждения, чтобы показаться исторически правдоподобным, не звуча при этом слишком современно или слишком явно оскорбительно по современным стандартам. Авторы отмечают, что даже для ученых, знакомых с периодом, было трудно провести четкую границу между языком, который казался исторически точным, и языком, который отражал современные идеи.

Тем не менее, результаты показали четкую оценку моделей, с тонко настроенной версией GPT-4o-mini, признанной наиболее правдоподобной в целом:

Оценки аннотаторов того, насколько правдоподобным кажется выходной текст каждой модели

Оценки аннотаторов того, насколько правдоподобным кажется выходной текст каждой модели

Неясно, является ли этот уровень производительности, оцененный как «правдоподобный» в восьмидесяти процентах случаев, достаточным для исторических исследований — особенно поскольку в исследовании не было базовой меры того, как часто подлинные периодические тексты могли быть неправильно классифицированы.

Тревога

Далее последовал «тест-интрудер», в котором экспертным аннотаторам были показаны четыре анонимных отрывка, отвечающих на один и тот же исторический вопрос. Три ответа были получены от языковых моделей, в то время как один был реальным и подлинным отрывком из раннего XX века.

Задача заключалась в том, чтобы определить, какой отрывок является оригинальным, написанным во время периода.

Этот подход не просил аннотаторов напрямую оценивать правдоподобность, а скорее измерял, как часто реальный отрывок выделялся из ответов ИИ, по сути, тестируя, могут ли модели обмануть читателей, заставив их думать, что их выходной текст является аутентичным.

Оценка моделей соответствовала результатам предыдущей задачи оценки: тонко настроенная версия GPT-4o-mini была наиболее убедительной среди моделей, но все еще не дотягивала до реального.

Частота, с которой каждый источник был правильно идентифицирован как аутентичный исторический отрывок.

Частота, с которой каждый источник был правильно идентифицирован как аутентичный исторический отрывок.

Этот тест также послужил полезной базовой линией, поскольку, с реальным отрывком, идентифицированным более чем в половине случаев, разрыв между аутентичной и синтетической прозой оставался заметным для человеческих читателей.

Статистический анализ, известный как тест МакНемара, подтвердил, что различия между моделями были значимыми, за исключением случая двух неразработанных версий (GPT-4o и GPT-4o-mini), которые показали схожую производительность.

Будущее прошлого

Авторы обнаружили, что подсказывание современных языковых моделей для принятия исторического голоса не дает надежных результатов: менее двух третей выходных данных были признаны правдоподобными человеческими читателями, и даже эта цифра, вероятно, завышена.

Во многих случаях ответы включали явные сигналы того, что модель говорила с точки зрения настоящего — фразы, такие как ‘в 1914 году еще не известно, что…’ или ‘на 1914 год я не знаком с…’ были достаточно распространены, чтобы появиться в до одной пятой всех завершений. Такие оговорки делали ясным, что модель имитирует историю извне, а не пишет изнутри.

Авторы заявляют:

‘Низкая производительность контекстного обучения неудачна, поскольку эти методы являются наиболее простыми и дешевыми для исследований на основе ИИ. Мы подчеркиваем, что мы не исследовали эти подходы исчерпывающе.

‘Возможно, контекстное обучение окажется достаточным — сейчас или в будущем — для подмножества исследовательских областей. Но наши первоначальные данные не обнадеживают.’

Авторы заключают, что хотя тонкая настройка коммерческой модели на исторических отрывках может произвести стилистически убедительный выходной текст при минимальных затратах, она не полностью устраняет следы современной точки зрения. Предварительное обучение модели исключительно на периодическом материале избегает анахронизма, но требует гораздо больших ресурсов и приводит к менее связному выходному тексту.

Ни один из методов не предлагает полного решения, и, пока, любая попытка симулировать исторические голоса, кажется, предполагает компромисс между аутентичностью и связностью. Авторы заключают, что дальнейшие исследования будут необходимы, чтобы прояснить, как лучше всего ориентироваться в этом напряжении.

Заключение

Возможно, один из наиболее интересных вопросов, возникающих из новой статьи, — это вопрос об аутентичности. Хотя они не являются идеальными инструментами, функции потерь и метрики, такие как LPIPS и SSIM, дают исследователям в области компьютерного зрения хотя бы методологию для оценки против основного текста.

Когда речь идет о генерации нового текста в стиле ушедшей эпохи, напротив, нет основного текста — только попытка воспроизвести утерянную культурную точку зрения. Попытка реконструировать этот образ мышления из литературных следов является сама по себе актом квантования, поскольку такие следы являются лишь доказательствами, в то время как культурное сознание, из которого они возникают, остается за пределами вывода и, вероятно, за пределами воображения.

На практическом уровне также основы современных языковых моделей, сформированные современными нормами и данными, рискуют переинтерпретировать или подавить идеи, которые казались бы разумными или незаметными для читателя Эдуарда, но которые теперь регистрируются как (часто оскорбительные) артефакты предубеждения, неравенства или несправедливости. Одна из них задается вопросом, даже если бы мы могли создать такой диалог, не оттолкнет ли он нас.

 

Опубликовано в первый раз в пятницу, 2 мая 2025 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai