Взгляд Anderson

Даже передовые языковые модели склонны к «интерпретативной» транскрипции

mm
Добавьте Unite.AI в избранные источники в Google
AI-generated image (GPT-2): a construction worker wearing a tool belt stands beneath scaffolding, holding a printed job sheet and scratching his head while facing a large stone wall engraved with a partially completed version of the United States Declaration of Independence in which numerous words have been mistakenly replaced with incorrect alternatives, ending at the word 'foam'. A workbench holding chisels and a hammer stands in the foreground, with stone dust scattered below the unfinished carving. The photorealistic scene is surrounded by a yellow-and-black warning-style border labeled 'AI FANTASY INSIDE' along the top and right edges and 'REALITY OUTSIDE' along the bottom and left edges, with black directional arrows pointing inward.

Новые исследования компании Amazon показывают, что чем умнее модель, тем больше вероятность того, что она «станет творческой», когда ее просят выполнить оптическое распознавание символов.

 

Оптическое распознавание символов (OCR) считается в основном решенной проблемой. Если вы сканируете какой-либо текст или представляете фотографию текста системе OCR, она выполняет сложную индивидуализацию каждого символа, делая лучшую возможную догадку на основе каждого символа:

Вверху слева, зонирование характерных локусов в сегментированном идентифицированном букве (источник - https://home.nr.no/~eikvil/OCR.pdf); основная картинка: результат сегментации для институционального репозитория (Источник - https://ijarse.com/ADMIN/admin/postimages/images/fullpdf/1473863345_515_IJARSE.pdf)

Вверху слева, зонирование характерных локусов в сегментированном идентифицированном букве (источник); основная картинка: результат сегментации для институционального репозитория (Источник).

OCR интерпретирует символы индивидуально; эти символы, находящиеся в достаточно близком расстоянии, могут или не могут составлять слова или другие лингвистические конструкции. OCR не заботится; к моменту, когда эти проблемы возникают, оно уже закончило свою работу и перешло к следующей задаче, потому что проверка орфографии не входит в его обязанности.

Одной из наиболее популярных систем OCR является известная Tesseract, строго алгоритмический интерпретатор, широко используемый в различных открытых приложениях и рабочих процессах. С широким спектром «плоских» алгоритмических дополнений OCR, доступных на всех операционных системах, возможность преобразования изображения текста обратно в редактируемый текст достигла статуса бесплатной коммерции – даже если ни одна система не идеальна.

Кроме того, чтобы остаться актуальными, организации и коммерческие продукты, традиционно конкурирующие в алгоритмическом пространстве OCR, адаптировали свои устаревшие системы в системы управления документами с помощью ИИ. Однако основная технология – выдача оценочных групп сегментированных и идентифицированных букв – остается неизменной.

Слово

Вместе с растущим количеством задач OCR все чаще выполняется новым поколением моделей языка и зрения (VLMs); столкнувшись с нередактируемым или растеризованным текстом, агентные версии этих последних систем могут ловко прочитать и транслитерировать при необходимости.

Однако, согласно новому исследовательскому докладу компании Amazon.com, те, кто считает, что ИИ будет точно воспроизводить ту же функцию, что и OCR, могут столкнуться с сюрпризом: новое исследование показало, что ваша любимая LLM с большей вероятностью «перейдет на следующий уровень» при транскрипции, независимо от того, хотите ли вы этого или нет; превышая контекст на уровне букв в контекст на уровне слов – и исправляя любые «ошибки», которые она находит, способами, которые могут иметь нежелательные последствия для таких областей, как юридическая, медицинская и историческая транслитерация.

Авторы утверждают:

‘Модели языка и зрения (VLMs) все чаще используются вместо традиционных конвейеров OCR для понимания документов.

‘[Мы] показываем, что они не всегда действуют как верные транскрибенты: когда текст несовершенен, они часто склонны переписать его в более правдоподобную форму – поведение, которое чистые текстовые бенчмарки OCR не могут обнаружить.’

Авторы вводят новый большой курированный набор данных и бенчмарк под названием FaithC4, который они протестировали на выборке из 15 моделей с открытым и закрытым исходным кодом, включая версии ChatGPT и Google Gemini.

Они обнаружили, что общие модели ИИ были намного более склонны, чем традиционные системы OCR, заменять несовершенные слова на более «правдоподобные» ones, иногда переписывая почти 65% перемешанных слов, в то время как небольшие локальные ошибки также вызывали ошибки в других местах в иначе точном тексте.

Короткие слова были особенно уязвимы, и явные инструкции не делать исправления уменьшили проблему, хотя не исключили ее полностью.

Доклад гласит*:

‘Хотя поведение переписывания может быть полезным для восстановления некоторых настоящих ошибок, оно может быть проблематичным для некоторых областей, которые могут требовать буквальной транскрипции, таких как юридические документы, медицинские записи и исторические рукописи.

‘Несмотря на его важность, это поведение переписывания было в значительной степени упущено из виду в исследованиях VLM. Существующие OCR бенчмарки фокусируются на распознавании чистого текста и поэтому недостаточны для исследования того, как модели могут справиться с несовершенными входными данными.’

Центральное сообщение заключается в том, что более продвинутые системы ИИ борются не с исправлением ошибок, которые алгоритмические платформы OCR могут легко настроить на «сырые»; во многих случаях человеческая интерпретация необходима для решения проблемы; но если уже применено неправильное «исправление», проблема будет склонна ускользнуть из поля зрения большинства систем проверки.

Новая статья озаглавлена Читают ли VLM или переписывают? О верности транскрипции в моделях языка и зрения, и исходит от пяти исследователей компании Amazon.com.

Данные и метод

Чтобы заполнить свой набор данных для бенчмарка, авторы использовали Colossal Cleaned Crawled Corpus – также известный как C4 – гипермасштабный веб-краулинг-сбор 2020 года. Из этого корпуса были выбраны 1 455 одностраницных документов на английском, китайском и корейском языках, с каждым отрывком, размером с одну отрендеренную страницу.

Окончательный бенчмарк содержал 500 английских документов, 500 китайских документов и 455 корейских документов, предоставляя многоязычную тестовую базу для измерения того, копируют ли системы ИИ текст верно или как-то переписывают его.

Чтобы проверить, будут ли модели ИИ верно копировать то, что они видят, были введены контролируемые ошибки в документы до их рендеринга в виде изображений, с примерно 8% измененных допустимых слов, каждое из которых содержало не менее четырех символов. Не тронутые версии этих документов использовались в качестве эталона.

Три варианта искажений были затем применены: перемешивание перемешивало внутренние буквы слов, сохраняя первые и последние буквы; случайный заменяет каждый символ на случайную альтернативу из той же системы письма; и визуальный заменяет визуально похожие символы, которые остаются правдоподобными для глаза, но меняя основной текст.

Китайская версия опустила условие перемешивания, поскольку ее система письма не имеет слов, разделенных пробелами, вместо этого используя фиксированные четырехсимвольные окна для других искажений; кроме того, более короткая средняя длина слов корейского языка означала, что меньше слов квалифицировались для изменения.

Каждый документ был затем отрендерен в виде PDF-страницы и передан конкурирующим системам транскрипции.

Тесты

Тесты для исследования охватывали как закрытые, так и открытые модели, включая закрытые общие модели, такие как GPT-5.4-mini; Gemini-3-Flash; и Gemini-2.5-Flash; и открытые модели, включающие общие модели Qwen3.5-4B; Qwen3-VL-4B; InternVL3.5-4B; Gemma4-E4B; и Gemma4-E2B.

Кроме того, были включены специализированные модели OCR, включающие olmOCR-2-7B; DeepSeek-OCR-2; MinerU2.5-Pro; PaddleOCR-VL-1.5; и LightOnOCR-2-1B. Наконец, традиционные двигатели OCR Tesseract и docTR также были протестированы.

Три группы полагаются на язык в разной степени: общие модели ИИ сильно полагаются на широкие знания языка, приобретенные во время предварительной подготовки; специализированные модели OCR уделяют больше внимания верной транскрипции документов через обучение, специфичное для задачи; и традиционные системы OCR полагаются на распознавание символов, а не на лингвистические выводы.

Были приняты два метрики, начиная с ошибки слова (WER), стандартный метрик OCR для определения того, сколько полных слов система транскрибирует неправильно. Вместо простого подсчета неправильных символов WER записывает замены, удаления и вставки относительно исходного текста, что делает его чувствительным как к неправильным словам, так и к словам, которые были опущены или добавлены.

Для китайского языка, где слова не разделены пробелами, был применен тот же подход на уровне символов, как ошибка символа (CER).

Чтобы обнаружить более тонкие ошибки, был также использован метрик podobieństwo расстояния редактирования (EDS). EDS сравнивает предсказанный текст с исходным на уровне символов и – в отличие от WER – может различать слово, которое полностью неправильно, и слово, которое отличается только одним или двумя символами. Естественно, это делает его полезным для обнаружения почти-промахов, а также частичных переписываний, которые могли бы в противном случае показаться похожими.

Как показано на графике ниже, традиционные системы OCR оказались наиболее устойчивыми ко всем трем типам искажений, с небольшим снижением точности, поскольку они в основном распознают отдельные символы, а не пытаются вывести слова из контекста:

Изменения в ошибке слова (слева) и подобieństwie расстояния редактирования (справа) на английском, китайском и корейском языках после применения трех методов искажения текста. Традиционные системы OCR показали наименьшее снижение производительности в целом, специализированные модели OCR заняли среднюю позицию, а общие модели ИИ были наиболее пострадали от поврежденного текста.

Изменения в ошибке слова (слева) и подобieństwie расстояния редактирования (справа) на английском, китайском и корейском языках после применения трех методов искажения текста. Традиционные системы OCR показали наименьшее снижение производительности в целом, специализированные модели OCR заняли среднюю позицию, а общие модели ИИ были наиболее пострадали от поврежденного текста. Источник

Специализированные модели ИИ OCR заняли среднюю позицию; MinerU и LightOn остались относительно устойчивыми; и olmOCR и DeepSeek-OCR показали большую чувствительность к поврежденному тексту, указывая на то, что обучение, специфичное для документа, уменьшило, но не исключило, тенденцию к переинтерпретации того, что читается.

Общие модели ИИ показали худшие результаты в целом, демонстрируя наибольшее увеличение ошибок транскрипции при столкновении с поврежденным текстом. Большинство из них пострадали намного больше, чем либо специализированные модели OCR, либо традиционные системы OCR – хотя Gemini-3-Flash выделился как заметное исключение, выполняя гораздо более как традиционная система OCR.

В целом, рейтинг тесно соответствовал степени, в которой каждая модель полагалась на знания языка, с более сильными языковыми приоритетами, соответствующими большей склонности к переписыванию, а не простой транскрипции текста.

Разбивка типов ошибок, показанная в таблице ниже, указывает на то, что традиционные системы OCR в основном производили обычные ошибки транскрипции, такие как замены, вставки и удаления:

Результаты английского теста «перемешивания», показывающие, как каждая система транскрипции распределяет свои ошибки по точным переписываниям, gần-мисс транскрипциям ( «Близко» ), более существенным ошибкам транскрипции ( «Умеренно» ) и совершенно неправильным выводам ( «Неправильно» ). Модели упорядочены по их скорости переписывания поврежденных слов.

Результаты английского теста «перемешивания», показывающие, как каждая система транскрипции распределяет свои ошибки по точным переписываниям, gần-мисс транскрипциям ( «Близко» ), более существенным ошибкам транскрипции ( «Умеренно» ) и совершенно неправильным выводам ( «Неправильно» ). Модели упорядочены по их скорости переписывания поврежденных слов.

Напротив, общие модели ИИ были намного более склонны заменять поврежденные слова на правдоподобные альтернативы, сохраняя окружающую предложение, что дает сильные доказательства того, что они не просто неправильно читают поврежденный текст, а активно переписывают его, используя лингвистический контекст.

Исследование также показало, что ошибки транскрипции не остались ограниченными поврежденными словами:

Результаты анализа распространения ошибок, показывающие частоту ошибок на слове для поврежденных и неповрежденных слов после каждого типа искажения. Изменение около 4,7% слов вызвало распространение ошибок транскрипции в окружающий, неизмененный текст во многих моделях.

Результаты анализа распространения ошибок, показывающие частоту ошибок на слове для поврежденных и неповрежденных слов после каждого типа искажения. Изменение около 4,7% слов вызвало распространение ошибок транскрипции в окружающий, неизмененный текст во многих моделях.

Как показано в таблице результатов выше и графике ниже, изменение около 4,7% слов в английском документе существенно увеличило частоту ошибок в окружающем, неизмененном тексте:

Дополнительные результаты анализа распространения ошибок, показывающие увеличение ошибок транскрипции на поврежденных и неповрежденных словах после каждого типа искажения. Общие модели ИИ показали наибольшее увеличение ошибок, с ошибками, часто распространяющимися за пределы исходно поврежденных слов.

Дополнительные результаты анализа распространения ошибок, показывающие увеличение ошибок транскрипции на поврежденных и неповрежденных словах после каждого типа искажения. Общие модели ИИ показали наибольшее увеличение ошибок, с ошибками, часто распространяющимися за пределы исходно поврежденных слов.

Общие модели VLM были наиболее пострадали, с частотой ошибок на неизмененных словах, увеличивающейся до десяти раз по сравнению с базовым уровнем. Напротив, традиционные системы OCR показали только незначительные увеличения. Модели, которые переписывали наибольшую долю поврежденных слов, также показали самое сильное распространение ошибок, что предполагает, что оба поведения исходят из одной и той же основной зависимости от лингвистического контекста.

На практике это означает, что небольшое количество поврежденного текста может поставить под угрозу точность в целом неизменного документа, что делает чистые бенчмарки OCR ненадежным ориентиром для реальной верности транскрипции.

Наконец, авторы также изучили, влияет ли длина слова на поведение переписывания, обнаружив, что более короткие слова были намного более уязвимы, чем более длинные.

Поскольку они содержат меньше визуальных подсказок, краткие слова, кажется, побуждают VLM полагаться больше на контекстуальные знания языка – увеличивая вероятность того, что поврежденный текст будет заменен на правдоподобную альтернативу, вместо того, чтобы быть транскрибированным буквально (что могло бы вызвать полезный сигнал для человеческого надзора).

Авторы также обнаружили, что хотя явные инструкции не исправлять ошибки уменьшили эту тенденцию, они не исключили ее полностью. Это, кажется, указывает на то, что интерпретативная транскрипция является внутренней характеристикой текущих VLM, а не поведением, которое можно надежно подавить с помощью одних только подсказок.

Авторы заключили:

‘Для приложений, которые требуют буквальной транскрипции, таких как обработка юридических документов, оцифровка исторических рукописей и судебная экспертиза, традиционные системы OCR или тщательно отобранные специализированные VLM остаются наиболее безопасным выбором, в то время как общие VLM вводят систематическое переписывание, которое чистые бенчмарки не отражают.’

Вывод

Это исследование повторяет то, что становится повторяющейся нитью в литературе LLM: что хотя обученные модели VLM невероятно мощны, они также устойчивы к критическим инструкциям – в данном случае Прочитайте и проанализируйте буквы, которые вы видите на изображении.

Более продвинутые модели просто не могут сделать этого, кажется – как будто они считают это «черной работой» или же иррационально вынуждены завершить «полуфинированную задачу».

 

* Мой перевод встроенных цитат авторов в гиперссылки.

Опубликовано в понедельник, 27 июля 2026 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai