Взгляд Anderson
Снижение многословности повышает точность в больших языковых моделях

Новые исследования показывают, что заставление больших языковых моделей давать более короткие ответы заметно улучшает точность и качество их ответов.
Каждый, кто пытался остановить чат-бота от «болтовни», признает выводы новых исследований: заставление ИИ давать более короткие ответы делает его более точным.
Изучая причины, почему более крупные модели ИИ работают хуже в этом отношении, чем более мелкие, в определенных случаях (известных как обратное масштабирование), исследования показали, что заставление 31 популярных больших языковых моделей (БЯМ) давать короче ответы привело к улучшению точности их ответов на 26,3%:
‘Результаты предоставляют убедительные доказательства: ограничения краткости улучшили точность крупных моделей на 26,3 процентных пункта и уменьшили разрыв обратного масштабирования на 67% (с 44,2% до 14,8%, парный т-тест: t = 7,80, p < 0,0001).'
Чрезмерная многословность является частой жалобой среди конечных пользователей, особенно среди тех, кто использует коммерческие модели, такие как ChatGPT, где форумы поддержки часто обсуждают эту тему.
Область, наиболее пострадавшая от устранения многословности в ответах, – это математика, где тестируемые ИИ были ограничены ответами в 50 слов или меньше. Для задач чтения они были ограничены ответами всего в 10 слов.
Статья определяет склонность ИИ к многословности как чрезмерное мышление, когда центральное сообщение не только окутано словами, но иногда даже негативно влияет на него. Чем меньше модель, наблюдает статья, тем меньше это решение необходимо, или работает.
Исследования показывают, что нет ничего архитектурного, что нужно решить, чтобы применить это решение систематически. Однако в сессии пользователя директива краткости, скорее всего, потребует повторения, тогда как глобально примененный системный запрос – который потребует реализации в качестве инженерного дефолта на платформах, таких как ChatGPT – может сделать более короткие ответы поведением по умолчанию.
Ветреные ветры
Ничто из этого не объясняет, почему более крупные модели склонны к многословности, поскольку это влияет на открытые модели, а также на другие. Статья предполагает, что протоколы и общие практики в техниках обучения с подкреплением от человеческой обратной связи (RLHF) могут предложить объяснение*:
‘Вероятная причина – это обучение RLHF, где человеческие аннотаторы вознаграждают тщательность несоразмерно в более крупных моделях с большей способностью действовать на сигналы длины – что соответствует различиям в многословности, которые больше в инструктивных, чем в базовых вариантах моделей. ‘
‘Предыдущие исследования документируют систематическую длину предвзятости в наградных моделях, где аннотаторы смешивают длину с качеством. ‘
‘Более крупные модели, имеющие большую способность удовлетворять сигналы длины, могут внутренне усваивать многословное поколение более глубоко, чем более мелкие модели, производя зависимое от масштаба чрезмерное мышление, которое мы наблюдаем.’
У людей многословность может возникнуть чтобы заполнить молчание, или чтобы скрыть чувства неловкости, из-за психического заболевания, или чтобы скрыть недостаток знаний. По сути, ИИ может быть подвержен влиянию этих факторов только через поглощение обучающих данных, которые отражают/проявляют эти черты.
В корпусах наборов данных существуют другие мотивы для многословных ответов, такие как стимул SEO для производства более длинного текстового контента, например в рецептах, где длина становится (часто ошибочно) связанной с авторитетом.
Что не может быть полностью исключено, так это то, что платформы на основе API, стимулируемые к тому, чтобы подтолкнуть пользователей к более высокой и более дорогой подписке, либо поощряют, либо не контролируют многословность, поскольку это увеличивает использование токенов довольно дешево, без необходимости чрезмерного рассуждения или RAG вызовов†.
Новая статья называется Ограничения краткости обращают иерархии производительности в языковых моделях и исходит из департамента информатики Шведского политехнического института в Читтагонге, в Бангладеш.
Метод
Чтобы проверить теории статьи, 31 языковая модель была оценена – слишком много, чтобы перечислить их здесь в текстовой форме, но изображено на изображении ниже:

Большие языковые модели (БЯМ), протестированные в различных частях испытаний для новой статьи.
Модели были оценены по пяти коллекциям эталонных тестов: GSM8K, для математических рассуждений; BoolQ, для чтения; CommonsenseQA, для рассуждений на основе здравого смысла; ARC-Easy, для научных вопросов; и MMLU-STEM, также для научных знаний.
Ответы были сгенерированы с помощью жадного декодирования, чтобы обеспечить детерминированные выходы, затем извлечены с помощью правил, специфичных для задач, с точностью, измеренной как доля правильных ответов против фактических данных.
Модели были разделены по размеру, с теми, которые были ниже 10 миллиардов параметров, рассматриваемыми как «маленькие», и теми, которые были выше 70 миллиардов, как «большие», на основе наблюдаемых разрывов в производительности.
Обратное масштабирование было количественно оценено путем сравнения производительности этих групп на каждой проблеме, отмечая случаи, когда более мелкие модели превосходили более крупные; статистический размер эффекта затем был использован для подтверждения того, что эти разрывы отражали последовательные, осмысленные различия, а не шум.
Исключая воспоминание
Чтобы исключить возможность того, что модели просто воспоминают обучающие данные, были проведены три отдельных проверки, изучающие, насколько ответы варьировались; насколько их длина колебалась; и как ошибки были совершены. Если модели полагались на запомненные закономерности, ответы, скорее всего, повторялись или следовали фиксированным шаблонам; вместо этого ответы оказались в основном уникальными среди моделей, с заметным варьированием длины от одного ответа к другому.
Ошибки также были осмотрены напрямую, и большинство неудач имели форму длинных, неправильных объяснений, а не коротких, уклончивых ответов – что указывает на то, что модели генерировали фактические рассуждения, а не извлекали хранимые ответы.
Данные и испытания
При тестировании на отдельные вопросы, а не на общий балл, значительная часть задач эталонных тестов оказалась неинформативной, с 27,1%, не разделяющих модели вообще, поскольку либо каждая система преуспела, либо каждая система потерпела неудачу, не давая никакого реального сигнала о относительной производительности:

Разбивка проблем по пяти эталонным тестам показала, что значительная часть задач не смогла различить модели, в то время как меньшая, но последовательная часть демонстрировала обратное масштабирование, где более мелкие модели превосходили более крупные. Общая распределение по 1485 проблемам показывает, что 7,7% демонстрируют обратное масштабирование. Источник
Среди вопросов, которые действительно различали модели, большинство вели себя как ожидается, с более крупными системами, работающими лучше, но меньшая часть показывала противоположный шаблон, с более мелкими моделями, выходящими на первое место. По всем проблемам обратное масштабирование появилось в 7,7% случаев, что указывает на то, что этот эффект не является маргинальным.
Появление обратного масштабирования
По пяти эталонным тестам 115 проблем были найдены, где более мелкие модели превосходили более крупные, составляя 7,7% всех 1485 задач, что указывает на то, что обратное масштабирование не является редким или маргинальным явлением в этом контексте.
Фактически, эффект появился в каждом наборе данных: наиболее сильно в BoolQ и более слабо в CommonsenseQA, ARC-Easy, GSM8K и MMLU-STEM, что указывает на то, что это распространенное явление, но варьируется по задаче:

Обратное масштабирование появилось во всех наборах данных, варьируясь от 3,9% в MMLU-STEM до 11,3% в BoolQ, с 115 проблемами в общей сложности. Разрывы в производительности отдавали предпочтение более мелким моделям в среднем на 28,4 процентных пункта. Точность снижалась по мере увеличения размера модели, с более мелкими моделями, достигающими 66,1%, по сравнению с 41,5% для более крупных моделей.
Размер разрыва оказался существенным, с более мелкими моделями, опережающими на 28,4 процентных пункта, и каждым случаем, показывающим один и тот же направление преимущества, указывающим на последовательное снижение производительности, а не случайные или ад hoc ошибки.
Тот же шаблон сохранился в разных семействах моделей, включая Llama, Qwen, Gemma и Mistral, где более крупные версии работали хуже, чем более мелкие, с точностью, склоняющейся к снижению по мере увеличения размера модели на этих проблемах.
Разрыв между более мелкими и более крупными моделями был достаточно большим, чтобы шанс не смог объяснить его; и поскольку тот же шаблон появился в разных наборах данных, задачах и семействах моделей, обратное масштабирование появилось как последовательный, а не случайный эффект.
При рассмотрении внутри каждого семейства моделей более крупные версии повторно работали хуже, чем более мелкие, на этих проблемах, что указывает на то, что снижение может быть связано с масштабом himself, а не с различиями в конструкции.
Результаты также указывают на предел для каждой задачи, где увеличение размера модели начинает вредить производительности, что показывает, что более крупные модели не всегда приводят к лучшим результатам.
Изучение чрезмерного мышления
После установления того, что более крупные модели иногда работают хуже на определенных областях, анализ обратился к тому, почему это происходит, предлагая, что проблема заключается не в отсутствии способности, а в слишком большом количестве объяснений – т.е. в случаях, когда более длинные ответы начинают закрывать правильное рассуждение.
По данным более длинные ответы были связаны с более низкой точностью на этих трудных проблемах, хотя более крупные и более мелкие модели производили примерно одинаковое количество шагов рассуждения, что указывает на то, что проблема заключается не в том, сколько рассуждений выполняется, а в том, как оно выражается:

Более короткие ответы улучшили производительность более крупных моделей и уменьшили разрыв с более мелкими моделями, сократив разницу с 44,2 процентных пункта до 14,8 (и в некоторых случаях полностью обратив ее), в то время как прямые форматы ответов сузили ее еще больше. Наиболее сильные выигрыши появились в GSM8K и MMLU-STEM, где рейтинги были перевернуты в пользу более крупных моделей, и проверки длины ответов подтвердили, что вмешательство сработало, с выходными данными, уменьшающимися с примерно 197 токенов до менее 80, связывая снижение многословности с улучшением точности.
Когда ответы были вынуждены быть более короткими, более крупные модели улучшили себя значительно, уменьшив существенный разрыв в производительности, и, в некоторых случаях, почти полностью исключив его. Напротив, более мелкие модели изменились очень мало, что указывает на то, что многословность активно вредила более крупным системам.
Эффект оказался варьирующимся по задаче, с некоторыми наборами данных, выигрывающими от более коротких ответов, и другими, требующими определенного уровня объяснения; но в нескольких случаях рейтинг между более мелкими и более крупными моделями полностью изменился, когда многословность была ограничена, что показало, что более крупные модели имели скрытую способность которая была маскирована чрезмерной экспозицией.
Дальнейший анализ показал, что более крупные модели склонны производить более длинные выходные данные в целом, несмотря на использование немного меньше явных шагов рассуждения, что указывает на более разрозненный и менее структурированный стиль рассуждения.
Напротив, более мелкие модели давали более короткие, более прямые ответы, что предполагает, что способ, которым выражается рассуждение, а не количество рассуждения само по себе, стимулирует снижение производительности.
Авторы заключают в целом, что ограничения краткости приносят выгоды точности, и считают, что это может стать фундаментальной функцией в языковых моделях, а не повторяющимся, применяемым пользователем ограничением, которое не выживает между сессиями; и они заявляют:
‘[Ограничения краткости] помогают более крупным моделям значительно, в то время как практически не влияют на более мелкие модели. ‘
‘Если многословность была бы случайной, а не причинной, можно было бы ожидать единообразные изменения точности в обеих категориях размеров. Дифференцированный ответ подтверждает, что чрезмерное мышление является специфическим для масштаба режимом неисправности, а не эффектом трудности задачи.’
Вывод
За пределами открытых версий, протестированных исследователями, проблема многословности, кажется, появляется с определенной частотой в многих крупных моделях, помимо ChatGPT, включая Claude, Gemini и Grok.
Независимо от того, игнорируют ли эти платформы проблему многословности, потому что она увеличивает использование токенов и поощряет более высокие расходы†, не кажется разумным, что они бы приняли снижение точности, сопровождающее это «подталкивание».
Было бы интересно увидеть, может ли какой-либо эмпирический метод определить с уверенностью, откуда берется тенденция к многословности. Каждый, кто когда-либо пытался заставить чат-бота действительно общаться, а не «блогить» многословные, многоступенчатые ответы пользователю, осознал, что модель была сильно запечатлена «все-в-одном» руководствами и «принятыми решениями» в своих обучающих данных.
Было бы очень интересно увидеть, может ли модель, специально обученная на пошаговых разговорах, действительно отклониться от многословной, суммирующей тенденции. Однако, кажется, что некоторые ограничения или фильтры должны быть применены к весу, который модель обучается давать «решенному» ответу, чтобы она могла обучаться напрямую также на предшествующем материале – по сути, на явном рассуждении, явном в пошаговых разговорах.
Поскольку подходящий материал, кажется, редок, возможно, что единственный способ продвинуться в этом подходе будет через синтетические данные, где «сложные» окончательные выводы разбиваются на пошаговые разговоры – иронично, точно так же, как AI-подкасты Google NotebookLM могут интерпретировать из простого текстового ввода.
* Мое преобразование встроенных цитат авторов в гиперссылки.
† Но давайте будем честными, разрыв между фактическими затратами на предоставление ИИ и подписными сборами в настоящее время так велик, что это просто повредит репутации пользовательской базы, не решив суровые основные экономические проблемы этой фазы «преобразования» и «сходимости» фазы ИИ.
Опубликовано впервые в воскресенье, 5 апреля 2026 года












