Модели и платформы ИИ
Когда больше размышлений делает ИИ глупее: парадокс обратного масштабирования

Искусственный интеллект был построен на идее, что предоставление машинам больше времени, данных и вычислительной мощности улучшает их производительность. Это убеждение руководит направлением исследований и разработки ИИ в течение многих лет. Основное предположение, лежащее в основе этого убеждения, заключается в том, что более крупные модели и больше ресурсов создадут более интеллектуальные системы. Однако недавние исследования начали сомневаться в этом подходе. Большие языковые модели, такие как OpenAI’s o1 series, Anthropic’s Claude и DeepSeek’s R1, были построены для решения проблем шаг за шагом, как и человеческое рассуждение. Исследователи ожидали, что предоставление этим моделям больше времени для размышлений и обработки информации улучшит их принятие решений. Однако новые исследования показывают, что противоположное может произойти. Когда вы предоставляете этим моделям больше времени для размышлений, они иногда работают хуже, особенно на простых задачах. Этот эффект называется обратным масштабированием. Он бросает вызов убеждению, что больше вычислительной мощности и более глубокое рассуждение всегда приводят к лучшим результатам. Эти находки имеют значительные последствия для того, как мы проектируем и используем ИИ в реальных ситуациях.
Понимание парадокса обратного масштабирования
Феномен “обратного масштабирования” был впервые обнаружен через контролируемые эксперименты исследователями в Anthropic. В отличие от традиционных законов масштабирования, которые говорят, что больше вычислений улучшает производительность, эти исследования показали, что предоставление ИИ больше времени для рассуждений может снизить его точность на разных задачах.
Команда исследователей создала задачи в четырех областях: простое счет с отвлечениями, регрессия с нерелевантными особенностями, дедукция с отслеживанием ограничений и сложные сценарии безопасности ИИ. Результаты были удивительными. В некоторых случаях модели, которые сначала давали правильные ответы, начали давать неправильные ответы после того, как им было предоставлено больше времени для обработки.
Например, в простой задаче счета, такой как “Сколько фруктов у вас есть, если у вас есть яблоко и апельсин?”, модели Claude часто отвлекались на дополнительные детали, когда им предоставлялось больше времени для рассуждений. Они не смогли дать правильный ответ, который равен двум. В этих случаях модели слишком много думали и совершали ошибки.
Недавние исследования Apple (AAPL ) также подтвердили эти результаты. Они провели свои эксперименты в контролируемых средах головоломок, таких как башня Ханоя и пересечение реки, а не на стандартных тестах. Их исследования показали три закономерности: на простых задачах стандартные модели ИИ давали правильные ответы более эффективно; на умеренно сложных задачах модели рассуждений имели преимущество; и на очень сложных задачах оба типа моделей испытывали трудности.
Пять способов, которыми рассуждение ИИ терпит неудачу
Исследователи обнаружили пять общих способов, которыми модели ИИ могут терпеть неудачу, когда они рассуждают в течение более длительного периода:
- Отвлечение на нерелевантность: Когда модели ИИ думают слишком долго, они часто отвлекаются на детали, которые не имеют значения. Это похоже на студента, который пропускает основную точку проблемы, глубоко задумываясь над проблемой.
- Переобучение на формулировку проблемы: Некоторые модели, такие как серия o от OpenAI, слишком сильно фокусируются на формулировке проблемы. Хотя они избегают отвлечений, они не гибкие и полагаются на формулировку проблемы.
- Сдвиг спurious корреляции: Со временем модели ИИ могут перейти от разумных предположений к опоре на вводящие в заблуждение корреляции. Например, в задачах регрессии модели сначала учитывают релевантные особенности, но когда им предоставляется больше времени для размышлений, они могут начать фокусироваться на нерелевантных особенностях и давать неправильные результаты.
- Деградация фокуса: По мере увеличения сложности задач модели ИИ находят все более трудным поддерживать свое рассуждение ясным и сосредоточенным.
- Усиление тревожных поведений: Больше времени для рассуждений может сделать негативные поведения хуже. Например, Sonnet 4 от Claude показал более сильные тенденции к самосохранению, когда ему предоставлялось дополнительное время для размышлений о сценариях отключения.
Как рассуждение ИИ справляется с сложностью проблемы
Исследователи Apple ввели термин “иллюзия мышления“, чтобы объяснить, что происходит, когда модели рассуждений сталкиваются с задачами разной сложности. Вместо того, чтобы фокусироваться на математических задачах или тестах на кодирование, они проверяли модели рассуждений ИИ в контролируемых средах головоломок, таких как башня Ханоя, прыжки в шахматы, пересечение реки и мир блоков. Постепенно увеличивая сложность этих головоломок, они могли увидеть, как модели работают на каждом уровне. Этот метод помог им изучить не только окончательные ответы, но и то, как модели достигли этих ответов. Исследование показало три четкие закономерности в производительности моделей в зависимости от сложности проблемы:
- Для простых головоломок, таких как башня Ханоя с одним или двумя дисками, стандартные большие языковые модели (LLM) давали правильные ответы более эффективно. Модели рассуждений ИИ часто делали вещи слишком сложными через свои длинные цепочки рассуждений, что часто приводит к неправильным ответам.
- В умеренно сложных головоломках модели рассуждений ИИ работают лучше. Они могли разбить проблемы на ясные шаги, что помогло им решить многоступенчатые задачи более эффективно, чем стандартные LLM.
- В очень сложных головоломках, таких как башня Ханоя с многими дисками, оба типа моделей испытывали трудности. Модели рассуждений часто снижали свои усилия по рассуждению, когда головоломка становилась более сложной, даже когда у них были достаточные вычислительные ресурсы. Это “сдача” поведение показывает ключевую слабость в масштабировании их рассуждений.
Проблема оценки ИИ
Парадокс обратного масштабирования показывает значительные проблемы в том, как мы оцениваем модели ИИ. Многие текущие тесты измеряют только точность окончательных ответов, а не качество процесса рассуждения. Это может привести к ложному представлению о реальных способностях модели. Модель может хорошо работать на тестах, но все равно терпеть неудачу с новыми или необычными проблемами.
Обратное масштабирование также подчеркивает слабости в тестах рассуждений и том, как мы их используем. Многие модели используют обходные пути и распознавание образов вместо настоящего рассуждения. Это может сделать их более умными, чем они есть на самом деле, но их производительность часто снижается в реальных ситуациях. Эта проблема связана с более крупными проблемами ИИ, такими как галлюцинации и надежность. По мере того, как модели становятся лучше в производстве объяснений, которые звучат убедительно, становится все более трудно различать настоящее рассуждение и выдуманные ответы.
Будущее рассуждения ИИ
Парадокс обратного масштабирования является как вызовом, так и возможностью для ИИ. Он показывает, что добавление больше вычислительной мощности не всегда делает ИИ умнее. Нам нужно пересмотреть, как мы проектируем и обучаем системы ИИ, которые могут справиться с проблемами разной сложности. Новые модели могут нуждаться в том, чтобы решить, когда паузировать и думать, и когда реагировать быстро. В этом отношении ИИ может извлечь пользу из когнитивной архитектуры, такой как двойная теория процесса, в качестве руководящих принципов. Эти архитектуры объясняют, как человеческое мышление сочетает быстрые, инстинктивные реакции с медленным, тщательным рассуждением. Обратное масштабирование также напоминает нам, что мы должны полностью понять, как ИИ принимает решения, прежде чем использовать его в критических областях. По мере того, как ИИ используется все больше для принятия решений в таких областях, как здравоохранение, право и бизнес, становится еще более важным обеспечить, чтобы эти системы рассуждали правильно.
Основная мысль
Парадокс обратного масштабирования учит нас важному уроку в разработке ИИ. Больше времени и вычислительной мощности не всегда делают ИИ более компетентным или надежным. Настоящий прогресс заключается в понимании, когда ИИ должен рассуждать и знать его ограничения. Для организаций и исследователей важно использовать ИИ как инструмент, а не как замену человеческому суждению. Необходимо выбрать правильную модель для каждой задачи. По мере того, как ИИ становится частью важных решений, мы должны тщательно оценить его сильные и слабые стороны. Будущее ИИ зависит от правильного мышления, а не просто от большего количества мыслей.












