Модели и платформы ИИ
Уверенно Неправильно: Почему Самые Умные Модели ИИ Худшие в Исправлении Себя

Многие в сообществе ИИ считают, что следующая большая революция будет эпохой самоулучшающегося ИИ, где ИИ сможет улучшать себя без вмешательства человека. Аргументация такова: по мере роста возможностей моделей они в конечном итоге научатся не только на данных, но и на самих себе. Каждый итерационный процесс будет совершенствовать предыдущий. Ошибки будут выявлены, исправлены и устранены. Со временем это наращивание улучшений может спровоцировать интеллектуальный взрыв, где ИИ начинает создавать ИИ. Этот взгляд лежит в основе большей части возбуждения вокруг рекурсивного ИИ, автономных агентов и долгожданного интеллектуального взрыва. В центре этого взгляда лежит способность ИИ-систем надежно исправлять свои собственные ошибки. Однако без надежной самоисправления самоулучшение не может быть достигнуто. Система, которая не может распознавать, когда она ошибается, не может осмысленно учиться на своих собственных выводах, независимо от того, насколько она кажется мощной.
Преобладающее предположение было таковым, что самоисправление естественным образом возникнет по мере роста возможностей моделей. Это убеждение кажется интуитивным. Ведь более сильные модели знают больше, лучше рассуждают и хорошо выполняют задачи. Однако недавние исследования показывают контринтуитивное открытие, что более продвинутые модели часто испытывают трудности в исправлении своих собственных ошибок, тогда как более слабые модели лучше справляются с самоисправлением. Это явление, известное как парадокс точности-исправления, заставляет нас пересмотреть не только то, как ИИ-системы рассуждают, но и насколько мы действительно готовы к самоулучшающемуся ИИ.
Понимание Самоулучшающегося ИИ
Самоулучшающийся ИИ относится к ИИ-системе, которая может выявить свои собственные ошибки, научиться на них и итеративно усовершенствовать свое поведение. В отличие от традиционных моделей, которые полагаются исключительно на обучающие данные, созданные людьми, самоулучшающийся ИИ будет активно оценивать свои собственные выводы и адаптироваться со временем. Теоретически это создает замкнутую обратную связь, где каждый цикл обучения строится на предыдущем, что приводит к тому, что часто описывается как интеллектуальный взрыв.
Но достижение этой цели далеко не тривиально. Самоулучшение требует больше, чем сырая вычислительная мощность или более крупные наборы данных. Оно требует надежной самооценки, включая способность обнаруживать ошибки, выявлять их источники и производить исправленные решения. Без этих возможностей модель не может различать правильный путь рассуждения и ошибочный. Итерация по неправильному решению, независимо от того, насколько быстро, только укрепляет ошибки, а не улучшает производительность.
Это различие имеет решающее значение. У людей обучение на ошибках часто включает в себя размышление, проверку гипотез и коррекцию курса. Для ИИ эти процессы должны быть закодированы внутри самой системы. Если модель не может надежно распознавать и исправлять свои ошибки, она не может участвовать осмысленно в цикле самоулучшения, и обещание рекурсивного интеллекта остается теоретическим, а не практическим.
Парадокс Точности-Исправления
Самоисправление часто рассматривается как единая способность, но на самом деле оно объединяет несколько различных возможностей, которые должны быть рассмотрены отдельно. Как минимум, мы можем разделить его на три измеримые подспособности: обнаружение ошибок, локализация ошибок или обнаружение источника и исправление ошибок. Обнаружение ошибок задает вопрос, может ли модель распознать, что ее вывод неверен. Локализация ошибок фокусируется на выявлении места, где происходит ошибка. Исправление ошибок относится к способности производить исправленное решение.
Измеряя эти возможности отдельно, исследователи раскрывают важные идеи о ограничениях текущих систем. Они показывают, что модели сильно различаются по этим способностям. Некоторые модели хорошо обнаруживают ошибки, но плохо исправляют их. Другие едва распознают ошибки, но все же способны исправить их через повторные попытки. Более важно, что эти идеи показывают, что улучшение в одной области не гарантирует улучшения в других.
Когда исследователи тестируют продвинутые модели на сложных математических задачах рассуждения, эти модели совершали меньше ошибок. Это было ожидаемо. Что было неожиданным, так это то, что когда эти модели совершали ошибки, они были менее склонны исправлять их самостоятельно. Напротив, более слабые модели, несмотря на то, что они совершали больше ошибок, были значительно лучше в исправлении своих ошибок без внешней обратной связи. Другими словами, исследователи обнаружили, что точность и самоисправление двигались в противоположных направлениях, парадокс, который они называют парадоксом точности-исправления. Это открытие бросает вызов глубоко укоренившемуся убеждению в разработке ИИ. Мы часто предполагаем, что масштабирование моделей улучшает каждый аспект интеллекта. Парадокс показывает, что это предположение не всегда справедливо, особенно для интроспективных способностей.
Гипотеза Глубины Ошибок
Этот парадокс вызывает очевидный вопрос: почему более слабые модели превосходят более сильные в самоисправлении? Исследователи находят ответ, изучая тип ошибок, совершаемых моделями. Они обнаружили, что более сильные модели совершают меньше ошибок, но ошибки, которые они совершают, являются “глубокими” и более устойчивыми к исправлению. Напротив, более слабые модели совершают “мелкие” ошибки, которые легко исправляются во время второго прохода.
Исследователи называют это открытие гипотезой глубины ошибок. Они категоризируют ошибки на ошибки установки, логические ошибки и расчетные ошибки. Ошибки установки включают неправильное толкование проблемы. Логические ошибки возникают, когда путь рассуждения структурно ошибочен. Расчетные ошибки являются простыми арифметическими ошибками. Для GPT-3.5 большинство ошибок (62%) являются простыми расчетными ошибками. Это мелкие ошибки. Когда модель предупреждается “проверить тщательно”, она часто может найти арифметическую ошибку и исправить ее. Для DeepSeek, однако, 77% его ошибок являются ошибками установки или логическими ошибками. Эти глубокие ошибки требуют от модели фундаментально переосмыслить свой подход. Сильные модели испытывают трудности с этим, потому что они склонны привязываться к своему первоначальному пути рассуждения. По мере увеличения интеллекта модели только самые устойчивые и трудные ошибки остаются.
Почему Обнаружение Ошибок Не Гарантирует Их Исправление
Одним из самых удивительных открытий исследования является то, что обнаружение ошибок не коррелирует с способностью исправлять ошибки. Модель может правильно выявить, что ее ответ неверен, но все же не исправить его. Другая модель может едва обнаружить ошибки, но улучшиться через повторное решение. Claude-3-Haiku предоставляет наиболее драматический пример. Claude обнаружил только 10,1% своих собственных ошибок, что является наименьшим показателем среди всех протестированных моделей. Несмотря на это слабое обнаружение, он достиг наивысшего внутреннего коэффициента исправления на уровне 29,1%. Для сравнения, GPT-3.5 обнаружил 81,5% своих ошибок, но исправил только 26,8%.
Это говорит о том, что некоторые модели могут “случайно” исправлять свои ошибки, просто перерешая проблему через другой путь выборки, даже если они не распознают, что первая попытка была неверной. Этот разрыв опасен для реального развертывания. Когда модель слишком уверена и не может обнаружить свои логические ошибки, она может представить правдоподобное, но совершенно неверное объяснение как истину. В некоторых случаях, побуждая модель выявить свои собственные ошибки, может ухудшить ситуацию. Когда модель неправильно выявляет, где она ошиблась, она привязывается к ошибочному объяснению и усиливает ошибку. Вместо того, чтобы помогать, самоисправляющиеся подсказки могут запереть модель в неправильном пути рассуждения. Это поведение отражает человеческую когнитивную предвзятость. Как только мы считаем, что знаем, где ошибка, мы перестаем искать более глубокие причины.
Итерация Помогает, Но Не В равной Степени
Исследование также показывает, что итеративное размышление часто улучшает результаты, но не все модели пользуются этим одинаково. Более слабые модели значительно выигрывают от нескольких раундов переосмысления, поскольку каждая итерация дает им еще один шанс исправить свои поверхностные проблемы. Сильные модели показывают гораздо меньшие выгоды от итерации. Их ошибки не легко решаются повторением. Без внешнего руководства дополнительные попытки часто воспроизводят тот же ошибочный путь рассуждения в разных словах. Это открытие говорит о том, что техники самоусовершенствования не являются универсально эффективными. Их успех зависит от характера ошибок, которые совершаются, а не только от интеллекта модели.
Что Это Значит для Проектирования Систем ИИ
Эти идеи имеют практические последствия. Во-первых, мы должны перестать предполагать, что более высокая точность подразумевает лучшее самоисправление. Системы, которые полагаются на автономное самоусовершенствование, должны быть протестированы явно на поведение исправления, а не только на конечную производительность. Во-вторых, разные модели могут потребовать разных стратегий вмешательства. Более слабые модели могут выиграть от простой верификации и итерации. Сильные модели могут потребовать внешней обратной связи, структурированной верификации или инструментальных проверок, чтобы преодолеть глубокие ошибки рассуждения. В-третьих, конвейеры самоисправления должны быть осведомлены об ошибках. Понимание того, склонна ли задача к мелким или глубоким ошибкам, может проинформировать, будет ли самоисправление работать вообще. Наконец, эталонные оценки должны разделить обнаружение, локализацию и исправление. Относиться к ним как к единой мере скрывает критические слабости, которые имеют значение в реальных развертываниях.
Основная Идея
Самоулучшающийся ИИ зависит не только от производства правильных ответов, но и от способности распознавать, диагностировать и пересматривать неправильные. Парадокс точности-исправления показывает, что более сильные модели не автоматически лучше в этом задании. По мере того, как модели становятся более способными, их ошибки растут глубже, труднее обнаружить и более устойчивы к самоисправлению. Это означает, что прогресс в масштабировании модели alone не достаточно. Если мы хотим ИИ-системы, которые действительно могут учиться на своих собственных ошибках, самоисправление должно быть рассмотрено как отдельная способность, явно измеренная, обученная и поддержанная.












