Модели и платформы ИИ
Конец цепочки мыслей? CoreThink и исследователи Калифорнийского университета предлагают сдвиг парадигмы в рассуждениях ИИ
На протяжении многих лет гонка в области искусственного интеллекта была сосредоточена на масштабе. Большие модели, больше GPU, длинные подсказки. OpenAI, Anthropic и Google (GOOGL ) возглавили эту гонку с помощью огромных моделей обработки языка (LLM), методов обучения с подкреплением и цепочки мыслей — техник, предназначенных для имитации рассуждений путем подробного описания шагов решения.
Но новая техническая статья под названием CoreThink: Символический слой рассуждений для работы с задачами с длинным горизонтом с помощью LLM от CoreThink AI и исследователей Калифорнийского университета утверждает, что этот парадигма может достигнуть своего потолка. Авторы статьи делают провокационное заявление: LLM — это мощные статистические генераторы текста, но они не являются двигателями рассуждений. А цепочка мыслей, метод, наиболее часто используемый для обоснования обратного, больше похож на театральное представление, чем на настоящую логику.
В ответ команда представляет Общие символы, нейро-символический слой рассуждений, предназначенный для подключения к существующим моделям. Их оценки показывают значительные улучшения во всех областях рассуждений — достигнутые без повторной тренировки или дополнительных затрат на GPU. Если этот подход будет подтвержден, он может стать поворотным моментом в проектировании систем ИИ для логических рассуждений и принятия решений.
Что такое цепочка мыслей — и почему она важна
Цепочка мыслей (CoT) стала одной из наиболее широко используемых техник в современном ИИ. Запрашивая у модели подробного описания шагов рассуждений перед предоставлением ответа, исследователи обнаружили, что они могут улучшить результаты тестов в областях, таких как математика, программирование и планирование. На поверхности это казалось прорывом.
Однако статья подчеркивает ограничения этого подхода. Объяснения CoT могут выглядеть убедительно, но исследования показывают, что они часто не соответствуют тому, что модель фактически вычислила, рационализируя выводы после факта, а не раскрывая настоящую логику. Это создает реальные риски. В медицине правдоподобная история может скрывать зависимость от ошибочных корреляций, что может привести к опасным неправильным диагнозам. В праве сфабрикованные рациональные основания могут быть приняты за настоящие обоснования, что угрожает надлежащей процедуре и подотчетности.
Статья также подчеркивает неэффективность: цепочки CoT часто становятся чрезвычайно длинными при решении простых задач, а при решении сложных задач они сводятся к поверхностному рассуждению. Результатом является расточительная трата вычислительных ресурсов, и в многих случаях снижение точности. Авторы приходят к выводу, что цепочка мыслей — это «театральное представление, а не механизм» — поверхностное представление, создающее иллюзию интерпретируемости без ее реализации.
Символический ИИ: от ранних мечтаний до новых возрождений
Критика CoT приглашает взглянуть на историю символического ИИ. В его ранние десятилетия исследования ИИ вращались вокруг систем, основанных на правилах, которые кодировали знания в явной логической форме. Экспертные системы, такие как MYCIN, пытались диагностировать заболевания, применяя手описные правила, а системы обнаружения мошенничества полагались на огромные логические наборы для обнаружения аномалий.
Символический ИИ имел неоспоримые сильные стороны: каждый шаг его рассуждений был прозрачным и отслеживаемым. Но эти системы были хрупкими. Кодирование десятков тысяч правил требовало огромного труда, и они испытывали трудности при столкновении с новыми ситуациями. Критики, такие как Хуберт Дрейфус, утверждали, что человеческий интеллект зависит от неявных, контекстно-зависимых знаний, которые никакой набор правил не может захватить. К 1990-м годам символические подходы уступили место нейронным сетям, основанным на данных.
В последние годы наблюдается возобновление усилий по объединению сильных сторон обоих миров посредством нейро-символического ИИ. Идея проста: пусть нейронные сети обрабатывают неструктурированные входные данные, такие как изображения или текст, а символические модули обеспечивают структурированные рассуждения и логические гарантии. Но большинство этих гибридных систем испытывали трудности с интеграцией. Символические основы были слишком жесткими, а нейронные модули часто подрывали последовательность. Результатом стали сложные, тяжелые системы, которые не смогли обеспечить обещанную интерпретируемость.
Общие символы: новый слой рассуждений
Слой рассуждений General Symbolics Reasoner (GSR) от CoreThink направлен на преодоление этих ограничений с помощью другого подхода. Вместо перевода языка в жесткие формальные структуры или высокоразмерные вложения GSR работает полностью в пределах естественного языка. Каждый шаг рассуждений выражается словами, обеспечивая сохранение контекста, нюансов и модальности. Это означает, что различия, такие как «должен» и «может», сохраняются на протяжении всего процесса рассуждений, а не абстрагируются.
Фреймворк работает путем анализа входных данных в естественном языке, применения логических ограничений посредством лингвистических преобразований и генерации вербальных следов рассуждений, которые остаются полностью читаемыми для человека. Когда возникают противоречия или ошибки, они сразу же обнаруживаются в пути рассуждений, что позволяет обеспечить прозрачность и отладку. Чтобы сохранить эффективность, система обрезает ненужные шаги, обеспечивая стабильное рассуждение на длинном горизонте без масштабирования GPU.
Поскольку он работает как слой, а не требует повторной тренировки, GSR может быть применен к существующим базовым моделям. В оценках он последовательно демонстрировал улучшения точности на 30-60% в задачах рассуждений, все без увеличения затрат на обучение.
Результаты тестирования
Улучшения лучше всего иллюстрируются тестами. На LiveCodeBench v6, который оценивает задачи программирования конкурсного уровня, CoreThink достигла показателя 66,6% — значительно выше, чем у ведущих моделей в своей категории. В SWE-Bench Lite, тесте для реального исправления ошибок, взятом из репозиториев GitHub, система достигла 62,3% точности, самого высокого результата, когда-либо зарегистрированного. А на ARC-AGI-2, одном из самых сложных тестов абстрактного рассуждения, она набрала 24,4%, значительно превысив передовые модели, такие как Claude и Gemini, которые остаются ниже 6%.
Эти цифры отражают не только сырую точность. В подробных случае-стади исследования символический слой позволил моделям работать по-разному. В ColumnTransformer scikit-learn, например, базовая модель предложила поверхностный патч, который маскировал ошибку. Система, дополненная CoreThink, вместо этого определила проблему синхронизации в корне и исправила ее комплексно. На сложной задаче LeetCode базовая модель неправильно применила динамическое программирование и полностью провалилась, а символический слой рассуждений исправил ошибочное представление состояния и сгенерировал рабочее решение.
Как это вписывается в символическое возрождение
Общие символы присоединяются к растущему движению попыток вернуть структуру в рассуждения ИИ. Классический символический ИИ показал ценность прозрачности, но не мог адаптироваться к новизне. Традиционные нейро-символические гибриды обещали баланс, но часто становились неуклюжими. Стеки планирования, которые прикрепляли поиск к LLM, предлагали раннюю надежду, но рухнули под сложностью, когда задачи масштабировались.
Последние достижения указывают на потенциал новых гибридных систем. Например, AlphaGeometry от DeepMind продемонстрировала, что символические структуры могут превосходить чисто нейронные модели в задачах геометрии. Подход CoreThink расширяет эту тенденцию. В своей трубопроводе ARC-AGI детерминированное обнаружение объектов и символическая абстракция закономерностей объединяются с нейронной реализацией, производя результаты, далеко превосходящие те, которые могут достичь системы LLM.
Ключевое различие заключается в том, что Общие символы не полагаются на жесткую логику или массивную повторную тренировку. Рассуждая напрямую на языке, он остается гибким, сохраняя при этом интерпретируемость. Это делает его легче, чем ранее гибридные системы, и, что важно, практичным для интеграции в корпоративные приложения.
Почему это важно
Если цепочка мыслей — это иллюзия рассуждений, то индустрия ИИ сталкивается с насущной проблемой. Предприятия не могут полагаться на системы, которые только кажутся рассуждающими, особенно в высокорисковых средах, таких как медицина, право и финансы. Статья предполагает, что настоящий прогресс будет достигнут не за счет масштабирования моделей, а за счет переосмысления основ рассуждений.
Общие символы — это одно из таких основ. Он предлагает легкий, интерпретируемый слой, который может улучшить существующие модели без повторной тренировки, производя настоящие улучшения рассуждений, а не поверхностные истории. Для более широкого сообщества ИИ это может означать сдвиг парадигмы: возвращение символического рассуждения, не как хрупкого набора правил, а как гибкого компаньона нейронного обучения.
Как говорят авторы: «Нам не нужно добавлять больше параметров, чтобы получить лучшее рассуждение — нам нужно переосмыслить основы».












