Модели и платформы ИИ
Иллюзия рассуждений ИИ: исследование Apple и дебаты о способностях ИИ к мышлению

Искусственный интеллект (ИИ) теперь является частью нашей повседневной жизни. Он управляет голосовыми помощниками, запускает чат-ботов и помогает принимать критические решения в таких отраслях, как здравоохранение, банковское дело и бизнес. Продвинутые системы, такие как OpenAI’s GPT-4 и Google’s Gemini, часто считаются способными предоставлять интеллектуальные, похожие на человеческие ответы. Многие люди считают, что эти модели могут рассуждать и мыслить как люди.
Однако исследование Apple 2025 года (AAPL ) оспаривает это убеждение. Их исследование ставит под вопрос, могут ли эти Большие модели рассуждений (БМР) действительно мыслить. Исследование заключает, что эти ИИ могут не использовать настоящие рассуждения, а вместо этого полагаться на распознавание образов. Модели выявляют и повторяют образы из своих тренировочных данных, а не создают новую логику или понимание.
Apple протестировала несколько ведущих моделей ИИ с помощью классических логических головоломок. Результаты были неожиданными. На более простых задачах стандартные модели иногда работали лучше, чем более продвинутые модели рассуждений. На умеренно сложных головоломках БМР показали некоторые преимущества. Но когда головоломки стали более сложными, оба типа моделей полностью провалились. Даже когда им предоставили правильное пошаговое решение, модели не смогли следовать ему надежно.
Результаты Apple вызвали дебаты в сообществе ИИ. Некоторые эксперты согласны с Apple, говоря, что эти модели создают только иллюзию мышления. Другие утверждают, что тесты могут не полностью отражать возможности ИИ и что необходимы более эффективные методы. Главный вопрос сейчас: Может ли ИИ действительно рассуждать или это просто продвинутое распознавание образов?
Этот вопрос важен для всех. Поскольку ИИ становится более распространенным, важно понять, что эти системы могут и чего они не могут делать.
Что такое Большие модели рассуждений (БМР)?
БМР – это системы ИИ, предназначенные для решения проблем путем пошагового рассуждения. В отличие от стандартных языковых моделей, которые генерируют ответы на основе предсказания следующего слова, БМР стремятся предоставить логические объяснения. Это делает их полезными для задач, которые требуют нескольких шагов рассуждения и абстрактного мышления.
БМР обучаются на больших наборах данных, которые включают книги, статьи, веб-сайты и другой текстовый контент. Это обучение позволяет моделям понять языковые образы и логические структуры, обычно встречающиеся в человеческом рассуждении. Показывая, как они приходят к своим выводам, БМР должны предоставлять более ясные и достоверные результаты.
Эти модели перспективны, потому что они могут справиться с сложными задачами в различных областях. Цель – повысить прозрачность принятия решений, особенно в критических областях, которые полагаются на точные и логические выводы.
Однако есть опасения по поводу того, действительно ли БМР рассуждают. Некоторые считают, что вместо того, чтобы мыслить в человеческом стиле, они могут использовать распознавание образов. Это вызывает вопросы о реальных пределах систем ИИ и о том, имитируют ли они рассуждение.
Исследование Apple: тестирование рассуждений ИИ и иллюзия мышления
Чтобы ответить на вопрос, могут ли БМР действительно рассуждать или являются просто продвинутыми распознавателями образов, команда исследователей Apple разработала набор экспериментов с помощью классических логических головоломок. Это включало головоломки “Башня Ханоя”, “Пересечение реки” и “Мир блоков”, которые давно используются для проверки человеческого логического мышления. Команда выбрала эти головоломки, потому что их сложность могла быть отрегулирована. Это позволило им оценить как стандартные языковые модели, так и БМР при разных уровнях сложности.
Подход Apple к тестированию рассуждений ИИ отличался от традиционных тестов, которые часто фокусируются на математических или кодировочных задачах. Эти тесты могут быть подвержены влиянию экспозиции моделей к подобным данным во время обучения. Вместо этого команда Apple использовала головоломки, которые позволяли им контролировать сложность, сохраняя при этом последовательные логические структуры. Этот дизайн позволил им наблюдать не только окончательные ответы, но и шаги рассуждения, предпринятые моделями.
Исследование показало три различных уровня производительности:
Простые задачи
На фундаментальных задачах стандартные языковые модели иногда работали лучше, чем более продвинутые БМР. Эти задачи были достаточно простыми, чтобы более простые модели могли генерировать правильные ответы более эффективно.
Умеренно сложные задачи
Когда сложность головоломок увеличилась, БМР, предназначенные для предоставления структурированных рассуждений с пошаговыми объяснениями, показали преимущество. Эти модели могли следовать процессу рассуждения и предлагать более точные решения, чем стандартные модели.
Высокосложные задачи
Когда головоломки стали более сложными, оба типа моделей полностью провалились. Хотя модели имели достаточные вычислительные ресурсы, они не смогли решить задачи. Их точность упала до нуля, что указывало на то, что они не могли справиться с уровнем сложности, необходимым для этих задач.
Распознавание образов или настоящие рассуждения?
При дальнейшем анализе исследователи обнаружили больше проблем с рассуждениями моделей. Ответы, предоставленные моделями, сильно зависели от того, как были представлены задачи. Небольшие изменения, такие как изменение чисел или имен переменных, могли привести к совершенно разным ответам. Эта последовательность предполагает, что модели полагаются на выученные образы из своих тренировочных данных, а не применяют логические рассуждения.
Исследование показало, что даже когда были предоставлены явные алгоритмы или пошаговые инструкции, модели часто не могли использовать их правильно, когда сложность головоломок увеличилась. Их следы рассуждения показали, что модели не последовательно следовали правилам или логике. Вместо этого их решения варьировались в зависимости от поверхностных изменений входных данных, а не от фактической структуры задачи.
Команда Apple заключила, что то, что казалось рассуждением, часто было просто продвинутым распознаванием образов. Хотя эти модели могут имитировать рассуждение, распознавая знакомые образы, они не действительно понимают задачи или применяют логику в человеческом стиле.
Продолжающиеся дебаты: может ли ИИ действительно рассуждать или просто имитировать мышление?
Исследование Apple привело к дебатам в сообществе ИИ о том, могут ли БМР действительно рассуждать. Многие эксперты теперь поддерживают выводы Apple, утверждая, что эти модели создают иллюзию рассуждения. Они считают, что когда они сталкиваются с сложными или новыми задачами, оба типа моделей испытывают трудности, даже когда им предоставлены правильные инструкции или алгоритмы. Это предполагает, что рассуждение часто является просто способностью распознавать и повторять образы из тренировочных данных, а не настоящим пониманием.
С другой стороны, компании как OpenAI и некоторые исследователи считают, что их модели могут рассуждать. Они ссылаются на высокую производительность на стандартизированных тестах, таких как LSAT, и сложных математических экзаменах. Например, OpenAI’s GPT-4 набрал 88-й процентиль среди тестируемых на LSAT. Некоторые интерпретируют эту высокую производительность как доказательство способности к рассуждению. Сторонники этого взгляда утверждают, что такие результаты показывают, что модели ИИ могут рассуждать, по крайней мере в определенных ситуациях.
Однако исследование Apple оспаривает этот взгляд. Исследователи утверждают, что высокие баллы на стандартизированных тестах не обязательно указывают на точное понимание или рассуждение. Текущие тесты могут не полностью отражать навыки рассуждения и могут быть подвержены влиянию данных, на которых были обучены модели. Во многих случаях модели могут просто повторять образы из своих тренировочных данных, а не действительно рассуждать о новых задачах.
Эти дебаты имеют практические последствия. Если модели ИИ не действительно рассуждают, они могут быть ненадежными для задач, которые требуют логического принятия решений. Это особенно важно в таких областях, как здравоохранение, финансы и право, где ошибки могут иметь серьезные последствия. Например, если модель ИИ не может применить логику к новым или сложным медицинским случаям, ошибки более вероятны. Аналогично, системы ИИ в финансах, которые лишены способности рассуждать, могут принимать плохие инвестиционные решения или неправильно оценивать риски.
Результаты Apple также предостерегают, что хотя модели ИИ полезны для задач, таких как генерация контента и анализ данных, они должны быть использованы с осторожностью в областях, которые требуют глубокого понимания или критического мышления. Некоторые эксперты видят отсутствие настоящего рассуждения как значительное ограничение, в то время как другие считают, что распознавание образов само по себе может быть ценным для многих практических применений.
Что дальше для рассуждений ИИ?
Будущее рассуждений ИИ все еще неопределенно. Некоторые исследователи считают, что с большим количеством тренировочных данных, лучшими данными и улучшенными архитектурами моделей ИИ продолжит развивать настоящие способности к рассуждению. Другие более скептичны и думают, что текущие модели ИИ могут всегда быть ограничены распознаванием образов, никогда не занимаясь человеческим рассуждением.
Исследователи в настоящее время разрабатывают новые методы оценки для оценки способности моделей ИИ справляться с задачами, с которыми они никогда не сталкивались раньше. Эти тесты направлены на оценку того, могут ли ИИ критически мыслить и объяснять свое рассуждение в方式, которая имеет смысл для людей. Если они будут успешными, эти тесты могут предоставить более точное понимание того, насколько хорошо ИИ может рассуждать и помочь исследователям разработать лучшие модели.
Также растет интерес к разработке гибридных моделей, которые сочетают сильные стороны распознавания образов и рассуждения. Эти модели будут использовать нейронные сети для распознавания образов и символические системы рассуждения для более сложных задач. Apple и NVIDIA (NVDA ), как сообщается, исследуют эти гибридные подходы, которые могут привести к системам ИИ, способным к настоящим рассуждениям.
Основной вывод
Исследование Apple 2025 года вызывает важные вопросы о реальной природе способностей ИИ к рассуждению. Хотя модели ИИ, такие как БМР, показывают большие перспективы в различных областях, исследование предупреждает, что они могут не обладать настоящим пониманием или человеческим рассуждением. Вместо этого они полагаются на распознавание образов, что ограничивает их эффективность в задачах, которые требуют более сложных когнитивных процессов.
ИИ продолжает формировать будущее, что делает важным признание как его сильных, так и ограничений. Отрабатывая методы тестирования и управляя нашими ожиданиями, мы можем использовать ИИ ответственно. Это обеспечит, что он будет дополнять человеческое принятие решений, а не заменять его.












