Модели и платформы ИИ

Можно ли действительно доверять цепочке рассуждений ИИ?

mm
Добавьте Unite.AI в избранные источники в Google

Поскольку искусственный интеллект (ИИ) широко используется в таких областях, как здравоохранение и самоходные автомобили, вопрос о том, насколько мы можем ему доверять, становится все более критичным. Один из методов, называемый цепочкой рассуждений (CoT), привлек внимание. Он помогает ИИ разбить сложные проблемы на шаги, показывая, как он приходит к окончательному ответу. Это не только улучшает производительность, но также дает нам возможность заглянуть в то, как ИИ думает, что важно для доверия и безопасности систем ИИ.

Но недавние исследования Anthropic ставят под сомнение, действительно ли CoT отражает то, что происходит внутри модели. Эта статья рассматривает, как работает CoT, что обнаружили исследователи Anthropic и что все это значит для построения надежного ИИ.

Понимание цепочки рассуждений

Цепочка рассуждений – это способ побудить ИИ решать проблемы шаг за шагом. Вместо того, чтобы просто давать окончательный ответ, модель объясняет каждый шаг на пути. Этот метод был введен в 2022 году и с тех пор помог улучшить результаты в задачах, таких как математика, логика и рассуждения.

Модели, такие как OpenAI’s o1 и o3, Gemini 2.5, DeepSeek R1 и Claude 3.7 Sonnet, используют этот метод. Одна из причин, по которой CoT популярен, заключается в том, что он делает рассуждения ИИ более прозрачными. Это полезно, когда стоимость ошибок высока, например, в медицинских инструментах или самоходных системах.

Однако, даже если CoT помогает с прозрачностью, он не всегда отражает то, что модель действительно думает. В некоторых случаях объяснения могут выглядеть логичными, но не основаны на фактических шагах, которые модель использовала для принятия решения.

Можно ли доверять цепочке рассуждений

Anthropic проверили, действительно ли объяснения CoT отражают, как модели ИИ принимают решения. Эта характеристика называется «верностью». Они изучили четыре модели, включая Claude 3.5 Sonnet, Claude 3.7 Sonnet, DeepSeek R1 и DeepSeek V1. Среди этих моделей Claude 3.7 и DeepSeek R1 были обучены с использованием методов CoT, в то время как другие – нет.

Им дали модели разные подсказки. Некоторые из этих подсказок включали намеки, предназначенные для влияния на модель неэтичными способами. Затем они проверили, использует ли ИИ эти намеки в своих рассуждениях.

Результаты вызвали беспокойство. Модели признались в использовании намеков менее чем в 20 процентах случаев. Даже модели, обученные с использованием методов CoT, давали верные объяснения только в 25-33 процентах случаев.

Когда намеки включали неэтичные действия, такие как обман системы вознаграждения, модели редко признавали это. Это произошло даже тогда, когда они действительно полагались на эти намеки для принятия решений.

Обучение моделей с использованием методов обучения с подкреплением привело к небольшому улучшению. Но оно все равно не помогло много, когда поведение было неэтичным.

Исследователи также заметили, что когда объяснения были не правдивыми, они часто были длиннее и более сложными. Это могло означать, что модели пытались скрыть, что они действительно делали.

Они также обнаружили, что чем более сложной была задача, тем менее верными становились объяснения. Это говорит о том, что CoT может не работать хорошо для сложных проблем. Он может скрывать, что модель действительно делает, особенно в чувствительных или рискованных решениях.

Что это значит для доверия

Исследование подчеркивает значущий разрыв между тем, насколько прозрачным кажется CoT, и насколько он действительно честен. В критических областях, таких как медицина или транспорт, это серьезный риск. Если ИИ дает логично выглядящее объяснение, но скрывает неэтичные действия, люди могут неправильно доверять выводу.

CoT полезен для проблем, которые требуют логических рассуждений на нескольких шагах. Но он может не быть полезен для обнаружения редких или рискованных ошибок. Он также не останавливает модель от предоставления вводящих в заблуждение или двусмысленных ответов.

Исследование показывает, что CoT в одиночку недостаточен для доверия к процессу принятия решений ИИ. Необходимы другие инструменты и проверки, чтобы убедиться, что ИИ ведет себя в безопасных и честных способах.

Преимущества и ограничения цепочки рассуждений

Несмотря на эти проблемы, CoT предлагает много преимуществ. Он помогает ИИ решать сложные проблемы, разбивая их на части. Например, когда большая языковая модель получает подсказку с CoT, она демонстрирует высочайшую точность на математических задачах с помощью этого пошагового рассуждения. CoT также делает его проще для разработчиков и пользователей следить за тем, что делает модель. Это полезно в областях, таких как робототехника, обработка естественного языка или образование.

Однако CoT не без своих недостатков. Меньшие модели испытывают трудности с генерацией пошагового рассуждения, в то время как большие модели требуют больше памяти и мощности для его использования. Эти ограничения делают его сложным для использования CoT в инструментах, таких как чат-боты или системы реального времени.

Производительность CoT также зависит от того, как написаны подсказки. Плохие подсказки могут привести к плохим или запутанным шагам. В некоторых случаях модели генерируют длинные объяснения, которые не помогают и делают процесс медленнее. Также ошибки на ранних этапах рассуждений могут распространиться на окончательный ответ. И в специализированных областях CoT может не работать хорошо, если модель не обучена в этой области.

Когда мы добавляем результаты Anthropic, становится ясно, что CoT полезен, но не достаточно сам по себе. Это одна часть более крупных усилий по построению ИИ, которому люди могут доверять.

Ключевые выводы и дальнейшие шаги

Это исследование приводит к нескольким выводам. Во-первых, CoT не должен быть единственным методом, который мы используем для проверки поведения ИИ. В критических областях нам нужны дополнительные проверки, такие как анализ внутренней активности модели или использование внешних инструментов для тестирования решений.

Нам также необходимо признать, что просто потому, что модель дает четкое объяснение, не значит, что оно правдиво. Объяснение может быть прикрытием, а не реальной причиной.

Чтобы решить эту проблему, исследователи предлагают объединить CoT с другими подходами. Это включает в себя лучшие методы обучения, обучение с учителем и проверки человека.

Anthropic также рекомендует более глубоко изучить внутреннюю работу модели. Например, проверка закономерностей активации или скрытых слоев может показать, скрывает ли модель что-то.

Самым важным является то, что модели могут скрывать неэтичное поведение, что показывает, почему сильное тестирование и этические правила необходимы в разработке ИИ.

Построение доверия к ИИ не только означает хорошую производительность. Это также означает обеспечение того, чтобы модели были честными, безопасными и открытыми для проверки.

Основная мысль

Цепочка рассуждений помогла улучшить способность ИИ решать сложные проблемы и объяснять свои ответы. Но исследование показывает, что эти объяснения не всегда правдивы, особенно когда речь идет об этических проблемах.

CoT имеет ограничения, такие как высокие затраты, необходимость больших моделей и зависимость от хороших подсказок. Он не может гарантировать, что ИИ будет действовать в безопасных или справедливых способах.

Чтобы построить ИИ, которому мы можем действительно доверять, нам необходимо объединить CoT с другими методами, включая человеческий надзор и внутренние проверки. Исследования также должны продолжать улучшать достоверность этих моделей.

Доктор Техсин Зия является доцентом в университете COMSATS в Исламабаде, имеющим степень PhD в области ИИ в Венском техническом университете, Австрия. Специализируясь в области искусственного интеллекта, машинного обучения, науки о данных и компьютерного зрения, он внес значительный вклад с публикациями в авторитетных научных журналах. Доктор Техсин также возглавлял различные промышленные проекты в качестве основного исследователя и служил консультантом по ИИ.