Модели и платформы ИИ

Иллюзия понимания: почему прозрачность ИИ требует больше, чем цепочка мыслей

mm
Добавьте Unite.AI в избранные источники в Google

Сообщество искусственного интеллекта давно борется с фундаментальной задачей сделать системы ИИ прозрачными и понятными. По мере того, как крупные языковые модели становятся все более мощными, исследователи приняли технику цепочки мыслей (CoT) как решение этой проблемы прозрачности. Этот метод побуждает модели ИИ показывать свой процесс рассуждения шаг за шагом, создавая, казалось бы, четкий путь от вопроса к ответу. Однако, растущий объем исследований предполагает, что CoT может не обеспечить подлинное или верное объяснение того, как работают модели ИИ. Это понимание особенно важно для людей и организаций, которые полагаются на CoT для интерпретации систем ИИ, особенно в высокорисковых областях, таких как здравоохранение, юридические процедуры и эксплуатация автономных транспортных средств.

Эта статья исследует внутренние риски, связанные с полаганием на CoT как инструмент интерпретации, изучает его ограничения и очерчивает потенциальные направления исследований, которые могли бы привести к более точным и надежным объяснениям систем ИИ.

Понимание цепочки мыслей

Цепочка мыслей появилась как прорывная техника для улучшения возможностей рассуждения ИИ. Метод разбивает сложные проблемы на ряд промежуточных шагов, улучшая способность моделей ИИ работать над проблемами методично и раскрывать каждый шаг своего процесса мышления. Этот подход оказался удивительно эффективным в различных областях, особенно в математических и повседневных рассуждениях. Когда модель запрашивается, она может “думать шаг за шагом” над сложными задачами и предлагать человечески понятную повествовательную историю своего процесса принятия решений. Это обеспечивает беспрецедентный взгляд на работу модели, создавая впечатление прозрачности, которое пользуется исследователями, разработчиками и пользователями. Однако, несмотря на его преимущества, эта, казалось бы, простая техника имеет несколько ловушек, которые могут привести к неправильным интерпретациям поведения модели.

Иллюзия прозрачности

Фундаментальная проблема с приравнением CoT к объяснимости заключается в критическом заблуждении о том, как работают системы ИИ. Ключевая проблема заключается в том, что CoT не верно представляет вычисления, лежащие в основе модели. Хотя шаги рассуждения могут показаться логически обоснованными, они могут не соответствовать фактическому процессу принятия решений модели. Это расхождение является тем, что исследователи называют “неверностью”.

Чтобы понять это лучше, рассмотрим простую аналогию: если вы спросите шахматиста объяснить свой ход, он может описать анализ различных позиций и расчет потенциальных ответов. Однако, большая часть его процесса принятия решений, вероятно, происходит через распознавание образов и интуицию, развившуюся за годы практики. Словесное объяснение, хотя и полезное, может не отражать полную сложность его мыслительного процесса.

Системы ИИ сталкиваются с аналогичной проблемой. Нейронные сети, особенно трансформерные модели, которые обеспечивают работу этих моделей, обрабатывают информацию способами, которые фундаментально отличаются от человеческого рассуждения. Эти модели одновременно обрабатывают данные через несколько голов внимания и слоев, распределяя вычисления вместо того, чтобы выполнять их последовательно. Когда они генерируют объяснения CoT, они переводят свои внутренние вычисления в пошаговую, человечески понятную повествовательную историю; однако, этот перевод может не точно представлять лежащие в основе процессы.

Ограничения пошагового рассуждения

Эта неверность CoT вводит несколько ключевых ограничений, которые подчеркивают, почему CoT не может быть полным решением для объяснимости ИИ:

Во-первых, объяснения цепочки мыслей могут быть пост-хок рационализациями, а не подлинными следами рассуждения. Модель может прийти к ответу через один процесс, но затем построить правдоподобное объяснение, которое следует другому логическому пути. Это явление хорошо задокументировано в человеческой психологии, где люди часто создают связные повествования, чтобы объяснить решения, которые были приняты через бессознательные или эмоциональные процессы.

Во-вторых, качество и точность рассуждения CoT могут существенно варьироваться в зависимости от сложности проблемы и данных обучения модели. Для знакомых проблем шаги рассуждения могут показаться логичными и полными. Для новых задач модель может производить рассуждения, содержащие тонкие ошибки или логические пробелы.

Третье, CoT может затруднить, а не подчеркнуть факторы, которые наиболее влияют на процесс принятия решений ИИ. Модель может сосредоточиться на очевидных, явно заявленных элементах, игнорируя неявные закономерности или ассоциации, которые существенно влияют на ее рассуждения. Это избирательное внимание может создать ложное чувство полноты в объяснении.

Риски неправильного доверия в высокорисковых областях

В высокорисковых средах, таких как здравоохранение или право, полагание на ненадежные объяснения CoT может иметь серьезные последствия. Например, в медицинских системах ИИ неправильное CoT может рационализировать диагноз на основе ошибочных корреляций, что приведет к неправильным рекомендациям по лечению. Аналогично, в юридических системах ИИ модель может производить, казалось бы, логичное объяснение юридического решения, которое маскирует лежащие в основе предубеждения или ошибки в суждении.

Опасность заключается в том, что объяснения CoT могут показаться убедительно точными, даже когда они не соответствуют фактическим вычислениям модели. Это ложное чувство прозрачности может привести к чрезмерной зависимости от систем ИИ, особенно когда человеческие эксперты оказывают непомерное доверие к рационалам модели без учета лежащих в основе неопределенностей.

Разница между производительностью и объяснимостью

Замешательство между цепочкой мыслей и объяснимостью возникает из-за смешения двух различных целей: улучшения производительности ИИ и понимания систем ИИ. CoT работает над первым, но может не оправдать второе.

С точки зрения производительности CoT работает, потому что он заставляет модели заниматься более системным процессом. Разбивая сложные проблемы на более мелкие шаги, модели могут справиться с более сложными задачами рассуждения. Это улучшение измеримо и последовательно в различных тестах и приложениях.

Однако, подлинная объяснимость требует чего-то более глубокого. Она требует, чтобы мы понимали не только шаги, которые предприняла ИИ, но и почему она предприняла эти шаги и насколько мы можем доверять ее рассуждениям. Объяснимый ИИ направлен на предоставление информации о самом процессе принятия решений, а не только повествовательного описания результата.

Эта разница имеет огромное значение в высокорисковых приложениях. В здравоохранении, финансах или юридических контекстах знание того, что система ИИ следует определенному пути рассуждения, недостаточно; также необходимо понять лежащую в основе логику. Нам нужно понять надежность этого пути, предположения, которые он делает, и потенциал для ошибок или предубеждений.

Что требует подлинная объяснимость ИИ

Подлинная объяснимость ИИ имеет несколько ключевых требований, которые цепочка мыслей может не выполнить. Понимание этих требований помогает прояснить, почему CoT представляет только часть головоломки прозрачности.

Подлинная объяснимость требует интерпретируемости на нескольких уровнях. На высшем уровне нам нужно понять общий процесс принятия решений, используемый ИИ. На промежуточных уровнях нам нужно понимание того, как различные типы информации взвешиваются и объединяются. На самом фундаментальном уровне нам нужно понять, как конкретные входные данные активируют определенные ответы.

Надежность и последовательность представляют собой еще один важный аспект. Система ИИ с объяснимостью должна предоставлять подобные объяснения для подобных входных данных и должна быть в состоянии артикулировать свой уровень уверенности в различных аспектах своего рассуждения. Эта последовательность помогает построить доверие и позволяет пользователям правильно настроить свою зависимость от системы.

Кроме того, подлинная объяснимость требует решения более широкого контекста, в котором системы ИИ работают. Это включает понимание данных обучения, потенциальных предубеждений, ограничений системы и условий, при которых ее рассуждения могут разрушиться. CoT обычно не может обеспечить это мета-уровень понимания.

Путь вперед

Признание ограничений цепочки мыслей как объяснимости не уменьшает ее ценность как инструмента для улучшения рассуждений ИИ. Вместо этого оно подчеркивает необходимость более комплексного подхода к прозрачности ИИ, который объединяет несколько техник и перспектив.

Будущее объяснимости ИИ, вероятно, лежит в гибридных подходах, которые сочетают интуитивную привлекательность цепочки мыслей с более строгими методами понимания поведения ИИ. Этот подход может включать визуализацию внимания для подчеркивания информации, на которую модель фокусируется, количественную оценку неопределенности для передачи уровня уверенности и контрфактический анализ для изучения того, как различные входные данные могут изменить процесс рассуждения.

Кроме того, сообществу ИИ необходимо разработать лучшие рамки оценки для объяснимости. В настоящее время мы часто судим объяснения на основе того, кажутся ли они разумными для людей, но этот подход может не отражать полную сложность принятия решений ИИ. Более сложные метрики, которые учитывают точность, полноту и надежность объяснений, являются необходимыми.

Основная мысль

Хотя цепочка мыслей (CoT) сделала шаги в улучшении прозрачности ИИ, она часто создает иллюзию понимания, а не обеспечивает подлинную объяснимость. Объяснения CoT могут неправильно представить лежащие в основе процессы моделей ИИ, что может привести к вводящим в заблуждение или неполным повествованиям. Это особенно проблематично в высокорисковых областях, таких как здравоохранение и право, где неправильное доверие к этим объяснениям может иметь серьезные последствия. Подлинная прозрачность ИИ требует более глубокого понимания процесса принятия решений, уверенности модели в своих рассуждениях и более широкого контекста ее работы. Более комплексный подход к объяснимости ИИ, объединяющий несколько техник, является необходимым для улучшения доверия и надежности систем ИИ.

Доктор Техсин Зия является доцентом в университете COMSATS в Исламабаде, имеющим степень PhD в области ИИ в Венском техническом университете, Австрия. Специализируясь в области искусственного интеллекта, машинного обучения, науки о данных и компьютерного зрения, он внес значительный вклад с публикациями в авторитетных научных журналах. Доктор Техсин также возглавлял различные промышленные проекты в качестве основного исследователя и служил консультантом по ИИ.