Модели и платформы ИИ
Проблема «чёрного ящика» в моделях обработки естественного языка: проблемы и появляющиеся решения
Машинное обучение, подмножество ИИ, включает в себя три компонента: алгоритмы, обучающие данные и полученную модель. Алгоритм, по сути, набор процедур, учится распознавать закономерности из большого набора примеров (обучающих данных). Результатом этого обучения является модель машинного обучения. Например, алгоритм, обученный на изображениях собак, приведет к модели, способной определять собак на изображениях.
«Чёрный ящик» в машинном обучении
В машинном обучении любой из трёх компонентов — алгоритм, обучающие данные или модель — может быть «чёрным ящиком». Хотя алгоритмы часто являются публично известными, разработчики могут выбрать сохранение модели или обучающих данных в секрете, чтобы защитить интеллектуальную собственность. Эта неясность делает сложным понимание процесса принятия решений ИИ.
«Чёрные ящики» ИИ — это системы, внутренние механизмы которых остаются непрозрачными или невидимыми для пользователей. Пользователи могут вводить данные и получать вывод, но логика или код, который производит вывод, остаётся скрытым. Это общая характеристика многих систем ИИ, включая передовые генеративные модели, такие как ChatGPT и DALL-E 3.
Модели обработки естественного языка, такие как GPT-4, представляют значительную проблему: их внутренние механизмы в значительной степени непрозрачны, что делает их «чёрными ящиками». Эта непрозрачность не только техническая загадка, но и представляет реальные проблемы безопасности и этики. Например, если мы не можем понять, как эти системы приходят к выводам, можем ли мы доверять им в критических областях, таких как медицинские диагнозы или финансовые оценки?
Масштаб и сложность моделей обработки естественного языка
Масштаб этих моделей добавляет к их сложности. Возьмем, например, GPT-3 с его 175 миллиардами параметров, и новые модели, имеющие триллионы. Каждый параметр взаимодействует сложными способами внутри нейронной сети, способствуя возникновению способностей, которые невозможно предсказать, изучая отдельные компоненты. Этот масштаб и сложность делают практически невозможным полностью понять их внутреннюю логику, что представляет собой препятствие в диагностике предвзятостей или нежелательного поведения в этих моделях.
Компромисс: масштаб против интерпретируемости
Снижение масштаба моделей обработки естественного языка могло бы улучшить интерпретируемость, но за счет их передовых возможностей. Масштаб — это то, что позволяет поведению, которого не могут достичь более мелкие модели. Это представляет собой внутренний компромисс между масштабом, возможностями и интерпретируемостью.
Влияние проблемы «чёрного ящика» моделей обработки естественного языка
1. Неправильное принятие решений
Непрозрачность в процессе принятия решений моделей обработки естественного языка, таких как GPT-3 или BERT, может привести к нераспознанным предвзятостям и ошибкам. В областях, таких как здравоохранение или уголовное правосудие, где решения имеют далеко идущие последствия, невозможность аудита моделей обработки естественного языка на этическую и логическую обоснованность является серьезной проблемой. Например, медицинская модель обработки естественного языка, полагающаяся на устаревшие или предвзятые данные, может давать вредные рекомендации. Аналогично, модели обработки естественного языка в процессе найма могут непреднамеренно увековечивать гендерные предвзятости. Природа «чёрного ящика» не только скрывает недостатки, но и может потенциально усилить их, что требует активного подхода к повышению прозрачности.
2. Ограниченная адаптируемость в различных контекстах
Недостаток прозрения во внутренние механизмы моделей обработки естественного языка ограничивает их адаптируемость. Например, модель обработки естественного языка в процессе найма может быть неэффективной в оценке кандидатов на роль, которая ценит практические навыки над академическими квалификациями, из-за неспособности скорректировать свои критерии оценки. Аналогично, медицинская модель обработки естественного языка может испытывать трудности с диагнозами редких заболеваний из-за дисбаланса данных. Эта негибкость подчеркивает необходимость прозрачности для перенастройки моделей обработки естественного языка для конкретных задач и контекстов.
3. Предвзятость и пробелы в знаниях
Обработка моделей обработки естественного языка огромных обучающих данных подвержена ограничениям, налагаемым их алгоритмами и архитектурами моделей. Например, медицинская модель обработки естественного языка может демонстрировать демографические предвзятости, если она обучена на несбалансированных наборах данных. Кроме того, профессионализм модели обработки естественного языка в нишевых темах может быть вводящим в заблуждение, что приводит к чрезмерно уверенным, неправильным выводам. Решение этих предвзятостей и пробелов в знаниях требует больше, чем просто дополнительных данных; это требует изучения механизмов обработки модели.
4. Юридическая и этическая ответственность
Непрозрачная природа моделей обработки естественного языка создает серую зону в отношении ответственности за любой вред, причиненный их решениями. Если модель обработки естественного языка в медицинской среде дает неправильные советы, что приводит к вреду пациента, определение ответственности становится сложным из-за непрозрачности модели. Эта юридическая неопределенность представляет риски для организаций, развертывающих модели обработки естественного языка в чувствительных областях, подчеркивая необходимость четкого управления и прозрачности.
5. Проблемы доверия в чувствительных приложениях
Для моделей обработки естественного языка, используемых в критических областях, таких как здравоохранение и финансы, недостаток прозрачности подрывает их достоверность. Пользователи и регулирующие органы должны обеспечить, чтобы эти модели не содержали предвзятости или не принимали решения на основе несправедливых критериев. Проверка отсутствия предвзятости в моделях обработки естественного языка требует понимания их процессов принятия решений, подчеркивая важность объяснимости для этической эксплуатации.
6. Риски, связанные с личными данными
Модели обработки естественного языка требуют обширных обучающих данных, которые могут включать чувствительную личную информацию. Непрозрачная природа этих моделей вызывает обеспокоенность по поводу того, как обрабатываются и используются эти данные. Например, медицинская модель обработки естественного языка, обученная на медицинских записях пациентов, вызывает вопросы о конфиденциальности данных и их использовании. Обеспечение того, чтобы личные данные не были неправильно использованы или эксплуатированы, требует прозрачных процессов обработки данных внутри этих моделей.
Появляющиеся решения для интерпретируемости
Для решения этих проблем разрабатываются новые методы. К ним относятся методы приближения контрфактов (CF). Первый метод включает в себя побуждение модели обработки естественного языка изменить определённую концепцию текста, сохраняя другие концепции постоянными. Этот подход, хотя и эффективен, требует значительных ресурсов во время вывода.
Второй подход включает в себя создание специального пространства вложений, управляемого моделью обработки естественного языка во время обучения. Это пространство соответствует причинному графу и помогает определить совпадения, приближающиеся к контрфактам. Этот метод требует меньше ресурсов во время тестирования и был показан как эффективно объясняющий прогнозы модели, даже в моделях обработки естественного языка с миллиардами параметров.
Эти подходы подчеркивают важность причинных объяснений в системах обработки естественного языка для обеспечения безопасности и установления доверия. Приближения контрфактов предоставляют способ представить, как данный текст изменится, если определённая концепция в его генеративном процессе будет другой, помогая в практической оценке причинного эффекта высокоуровневых концепций на модели обработки естественного языка.
Глубокое погружение: методы объяснений и причинность в моделях обработки естественного языка
Пробирование и инструменты важности функций
Пробирование — это метод, используемый для расшифровки того, что внутренние представления в моделях кодируют. Это может быть либо контролируемым, либо неконтролируемым и направлено на определение того, кодируются ли определённые концепции в определённых местах сети. Хотя эффективно до определённой степени, зонды не могут обеспечить причинные объяснения, как подчеркнуто Geiger et al. (2021).
Инструменты важности функций, другой тип метода объяснения, часто фокусируются на входных функциях, хотя некоторые методы, основанные на градиентах, распространяют это на скрытые состояния. Примером является метод интегрированных градиентов, который предлагает причинную интерпретацию, изучая базовые (контрфактные, CF) входные данные. Несмотря на свою полезность, эти методы всё ещё испытывают трудности в связывании своих анализов с реальными концепциями за пределами простых свойств входных данных.
Методы, основанные на вмешательстве
Методы, основанные на вмешательстве, включают изменение входных данных или внутренних представлений для изучения эффектов на поведение модели. Эти методы могут создавать контрфактные состояния для оценки причинных эффектов, но они часто генерируют неправдоподобные входные данные или состояния сети, если не контролировать их тщательно. Модель причинного прокси (CPM), вдохновлённая концепцией S-learner, является новым подходом в этой области, имитирующим поведение объясняемой модели под контрфактными входными данными. Однако необходимость в отдельном объясняющем модели для каждой модели является значительным ограничением.
Приближение контрфактов
Контрфакты широко используются в машинном обучении для аугментации данных, включающей изменения различных факторов или меток. Они могут быть сгенерированы с помощью ручного редактирования, эвристического замены ключевых слов или автоматического переписывания текста. Хотя ручное редактирование точное, оно также ресурсоёмкое. Методы, основанные на ключевых словах, имеют ограничения, и генеративные подходы предлагают баланс между плавностью и охватом.
Верные объяснения
Верность в объяснениях относится к точному изображению лежащей в основе логики модели. Нет универсально принятого определения верности, что приводит к её характеристике через различные метрики, такие как чувствительность, последовательность, соглашение об важности функций, устойчивость и симулируемость. Большинство этих методов фокусируются на объяснениях на уровне функций и часто путают корреляцию с причинностью. Наша работа направлена на предоставление объяснений высокоуровневых концепций, используя литературу о причинности для предложения интуитивного критерия: Order-верность.
Мы углубились в внутренние сложности моделей обработки естественного языка, понимая их «чёрный ящик» и значительные проблемы, которые он представляет. От рисков неправильного принятия решений в чувствительных областях, таких как здравоохранение и финансы, до этических дилемм, окружающих предвзятость и справедливость, необходимость прозрачности в моделях обработки естественного языка никогда не была более очевидной.
Будущее моделей обработки естественного языка и их интеграция в нашу повседневную жизнь и критические процессы принятия решений зависят от нашей способности сделать эти модели не только более продвинутыми, но и более понятными и ответственными. Поиск объяснимости и интерпретируемости не только техническое начинание, но и фундаментальный аспект построения доверия к системам ИИ. По мере того, как модели обработки естественного языка становятся более интегрированными в общество, спрос на прозрачность будет расти, не только со стороны практиков ИИ, но и со стороны каждого пользователя, взаимодействующего с этими системами.















