Лидеры мнений

Расшифровка возможностей и проблем для агентов LLM в генеративном ИИ

mm
Добавьте Unite.AI в избранные источники в Google

Мы наблюдаем прогресс генеративных приложений ИИ, работающих на основе больших языковых моделей (LLM), от подсказок к генерации с помощью поиска (RAG) и агентов. Агенты активно обсуждаются в отрасли и научных кругах, прежде всего за потенциал трансформации корпоративных приложений и предоставления лучшего опыта взаимодействия с клиентами. Существуют общие закономерности для создания агентов, которые позволяют сделать первые шаги к искусственному общему интеллекту (AGI).

В моей предыдущей статье мы рассмотрели лестницу интеллекта для построения приложений на основе LLM. Начиная с подсказок, которые фиксируют проблемную область и используют внутреннюю память LLM для генерации вывода. С помощью RAG мы дополняем подсказку внешними знаниями, полученными из векторной базы данных, чтобы контролировать вывод. Далее, объединяя вызовы LLM, мы можем создавать рабочие процессы для реализации сложных приложений. Агенты поднимают это на новый уровень, автоматически определяя, как эти цепочки LLM должны быть сформированы. Давайте рассмотрим подробнее.

Агенты – Под капотом

Ключевая закономерность для агентов заключается в том, что они используют возможности языкового понимания LLM для создания плана решения задачи. LLM понимает проблему и дает нам последовательность шагов для ее решения. Однако это не все. Агенты не являются просто системой поддержки, которая будет предоставлять рекомендации по решению проблемы и затем передавать бразды правления вам, чтобы вы выполнили рекомендуемые шаги. Агенты оснащены инструментами для выполнения действий. Это немного страшно!

Если мы зададим агенту простой вопрос, такой как:

Человек: Какая компания была основана изобретателем телефона?

Ниже приведен образец мыслительных шагов, которые агент может выполнить.

Агент (ДУМАЮ):

  • Мысль: Мне нужно найти изобретателя телефона.
  • Действие: Поиск [изобретатель телефона]
  • Наблюдение: Александр Грейам Белл
  • Мысль: Мне нужно найти компанию, основанную Александром Грейамом Беллом
  • Действие: Поиск [компания, основанная Александром Грейамом Беллом]
  • Наблюдение: Александр Грейам Белл стал сооснователем компании American Telephone and Telegraph Company (AT&T) в 1885 году
  • Мысль: Я нашел ответ. Я верну его.

Агент (ОТВЕТ): Александр Грейам Белл стал сооснователем AT&T в 1885 году

Вы можете видеть, что агент следует методическому подходу к разбиению проблемы на подзадачи, которые можно решить, выполнив определенные действия. Эти действия рекомендуются LLM, и мы можем сопоставить их с конкретными инструментами для реализации этих действий. Мы могли бы включить инструмент поиска для агента, чтобы когда он осознает, что LLM рекомендует поиск в качестве действия, он вызовет этот инструмент с параметрами, предоставленными LLM. Поиск здесь выполняется в интернете, но также может быть перенаправлен на поиск во внутренней базе знаний, такой как векторная база данных. Система становится самодостаточной и может выяснить, как решить сложные проблемы, следуя серии шагов. Фреймворки, такие как LangChain и LLaMAIndex, предоставляют простой способ построения этих агентов и подключения к инструментам и API. Amazon недавно запустила свою платформу Bedrock Agents, которая предлагает визуальный интерфейс для проектирования агентов.

Под капотом агенты следуют специальному стилю отправки подсказок LLM, которые заставляют их генерировать план действий. Вышеупомянутый шаблон Мысли-Действия-Наблюдения популярен в типе агентов, называемом ReAct (Reasoning and Acting). Другие типы агентов включают MRKL и Plan & Execute, которые в основном различаются стилем подсказок.

Для более сложных агентов действия могут быть связаны с инструментами, которые вызывают изменения в исходных системах. Например, мы могли бы подключить агента к инструменту, который проверяет баланс отпуска и подает заявку на отпуск в системе ERP для сотрудника. Теперь мы могли бы построить приятный чат-бот, который взаимодействует с пользователями и через команду чата подает заявку на отпуск в системе. Больше нет сложных экранов для подачи заявок на отпуск, а есть простой унифицированный интерфейс чата. Звучит интересно!

Ограничения и необходимость Ответственного ИИ

А что, если у нас есть инструмент, который вызывает транзакции на фондовом рынке с помощью предварительно авторизованного API? Вы строите приложение, где агент изучает изменения на фондовом рынке (с помощью инструментов) и принимает решения о покупке и продаже акций. Что, если агент продает неправильные акции, потому что он галлюцинирует и принимает неправильное решение? Поскольку LLM являются огромными моделями, трудно понять, почему они принимают некоторые решения, поэтому галлюцинации распространены в отсутствие надлежащих ограничений.

Хотя агенты fasciniruyuschie, вы, вероятно, уже поняли, насколько они могут быть опасны. Если они галлюцинируют и совершают неправильные действия, это может привести к значительным финансовым потерям или серьезным проблемам в корпоративных системах. Поэтому Ответственный ИИ становится крайне важным в эпоху приложений, работающих на LLM. Принципы Ответственного ИИ, связанные с воспроизводимостью, прозрачностью и подотчетностью, пытаются установить ограничения на решения, принимаемые агентами, и предлагают анализ рисков, чтобы решить, какие действия требуют участия человека.

Заключительные мысли

Способность агентов генерировать логический путь шагов с действиями приближает их к человеческому рассуждению. Оснащение их более мощными инструментами может дать им сверхспособности. Шаблоны, такие как ReAct, пытаются имитировать, как люди решают проблемы, и мы увидим лучшие шаблоны агентов, которые будут актуальны для конкретных контекстов и областей (банковского дела, страхования, здравоохранения, промышленности и т. д.). Будущее уже здесь, и технология, лежащая в основе агентов, готова к использованию. В то же время нам нужно внимательно следить за ограничениями Ответственного ИИ, чтобы убедиться, что мы не строим Skynet!

Dattaraj Rao, Chief Data Scientist в Persistent Systems, является автором книги “Keras to Kubernetes: The Journey of a Machine Learning Model to Production.” В Persistent Systems Dattaraj возглавляет лабораторию AI Research, которая исследует современные алгоритмы в области Computer Vision, Natural Language Understanding, вероятностного программирования, Reinforcement Learning, Explainable AI и т. д. и демонстрирует их применимость в области здравоохранения, банковского дела и промышленности. Dattaraj имеет 11 патентов в области Machine Learning и Computer Vision.