Модели и платформы ИИ
От Интенции к Исполнению: Как Microsoft Преобразует Большие Языковые Модели в Ориентированную на Действие Интеллектуальную Систему
Большие языковые модели (БЯМ) изменили то, как мы обрабатываем естественный язык. Они могут отвечать на вопросы, писать код и вести разговоры. Однако они не справляются с реальными задачами. Например, БЯМ может провести вас через покупку куртки, но не может сделать заказ от вашего имени. Этот разрыв между мыслями и действиями является значительным ограничением. Люди не только нуждаются в информации, но и хотят результатов.
Чтобы преодолеть этот разрыв, Microsoft (MSFT ) преобразует БЯМ в ориентированную на действие интеллектуальную систему. Позволяя им планировать, разбивать задачи и взаимодействовать с реальным миром, они наделяют БЯМ возможностью эффективно управлять практическими задачами. Этот сдвиг имеет потенциал переопределить то, что могут делать БЯМ, превращая их в инструменты, которые автоматизируют сложные рабочие процессы и упрощают повседневные задачи. Давайте посмотрим, что нужно для этого и как Microsoft подходит к этой проблеме.
Что Нужно БЯМ для Действия
Для того чтобы БЯМ могли выполнять задачи в реальном мире, им нужно выйти за рамки понимания текста. Они должны взаимодействовать с цифровыми и физическими средами, адаптируясь к меняющимся условиям. Вот некоторые из возможностей, которые им нужны:
-
Понимание Намерения Пользователя
Чтобы действовать эффективно, БЯМ нужно понять запросы пользователей. Входные данные, такие как текст или голосовые команды, часто бывают неясными или неполными. Система должна заполнить пробелы, используя свои знания и контекст запроса. Многоступенчатые разговоры могут помочь уточнить эти намерения, обеспечивая понимание системы перед принятием действия.
-
Преобразование Намерений в Действия
После понимания задачи БЯМ должны преобразовать ее в действенные шаги. Это может включать нажатие кнопок, вызов API или управление физическими устройствами. БЯМ должны изменить свои действия в соответствии с конкретной задачей, адаптируясь к среде и решая проблемы по мере их возникновения.
-
Адаптация к Изменениям
Реальные задачи не всегда проходят по плану. БЯМ должны предвидеть проблемы, корректировать шаги и находить альтернативы, когда возникают проблемы. Например, если необходимый ресурс недоступен, система должна найти другой способ выполнить задачу. Эта гибкость обеспечивает, что процесс не застревает, когда что-то меняется.
-
Специализация в Конкретных Задачах
Хотя БЯМ предназначены для общего использования, специализация делает их более эффективными. Сосредоточившись на конкретных задачах, эти системы могут обеспечить лучшие результаты с меньшими ресурсами. Это особенно важно для устройств с ограниченной вычислительной мощностью, таких как смартфоны или встроенные системы.
Разрабатывая эти навыки, БЯМ могут выйти за рамки простой обработки информации. Они могут совершать осмысленные действия, открывая путь для интеграции искусственного интеллекта в повседневные рабочие процессы.
Как Microsoft Преобразует БЯМ
Подход Microsoft к созданию ориентированной на действие интеллектуальной системы включает структурированный процесс. Основная цель – позволить БЯМ понимать команды, планировать эффективно и совершать действия. Вот как они это делают:
Шаг 1: Сбор и Подготовка Данных
На первом этапе они собрали данные, связанные с их конкретными случаями использования: агент UFO (описано ниже). Данные включают запросы пользователей, детали окружения и задачи. Два типа данных собираются на этом этапе: во-первых, они собирают данные о планировании задач, помогающие БЯМ очертить высокоуровневые шаги, необходимые для выполнения задачи. Например, “Изменить размер шрифта в Word” может включать шаги, такие как выбор текста и корректировка настроек панели инструментов. Во-вторых, они собирают данные о действиях задач, позволяющие БЯМ перевести эти шаги в точные инструкции, такие как нажатие конкретных кнопок или использование комбинаций клавиш.
Это сочетание дает модели как общую картину, так и подробные инструкции, необходимые для выполнения задач эффективно.
Шаг 2: Обучение Модели
После сбора данных БЯМ совершенствуются посредством нескольких сессий обучения. На первом этапе БЯМ обучаются для планирования задач, обучая их тому, как разбивать запросы пользователей на действенные шаги. Далее экспертно-помеченные данные используются для обучения их тому, как перевести эти планы в конкретные действия. Чтобы еще больше повысить их способности к решению проблем, БЯМ участвуют в процессе самоусиления, который позволяет им решать нерешенные задачи и генерировать новые примеры для непрерывного обучения. Наконец, применяется обучение с подкреплением, используя обратную связь от успехов и неудач для дальнейшего улучшения их процессов принятия решений.
Шаг 3: Офлайн-Тестирование
После обучения модель тестируется в контролируемых средах, чтобы обеспечить надежность. Метрики, такие как Коэффициент Успешного Выполнения Задач (TSR) и Коэффициент Успешного Шага (SSR), используются для измерения производительности. Например, тестирование агента управления календарем может включать проверку его способности планировать встречи и отправлять приглашения без ошибок.
Шаг 4: Интеграция в Реальные Системы
После проверки модель интегрируется в агентскую структуру. Это позволяет ей взаимодействовать с реальными средами, такими как нажатие кнопок или навигация по меню. Инструменты, такие как API автоматизации пользовательского интерфейса, помогают системе идентифицировать и манипулировать элементами пользовательского интерфейса динамически.
Например, если задача состоит в том, чтобы выделить текст в Word, агент идентифицирует кнопку выделения, выбирает текст и применяет форматирование. Компонент памяти может помочь БЯМ запомнить прошлые действия, позволяя ей адаптироваться к новым сценариям.
Шаг 5: Реальное Тестирование
Окончательный шаг – онлайн-оценка. Здесь система тестируется в реальных сценариях, чтобы обеспечить ее способность справиться с неожиданными изменениями и ошибками. Например, бот поддержки клиентов может провести пользователя через процесс сброса пароля, адаптируясь к неправильным вводам или отсутствующей информации. Это тестирование обеспечивает, что ИИ является прочным и готов к повседневному использованию.
Практический Пример: Агент UFO
Чтобы продемонстрировать, как работает ориентированная на действие интеллектуальная система, Microsoft разработала агент UFO. Эта система предназначена для выполнения реальных задач в среде Windows, превращая запросы пользователей в выполненные действия.
В своей основе агент UFO использует БЯМ для интерпретации запросов и планирования действий. Например, если пользователь говорит: “Выделите слово ‘важно’ в этом документе”, агент взаимодействует с Word, чтобы выполнить задачу. Он собирает контекстную информацию, такую как положение элементов управления, и использует ее для планирования и выполнения действий.
Агент UFO полагается на инструменты, такие как автоматизация пользовательского интерфейса Windows (UIA) API. Этот API сканирует приложения на наличие элементов управления, таких как кнопки или меню. Для задачи, такой как “Сохранить документ как PDF”, агент использует UIA для идентификации кнопки “Файл”, нахождения опции “Сохранить как” и выполнения необходимых шагов. Структурируя данные последовательно, система обеспечивает плавную работу от обучения до реального применения.
Преодоление Вызовов
Хотя это интересное развитие, создание ориентированной на действие интеллектуальной системы сопряжено с вызовами. Масштабируемость является значительной проблемой. Обучение и развертывание этих моделей на различные задачи требуют значительных ресурсов. Обеспечение безопасности и надежности также важно. Модели должны выполнять задачи без непредвиденных последствий, особенно в чувствительных средах. И поскольку эти системы взаимодействуют с частными данными, поддержание этических стандартов в области конфиденциальности и безопасности также важно.
Дорожная карта Microsoft фокусируется на повышении эффективности, расширении случаев использования и поддержании этических стандартов. С этими достижениями БЯМ могут переопределить, как ИИ взаимодействует с миром, делая их более практичными, адаптируемыми и ориентированными на действие.
Будущее ИИ
Преобразование БЯМ в ориентированную на действие интеллектуальную систему может стать прорывом. Эти системы могут автоматизировать задачи, упростить рабочие процессы и сделать технологии более доступными. Работа Microsoft над ориентированной на действие интеллектуальной системой и инструментами, такими как агент UFO, только начало. По мере того, как ИИ продолжает эволюционировать, мы можем ожидать более умных, способных систем, которые не просто взаимодействуют с нами – они выполняют задачи.












