Моделі та платформи ШІ

Від намірів до виконання: Як Microsoft перетворює великі мовні моделі на орієнтовану на дії штучний інтелект

mm
Додайте Unite.AI до бажаних джерел у Google

Великі мовні моделі (LLM) змінили спосіб, у який ми обробляємо природні мови. Вони можуть відповідати на питання, писати код і проводити розмови. Однак вони не можуть виконувати реальні завдання. Наприклад, LLM може допомогти вам купити куртку, але не може зробити замовлення. Ця розрив між думкою і діями є великою обмеженням. Люди не просто потребують інформації; вони хочуть результатів.

Щоб закрити цю розрив, Microsoft (MSFT ) перетворює LLM на орієнтовані на дії штучні інтелекти. Надавши їм можливість планувати, розбивати завдання на етапи і взаємодіяти з реальним світом, вони надають LLM можливість ефективно керувати практичними завданнями. Ця зміна має потенціал змінити те, що можуть робити LLM, перетворюючи їх на інструменти, які автоматизують складні робочі процеси і спрощують повсякденні завдання. Давайте розглянемо, що потрібно, щоб зробити це можливим, і як Microsoft підходить до цього завдання.

Що потрібно LLM, щоб діяти

Для того, щоб LLM могли виконувати завдання в реальному світі, їм потрібно вийти за межі розуміння тексту. Вони повинні взаємодіяти з цифровими і фізичними середовищами, адаптуючись до змінних умов. Ось деякі з можливостей, які їм потрібно:

  1. Розуміння намірів користувача

Для того, щоб діяти ефективно, LLM потрібно розуміти запити користувача. Вхідні дані, такі як текст або голосові команди, часто є нечіткими або неповними. Система повинна заповнити прогалини, використовуючи свої знання і контекст запиту. Багатоступеневі розмови можуть допомогти уточнити ці наміри, забезпечуючи те, що штучний інтелект розуміє, перш ніж виконувати дії.

  1. Перетворення намірів на дії

Після розуміння завдання, LLM повинні перетворити його на діючі кроки. Це може включати натискання кнопок, виклик API або контроль фізичних пристроїв. LLM потрібно модифікувати свої дії відповідно до конкретного завдання, адаптуючись до середовища і розв’язуючи проблеми, які виникають.

  1. Адаптація до змін

Реальні завдання не завжди проходять згідно з планом. LLM потрібно передбачати проблеми, змінювати кроки і знаходити альтернативи, коли виникають питання. Наприклад, якщо необхідний ресурс недоступний, система повинна знайти інший спосіб виконання завдання. Ця гнучкість забезпечує те, що процес не зупиняється, коли щось змінюється.

  1. Спеціалізація на конкретних завданнях

Хоча LLM призначені для загального використання, спеціалізація робить їх більш ефективними. Зосереджуючись на конкретних завданнях, ці системи можуть забезпечувати кращі результати з меншими ресурсами. Це особливо важливо для пристроїв з обмеженою потужністю обчислень, таких як смартфони або вбудовані системи.

Розробляючи ці навички, LLM можуть вийти за межі простої обробки інформації. Вони можуть виконувати значимі дії, відкриваючи шлях для штучного інтелекту, щоб безшовно інтегруватися в повсякденні робочі процеси.

Як Microsoft перетворює LLM

Підхід Microsoft до створення орієнтованого на дії штучного інтелекту включає структурований процес. Основна мета полягає в тому, щоб надати LLM можливість розуміти команди, планувати ефективно і виконувати дії. Ось, як вони це роблять:

Крок 1: Збір і підготовка даних

На першому етапі вони збирають дані, пов’язані з їхніми конкретними випадками використання: агент UFO (описано нижче). Дані включають запити користувача, деталі середовища і завдання-специфічні дії. Два різних типу даних збираються на цьому етапі: по-перше, вони збирають дані про планування завдань, які допомагають LLM розбивати високорівневі кроки, необхідні для виконання завдання. Наприклад, “Змінити розмір шрифта в Word” може включати кроки, такі як вибір тексту і налаштування панелі інструментів. По-друге, вони збирають дані про дії завдань, які дозволяють LLM перекладати ці кроки на точні інструкції, такі як натискання конкретних кнопок або використання клавішних скорочень.

Це поєднання забезпечує моделі як загальну картину, так і детальні інструкції, необхідні для виконання завдань ефективно.

Крок 2: Навчання моделі

Після збору даних LLM уточнюються через декілька навчальних сесій. На першому етапі LLM навчаються плануванню завдань, вчучи їх, як розбивати запити користувача на діючі кроки. Дані, позначені експертами, потім використовуються для навчання їх перекладу цих планів на конкретні дії. Для подальшого підвищення їх здатності розв’язувати проблеми LLM займаються процесом самоусування, який дозволяє їм займатися нерозв’язаними завданнями і генерувати нові приклади для безперервного навчання. Нарешті, застосовується навчання з підкріпленням, яке використовує відгук про успіхи і невдачі для подальшого поліпшення їх процесів прийняття рішень.

Крок 3: Офлайн-тестування

Після навчання модель тестується в контрольованих середовищах, щоб забезпечити надійність. Метрики, такі як Коефіцієнт успіху завдань (TSR) і Коефіцієнт успіху кроків (SSR), використовуються для вимірювання продуктивності. Наприклад, тестування агента управління календарем може включати перевірку його здатності планувати зустрічі і надсилати запрошення без помилок.

Крок 4: Інтеграція в реальні системи

Після перевірки модель інтегрується в агентську структуру. Це дозволяє їй взаємодіяти з реальним світом, таким як натискання кнопок або навігація в меню. Інструменти, такі як API автоматизації інтерфейсу користувача, допомагають системі ідентифікувати і маніпулювати елементами інтерфейсу користувача динамічно.

Наприклад, якщо завдання полягає в виділенні тексту в Word, агент ідентифікує кнопку виділення, вибирає текст і застосовує форматування. Компонент пам’яті міг би допомогти LLM зберігати інформацію про попередні дії, дозволяючи йому адаптуватися до нових сценаріїв.

Крок 5: Реальне тестування

Останнім кроком є онлайн-оцінка. Тут система тестується в реальних сценаріях, щоб забезпечити її здатність справлятися з несподіваними змінами і помилками. Наприклад, бот підтримки клієнтів міг би допомогти користувачам у процесі скидання пароля, адаптуючись до неправильних входів або відсутньої інформації. Це тестування забезпечує те, що штучний інтелект є надійним і готовим до повсякденного використання.

Практичний приклад: Агент UFO

Щоб продемонструвати, як працює орієнтований на дії штучний інтелект, Microsoft розробив агент UFO. Ця система призначена для виконання реальних завдань у середовищі Windows, перетворюючи запити користувача на виконані дії.

У своєму ядрі агент UFO використовує LLM для інтерпретації запитів і планування дій. Наприклад, якщо користувач каже: “Виділіть слово ‘важливо’ в цьому документі”, агент взаємодіє з Word, щоб виконати завдання. Він збирає контекстну інформацію, таку як позиції елементів інтерфейсу користувача, і використовує її для планування і виконання дій.

Агент UFO використовує інструменти, такі як автоматизація інтерфейсу користувача Windows (UIA) API. Цей API сканує програми для контролю елементів, таких як кнопки або меню. Для завдання, такого як “Зберегти документ як PDF”, агент використовує UIA для ідентифікації кнопки “Файл”, знаходження варіанту “Зберегти як” і виконання необхідних кроків. Структуруючи дані послідовно, система забезпечує безшовну роботу від навчання до реального застосування.

Переборювання викликів

Хоча це цікавий розвиток, створення орієнтованого на дії штучного інтелекту супроводжується викликами. Масштабованість є однією з основних проблем. Навчання і розгортання цих моделей для різноманітних завдань вимагає значних ресурсів. Забезпечення безпеки і надійності є рівною важливим. Моделі повинні виконувати завдання без непередбачуваних наслідків, особливо в чутливих середовищах. А також, оскільки ці системи взаємодіють з приватними даними, підтримання етичних стандартів щодо конфіденційності і безпеки є також важливим.

Дорожня карта Microsoft зосереджена на підвищенні ефективності, розширенні випадків використання і підтриманні етичних стандартів. З цими вдосконаленнями LLM можуть змінити те, як штучний інтелект взаємодіє з світом, роблячи їх більш практичними, адаптивними і орієнтованими на дії.

Майбутнє штучного інтелекту

Перетворення LLM на орієнтовані на дії штучні інтелекти може бути революційним. Ці системи можуть автоматизувати завдання, спрощувати робочі процеси і робити технології більш доступними. Робота Microsoft над орієнтованим на дії штучним інтелектом і інструментами, такими як агент UFO, тільки почалася. По мірі того, як штучний інтелект продовжує розвиватися, ми можемо очікувати більш розумних, здатних систем, які не просто взаємодіють з нами – вони виконують завдання.

Доктор Техсін Зія є доцентом COMSATS University Islamabad, який має ступінь PhD з штучного інтелекту у Віденському технічному університеті, Австрія. Спеціалізується на штучному інтелекті, машинному навчанні, науці про дані та комп'ютерному баченні, він зробив значний внесок з публікаціями в авторитетних наукових журналах. Доктор Техсін також очолював різні промислові проекти як головний дослідник і служив консультантом з штучного інтелекту.