AGI та майбутній ШІ
Великі моделі дій (LAM): Наступний рубіж у взаємодії, що використовує штучний інтелект
Майже рік тому Мустафа Сулейман, співзасновник DeepMind, передрік, що епоха генеративного штучного інтелекту скоро віддасть місце щось більш інтерактивному: системам, здатним виконувати завдання шляхом взаємодії з програмними додатками та людськими ресурсами. Сьогодні ми починаємо бачити, як це бачення набуває форми з розробкою нового штучного інтелекту Rabbit AI – операційної системи R1. Ця система продемонструвала вражаючу здатність моніторити та імітувати людську взаємодію з додатками. У серці R1 лежить Велика модель дії (LAM), просунутий штучний інтелект, здатний розуміти наміри користувача та виконувати завдання від їхнього імені. Хоча раніше вони були відомі під іншими термінами, такими як інтерактивний штучний інтелект та Велика агентна модель, концепція LAM набуває імпульсу як ключовий інноваційний крок у взаємодії, що використовує штучний інтелект. Ця стаття досліджує деталі LAM, як вони відрізняються від традиційних більших мовних моделей (LLM), представляє систему R1 від Rabbit AI та розглядає, як Apple (AAPL ) рухається до підходу, подібного до LAM. Вона також обговорює потенційні застосування LAM та виклики, з якими вони стикаються.
Поняття великих моделей дій або агентних моделей (LAM)
LAM – це просунутий штучний інтелект, розроблений для розуміння людських намірів та виконання конкретних цілей. Ці моделі виділяються своєю здатністю розуміти людські потреби, планувати складні завдання та взаємодіяти з різними моделями, додатками чи людьми для виконання своїх планів. LAM виходять за рамки простих завдань штучного інтелекту, таких як генерація відповідей чи зображень; вони є повноцінними системами, розробленими для виконання складних дій, таких як планування подорожей, організація зустрічей та управління електронною поштою. Наприклад, у плануванні подорожей LAM координуватиме дії з погодним додатком для прогнозів, взаємодіятиме з сервісами бронювання авіаквитків для пошуку відповідних рейсів та взаємодіятиме з системами бронювання готелів для забезпечення проживання. На відміну від багатьох традиційних моделей штучного інтелекту, які залежать виключно від нейронних мереж, LAM використовують гібридний підхід, який поєднує нейро-символічне програмування. Ця інтеграція символічного програмування допомагає у логічному висновку та плануванні, тоді як нейронні мережі сприяють розпізнаванню складних сенсорних патернів. Це поєднання дозволяє LAM займатися широким спектром завдань, роблячи їх витонченим розвитком у взаємодії, що використовує штучний інтелект.
Порівняння LAM з LLM
На відміну від LAM, LLM – це штучний інтелект, який виділяється своєю здатністю інтерпретувати запити користувача та генерувати текстові відповіді, допомагаючи переважно з завданнями, пов’язаними з обробкою мови. Однак їхній обсяг зазвичай обмежений текстовими діяльностями. З іншого боку, LAM розширюють можливості штучного інтелекту за межі мови, дозволяючи їм виконувати складні дії для досягнення конкретних цілей. Наприклад, тоді як LLM може ефективно складати електронний лист на основі інструкцій користувача, LAM йде далі, не тільки складає, але й розуміє контекст, приймає рішення про відповідну реакцію та керує доставкою електронного листа.
Крім того, LLM зазвичай розроблені для передбачення наступного токену в послідовності тексту та виконання написаних інструкцій. На відміну від них, LAM оснащені не тільки розумінням мови, але й здатністю взаємодіяти з різними додатками та реальними системами, такими як пристрої IoT. Вони можуть виконувати фізичні дії, керувати пристроями та керувати завданнями, які вимагають взаємодії з зовнішнім середовищем, такими як бронювання зустрічей або замовлення. Ця інтеграція мовних навичок з практичним виконанням дозволяє LAM діяти в більш різноманітних сценаріях, ніж LLM.
LAM у дії: Rabbit R1
Rabbit R1 є видатним прикладом LAM у практичному використанні. Цей пристрій, що використовує штучний інтелект, може керувати кількома додатками через один інтерфейс. Оснащений сенсорним екраном діагоналлю 2,88 дюйма, обертальним камерою та скроллінговим колесом, R1 розміщений у стильному, округлому корпусі, розробленому у співпраці з Teenage Engineering. Він працює на процесорі MediaTek частотою 2,3 ГГц, підтримується 4 ГБ оперативної пам’яті та 128 ГБ сховища.
У серці R1 лежить його LAM, який інтелектуально контролює функціональність додатків та спрощує складні завдання, такі як контроль музики, бронювання транспорту, замовлення продуктів та надсилання повідомлень, все з однієї точки взаємодії. Таким чином R1 усуває клопіт перемикання між кількома додатками або кількома входами для виконання цих завдань.
LAM у R1 спочатку був навчений шляхом спостереження за взаємодією людини з популярними додатками, такими як Spotify та Uber. Це навчання дозволило LAM орієнтуватися в інтерфейсах користувача, розпізнавати іконки та обробляти транзакції. Це широке навчання дозволяє R1 адаптуватися до практично будь-якого додатка. Крім того, спеціальний режим навчання дозволяє користувачам вводити та автоматизувати нові завдання, постійно розширюючи діапазон можливостей R1 та роблячи його динамічним інструментом у сфері взаємодії, що використовує штучний інтелект.
Розробки Apple щодо можливостей, надихнутих LAM, у Siri
Команда дослідників штучного інтелекту Apple недавно поділилася інформацією про свої зусилля щодо покращення можливостей Siri через нову ініціативу, подібну до тих, що мають LAM. Ця ініціатива, викладена в дослідницькій роботі про Reference Resolution As Language Modeling (ReALM), має на меті покращити здатність Siri розуміти контекст розмов, обробляти візуальний контент на екрані та виявляти навколишню діяльність. Підхід, прийнятий у ReALM для обробки входів інтерфейсу користувача, нагадує функціональність, спостережену в R1 від Rabbit AI, демонструючи намір Apple покращити взаємодію Siri з користувачами.
Цей розвиток показує, що Apple розглядає можливість прийняття технологій LAM для вдосконалення взаємодії користувачів зі своїми пристроями. Хоча немає явних заяв щодо розгортання ReALM, потенціал суттєвого покращення взаємодії Siri з додатками свідчить про перспективні досягнення в створенні більш інтуїтивного та реактивного помічника.
Потенційні застосування LAM
LAM мають потенціал розширити свій вплив далеко за межі поліпшення взаємодії між користувачами та пристроями; вони можуть забезпечити суттєві вигоди в багатьох галузях.
- Сервіс клієнтів: LAM можуть покращити сервіс клієнтів, самостійно обробляючи запити та скарги через різні канали. Ці моделі можуть обробляти запити за допомогою природної мови, автоматизувати розв’язання проблем та керувати графіком, забезпечуючи персоналізований сервіс на основі історії клієнта для покращення задоволеності.
- Охорона здоров’я: В охороні здоров’я LAM можуть допомогти керувати доглядом за пацієнтами, організовуючи зустрічі, керуючи рецептами та полегшуючи спілкування між службами. Вони також корисні для віддаленого моніторингу, інтерпретації медичних даних та оповіщення персоналу в умовах надзвичайної ситуації, особливо корисні для управління доглядом за хронічними та літніми пацієнтами.
- Фінанси: LAM можуть пропонувати персоналізовані фінансові поради та керувати завданнями, такими як балансування портфеля та пропозиції інвестицій. Вони також можуть моніторити транзакції для виявлення та запобігання шахрайству, інтегруючись безперешкодно з банківськими системами для швидкого реагування на підозрілу діяльність.
Виклики LAM
Незважаючи на їхній суттєвий потенціал, LAM зустрічають кілька викликів, які потрібно вирішити.
- Конфіденційність даних та безпека: Оскільки LAM потребують широкого доступу до особистої та конфіденційної інформації для виконання своєї функції, забезпечення конфіденційності даних та безпеки є суттєвим викликом. LAM взаємодіють з особистими даними через кілька додатків та платформ, що викликає питання щодо безпечної обробки, зберігання та обробки цієї інформації.
- Етичні та нормативні проблеми: Коли LAM приймають більш автономні ролі у прийнятті рішень та взаємодії з людським середовищем, етичні питання стають все більш важливими. Питання про відповідальність, прозорість та ступінь прийняття рішень, делегованих машинам, є критичними. Крім того, можуть виникнути нормативні виклики при розгортанні таких просунутих систем штучного інтелекту в різних галузях.
- Складність інтеграції: LAM вимагають інтеграції з різними програмними та апаратними системами для ефективного виконання завдань. Ця інтеграція є складною та може бути складною для керування, особливо при координуванні дій через різні платформи та служби, такі як бронювання авіаквитків, проживання та інших логістичних деталей в режимі реального часу.
- Масштабованість та адаптивність: Хоча LAM розроблені для адаптації до широкого спектра сценаріїв та додатків, масштабування цих рішень для ефективної роботи в реальному світі залишається викликом. Забезпечення того, щоб LAM могли адаптуватися до змінних умов та підтримувати продуктивність через різні завдання та потреби користувачів, є важливим для їхньої довгострокової успішності.
Висновок
Великі моделі дій (LAM) виникають як суттєва інновація у сфері штучного інтелекту, впливаючи не тільки на взаємодію з пристроями, але й на широке застосування в різних галузях. Як демонструє система R1 від Rabbit AI та дослідження Apple щодо вдосконалення Siri, LAM готують сцену для більш інтерактивних та інтуїтивних систем штучного інтелекту. Ці моделі готуються до покращення ефективності та персоналізації в таких галузях, як сервіс клієнтів, охорона здоров’я та фінанси.
Однак, розгортання LAM супроводжується викликами, включаючи проблеми конфіденційності даних, етичні питання, складність інтеграції та масштабованість. Вирішення цих питань є суттєвим кроком у напрямку широкого прийняття технологій LAM, спрямованого на використання їхніх можливостей відповідально та ефективно. Коли LAM продовжують розвиватися, їхній потенціал для трансформації цифрової взаємодії залишається суттєвим, підкреслюючи їхню важливість у майбутньому ландшафті штучного інтелекту.












