AGI и будущее ИИ
Большие модели действий (LAM): Новый рубеж в интеракциях, управляемых ИИ
Почти год назад Мустафа Сулейман, сооснователь DeepMind, предсказал, что эпоха генеративного ИИ скоро уступит место чему-то более интерактивному: системам, способным выполнять задачи, взаимодействуя с программными приложениями и человеческими ресурсами. Сегодня мы начинаем видеть, как это видение принимает форму с разработкой Rabbit AI новой операционной системы, управляемой ИИ, R1. Эта система продемонстрировала впечатляющую способность отслеживать и имитировать человеческие взаимодействия с приложениями. В основе R1 лежит Большая модель действий (LAM), продвинутый помощник ИИ, способный понимать намерения пользователя и выполнять задачи от его имени. Хотя ранее они были известны под другими терминами, такими как интерактивный ИИ и большая агентная модель, концепция LAM набирает обороты как ключевое нововведение в интеракциях, управляемых ИИ. Эта статья исследует детали LAM, то, как они отличаются от традиционных больших языковых моделей (LLM), представляет систему Rabbit AI R1 и рассматривает, как Apple (AAPL ) движется в сторону подхода, вдохновленного LAM. Она также обсуждает потенциальные применения LAM и проблемы, с которыми они сталкиваются.
Понимание больших моделей действий или агентных моделей (LAM)
LAM – это продвинутый агент ИИ, разработанный для понимания человеческих намерений и выполнения конкретных целей. Эти модели отлично подходят для понимания человеческих потребностей, планирования сложных задач и взаимодействия с различными моделями, приложениями или людьми для выполнения своих планов. LAM выходят за рамки простых задач ИИ, таких как генерация ответов или изображений; они представляют собой полноценные системы, предназначенные для обработки сложных действий, таких как планирование путешествий, планирование встреч и управление электронной почтой. Например, при планировании путешествия LAM будет координировать с приложением погоды для прогнозов, взаимодействовать с сервисами бронирования рейсов, чтобы найти подходящие рейсы, и взаимодействовать с системами бронирования отелей, чтобы обеспечить размещение. В отличие от многих традиционных моделей ИИ, которые полагаются исключительно на нейронные сети, LAM используют гибридный подход, сочетающий нейро-символическое программирование. Это интеграция символического программирования помогает в логическом рассуждении и планировании, в то время как нейронные сети способствуют распознаванию сложных сенсорных моделей. Это сочетание позволяет LAM решать широкий спектр задач, что делает их тонким нововведением в интеракциях, управляемых ИИ.
Сравнение LAM с LLM
В отличие от LAM, LLM – это агенты ИИ, которые отлично подходят для интерпретации подсказок пользователя и генерации текстовых ответов, в основном помогая с задачами, которые включают обработку языка. Однако их объем обычно ограничен текстовыми действиями. С другой стороны, LAM расширяют возможности ИИ за пределы языка, позволяя им выполнять сложные действия для достижения конкретных целей. Например, хотя LLM может эффективно составить электронное письмо на основе инструкций пользователя, LAM идет дальше, не только составляя, но и понимая контекст, решая, какой ответ подходит, и управляя доставкой электронного письма.
Кроме того, LLM обычно предназначены для прогнозирования следующего токена в последовательности текста и для выполнения написанных инструкций. Напротив, LAM оснащены не только пониманием языка, но и способностью взаимодействовать с различными приложениями и реальными системами, такими как устройства IoT. Они могут выполнять физические действия, контролировать устройства и управлять задачами, которые требуют взаимодействия с внешней средой, такими как бронирование встреч или сделать резервирование. Эта интеграция навыков языка с практическим выполнением позволяет LAM работать в более разнообразных сценариях, чем LLM.
LAM в действии: Rabbit R1
Rabbit R1 является ярким примером LAM в практическом использовании. Это устройство, управляемое ИИ, может управлять несколькими приложениями через единый, удобный интерфейс. Оснащенный 2,88-дюймовым сенсорным экраном, поворотной камерой и скроллинг-мультирулером, R1 находится в элегантном, округлом корпусе, разработанном в сотрудничестве с Teenage Engineering. Он работает на процессоре MediaTek 2,3 ГГц, усиленном 4 ГБ оперативной памяти и 128 ГБ хранилища.
В основе R1 лежит его LAM, который интеллектуально контролирует функциональность приложений и упрощает сложные задачи, такие как управление музыкой, бронирование транспорта, заказ продуктов и отправка сообщений, все из одной точки взаимодействия. Таким образом R1 устраняет хлопоты переключения между несколькими приложениями или несколькими входами в систему для выполнения этих задач.
LAM внутри R1 изначально был обучен, наблюдая за человеческими взаимодействиями с популярными приложениями, такими как Spotify и Uber. Это обучение позволило LAM ориентироваться в интерфейсах пользователя, распознавать иконки и обрабатывать транзакции. Это обширное обучение позволяет R1 адаптироваться к практически любому приложению. Кроме того, специальный режим обучения позволяет пользователям вводить и автоматизировать новые задачи, постоянно расширяя возможности R1 и делая его динамичным инструментом в области интеракций, управляемых ИИ.
Прогресс Apple в сторону возможностей, вдохновленных LAM, в Siri
Команда исследователей ИИ Apple недавно поделилась информацией о своих усилиях по улучшению возможностей Siri с помощью новой инициативы, похожей на те, что имеют LAM. Инициатива, изложенная в исследовательской работе на тему Reference Resolution As Language Modeling (ReALM), направлена на улучшение способности Siri понимать контекст разговора, обрабатывать визуальный контент на экране и обнаруживать окружающие действия. Подход, принятый ReALM при обработке входных данных интерфейса пользователя (UI), проводит параллели с функциональностью, наблюдаемой в Rabbit AI R1, демонстрируя намерение Apple улучшить понимание Siri взаимодействия пользователя.
Этот прогресс указывает на то, что Apple рассматривает возможность принятия технологий LAM для уточнения того, как пользователи взаимодействуют со своими устройствами. Хотя нет явных объявлений о развертывании ReALM, потенциал для значительного улучшения взаимодействия Siri с приложениями предполагает многообещающие достижения в том, чтобы сделать помощника более интуитивным и отзывчивым.
Потенциальные применения LAM
LAM имеют потенциал распространить свое влияние далеко за пределы улучшения взаимодействия между пользователями и устройствами; они могут оказать значительную пользу в различных отраслях.
- Служба поддержки клиентов: LAM могут улучшить обслуживание клиентов, независимо обрабатывая запросы и жалобы по различным каналам. Эти модели могут обрабатывать запросы с помощью естественного языка, автоматизировать решения и управлять планированием, предоставляя персонализированную службу на основе истории клиента для улучшения удовлетворенности.
- Здравоохранение: В здравоохранении LAM могут помочь управлять уходом за пациентами, организовывая встречи, управляя рецептами и облегчая связь между службами. Они также полезны для удаленного мониторинга, интерпретации медицинских данных и оповещения персонала в случае чрезвычайных ситуаций, особенно полезных для управления уходом за хроническими и пожилыми пациентами.
- Финансы: LAM могут предлагать персонализированные финансовые советы и управлять задачами, такими как балансировка портфеля и предложения инвестиций. Они также могут отслеживать транзакции для обнаружения и предотвращения мошенничества, интегрируясь с банковскими системами для быстрого реагирования на подозрительные действия.
Проблемы LAM
Несмотря на их значительный потенциал, LAM сталкиваются с несколькими проблемами, которые необходимо решить.
- Конфиденциальность и безопасность данных: Учитывая широкий доступ к личной и конфиденциальной информации, необходимой для функционирования LAM, обеспечение конфиденциальности и безопасности данных является серьезной проблемой. LAM взаимодействуют с личными данными в нескольких приложениях и платформах, что вызывает обеспокоенность по поводу безопасной обработки, хранения и обработки этой информации.
- Этические и нормативные проблемы: Поскольку LAM принимают на себя более автономные роли в принятии решений и взаимодействии с человеческой средой, этические соображения становятся все более важными. Вопросы об ответственности, прозрачности и степени принятия решений, делегированных машинам, являются критическими. Кроме того, могут возникнуть нормативные проблемы при развертывании таких передовых систем ИИ в различных отраслях.
- Сложность интеграции: LAM требуют интеграции с различными программными и аппаратными системами для эффективного выполнения задач. Эта интеграция сложна и может быть сложной для управления, особенно при координации действий в нескольких платформах и сервисах, таких как бронирование рейсов, проживания и других логистических деталей в режиме реального времени.
- Масштабируемость и адаптируемость: Хотя LAM предназначены для адаптации к широкому спектру сценариев и приложений, масштабирование этих решений для эффективного и эффективного управления разнообразными реальными средами остается проблемой. Обеспечение того, чтобы LAM могли адаптироваться к меняющимся условиям и поддерживать производительность в различных задачах и потребностях пользователей, имеет решающее значение для их долгосрочного успеха.
Итог
Большие модели действий (LAM) появляются как значительное нововведение в ИИ, влияющее не только на взаимодействие с устройствами, но и на более широкие отраслевые применения. Демонстрируемые Rabbit AI R1 и исследуемые в достижениях Apple с Siri, LAM устанавливают сцену для более интерактивных и интуитивных систем ИИ. Эти модели готовы повысить эффективность и персонализацию в таких секторах, как обслуживание клиентов, здравоохранение и финансы.
Однако развертывание LAM сопряжено с проблемами, включая проблемы конфиденциальности данных, этические проблемы, сложности интеграции и масштабируемости. Решение этих проблем имеет важное значение, поскольку мы продвигаемся к более широкому внедрению технологий LAM, стремясь использовать их возможности ответственно и эффективно. По мере того, как LAM продолжают развиваться, их потенциал для трансформации цифровых взаимодействий остается значительным, подчеркивая их важность в будущем ландшафте ИИ.












