Интервью
Див Гарг, генеральный директор и сооснователь AGI, Inc – Интервью

Див Гарг, генеральный директор и сооснователь AGI, Inc, является исследователем искусственного интеллекта и предпринимателем, специализирующимся на автономных агентах, интеллекте на краю, компьютерном зрении и робототехнике. До основания AGI, Inc. он соосновал и возглавлял MultiOn, одного из первых пионеров в области агентов, использующих компьютеры, и позже являлся председателем его совета директоров. Гарг также почти четыре года работал в качестве адъюнкт-профессора в Стэнфордском университете, где создал CS 25: Transformers United, первый курс университета, посвященный архитектурам трансформеров. Его более ранний опыт включает руководство разработкой искусственного интеллекта в Collaborative Robotics, проведение исследований в NVIDIA (NVDA ) и Apple (AAPL ), а также работу над технологиями компьютерного зрения и автономного вождения в Google, Uber и Корнелльском университете, где его исследования включали влиятельный подход Pseudo-LiDAR к камера-основанному 3D-восприятию.
AGI, Inc. является компанией, занимающейся исследованиями в области искусственного интеллекта, которая разрабатывает частную, безопасную и доступную интеллектуальную систему, работающую напрямую на устройствах на краю. Ее флагманская технология, AGI-0, представляет собой ориентированную на действие систему искусственного интеллекта, предназначенную для понимания предпочтений пользователей и выполнения задач во всех приложениях на телефонах, компьютерах, носимых устройствах и других подключенных устройствах, включая рабочие процессы, связанные с покупками, транспортировкой, планированием, обменом сообщениями и развлечениями. Компания также предлагает платформу, которая позволяет производителям оборудования и разработчикам добавлять агентов, осознающих экран и способных рассуждать и действовать во всех существующих приложениях без создания отдельных интеграций для каждого приложения. AGI, Inc. продемонстрировала свою технологию с Lenovo и оптимизирует свой стек агентов для устройств на базе процессоров Qualcomm (QCOM ) Snapdragon.
Вы работали в Apple, Google, Nvidia и помогли создать ранние системы агентов в MultiOn, прежде чем приостановить свою аспирантуру в Стэнфорде, чтобы основать AGI, Inc. Какое конкретное ограничение или момент убедило вас, что существующие подходы к искусственному интеллекту недостаточны, и что построение автономного агента на устройстве является правильным путем вперед?
Это изменение произошло где-то между 2023 и 2024 годами, когда я работал над веб-агентами. Мы могли создавать агентов для выполнения действий в браузерах, но только если веб-сайт имел правильную структуру, с которой агент мог работать. Как только что-то пошло не так и не повело себя как идеализированная версия DOM, такая как модальное окно или эффект анимации, агент переставал функционировать. С другой стороны, все, что имеет значение, когда люди хотят взаимодействовать со своими смартфонами, происходит внутри приложений. Приложения не предоставляют никакого вида API; они представляют экраны вместо этого.
Это различие привело к нашим выводам. Решение проблемы не заключалось в более сложных API или более крупных моделях, а rather в агенте, который будет работать с устройством с точки зрения человека. Это означало обращение с смартфоном как с человеком – взаимодействие с его экранами.
Многие помощники искусственного интеллекта сегодня все еще сильно полагаются на API, интеграции и облачную оркестрацию. Что фундаментально ломается в этой модели, и почему вы считаете, что выполнение на устройстве является отсутствующим слоем?
Есть три проблемы с этим. Первая – покрытие. API требуют, чтобы все разработчики взаимодействовали с вами, что ограничивает возможности вашего агента до самых медленных партнеров. App Intents от Apple являются отличным примером такой технологии, над которой начали работать еще на WWDC 2024. Затем есть проблема конфиденциальности. Облачная оркестрация требует, чтобы содержимое вашего экрана, сообщения и действия передавались на сервера третьей стороны. Наконец, есть проблема стоимости и задержки. Все обработки, проходящие через облако, делают это медленным и дорогим.
Выполнение на устройстве решает все эти проблемы. Ваш агент не зависит от кого-либо другого и взаимодействует с системой, взаимодействуя с UI напрямую.
Ваш подход смещает искусственный интеллект от ответов на вопросы к фактическому выполнению задач во всех приложениях. Какими были самыми сложными техническими задачами в обеспечении надежной работы агента на телефоне, как человек?
Надежное управление телефоном более сложно, чем может показаться. Сначала агент должен одновременно воспринимать экран телефона как человек, понимать, что происходит дальше, и выполнять соответствующее действие. Восприятие осуществляется с помощью модели компьютерного зрения и языка, способной распознавать кнопки, текстовые поля, меню, макеты и т. д. Выбор действия необходим для обработки неоднозначностей, частично загруженных страниц, модальных диалогов и ошибок. Наконец, действие должно быть достаточно точным, чтобы касание приземлилось в правильном месте.
Самая значительная проблема, однако, заключается в способности надежно взаимодействовать с сложными приложениями в течение длительного периода времени. Бронирование Uber – это одно, но выполнение многоступенчатого процесса внутри приложения, где каждый шаг зависит от предыдущих взаимодействий, – это совершенно другая игра. Именно поэтому обучение моделей с конца в начало было важно для разработки продукта.
Вы описали это как переход от помощников к агентам. Что этот переход действительно означает на практике для повседневных пользователей, и как быстро вы ожидаете изменений в поведении?
Практические изменения происходят от интерфейса. Где сегодня у нас есть приложение и учимся использовать приложение, завтра у нас будет агент, и приложения станут возможностями, составленными агентом от нашего имени. Мы перестаем думать об приложениях и начинаем думать об намерениях: “Забронируйте мне поездку домой.” “Отправьте фотографии из выходных маме.” “Покажите мне отели в Лиссабоне, где я могу получить некоторое спокойствие на следующий уик-энд.” Агент знает, какие приложения использовать.
Изменения в поведении начинаются медленно и становятся быстрее, когда они идут дальше. Сначала люди будут пробовать этот подход для простых задач, которым они доверяют, и затем расширять, пока они не смогут. Спусковой крючок для полномасштабного принятия придет, когда агент правильно выполнит рутинные задачи на наших телефонах каждый раз.
С партнерствами, такими как Qualcomm и Lenovo, насколько важно тесное интеграция аппаратного и программного обеспечения для того, чтобы агентский искусственный интеллект был пригоден для использования в масштабе?
Это разница между прототипом, используемым для исследовательских целей, и приложением, которое фактически используется. Устройства, работающие на базе процессоров Snapdragon, имеют нейронные процессорные единицы, которые обеспечат, что алгоритмы агента могут работать на устройстве с минимальными задержками и потреблением энергии. Qualcomm потратил годы на достижение этой оптимизации, и партнерство, которое мы объявили на MWC 2026, имело именно эту цель.
Другой конец – Lenovo. Lenovo может достичь сотен миллионов пользователей по всему миру через смартфоны, планшеты и компьютеры, стремясь отличиться с помощью искусственного интеллекта. Партнерство с компаниями, имеющими существующие портфели устройств, и достижение их быстро и прозрачно лучше, чем альтернативный путь. Я знаю это из опыта.
Доверие кажется значительным барьером. Как вы проектируете системы, в которых пользователи чувствуют себя комфортно, разрешая искусственному интеллекту выполнять действия от их имени, особенно когда эти действия охватывают несколько приложений и конфиденциальные данные?
Доверие строится на основе открытости о том, что агент может и не может делать. Любое действие, включающее что-то важное, такое как совершение фактической покупки, отправка сообщения или изменение настроек учетной записи, требует одобрения пользователя. Агент может пойти до страницы оформления заказа самостоятельно, но не дальше, пока вы не сделаете это. Наше партнерство с Visa добавляет аутентифицированные платежные рельсы поверх этого.
Все это делается на основе двух простых философий. Первая – “человек в цикле для всего существенного”. Вторая – “обратимость, когда это возможно”. Кроме того, агент будет видеть только то, что видно на экране, и будет уважать разрешения, установленные операционной системой.
Существует растущая нарратив о том, что экономика приложений может быть нарушена. Видите ли вы агентов, полностью заменяющих приложения, или меняющих, как приложения доступны и монетизируются?
Приложения никогда не исчезают. Динамика просто меняется. Сегодня приложение – это то, как бренд общается с потребителем. Завтра агент будет, и приложение будет инструментом, используемым агентом. Разработчики приложений остаются, потому что всегда будет необходимость в приложении за сервисным вызовом, текстовом сообщении или транзакции. Разница будет в интерфейсе, на котором эти выборы делаются.
Это представляет собой новую границу для приложений и для брендов, которые используют их. Это представляет собой не угрозу, а скорее удивительную возможность для изучения и разработки с нашими партнерами в разработке и платформах.
Ваша система избегает использования API. Создает ли это напряженность с разработчиками и платформами или в конечном итоге разблокирует более открытую экосистему?
Это менее спорно, чем звучит. Нет конкуренции между разработчиками и нами. То, как работает интерфейс, – это тот же процесс, который человек использует приложение, поэтому агент использует те же интерфейсы, что и любой другой. Разработчики могут использовать общие технические практики, чтобы заблокировать доступ, и мы понимаем их рассуждения.
Более интересным результатом является отсутствие конфликта. Открытая система с универсальной интероперабельностью приносит пользу всем, по сравнению с закрытой системой, где каждый помощник может использоваться только на определенных приложениях, потому что он поддерживает только такой тип специализированной интеграции. Универсальность помогает пользователям, но она также помогает приложениям с реальной ценностью.
Местный искусственный интеллект часто представляется как преимущество конфиденциальности. Как вы балансируете локальную обработку с необходимостью мощных моделей, которые традиционно требуют крупномасштабных вычислений?
Это гибридная система, которая будет продолжать развиваться в сторону полностью локальной системы. И действия, и легкое рассуждение происходят на телефоне, в то время как тяжелое рассуждение происходит в облаке. С оптимизацией стека через нашу работу с Qualcomm и возможностями NPUs телефонов, которые становятся все более продвинутыми, есть сдвиг в сторону большей локализации модели. В настоящее время большинство флагманских телефонов, доступных на рынке, имеют возможность обработки необходимой рабочей нагрузки.
Дихотомия либо иметь мощную производительность и жертвовать локализацией, либо наоборот, также устарела. Модели становятся более эффективными, и аппаратное обеспечение телефона становится более способным. Все это может быть достигнуто, когда стек правильно оптимизирован.
Оглядываясь вперед на три-пять лет, как выглядит полностью реализованный AI-родной девайс, и что должно произойти технически и культурно, прежде чем это видение станет мейнстримом?
Фактическая реализация будет представлять собой единого агента, следующего за вами на устройствах. Вы говорите своему ПК найти информацию о подарках, переключаетесь на свой смартфон, чтобы сделать покупку, затем говорите своей машине, чтобы она нагрелась. Намерение одно и то же; контекст остается постоянным, в то время как поверхность меняется. Телефоны – это точка вставки, поскольку именно там происходит большинство вычислений сейчас. После этого это перейдет на ПК, телевизоры, машины и, наконец, на умные очки, и сотрудничество с Qualcomm делает огромную разницу в этом отношении.
С технической точки зрения, это продолжение локального рассуждения и увеличение долгосрочной надежности, а также правильных переходов между устройствами. С культурной точки зрения, изменение будет заключаться в все большем доверии агентам все более сложными задачами, что основано на агенте, рассказывающем вам все, что он не может сделать без колебаний, и также не нарушая никаких простых обещаний, данных вам.
Спасибо за отличное интервью, читатели, которые хотят узнать больше, должны посетить AGI, Inc.












