Інтерв’ю

Дів Гарг, генеральний директор і співзасновник AGI, Inc – Серія інтерв’ю

mm
Додайте Unite.AI до бажаних джерел у Google

Дів Гарг, генеральний директор і співзасновник AGI, Inc, є дослідником штучного інтелекту і підприємцем, який зосереджується на автономних агентах, краєвій інтелекті, комп’ютерному баченні та робототехніці. До заснування AGI, Inc. він співзаснував і очолював MultiOn, одного з перших піонерів у сфері агентів для комп’ютерів, а пізніше обіймав посаду голови ради директорів цієї компанії. Гарг також майже чотири роки працював як ад’юнкт-професор Стенфордського університету, де створив курс CS 25: Transformers United, перший курс університету, присвячений архітектурам трансформерів. Його попередній досвід включає керівництво розробкою штучного інтелекту в Collaborative Robotics, проведення досліджень в NVIDIA (NVDA ) і Apple (AAPL ), а також роботу над комп’ютерним баченням і технологіями автономного руху в Google, Uber і Корнелльському університеті, де його дослідження включали впливовий підхід Pseudo-LiDAR до камерного 3D сприйняття.

AGI, Inc. є компанією з дослідження штучного інтелекту, яка розробляє приватний, безпечний і доступний інтелект, який працює безпосередньо на краєвому пристрої. Її флагманська технологія, AGI-0, є системою штучного інтелекту, орієнтованою на дії, призначеною для розуміння переваг користувача і виконання завдань у різних додатках на телефонах, комп’ютерах, носимих пристроях і інших підключених пристроях, включаючи робочі процеси, пов’язані з покупками, транспортом, плануванням, повідомленнями та розвагами. Компанія також пропонує платформу, яка дозволяє виробникам апаратного забезпечення і розробникам додавати агентів, які можуть розуміти і діяти в існуючих додатках без створення окремих інтеграцій для кожного додатку. AGI, Inc. продемонструвала свою технологію з Lenovo і оптимізує свій стек агентів для пристроїв, оснащених процесорами Qualcomm (QCOM ) Snapdragon.

Ви працювали в Apple, Google, Nvidia і допомогали створити ранні системи агентів у MultiOn, перш ніж призупинити свій PhD у Стенфорді, щоб заснувати AGI, Inc. Який конкретний обмеження або момент переконав вас, що існуючі підходи до штучного інтелекту були недостатніми, і що будівництво автономного агента на пристрої було правильним шляхом вперед?

Ця зміна відбулася десь між 2023 і 2024 роками, коли я працював над веб-агентами. Ми могли створити агентів для виконання дій у браузерах, але тільки якщо веб-сайт мав належну структуру, з якою агент міг працювати. Як тільки щось пішло не так і не поводилося як ідеалізована версія DOM, наприклад, модальне вікно або ефект анімації, агент перестав функціонувати. З іншого боку, все, що має значення, коли люди хочуть взаємодіяти зі своїми смартфонами, відбувається в додатках. Додатки не забезпечують жодного типу API; вони відображають екрани.

Це розходження призвело до наших висновків. Рішення проблеми не полягало в більш складних API або більших моделях, а радше в агенті, який би працював на пристрої з точки зору людини. Це означало behandeling смартфона як людина – взаємодію з його екранами.

Багато сучасних помічників штучного інтелекту все ще сильно залежать від API, інтеграцій і оркестрування в хмарі. Що фундаментально ламається в цій моделі, і чому ви вважаєте, що виконання на пристрої є відсутнім шаром?

Є три проблеми з цим. Перша – це покриття. API вимагають, щоб усі розробники взаємодіяли з вами, що обмежує можливості вашого агента до найповільнішого партнера. App Intents від Apple – це приклад такої технології, над якою працювали з моменту WWDC 2024. Потім є питання конфіденційності. Оркестрування в хмарі вимагає, щоб ваш контент екрана, повідомлення та дії надсилалися на сервери третіх осіб. Нарешті, є проблема витрат і затримки. Усі операції з обробки в хмарі роблять це повільним і дорогим.

Виконання на пристрої вирішує всі ці проблеми. Ваш агент не залежить від когось іншого і взаємодіє з системою шляхом взаємодії з інтерфейсом користувача безпосередньо.

Ваш підхід зсуває штучний інтелект від відповідей на питання до виконання завдань у різних додатках. Які були найбільшими технічними проблемами при створенні агента, який міг би надійно працювати на телефоні, як людина?

Надійно керування телефоном складніше, ніж здається. Спочатку агент повинен одночасно сприймати екран телефону, як людина, розуміти, що відбувається далі, і виконувати відповідні дії. Сприйняття здійснюється моделлю бачення мови, яка може розпізнавати кнопки, текстові поля, меню, макети тощо. Вибір дії необхідний для обробки неоднозначностей, частково завантажених сторінок, модальних діалогів і помилок. Нарешті, дія повинна бути достатньо точною, щоб клік приземлився в правильному місці.

Найбільшою проблемою, однак, є здатність надійно взаємодіяти з складними додатками протягом тривалого часу. Заказ Uber – це одне, але виконання багатокрокового процесу в додатку, де кожен крок залежить від попередніх взаємодій, – це зовсім інша справа. Саме тому навчання моделей з кінця в кінець було важливим для розробки продукту.

Ви описали це як перехід від помічників до агентів. Що це означає на практиці для звичайних користувачів, і як швидко ви очікуєте зміни поведінки?

Практична зміна відбувається через інтерфейс. Де сьогодні у нас є додаток і ми вчимося використовувати додаток, завтра у нас буде агент, і додатки стануть можливостями, створеними агентом від нашого імені. Ми перестаємо думати про додатки і починаємо думати про намір: “Замовте мені поїздку додому.” “Відправте фотографії з вихідних моїй мамі.” “Покажіть мені готелі в Лісабоні, де я можу отримати мир і спокій на наступних вихідних.” Агент знає, які додатки використовувати.

Зміна поведінки починається повільно і прискорюється, коли вона відбувається. Спочатку люди спробують цей підхід для простих завдань, яким вони довіряють, і потім розширять його, як тільки зможуть. Спусковий механізм для повномасштабового прийняття настане, коли агент правильно виконуватиме звичайні завдання на наших телефонах кожен раз.

З партнерствами, такими як Qualcomm і Lenovo, наскільки важливим є тісна інтеграція апаратного і програмного забезпечення для того, щоб штучний інтелект був корисним у масштабі?

Це різниця між прототипом, який використовується для дослідницьких цілей, і застосуванням, яке насправді можна використовувати. Пристрої, оснащені процесорами Snapdragon, мають нейронні процесорні одиниці, які забезпечать, що алгоритми агента зможуть працювати на пристрої з мінімальними затримками і енергоспоживанням. Qualcomm витратив роки на досягнення цієї оптимізації, і партнерство, яке ми оголосили на MWC 2026, мало саме цю мету.

Інший кінець – це Lenovo. Lenovo може досягти сотень мільйонів користувачів через смартфони, планшети і ПК, які шукають можливість відрізнитися за допомогою штучного інтелекту. Проходження через партнерів з існуючими портфелями пристроїв і досягнення їх швидко і прозоро переважає альтернативний шлях. Я знаю це з досвіду.

Довіра здається великим бар’єром. Як ви проектуєте системи, в яких користувачі відчувають себе комфортно, дозволяючи штучному інтелекту виконувати дії від їхнього імені, особливо коли ці дії охоплюють кілька додатків і чутливі дані?

Довіра будується на основі відкритості про те, чого агент є і не є здатним робити. Будь-яка дія, яка включає щось важливе, наприклад, здійснення покупки, відправлення повідомлення або зміну будь-яких налаштувань облікового запису, потребує затвердження користувачем. Агент має можливість дійти до сторінки оформлення замовлення самостійно, але не далі, доки ви не зробите цього. Наше партнерство з Visa додає автентифіковані платіжні рейки на додаток до цього.

Все це робиться на основі двох простих філософій. Перша – “людина в циклі для всього суттєвого”. Друга – “зворотність, де це можливо”. Крім того, агент буде бачити тільки те, що видно на екрані, і буде дотримуватися дозволів операційної системи, встановлених на місці.

Є зростаюча розповідь про те, що економіка додатків може бути порушена. Чи бачите ви агентів, які повністю замінять додатки, або змінюють, як додатки доступні і монетизуються?

Додатки ніколи не зникають. Динаміка просто зміщується. Для сьогодні додаток – це те, як бренд спілкується з споживачем. Завтра агент буде, і додаток стане інструментом, який використовується агентом. Розробники додатків залишаються, оскільки завжди буде потреба в додатку за сервісним викликом, текстовим повідомленням або транзакцією. Різниця полягає в інтерфейсі, на якому ці вибори здійснюються.

Це представляє новий рубіж для додатків і для брендів, які їх використовують. Це представляє жодної загрози, а радше неймовірну можливість досліджувати і розвивати з нашими партнерами в розробці і платформах.

Ваша система уникання залежності від API. Чи створює це напруженість з розробниками і платформами, або це нарешті відкриває більш відкриту екосистему?

Це менш суперечливе, ніж здається. Між розробниками і нами немає конкуренції. Шлях, яким працює інтерфейс, є тим же процесом, яким людина використовує додаток, тому агент використовує самі ж інтерфейси, як і будь-хто інший. Розробники можуть використовувати загальні технічні практики для блокування доступу, і ми розуміємо їхню логіку.

Більш цікавим результатом є відсутність суперечок. Відкрита система з універсальною взаємодією приносить користь усім, на відміну від закритої системи, де кожен помічник можна використовувати тільки на певних додатках, оскільки він підтримує тільки такий тип інтеграції. Універсальність допомагає користувачам, але вона також допомагає додаткам з реальною цінністю.

Місцеве штучне інтелект часто позиціонується як перевага конфіденційності. Як ви балансуйте місцеву обробку з необхідністю потужних моделей, які традиційно вимагають великомасштабної обробки?

Це гібридна система, яка буде продовжувати еволюціонувати до повністю місцевої системи. Обидві дії і легке міркування відбуваються на телефоні, тоді як важке міркування відбувається в хмарі. З оптимізацією стеку через нашу роботу з Qualcomm і можливостями нейронних процесорних одиниць телефонів, які стають дедалі більш просунутими, відбувається зміщення до більш локальної моделі. Наразі більшість флагманських телефонів, доступних на ринку, мають можливість обробляти необхідне навантаження.

Дихотомія або потужної продуктивності, або жертвування локалізацією, є застарілою. Моделі стають більш ефективними, а апаратне забезпечення телефону стає більш здатним. Все це можна досягти при правильній оптимізації стеку.

Оглядаючи вперед три-п’ять років, що виглядає повністю реалізований AI-родний пристрій, і що потрібно технічно і культурно, щоб ця бачення стала мейнстрімом?

Фактична реалізація буде складатися з одного агента, який слідує за вами через пристрої. Ви кажете своєму ПК знайти інформацію про подарунки, переходите на свій смартфон, щоб зробити покупку, потім кажете своїй машині розігратися. Намір залишається тим самим; контекст залишається постійним, тоді як поверхня змінюється. Телефони є точкою вставлення, оскільки зараз більшість обчислень відбувається саме там. Потім це перейде на ПК, телевізори, машини і, нарешті, на окуляри з доповненою реальністю, і співробітництво з Qualcomm робить велику різницю в цьому відношенні.

З технічної точки зору це продовжується місцевим міркуванням і збільшенням довгострокової надійності, а також правильними переходами між пристроями. З культурної точки зору зміна буде полягати в дедалі більших довірах агентам з дедалі більш складними завданнями, що ґрунтується на агенті, який каже вам усе, чого він не може зробити без вагання, і не порушує жодних простих обіцянок, даних вам.

Дякуємо за велике інтерв’ю. Читачам, які бажають дізнатися більше, рекомендуємо відвідати AGI, Inc.

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.