Rozhovory
Div Garg, CEO a spoluzakladatel AGI, Inc – Interview Series

Div Garg, CEO a spoluzakladatel AGI, Inc, je AI výzkumník a podnikatel zaměřený na autonomní agenty, edge inteligenci, počítačové vidění a robotiku. Před založením AGI, Inc. spoluzaložil a vedl MultiOn, raného průkopníka v agentech pro počítače, a později působil jako předseda jeho správní rady. Garg také strávil téměř čtyři roky jako adjunkt na Stanfordově univerzitě, kde vytvořil CS 25: Transformers United, první kurz univerzity věnovaný architekturám transformátorů. Jeho dřívější zkušenosti zahrnují vedení vývoje umělé inteligence v Collaborative Robotics, výzkum v NVIDIA (NVDA ) a Apple (AAPL ), a práci na počítačovém vidění a technologiích autonomního řízení v Google, Uber a Cornell University, kde jeho výzkum zahrnoval vlivný přístup Pseudo-LiDAR pro kamerou založené 3D vnímání.
AGI, Inc. je AI výzkumná společnost, která vyvíjí soukromou, zabezpečenou a přístupnou inteligenci, která funguje přímo na edge zařízeních. Jejich vlajkovou lodí je AGI-0, akční orientovaný AI systém navržený pro pochopení uživatelských preferencí a dokončení úkolů napříč aplikacemi na telefonech, počítačích, nositelných zařízeních a dalších propojených zařízeních, včetně pracovních postupů zahrnujících nákup, dopravu, plánování, zasílání zpráv a zábavu. Společnost také nabízí platformu, která umožňuje výrobcům hardwaru a vývojářům přidat obrazovku-aware agenty schopné rozumět a jednat napříč stávajícími aplikacemi bez vytváření samostatných integračních prvků pro každou aplikaci. AGI, Inc. prokázala svou technologii s Lenovo a optimalizuje svůj agentní stack pro zařízení s procesory Qualcomm (QCOM ) Snapdragon.
Pracoval jste v Apple, Google, Nvidia a pomáhal zakládat rané agentní systémy v MultiOn, než jste přerušil svůj doktorát na Stanfordu, aby založil AGI, Inc. Jaká konkrétní omezení nebo okamžik vás přesvědčily, že stávající přístupy k AI nejsou dostatečné, a že budování autonomního agenta na zařízení je správnou cestou vpřed?
Tato změna nastala někde mezi lety 2023 a 2024, zatímco jsem pracoval na webových agentech. Bylo možné vytvořit agenty, kteří mohli provádět akce v prohlížečích, ale pouze pokud měla webová stránka správnou strukturu, se kterou mohl agent pracovat. Jakmile něco šlo špatně a nechovalo se jako idealizovaná verze DOM, jako například modální okno nebo animační efekt, agent přestal fungovat. Na druhé straně všechno, co je důležité, když lidé chtějí interagovat se svými chytrými telefony, se děje uvnitř aplikací. Aplikace neposkytují žádný druh API; místo toho zobrazují obrazovky.
To vedlo k našim závěrům. Řešením problému nebylo více sofistikovaných API nebo větších modelů, ale spíše agent, který by fungoval na zařízení z pohledu člověka. To znamenalo, že smartphone bude léčen jako člověk – interagovat s jeho obrazovkami.
Mnozí AI asistenti dnes stále spoléhají na API, integrace a cloud orchestraci. Co fundamentálně porušuje v tomto modelu a proč věříte, že provedení na zařízení je chybějící vrstva?
Existují tři problémy s tím. První je pokrytí. API vyžadují, aby všichni vývojáři museli rozhraní s vámi, což omezuje schopnosti vašeho agenta na nejpomalejšího partnera. App Intents od Apple jsou skvělým příkladem takové technologie, která začala být vyvíjena na WWDC 2024. Potom je zde otázka soukromí. Cloud orchestrace vyžaduje, aby váš obsah obrazovky, zprávy a aktivity šly na servery třetí strany. Nakonec je zde problém nákladů a latence. Všechny round-trip zpracování přes cloud činí to pomalým a nákladným.
Provedení na zařízení řeší všechny tyto problémy. Váš agent nezávisí na nikom jiném a rozhraní se systémem se děje přímo prostřednictvím uživatelského rozhraní.
Vaše přístup mění AI z odpovědí na otázky na skutečné dokončení úkolů napříč aplikacemi. Jaké byly nejobtížnější technické výzvy při umožnění agentovi spolehlivě ovládat telefon jako člověk?
Spolehlivé ovládání telefonu je obtížnější, než se zdá. Nejprve musí agent současně vnímat obrazovku telefonu jako člověk, porozumět tomu, co přijde dál, a provést příslušnou akci. Vnímání se provádí modelem vidění a jazyka, který je schopen rozpoznat tlačítka, textové pole, menu, rozložení atd. Výběr akce je vyžadován pro zpracování nejednoznačností, částečně načtených stránek, modálních dialogů a chyb. Nakonec musí být akce dostatečně přesná, aby se dotyk umístil na správné místo.
Nejdůležitějším problémem je však schopnost spolehlivě interagovat s komplexními aplikacemi po dlouhou dobu. Objednání Uberu je jedna věc, ale provedení vícekrokového procesu uvnitř aplikace, kde každá fáze závisí na předchozích interakcích, je úplně jiná hra. To je přesně proč bylo pro vývoj produktu nezbytné trénovat modely koncovými body.
Popisujete to jako přechod od asistentů k agentům. Co to znamená v praxi pro běžné uživatele a jak rychle očekáváte změnu chování?
Praktická změna přichází z rozhraní samo o sobě. Dnes máme aplikaci a učíme se, jak ji používat, zítra budeme mít agenta a aplikace se stanou schopnostmi složenými agentem naším jménem. Přestaneme myslet na aplikace a začneme myslet na záměr: “Objednaj mi jízdu domů.” “Pošli mi obrázky z víkendu na Mamu.” “Ukaž mi hotely v Lisabonu, kde si mohu odpočinout na příští víkend.” Agent ví, které aplikace použít.
Změna chování začíná pomalu a zrychluje, jak pokračuje. Nejprve lidé budou tuto metodu zkoušet pro jednoduché úkoly, kterým důvěřují, a poté se rozšíří, jak daleko to půjde. Spouštěčem pro plnou akceptaci bude, když agent zvládne rutinní úkoly na našich telefonech každý čas.
S partnerstvími jako Qualcomm a Lenovo, jak důležité je těsné integrování hardwaru a softwaru pro umožnění agentic AI na velkém měřítku?
To je rozdíl mezi prototypem používaným pro výzkumné účely a aplikací, která je skutečně použitelná. Zařízení s procesory Snapdragon mají neuronové procesorové jednotky, které zajistí, že algoritmy agenta mohou fungovat na zařízení s minimálními zpožděními a spotřebou energie. Qualcomm strávil roky prací na dosažení této optimalizace, a partnerství, které jsme oznámili na MWC 2026, mělo tento přesně cíl na mysli.
Druhým koncem je Lenovo. Lenovo může dosáhnout stovek milionů uživatelů napříč chytrými telefony, tablety a počítači, kteří hledají odlišnost pomocí AI. Procházet partnery s existujícími portfolio zařízení a dosáhnout jich rychle a transparentně je lepší než alternativní cesta. To vím z vlastní zkušenosti.
Důvěra se zdá být velkou bariérou. Jak navrhujete systémy, ve kterých se uživatelé cítí pohodlně, aby AI provedla akce na jejich behalf, zejména když tyto akce zahrnují několik aplikací a citlivá data?
Důvěra je založena na základě transparentnosti o tom, co je agent schopen a co ne. Jakékoli akce, které zahrnují něco důležitého, jako je skutečný nákup, odeslání zprávy nebo změna nastavení účtu, vyžadují schválení uživatele. Agent má schopnost jít až na stránku objednávky sám, ale ne dál, dokud to neučiníte. Naše partnerství s Visa přidává ověřené platební kanály na top.
To je vše založeno na dvou jednoduchých filozofiích. První je “člověk v smyčce pro cokoliv podstatného”. Druhá je “vratnost, kde je to možné”. Kromě toho agent bude mít přístup pouze k tomu, co je viditelné na obrazovce, a bude respektovat oprávnění nastavená v operačním systému.
Existuje rostoucí narativ, že ekonomika aplikací by mohla být narušena. Vidíte agenty nahrazující aplikace úplně, nebo měnící, jak jsou aplikace přístupné a monetizovány?
Aplikace nikdy nezmizí. Dynamika se prostě změní. Dnes je aplikace tím, jak značka komunikuje se spotřebitelem. Zítra to bude agent a aplikace bude nástrojem, který agent používá. Vývojáři aplikací zůstanou, protože vždy bude potřeba aplikace za službou, zprávou nebo transakcí. Rozdíl bude v rozhraní, na kterém se tyto volby dělají.
To představuje novou frontu pro aplikace a pro značky, které je používají. To nepředstavuje žádnou hrozbu, ale spíše úžasnou příležitost prozkoumat a vyvinout s našimi partnery ve vývoji a platformách.
Vaše systém se vyhýbá spoléhání se na API. To vytváří napětí s vývojáři a platformami, nebo to nakonec odemkne více otevřený ekosystém?
Je to méně sporné, než to zní. Není zde žádný konflikt mezi vývojáři a námi. Způsob, jakým rozhraní funguje, je stejný proces, který by člověk použil aplikaci, takže agent používá stejné rozhraní jako kdokoli jiný. Vývojáři mohou použít běžné technické postupy, aby zablokovali přístup, a my rozumíme jejich důvodům.
Více fascinujícím výsledkem je absence konfliktu. Otevřený systém s univerzální interoperabilitou prospívá všem, ve srovnání se systémem, který je uzavřený, kde může být každý asistent použit pouze na konkrétní aplikace, protože podporuje pouze takový typ přizpůsobené integrace. Univerzálnost pomáhá uživatelům, ale také pomáhá aplikacím s skutečnou hodnotou.
Na zařízení AI je často prezentován jako výhoda pro soukromí. Jak vyvažujete místní zpracování s potřebou silných modelů, které tradičně vyžadují velkokapacitní výpočet?
Je to hybridní systém, který bude pokračovat v evoluci směrem k plně na zařízení systému. Obě akce a lehké uvažování se dějí na telefonu, zatímco těžké uvažování se děje v cloudu. Díky optimalizaci našeho stacku s Qualcomm a schopnostem NPUs telefonů, které se stávají stále pokročilejšími, dochází ke změně směrem k více lokalizovanému modelu. V současné době většina vlajkových telefonů na trhu má schopnost zvládnout požadovanou zátěž.
Dichotomie mezi silným výkonem a obětováním lokalizace je také zastaralá. Modely se stávají efektivnějšími a hardwar na telefonu se stává schopnějším. To vše lze dosáhnout, když je stack řádně optimalizován.
Pohledem do budoucna tři až pět let, co vypadá plně realizované AI-rodinné zařízení a co se musí technicky a kulturně stát, aby se tato vize stala mainstreamem?
Skutečná implementace by byla jeden agent, který vás bude následovat napříč zařízeními. Řeknete svému PC, aby našel informace o dárkách, přepnete se na váš smartphone, abyste provedli nákup, a pak řeknete svému autu, aby se zahřálo. Záměr je stejný; kontext zůstává konstantní, zatímco povrch se mění. Telefony jsou bodem vložení, protože tam se děje většina výpočtů. Potom to půjde na PC, TV, auta a nakonec na chytré brýle, a spolupráce s Qualcomm v tom dělá obrovskou rozdíl.
Z technického hlediska je to pokračování v na zařízení uvažování a zvyšování dlouhodobé spolehlivosti, stejně jako řádné přechody mezi zařízeními. Z kulturního hlediska by změna spočívala v tom, že agenty budou stále více důvěřovat a budou jim svěřovat stále složitější úkoly, což je založeno na tom, že agent vám řekne všechno, co nemůže udělat, bez váhání, a také nezlomí žádná jednoduchá slib, která byla učiněna vám.
Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit AGI, Inc.












