Interviews
Div Garg, CEO en mede-oprichter van AGI, Inc – Interviewreeks

Div Garg, CEO en mede-oprichter van AGI, Inc, is een AI-onderzoeker en ondernemer die zich richt op autonome agenten, edge-intelligentie, computerzicht en robotica. Voordat hij AGI, Inc oprichtte, was hij mede-oprichter en leidde hij MultiOn, een vroege pionier in computergebruikte agenten, en later was hij voorzitter van de raad van bestuur. Garg werkte ook bijna vier jaar als adjunct-faculteitslid aan de Stanford University, waar hij CS 25: Transformers United creëerde, de eerste cursus van de universiteit die zich specifiek richtte op transformatie-architecturen. Zijn eerdere ervaring omvatte het leiden van de ontwikkeling van kunstmatige intelligentie bij Collaborative Robotics, het uitvoeren van onderzoek bij NVIDIA (NVDA ) en Apple (AAPL ), en werken aan computerzicht en autonome rijtechnologie bij Google, Uber en Cornell University, waar zijn onderzoek de invloedrijke Pseudo-LiDAR-benadering van camera-gebaseerde 3D-perceptie omvatte.
AGI, Inc. is een AI-onderzoeksbedrijf dat particuliere, beveiligde en toegankelijke intelligentie ontwikkelt die rechtstreeks op randapparaten werkt. De vlaggenschip-technologie, AGI-0, is een actiegerichte AI-systeem dat is ontworpen om gebruikersvoorkeuren te begrijpen en taken uit te voeren in verschillende applicaties op telefoons, computers, wearables en andere verbonden apparaten, waaronder workflows die winkelen, transport, planning, messaging en entertainment omvatten. Het bedrijf biedt ook een platform dat hardwarefabrikanten en ontwikkelaars in staat stelt om schermgevoelige agenten toe te voegen die kunnen redeneren en handelen over bestaande applicaties zonder aparte integraties voor elke app te hoeven bouwen. AGI, Inc heeft zijn technologie gedemonstreerd met Lenovo en optimaliseert zijn agent-stack voor Qualcomm (QCOM ) Snapdragon-gebaseerde apparaten.
U hebt gewerkt bij Apple, Google, Nvidia en hebt geholpen bij het pionieren van vroege agentsystemen bij MultiOn voordat u uw Stanford PhD onderbrak om AGI, Inc op te richten. Wat was de specifieke beperking of het moment dat u ervan overtuigde dat bestaande AI-benaderingen niet genoeg waren, en dat het bouwen van een on-device autonome agent de juiste weg vooruit was?
Deze verandering vond plaats ergens tussen 2023 en 2024, terwijl ik werkte aan webagenten. We konden agenten maken om acties uit te voeren in browsers, maar alleen als de website een juiste structuur had die de agent kon gebruiken. Zodra er iets misging en het niet gedroeg als een geïdealiseerde versie van de DOM, zoals een modale venster of een animatie-effect, hield de agent op met functioneren. Aan de andere kant gebeurt alles wat ertoe doet als mensen willen interactie hebben met hun smartphones binnen applicaties. Applicaties bieden geen enkele API; ze presenteren schermen in plaats daarvan.
Het was dit verschil dat leidde tot onze conclusies. De oplossing voor het probleem zou niet zijn om meer geavanceerde API’s of grotere modellen te hebben, maar eerder een agent die het apparaat zou bedienen vanuit het perspectief van een persoon. Dit betekende dat de smartphone behandelen als een persoon zou doen – interactie hebben met zijn schermen.
Veel AI-assistenten vandaag zijn nog steeds sterk afhankelijk van API’s, integraties en cloud-orchestratie. Wat breekt er fundamenteel in dat model, en waarom denkt u dat on-device-uitvoering de ontbrekende laag is?
Er zijn drie problemen met dat. Het eerste is dekking. API’s vereisen dat alle ontwikkelaars moeten communiceren met u, wat de mogelijkheden van uw agent beperkt tot de langzaamste partner. App-intents van Apple zijn een goed voorbeeld van dergelijke technologie die al in 2024 op WWDC werd uitgewerkt. Dan is er privacy. Cloud-orchestratie vereist dat uw scherminhoud, berichten en activiteiten naar de servers van een derde partij gaan. Tenslotte is er het probleem van kosten en latentie. Alle verwerking via de cloud maakt het langzaam en duur.
On-device-uitvoering lost al deze problemen op. Uw agent is niet afhankelijk van iemand anders en communiceert met het systeem door rechtstreeks met de UI te communiceren.
Uw benadering verplaatst AI van het beantwoorden van vragen naar het daadwerkelijk voltooien van taken over applicaties. Wat waren de moeilijkste technische uitdagingen bij het inschakelen van een agent om een telefoon betrouwbaar te bedienen zoals een mens zou doen?
Betrouwbaar een telefoon bedienen is moeilijker dan het lijkt. Eerst moet een agent het telefoonscherm tegelijkertijd waarnemen als een mens, begrijpen wat er komt en de juiste actie uitvoeren. Waarneming gebeurt door een visuele-taalmodel dat in staat is om knoppen, tekstvakken, menu’s, lay-outs enz. te herkennen. Actie-selectie is nodig om ambiguïteiten, gedeeltelijk geladen pagina’s, modale dialogen en fouten te behandelen. Ten slotte moet de actie nauwkeurig genoeg zijn om een tik op de juiste locatie te landen.
Het meest significante probleem ligt echter in de mogelijkheid om complexe applicaties over een lange periode betrouwbaar te bedienen. Een Uber boeken is één ding, maar een multi-stap-proces binnen een applicatie waarbij elke stap afhankelijk is van eerdere interacties, is een heel ander verhaal. Dit is precies waarom het trainen van modellen van begin tot einde essentieel was voor de ontwikkeling van het product.
U hebt dit beschreven als een verandering van assistenten naar agenten. Wat betekent die overgang in de praktijk voor dagelijkse gebruikers, en hoe snel verwacht u dat het gedrag zal veranderen?
Praktische verandering komt van de interface zelf. Waar we vandaag de app hebben en leren hoe we de app gebruiken, zullen we morgen de agent hebben en zullen de apps de capaciteiten zijn die door de agent voor ons worden samengesteld. We stoppen met nadenken over apps en beginnen met nadenken over intentie: “Boek me een rit naar huis.” “Stuur de foto’s van het weekend naar mama.” “Laat me hotels in Lissabon zien waar ik wat rust kan krijgen voor het komende weekend.” De agent weet welke apps te gebruiken.
Gedragsverandering begint langzaam en wordt sneller naarmate het vordert. Aanvankelijk zullen mensen deze benadering proberen voor eenvoudige taken die ze vertrouwen en vervolgens uitbreiden zodra ze kunnen. De trigger voor volledige acceptatie zal komen wanneer de agent de routine-taken correct op onze telefoons uitvoert elke keer.
Met partnerschappen zoals Qualcomm en Lenovo, hoe belangrijk is nauwe hardware- en software-integratie voor het maken van agente-ai bruikbaar op grote schaal?
Dit is het verschil tussen een prototype dat voor onderzoeksdoeleinden wordt gebruikt en een applicatie die daadwerkelijk bruikbaar is. Apparaten die worden aangedreven door Snapdragon hebben neurale verwerkingseenheden, die ervoor zullen zorgen dat de algoritmen van de agent op het apparaat kunnen werken met minimale vertragingen en energieverbruik. Qualcomm heeft jaren gewerkt aan het bereiken van deze optimalisatie, en het partnerschap dat we aankondigden op MWC 2026 had dit exacte doel voor ogen.
De andere kant is Lenovo. Lenovo kan honderden miljoenen gebruikers bereiken over smartphones, tablets en pc’s, die op zoek zijn naar differentiatie met behulp van AI. Door partners met bestaande apparaatportefeuilles te gaan en ze snel en transparant te bereiken, verslaat dit de alternatieve route. Ik weet dit uit ervaring.
Vertrouwen lijkt een grote barrière. Hoe ontwerpt u systemen waarin gebruikers zich comfortabel voelen om AI taken uit te laten voeren namens hen, vooral wanneer die taken meerdere apps en gevoelige gegevens omvatten?
Vertrouwen wordt opgebouwd op basis van het zijn van openhartig over wat de agent wel en niet kan doen. Elke actie die iets belangrijks omvat, zoals een daadwerkelijke aankoop, het verzenden van een bericht of het wijzigen van accountinstellingen, vereist gebruikersgoedkeuring. De agent kan de weg vinden naar de checkout-pagina op eigen initiatief, maar niet verder totdat u het laat gebeuren. Ons partnerschap met Visa voegt geauthenticeerde betalingsrails toe aan dat.
Dit gebeurt allemaal op basis van twee eenvoudige filosofieën. De eerste is “mens in de lus voor alles substantieels.” De tweede is “omkeerbaarheid waar mogelijk.” Bovendien zal de agent alleen zien wat zichtbaar is op het scherm en de door het besturingssysteem ingestelde machtigingen respecteren.
Er is een groeiend verhaal dat de app-economie verstoord kan worden. Ziet u agenten als vervangers van apps of als een manier om apps toegankelijker en winstgevender te maken?
De apps gaan nooit weg. De dynamiek verandert alleen. Vandaag is de app de manier waarop het merk communiceert met de consument. Morgen zal de agent dat zijn en zal de app het instrument zijn dat door de agent voor ons wordt gebruikt. App-ontwikkelaars zijn hier om te blijven omdat er altijd een behoefte zal zijn aan de toepassing achter de service-aanroep, tekstbericht of transactie. Het verschil zal zijn in het interface waarop die keuzes worden gemaakt.
Dit vertegenwoordigt een nieuwe frontier voor apps en voor de merken die ze gebruiken. Dit vertegenwoordigt geen enkele bedreiging, maar eerder een geweldige kans om te verkennen en te ontwikkelen met onze partners in ontwikkeling en platforms.
Uw systeem vermijdt het gebruik van API’s. Creëert dit spanning met ontwikkelaars en platforms, of ontgrendelt het uiteindelijk een meer open ecosysteem?
Het is minder controversieel dan het klinkt. Er is geen concurrentie tussen de ontwikkelaars en ons. De manier waarop een interface werkt is hetzelfde proces dat een persoon zou gebruiken om een applicatie te gebruiken, dus de agent gebruikt dezelfde interfaces als iedereen. Ontwikkelaars kunnen technische praktijken gebruiken om toegang te blokkeren en we begrijpen hun redenering.
Een meer intrigerend resultaat is het ontbreken van spanning. Een open systeem met universele interoperabiliteit is gunstig voor iedereen, in vergelijking met een gesloten systeem waarin elke assistent alleen kan worden gebruikt op specifieke apps, omdat het alleen die soort maatwerkintegratie ondersteunt. Universaliteit helpt de gebruikers, maar helpt ook de apps met werkelijke waarde.
On-device AI wordt vaak geframed als een voordeel voor de privacy. Hoe balanceert u lokale verwerking met de behoefte aan krachtige modellen die traditioneel grote rekenkracht vereisen?
Het is een hybride systeem dat zal blijven evolueren naar een volledig on-device-systeem. Zowel acties als lichte redenering gebeuren op de telefoon, terwijl zware redenering in de cloud gebeurt. Met de stack-optimalisatie via onze samenwerking met Qualcomm en de mogelijkheden van NPUs van de telefoons die steeds geavanceerder worden, is er een verschuiving naar een meer gelokaliseerd model. Momenteel kunnen de meeste vlaggenschiptelefoons op de markt het vereiste werkbelasting aan.
De dichotomie van het hebben van krachtige prestaties en het offeren van lokaliteit of vice versa is ook verouderd. Modellen worden efficiënter en de hardware op de telefoon wordt krachtiger. Alles kan worden bereikt wanneer de stack correct is geoptimaliseerd.
Kijkend naar de toekomst, drie tot vijf jaar, wat ziet een volledig gerealiseerd AI-natief apparaat eruit, en wat moet er technisch en cultureel gebeuren voordat die visie mainstream wordt?
De daadwerkelijke implementatie zou een enkele agent zijn die u over apparaten volgt. U zegt tegen uw pc om informatie over geschenken te vinden, overschakelt naar uw smartphone om een aankoop te doen, en zegt dan tegen uw auto om op te warmen. De intentie is hetzelfde; de context blijft constant, terwijl het oppervlak verandert. De telefoons zijn het punt van insertie, omdat dat nu de meeste computing gebeurt. Vervolgens zal het naar pc’s, tv’s, auto’s en uiteindelijk naar slimme brillen gaan, en de Qualcomm-samenwerking maakt een enorm verschil in dat opzicht.
Vanuit een technisch oogpunt is het doorgaan met on-device-redenering en het verhogen van de langetermijnbetrouwbaarheid, evenals een goede overgang tussen apparaten. Vanuit een cultureel oogpunt zou de verandering zijn om steeds complexere taken aan agenten toe te vertrouwen, wat gebaseerd is op het feit dat de agent u alles vertelt wat het niet kan doen zonder aarzeling, en ook geen van de eenvoudige beloften die aan u zijn gedaan breekt.
Bedankt voor het geweldige interview, lezers die meer willen leren, moeten AGI, Inc bezoeken.












