Haastattelut
Div Garg, AGI, Inc:n toimitusjohtaja ja perustaja – Haastattelusarja

Div Garg, AGI, Inc:n toimitusjohtaja ja perustaja, on tekoälytutkija ja yrittäjä, joka on erikoistunut autonomisiin agenteihin, reunan älyyn, tietokoneisiin ja robottiin. Ennen AGI, Inc:n perustamista hän perusti ja johti MultiOnin, joka oli varhainen edelläkävijä tietokoneiden käytössä olevissa agenteissa, ja myöhemmin toimi sen hallituksen puheenjohtajana. Garg vietti lähes neljä vuotta Stanfordin yliopistossa sivutoimisena opettajana, jossa hän loi CS 25:n: Transformers United, yliopiston ensimmäisen kurssin, joka oli omistettu transformatioarkkitehtuureille. Hänen aiempi kokemuksensa käsittää tekoälykehityksen johtamisen Collaborative Roboticsissa, tutkimuksen suorittamisen NVIDIA (NVDA ) ja Apple (AAPL ): ssä, sekä työskentelyn tietokoneen näkemisen ja autonomisen ajo-tekniikan parissa Googlella, Uberilla ja Cornellin yliopistossa, jossa hänen tutkimuksensa käsitti vaikutusvaltaisen Pseudo-LiDAR-lähestymistavan kamerapohjaiseen 3D-havainnointiin.
AGI, Inc on tekoälytutkimusyhtiö, joka kehittää yksityisiä, turvallisia ja saatavilla olevia älykkäitä järjestelmiä, jotka toimivat suoraan reunan laitteissa. Sen lippulaiva-teknologia, AGI-0, on toimintoihin suunnattu tekoälyjärjestelmä, joka on suunniteltu ymmärtämään käyttäjän mieltymykset ja suorittamaan tehtäviä sovellusten yli puhelimissa, tietokoneissa, wearables-laitteissa ja muissa kytketyissä laitteissa, mukaan lukien työnkulut, jotka liittyvät ostoksiin, liikenteeseen, aikatauluihin, viestintään ja viihteeseen. Yhtiö tarjoaa myös alustan, joka mahdollistaa laitteiden valmistajien ja kehittäjien lisätä näytön tietoisia agenteja, jotka voivat toimia ja päättää olemassa olevien sovellusten yli ilman erillisiä integraatioita kunkin sovelluksen kanssa. AGI, Inc on osoittanut teknologiansa yhteistyössä Lenovon kanssa ja optimoi agenttistackiaan Qualcomm (QCOM ) Snapdragon-pohjaisille laitteille.
Olet työskennellyt Applen, Google, Nvidian ja MultiOnin parissa ennen kuin perustit AGI, Inc:n. Mikä tarkka rajoitus tai hetki vakuutti sinut siitä, että olemassa olevat tekoälylähestymistavat eivät riittäneet, ja että reunan autonomisen agentin rakentaminen oli oikea tie eteenpäin?
Tämä muutos tapahtui jonkin aikaa vuosien 2023 ja 2024 välillä, kun työskentelin web-agenteilla. Voimme luoda agenteja, jotka suorittavat toimintoja selaimissa, mutta vain jos verkkosivuilla on oikea rakenne, jonka agentti voi työskennellä. Kun jotain meni pieleen eikä käyttäytynyt ihanteellisen DOM-version mukaisesti, kuten modal-ikkuna tai animaatiovaikutus, agentti lakkasi toimimasta. Toisaalta kaikki, mitä ihmiset haluavat vuorovaikuttaa älypuhelimen kanssa, tapahtuu sovellusten sisällä. Sovellukset eivät tarjoa mitään API:ta; ne tarjoavat näyttöjä sen sijaan.
Tämä ero johti meidän johtopäätökseen. Ratkaisu ongelmaan ei ollut enemmän kehittyneitä API:ita tai suurempia malleja, vaan agentti, joka toimii laitteen henkilön näkökulmasta. Tämä tarkoitti sitä, että älypuhelimen käsiteltiin kuin henkilö – vuorovaikutuksen näytön kanssa.
Monet nykyiset tekoälyavustajat riippuvat edelleen voimakkaasti API:ista, integraatioista ja pilvi-orkestraatiosta. Mitä perustavasti menee rikki tässä mallissa, ja miksi uskot, että laitteen suorittaminen on puuttuva kerros?
On kolme ongelmaa. Ensimmäinen on kattavuus. API:t edellyttävät, että kaikki kehittäjät on.interfaceiden kanssa, mikä rajoittaa agentin kykyjä hitaimman kumppanin mukaan. Apple App Intents on esimerkki tällaisesta teknologiasta, jota alettiin kehittää jo WWDC 2024:ssä. Sitten on yksityisyys. Pilvi-orkestraatio edellyttää, että ruudun sisältö, viestit ja toiminnot menevät kolmannen osapuolen palvelimille. Lopulta on ongelma kustannuksista ja viiveestä. Kaikki kiertävä prosessointi pilvessä tekee siitä hitaan ja kalliin.
Laitteen suorittaminen ratkaisee nämä ongelmat. Agentti ei riipu kenestäkään muusta ja interfacee laitteiston kanssa suoraan käyttöliittymän kautta.
Millaisia olivat haastavimmat tekniset haasteet agentin kehittämisessä, jotta se voisi luotettavasti toimia puhelimella kuin ihminen?
Puhelimen luotettava ohjaaminen on vaikeampaa kuin se kuulostaa. Ensinnäkin agentin on ymmärrettävä puhelimen näyttö kuin ihminen, tehtävä jotain seuraavasta ja suoritettava sopiva toiminto. Näkeminen tehdään visio-kieli-mallilla, joka tunnistaa painikkeet, tekstiruutuja, valikkoja, layouteja jne. Toiminnan valinta edellytetään käsitelläkseen epäselvyyksiä, osittain latautuneita sivuja, modaali-ikkunoita ja virheitä. Lopulta toiminnan on oltava tarpeeksi tarkka, jotta napautus osuu oikeaan kohtaan.
Merkitsevin ongelma on kuitenkin kyky luotettavasti vuorovaikuttaa monimutkaisissa sovelluksissa pitkän ajan kuluessa. Uberin varaaminen on yksi asia, mutta usean vaiheen suorittaminen sovelluksessa, jossa kunkin vaiheen edellytyksenä on aiemmat vuorovaikutukset, on aivan toinen asia. Tämä on juuri sitä, miksi mallien koulutus loppuun asti oli olennainen tuotteen kehittämisessä.
Kuvailet tätä siirtymänä avustajista agenteihin. Mitä tämä siirtymä tarkoittaa käytännössä arkisten käyttäjien kannalta, ja kuinka nopeasti odotat käyttäytymisen muuttuvan?
Käytännön muutos tulee käyttöliittymästä itsestään. Siinä, missä meillä on tänään sovellus ja opimme sen käytön, huomenna meillä on agentti, ja sovellukset tulevat agentin kyvyiksi meidän puolestemme. Me lopetamme sovellusten ajattelun ja aloitamme tarkoituksen ajattelun: “Varaa minulle ajokki kotiin.” “Lähetä viikonlopun kuvat äidille.” “Näytä minulle hotellit Lissabonissa, joissa voin saada rauhaa seuraavaksi viikonlopuksi.” Agentti tietää, mitä sovelluksia käyttää.
Käyttäytymisen muutos alkaa hitaasti ja nopeutuu, kun se etenee. Aluksi ihmiset kokeilevat tätä lähestymistapaa yksinkertaisissa tehtävissä, joissa he luottavat siihen, ja laajentavat sen sitten niin pitkälle kuin he voivat. Laajan hyväksymisen laukaisee se, kun agentti saa arkisen tehtävät oikein puhelimilla joka kerta.
Miten tärkeää on tiivis laitteiston ja ohjelmiston integrointi agenteille, jotka ovat käytettävissä laajassa mittakaavassa?
Tämä on ero tutkimuksellisesti käytetyistä prototyypeistä ja sovelluksista, jotka ovat todella käytettävissä. Laitteet, jotka on varustettu Snapdragonilla, sisältävät neuroverkkoprosessoreita, jotka takaavat, että agentin algoritmien suorittaminen laitteessa tapahtuu vähäisillä viiveillä ja energiankulutuksella. Qualcomm on viettänyt vuosia tämän optimoinnin kehittämiseen, ja yhteistyö, jonka ilmoitimme MWC 2026:ssa, oli tämän tarkoituksen mukainen.
Toisaalta on Lenovo. Lenovo voi tavoittaa satoja miljoonia käyttäjiä älypuhelimissa, tableteissa ja tietokoneissa, jotka etsivät tekoälyllisiä eroja. Käydä yhteistyössä kumppaneiden kanssa, joilla on olemassa olevia laitteita, ja tavoittaa heitä nopeasti ja avoimesti, on parempi vaihtoehto. Tiedän tämän kokemuksesta.
Luottamus näyttää olevan suuri este. Kuinka suunnittelet järjestelmiä, joissa käyttäjät tuntevat olonsa mukavaksi antaakseen tekoälyn toimia heidän puolestaan, erityisesti kun nämä toiminnot kattavat useita sovelluksia ja arkaluontoisia tietoja?
Luottamus perustuu avoimuuteen siitä, mitä agentti on ja mitä se ei ole kykenevä tekemään. Mikä tahansa toiminto, joka liittyy johonkin tärkeään, kuten oikean ostoksen tekemiseen, viestin lähettämiseen tai tilin asetusten muuttamiseen, edellyttää käyttäjän hyväksyntää. Agentilla on kyky mennä kauppojen kassalle omin avuin, mutta ei eteenpäin, kunnes sinä teet siitä. Yhteistyömme Visan kanssa lisää todennettuja maksuväyliä sen lisäksi.
Tämä perustuu kahteen yksinkertaiseen filosofiaan. Ensimmäinen on “ihminen silmukassa kaikessa merkittävässä”. Toinen on “kumoamiskyky aina, kun se on mahdollista”. Lisäksi agentti näkee vain sen, mitä näkyy näytöllä, ja kunnioittaa käyttöjärjestelmän asettamia käyttöoikeuksia.
On kasvava kertomus siitä, että sovellus talous voisi olla vaarassa. Näetkö agentejen korvaavan sovellukset kokonaan, vai muokkaavan niiden käyttöä ja rahoitusta?
Sovellukset eivät katoa. Dynamiikka muuttuu. Tänään sovellus on tapa, jolla brändi viestii kuluttajalle. Huomenna agentti on se, ja sovellus on työkalu, jonka agentti käyttää puoleemme. Sovelluskehittäjät ovat täällä pysyvästi, koska on aina olemassa sovelluksen tarve palvelupyyntöön, tekstiviestiin tai transaktioon. Ero on siinä, millä käyttöliittymällä nämä valinnat tehdään.
Tämä edustaa uutta rintamaa sovelluksille ja niille brändeille, jotka niitä käyttävät. Tämä edustaa ei mitään uhkaa, vaan erinomaisen mahdollisuuden tutkia ja kehittää yhdessä kehitys- ja alustapartneriemme kanssa.
Järjestelmäsi välttää riippuvuutta API:ista. Luo tämä jännitettä kehittäjien ja alustojen kanssa, vai vapauttaa lopulta avoimemman ekosysteemin?
Se on vähemmän kiistanalainen kuin se kuulostaa. Ei ole kilpailua kehittäjien ja meidän välillä. Tapa, jolla käyttöliittymä toimii, on sama prosessi, jota henkilö käyttää sovellusta, joten agentti käyttää samaa käyttöliittymää kuin kuka tahansa muu. Kehittäjät voivat käyttää yleisiä teknisiä käytäntöjä estääksesi pääsyn, ja ymmärrämme heidän syynsä.
Lisäksi on mielenkiintoinen tulos, jossa ei ole kilpailua. Avoin järjestelmä, jossa on yleinen yhteensopivuus, hyödyttää kaikkia, verrattuna suljettuun järjestelmään, jossa jokainen avustaja voidaan käyttää vain tiettyjen sovellusten kanssa, koska se tukee vain tällaista räätälöityä integraatiota. Yleisyys auttaa käyttäjiä, mutta se auttaa myös sovelluksia, joilla on todellista arvoa.
Laitteen tekoäly on usein esitetty yksityisyyden edunä. Kuinka tasapainotat paikallisen prosessoinnin ja voimakkaiden mallien tarpeen, jotka perinteisesti edellyttävät suurimittakaavaisen laskennan?
Se on hybridi-järjestelmä, joka jatkaa kehittymistä täysin laitteistopohjaiseksi järjestelmäksi. Molemmat toiminnot ja kevyt päättely tapahtuvat puhelimessa, kun taas raskas päättely tapahtuu pilvessä. Qualcommin kanssa tehdyn pinon optimoinnin ja puhelimien NPUns:ien kasvavan edistyneisyyden myötä malli on siirtymässä kohti lokalisoitumista. Tällä hetkellä useimmat markkinoilla olevat lippulaivapuhelimet pystyvät käsittelemään vaadittua työkuormaa.
Vastakkainasettelu, jossa on voimakas suorituskyky ja lokalisoituminen, on vanhentunut. Mallit ovat yhä tehokkaampia, ja puhelimen laitteisto on yhä kykenevämpää. Kaikki voidaan saavuttaa, kun pinot on kunnolla optimoitu.
Miten tulevaisuuden täysin toteutettu tekoälykäyttöinen laite näyttää, ja mitä on teknisesti ja kulttuurisesti tapahtuvaa, ennen kuin tämä visio tulee vallitsevaksi?
Todellinen toteutus olisi yksittäinen agentti, joka seuraa sinua laitteiden yli. Kerrot tietokoneellesi etsiä tietoa lahjoista, vaihdat älypuhelimeesi tehdäksesi ostoksen, ja kerrot autolle lämmittää. Tarkoitus on sama; konteksti pysyy vakiona, kun taas pinta muuttuu. Puhelimet ovat sisääntulopiste, koska siinä tapahtuu suurin osa laskennasta tällä hetkellä. Sen jälkeen se siirtyy tietokoneisiin, televisioihin, autoihin ja lopulta älylasien, ja Qualcommin yhteistyö tekee siinä suuren eron.
Teknisesti jatkuvaa laitteen päättelyä ja pitkäaikaista luotettavuutta parannetaan, sekä oikein toteutettuja laitteiden välistä siirtymiä. Kulttuurisesti muutos perustuu yhä enemmän agenttien luottamiseen yhä monimutkaisempiin tehtäviin, mikä perustuu siihen, että agentti kertoo sinulle kaiken, mitä se ei voi tehdä ilman epäröintiä, ja ei riko yhtään yksinkertaista lupausta, jonka on tehty sinulle.
Kiitos haastattelusta, lukijat, jotka haluavat oppia lisää, voivat vierailla AGI, Inc: ssä.












