Wywiady
Div Garg, CEO i współzałożyciel AGI, Inc – seria wywiadów

Div Garg, CEO i współzałożyciel AGI, Inc, jest badaczem sztucznej inteligencji i przedsiębiorcą specjalizującym się w agentach autonomicznych, inteligencji krawędziowej, widzeniu komputerowym i robotyce. Przed założeniem AGI, Inc. współzałożył i kierował MultiOn, wczesnym pionierem w dziedzinie agentów komputerowych, a później pełnił funkcję przewodniczącego jej rady nadzorczej. Garg spędził również prawie cztery lata jako członek wydziału na Uniwersytecie Stanforda, gdzie stworzył CS 25: Transformers United, pierwszy kurs uniwersytecki poświęcony architekturze transformatorów. Jego wcześniejsze doświadczenie obejmuje kierowanie rozwojem sztucznej inteligencji w Collaborative Robotics, prowadzenie badań w NVIDIA (NVDA ) i Apple (AAPL ), a także pracę nad technologiami widzenia komputerowego i jazdy autonomicznej w Google, Uber i Cornell University, gdzie jego badania obejmowały wpływowy podejście Pseudo-LiDAR do percepcji 3D opartej na kamerach.
AGI, Inc. jest firmą badawczą sztucznej inteligencji, która rozwija prywatną, bezpieczną i dostępną inteligencję, która działa bezpośrednio na urządzeniach krawędziowych. Jej flagowa technologia, AGI-0, to system sztucznej inteligencji ukierunkowany na działanie, zaprojektowany do zrozumienia preferencji użytkownika i wykonania zadań w różnych aplikacjach na telefonach, komputerach, urządzeniach noszonych i innych połączonych urządzeniach, w tym workflow, który obejmuje zakupy, transport, planowanie, wiadomości i rozrywkę. Firma oferuje również platformę, która umożliwia producentom sprzętu i deweloperom dodanie agentów świadomych ekranu, które mogą powodować i działać w istniejących aplikacjach bez tworzenia odrębnych integracji dla każdej aplikacji. AGI, Inc. zademonstrowała swoją technologię z Lenovo i optymalizuje swój stos agenta dla urządzeń z napędem Qualcomm (QCOM ) Snapdragon.
Pracowałeś w Apple, Google, Nvidia i pomagałeś w rozwoju wczesnych systemów agentowych w MultiOn, zanim przerwałeś swój doktorat na Uniwersytecie Stanforda, aby założyć AGI, Inc. Jaki konkretny limit lub moment przekonał Cię, że istniejące podejścia sztucznej inteligencji są niewystarczające, a budowanie autonomicznego agenta na urządzeniu jest właściwą drogą do przodu?
Zmiana ta nastąpiła gdzieś pomiędzy 2023 a 2024 rokiem, kiedy pracowałem nad agentami sieciowymi. Mogliśmy tworzyć agenty do wykonywania działań w przeglądarce, ale tylko wtedy, gdy strona internetowa miała odpowiednią strukturę, z którą agent mógł współpracować. Jak tylko coś poszło nie tak i nie zachowywało się jak ideał DOM, takich jak okno modalne lub efekt animacji, agent przestał działać. Z drugiej strony, wszystko, co jest istotne, gdy ludzie chcą wchodzić w interakcje ze swoimi smartfonami, dzieje się w aplikacjach. Aplikacje nie zapewniają żadnego rodzaju interfejsu API; prezentują ekrany zamiast.
To była różnica, która doprowadziła do naszych wniosków. Rozwiązanie problemu nie polegało na bardziej zaawansowanych interfejsach API lub większych modelach, ale raczej na agencie, który działałby na urządzeniu z punktu widzenia osoby. Oznaczało to traktowanie smartfona jak osoby – interakcję z jego ekranami.
Wiele asystentów AI dzisiaj nadal opiera się głównie na interfejsach API, integracjach i orkiestracji w chmurze. Co fundamentalnie się łamie w tym modelu, a dlaczego uważasz, że wykonanie na urządzeniu jest brakującą warstwą?
Istnieją trzy problemy z tym. Pierwszym jest zakres. Interfejsy API wymagają, aby wszyscy deweloperzy mieli interfejsować z tobą, co ogranicza możliwości twojego agenta do najwolniejszego partnera. Intencje aplikacji z Apple są doskonałym przykładem takiej technologii, nad którą pracowano od WWDC 2024. Następnie jest prywatność. Orkiestracja w chmurze wymaga, aby zawartość twojego ekranu, wiadomości i działania trafiały na serwery osoby trzeciej. Wreszcie jest problem kosztu i opóźnienia. Wszystkie przetwarzania przez chmurę są wolne i drogie.
Wykonanie na urządzeniu rozwiązuje wszystkie te problemy. Twój agent nie zależy od nikogo innego i interfejsuje z systemem, interakcją z interfejsem użytkownika bezpośrednio.
Twoje podejście przenosi sztuczną inteligencję z odpowiedzi na pytania do faktycznego wykonania zadań w różnych aplikacjach. Jakie były najtrudniejsze wyzwania techniczne w umożliwieniu agentowi niezawodnego działania telefonu jak człowiek?
Niezawodne kontrolowanie telefonu jest trudniejsze, niż się wydaje. Po pierwsze, agent musi jednocześnie postrzegać ekran telefonu jak człowiek, zrozumieć, co następuje, i wykonać odpowiednie działanie. Percepcja jest wykonywana przez model widzenia-języka, który może rozpoznać przyciski, pola tekstowe, menu, układy, itp. Wybór działania jest wymagany do obsługi niejasności, częściowo załadowanych stron, dialogów modalnych i błędów. Wreszcie, działanie musi być wystarczająco dokładne, aby dotknąć prawidłowej lokalizacji.
Największym problemem jest jednak zdolność do niezawodnej interakcji z złożonymi aplikacjami przez długi czas. Rezerwacja Ubera to jedna rzecz, ale wykonanie wieloetapowego procesu w aplikacji, w której każdy krok zależy od wcześniejszych interakcji, jest zupełnie inną grą. Dlatego szkolenie modeli end-to-end było niezbędne do rozwoju produktu.
Opisujesz to jako przejście od asystentów do agentów. Co to przejście oznacza w praktyce dla codziennych użytkowników, a jak szybko oczekujesz, że zachowanie się zmieni?
Prawdziwa zmiana pochodzi z samego interfejsu. Dziś mamy aplikację i uczymy się, jak ją używać, jutro będziemy mieli agenta, a aplikacje staną się możliwościami składanymi przez agenta w naszym imieniu. Przestajemy myśleć o aplikacjach i zaczynamy myśleć o intencji: “Zarezerwuj mi przejazd do domu.” “Wyślij zdjęcia z weekendu do Mamy.” “Pokaż mi hotele w Lizbonie, w których mogę znaleźć spokój na najbliższy weekend.” Agent wie, jakie aplikacje użyć.
Zmiana zachowania zaczyna się powoli i przyspiesza, gdy się rozwija. Na początku ludzie będą próbowali tego podejścia dla prostych zadań, którym ufają, a następnie rozszerzą je, jak tylko będą mogli. Wyzwalacz pełnego zaakceptowania nastąpi, gdy agent poprawnie wykona rutynowe zadania na naszych telefonach za każdym razem.
Z partnerstwami takimi jak Qualcomm i Lenovo, jak ważna jest ścisła integracja sprzętu i oprogramowania, aby uczynić agenty sztucznej inteligencji użytecznymi na dużą skalę?
To jest różnica między prototypem używanym do celów badawczych a aplikacją, która jest naprawdę użyteczna. Urządzenia z napędem Snapdragon mają jednostki przetwarzania neuronowego, które zapewnią, że algorytmy agenta mogą działać na urządzeniu z minimalnymi opóźnieniami i zużyciem energii. Qualcomm pracował przez lata nad osiągnięciem tej optymalizacji, a partnerstwo, które ogłosiliśmy na MWC 2026, miało ten konkretny cel.
Z drugiej strony jest Lenovo. Lenovo może dotrzeć do setek milionów użytkowników na smartfonach, tabletach i komputerach, szukając sposobu na różnicowanie się za pomocą sztucznej inteligencji. Przechodzenie przez partnerów z istniejącymi portfolio urządzeń i dotarcie do nich szybko i przejrzyście bije alternatywną drogę. Wiem to z doświadczenia.
Zaufanie wydaje się dużą barierą. Jak projektujesz systemy, w których użytkownicy czują się komfortowo, pozwalając sztucznej inteligencji działać w ich imieniu, szczególnie gdy te działania obejmują wiele aplikacji i wrażliwe dane?
Zaufanie opiera się na fundamencie bycia otwartym w kwestii tego, co agent jest i nie jest w stanie zrobić. Każde działanie, które dotyczy czegoś istotnego, takiego jak dokonanie faktycznego zakupu, wysłanie wiadomości lub zmiana ustawień konta, wymaga zatwierdzenia użytkownika. Agent ma możliwość przejścia do strony potwierdzenia zakupu, ale nie dalej, dopóki użytkownik nie zdecyduje się na to. Nasze partnerstwo z Visa dodaje uwierzytelnione kanały płatnicze na górze.
Wszystko to opiera się na dwóch prostych filozofiach. Pierwsza to “człowiek w pętli dla wszystkiego istotnego”. Druga to “odwracalność, gdzie tylko możliwe”. Ponadto agent będzie wyświetlał tylko to, co jest widoczne na ekranie, i szanował będzie uprawnienia systemu operacyjnego, które zostały ustawione.
Istnieje rosnąca narracja, że gospodarka aplikacji może zostać zakłócona. Czy widzisz agenty zastępujące aplikacje w całości, czy zmieniające sposób, w jaki aplikacje są dostępne i monetyzowane?
Aplikacje nigdy nie znikają. Dynamika po prostu się zmienia. Dziś aplikacja jest sposobem, w jaki marka komunikuje się z konsumentem. Jutro agent będzie, a aplikacja będzie narzędziem używanym przez agenta. Deweloperzy aplikacji są tu, aby pozostać, ponieważ zawsze będzie potrzeba aplikacji za pośrednictwem której odbywa się wywołanie usługi, wiadomość, transakcja. Różnica polega na interfejsie, na którym te wybory są podejmowane.
To reprezentuje nową granicę dla aplikacji i dla marek, które je używają. To reprezentuje nie tyle zagrożenie, co wspaniałą okazję do eksploracji i rozwoju z naszymi partnerami w rozwoju i platformach.
Twój system unika polegania na interfejsach API. Czy to tworzy napięcie z deweloperami i platformami, czy ostatecznie odblokowuje bardziej otwarty ekosystem?
Jest mniej kontrowersyjne, niż się wydaje. Nie ma konkurencji między deweloperami a nami. Sposób, w jaki działa interfejs, jest tym samym procesem, który osoba używa aplikacji, więc agent używa tego samego interfejsu, co każdy inny. Deweloperzy mogą zastosować powszechne praktyki techniczne, aby zablokować dostęp, i rozumiemy ich powody.
Bardziej interesującym wynikiem jest brak sporu. Otwarty system z powszechną interoperacyjnością korzysta wszystkim, w porównaniu z systemem zamkniętym, w którym każdy asystent może być używany tylko na określonych aplikacjach, ponieważ obsługuje tylko tego rodzaju integrację na zamówienie. Powszechność pomaga użytkownikom, ale także pomaga aplikacjom o rzeczywistej wartości.
Sztuczna inteligencja na urządzeniu jest często przedstawiana jako zaleta prywatności. Jak równoważysz przetwarzanie lokalne z potrzebą potężnych modeli, które tradycyjnie wymagają obliczeń na dużą skalę?
Jest to hybrydowy system, który będzie nadal ewoluował w kierunku w pełni systemu na urządzeniu. Zarówno działania, jak i lekkie rozumność występują na telefonie, podczas gdy ciężka rozumność występuje w chmurze. Z optymalizacją stosu przez naszą pracę z Qualcomm i możliwościami jednostek przetwarzania neuronowego telefonów, które stają się coraz bardziej zaawansowane, następuje przesunięcie w kierunku bardziej lokalnego modelu. Obecnie większość flagowych telefonów dostępnych na rynku ma możliwość obsługi obciążenia wymaganego.
Dychotomia wydajności i lokalizacji jest również przestarzała. Modele stają się bardziej wydajne, a sprzęt na telefonie staje się bardziej zdolny. Wszystko można osiągnąć, gdy stos jest odpowiednio zoptymalizowany.
Patrząc w przyszłość, trzy do pięciu lat, jaki wygląda w pełni zrealizowany urządzenie AI, a co musi się wydarzyć technicznie i kulturowo, zanim to wizja stanie się głównym nurtem?
Wdrożenie obejmie pojedynczego agenta, który będzie śledził urządzenia. Powiesz swojemu komputerowi, aby znalazł informacje o prezentach, przełączysz się na swój smartfon, aby zrobić zakup, a następnie powiesz swojemu samochodowi, aby rozgrzał się. Intencja jest taka sama; kontekst pozostaje stały, podczas gdy powierzchnia się zmienia. Telefony są punktem wejścia, ponieważ tam teraz występuje większość obliczeń. Później przeniesie się na komputery, telewizory, samochody i ostatecznie na okulary inteligentne, a współpraca z Qualcomm ma ogromne znaczenie w tym zakresie.
Pod względem technicznym jest to kontynuacja rozumności na urządzeniu i zwiększanie długoterminowej niezawodności, a także odpowiednich przejść między urządzeniami. Z punktu widzenia kulturowego zmiana będzie polegała na coraz większym zaufaniu do agentów do coraz bardziej złożonych zadań, co opiera się na tym, że agent mówi ci wszystko, co nie może zrobić bez wahania, i nie łamie żadnych prostych obietnic złożonych tobie.
Dziękuję za wspaniały wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić AGI, Inc.












