Röportajlar

Div Garg, AGI, Inc’in CEO ve Kurucu Ortağı – Röportaj Serisi

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Div Garg, AGI, Inc’in CEO ve Kurucu Ortağı, otonom ajanlar, kenar zekası, bilgisayar görme ve robotik üzerine odaklanan bir AI araştırmacısı ve girişimcidir. AGI, Inc’i kurmadan önce, bilgisayar kullanım ajanlarında erken bir öncü olan MultiOn’u kurdu ve daha sonra yönetim kurulunun başkanlığını yaptı. Garg ayrıca Stanford Üniversitesi’nde yaklaşık dört yıl süreyle yardımcı öğretim üyesi olarak görev yaptı ve burada CS 25: Transformers United’i oluşturdu, yani transformer mimarilerine adanmış üniversitenin ilk dersini verdi. Daha önceki deneyimi, Collaborative Robotics’te yapay zeka geliştirmeyi içerir, NVIDIA (NVDA ) ve Apple (AAPL )‘da araştırma yaptı ve Google, Uber ve Cornell Üniversitesi’nde bilgisayar görme ve otonom sürüş teknolojileri üzerinde çalıştı, araştırmaları arasında etkili Pseudo-LiDAR yaklaşımı da vardı.

AGI, Inc. özel, güvenli ve erişilebilir zeka geliştiren bir AI araştırma şirketidir ve bu zeka doğrudan kenar cihazlarda çalışır. Şirketin amiral gemisi teknolojisi AGI-0, kullanıcı tercihlerini anlayan ve telefonlar, bilgisayarlar, giyilebilir cihazlar ve diğer bağlı cihazlardaki uygulamalar arasında görevleri tamamlayan bir eylem odaklı AI sistemidir. Şirket, ayrıca donanım üreticileri ve geliştiricilerin mevcut uygulamalar için ayrı ayrı entegrasyonlar oluşturmaksızın, mevcut uygulamalar arasında akıl yürütme ve eylem yapabilen ekran odaklı ajanları eklemelerine olanak tanıyan bir platform sunar. AGI, Inc, teknolojisini Lenovo ile gösterdi ve ajan yığınını Qualcomm (QCOM ) Snapdragon güçlendirilmiş cihazlar için optimize ediyor.

Apple, Google, Nvidia’de çalıştınız ve MultiOn’da erken ajan sistemlerini öncülük ettiniz, sonra da AGI, Inc’i kurmak için Stanford PhD’nizi askıya aldınız. Mevcut AI yaklaşımlarının yeterli olmadığını ve bir cihazda otonom bir ajan oluşturmanın doğru yol olduğunu düşünen özel bir sınırlama veya anı nedir?

Bu değişiklik 2023 ile 2024 yılları arasında, web ajanları üzerinde çalışırken gerçekleşti. Tarayıcılar içinde eylemler gerçekleştirebileceğimiz ajanlar oluşturabiliyorduk, ancak yalnızca web sitesi ajanın çalışabileceği bir yapıya sahipse. Bir şey yanlış gittiğinde ve idealize edilmiş bir DOM gibi davranmadığında, örneğin bir modal pencere veya animasyon etkisi, ajan işlevini durdurdu. Diğer yandan, insanların akıllı telefonlarıyla etkileşime girmek istedikleri her şey uygulamalar içinde gerçekleşiyor. Uygulamalar herhangi bir API sunmuyor; bunun yerine ekranlar sunuyor.

Bu fark bizi sonuçlara götürdü. Sorunun çözümü daha sofistike API’ler veya daha büyük modeller olmayacak, sondern cihazın bir kişi gibi kullanılabilen bir ajan olacaktı. Bu, akıllı telefonu bir kişi gibi davranmak anlamına geliyordu – ekranlarla etkileşime girerek.

Çoğu AI asistanı hala API’lere, entegrasyonlara ve bulut düzenlenmesine dayanmaktadır. Bu modelde ne fundamental olarak bozulur ve neden cihazda yürütme eksik bir katman olduğunu düşünüyorsunuz?

Üç sorun vardır. İlk sorun kapsamdır. API’ler, tüm geliştiricilerin sizinle arayüze geçmesi gerektiğini gerektirir, bu da ajanın yeteneklerini en yavaş ortakla sınırlar. Apple’ın App Intents’i gibi teknoloji, WWDC 2024’te çalışmaya başlanan bir örnektir. Sonra gizlilik sorunu vardır. Bulut düzenleme, ekran içeriğinizin, mesajlarınızın ve aktivitelerinizin üçüncü bir tarafın sunucularına gitmesini gerektirir. Son olarak, maliyet ve gecikme sorunu vardır. Tüm bulut aracılığıyla işleme, yavaş ve pahalı olur.

Cihazda yürütme bu sorunları çözer. Ajanınız başkalarına bağımlı değildir ve sistemle doğrudan UI aracılığıyla arayüze girer.

Yaklaşımınız, AI’ı sorulara cevap vermekten, aslında uygulamalar arasında görevleri tamamlamaya doğru kaydırıyor. Bir ajanın güvenilir bir şekilde bir telefonu insan gibi kullanabilmesi için en zor teknik zorluklar nelerdi?

Güvenilir bir şekilde telefon kontrolü yapmak kolay değil. İlk olarak, bir ajanın telefon ekranını insan gibi algılaması, ne olacağını anlaması ve uygun eylemi gerçekleştirmesi gerekir. Algılama, düğmeler, metin kutuları, menüler, düzenler vb. tanıyan bir görme-dil modeli tarafından yapılır. Eylem seçimi, belirsizlikleri, kısmen yüklenen sayfaları, modal diyalogları ve hataları ele almak için gereklidir. Son olarak, eylemin doğru konumu için yeterli olması gerekir.

En önemli sorun, karmaşık uygulamalarla uzun süre boyunca güvenilir bir şekilde etkileşime girmektir. Bir Uber rezervasyonu yapmak bir şeydir, ancak her biri önceki etkileşimlere bağlı olan çok adımlı bir işlem gerçekleştirmek tamamen farklı bir şeydir. Bu nedenle, modelleri uçtan uca eğitmek ürünün geliştirilmesinde çok önemlidir.

Sizi asistanlardan ajanlara doğru bir geçiş olarak tanımladınız. Bu geçiş, günlük kullanıcılar için gerçekten ne anlama geliyor ve davranışın ne kadar sürede değişmesini bekliyorsunuz?

Pratik değişiklik, arayüzedir. Bugün uygulamayı öğreniyoruz, yarın ajanı öğreneceğiz ve uygulamalar ajan tarafından bizim adımıza oluşturulan yetenekler haline gelecek. Uygulamalar hakkında düşünmeyi bırakıp niyet hakkında düşünmeye başlarız: “Beni eve götür.” “Anneme hafta sonu resimlerini gönder.” “Benim için next hafta barış içinde kalabileceğim Lizbon’daki otelleri göster.” Ajan, hangi uygulamaları kullanacağını bilir.

Davranış değişikliği yavaş başlar ve devam ettikçe hızlanır. İlk olarak, insanlar basit görevler için bu yaklaşımı deneyecekler ve güvendikleri sürece genişletecekler. Tam ölçekli kabul, ajanın günlük görevleri her zaman doğru bir şekilde gerçekleştirdiğinde gerçekleşecek.

Qualcomm ve Lenovo gibi ortaklıklarla, agentic AI’ı büyük ölçekte kullanılabilir kılmak için donanım ve yazılım entegrasyonunun ne kadar önemli olduğunu düşünüyorsunuz?

Bu, bir araştırma için kullanılan bir prototip ile gerçekten kullanılabilir bir uygulama arasındaki farktır. Snapdragon güçlendirilmiş cihazlar, sinir işlem birimleri vardır ve bu da ajanın algoritmalarının cihazda minimal gecikme ve enerji tüketimiyle çalışabileceği anlamına gelir. Qualcomm, bu optimizasyonu yıllarca çalıştı ve MWC 2026’da duyurduğumuz ortaklık bu hedefi gerçekleştirmeyi amaçladı.

Diğer uçta Lenovo var. Lenovo, yüz milyonlarca kullanıcıya ulaşabilir, akıllı telefonlar, tabletler ve bilgisayarlar aracılığıyla ve AI kullanarak kendini ayırmak ister. Mevcut cihaz portföylerine sahip ortaklarla çalışmak ve hızlı bir şekilde şeffaf bir şekilde ulaşmak, alternatif rotaya göre daha iyidir. Bunu deneyimden biliyorum.

Güven gibi bir engel var. Kullanıcıların AI’ın adına eylemler gerçekleştirmesine izin vermelerini sağlamak için nasıl bir sistem tasarlıyorsunuz, özellikle de bu eylemler birden fazla uygulamayı ve hassas verileri içerdiğinde?

Güven, ajanın ne yapabileceğini ve ne yapamayacağını açık bir şekilde belirtmekle kurulur. Önemli bir şeyleri içeren herhangi bir eylem, örneğin gerçek bir satın alma, bir mesaj gönderme veya herhangi bir hesap ayarını değiştirme, kullanıcı onayı gerektirir. Ajan, kendi başına ödeme sayfasına kadar gidebilir, ancak sizin onayınız olmadan daha ileri gitmez. Visa ile olan ortaklığımız, bunun üzerine kimlik doğrulama ödeme rayları ekler.

Bu, iki basit felsefe üzerine dayanır. Birincisi, “her önemli şey için insan döngüsü”. İkincisi, “her yerde mümkün olduğunda tersinebilirlik”. Ayrıca, ajan yalnızca ekran上的 metni görebilir ve işletim sistemi tarafından belirlenen izinlere uymalıdır.

Uygulama ekonomisinin bozulabileceği konusunda bir anlatı var. Ajanların uygulamaları tamamen değiştireceğini yoksa uygulamalara erişimi ve para kazanma şeklini yeniden şekillendireceğini düşünüyor musunuz?

Uygulamalar gitmiyor. Dinamik sadece değişiyor. Bugün, uygulama, markanın tüketiciyle iletişim kurduğu yoldur. Yarın, ajan olacak ve uygulama, ajan tarafından kullanılan araç olacak. Uygulama geliştiricileri burada kalacaklar, çünkü hizmet çağrısı, metin mesajı veya işlem için her zaman bir uygulama ihtiyacı olacak. Fark, bu seçimleri yapılan arayüzedir.

Bu, uygulamalar ve uygulamaları kullanan markalar için yeni bir sınırı temsil ediyor. Bu, bir tehdit değil, sondern geliştirme ve platform ortaklarımızla keşfetmek ve geliştirmek için harika bir fırsat.

Sisteminiz API’lere dayanmıyor. Bu, geliştiriciler ve platformlar ile gerilime neden oluyor mu, yoksa daha açık bir ekosistem mi yaratıyor?

Bu,听diği kadar tartışmalı değil. Geliştiriciler ve bizim aramızda bir rekabet yok. Arayüzün çalışması, bir kişinin bir uygulamayı kullanmasıyla aynı süreçtir, bu nedenle ajan da aynı arayüzü kullanır. Geliştiriciler, erişimini engellemek için ortak teknik uygulamaları kullanabilir ve nedenlerini anlıyoruz.

Daha ilginç bir sonuç, çatışmanın olmamasıdır. Evrensel bir sistem, herkes için yararlıdır, çünkü her asistan yalnızca belirli uygulamalar için kullanılabilir, yalnızca bu tür özel entegrasyonları destekler. Evrensellik, kullanıcıları yararlandırır, ancak aynı zamanda gerçek değeri olan uygulamaları da yararlandırır.

Cihazda AI thường, gizlilik avantajı olarak tanımlanıyor. Güçlü modellerin geleneksel olarak büyük ölçekli hesaplama gerektirdiği gerçeğiyle yerel işleme nasıl dengeliyorsunuz?

Bu, bir hibrit sistemdir ve tamamen cihazda bir sistem haline doğru evrimleşecek. Eylemler ve hafif akıl yürütme telefon üzerinde gerçekleşir, mentre ağır akıl yürütme bulutta gerçekleşir. Qualcomm ile optimize ettiğimiz yığın ve telefonların artan olarak gelişen NPUs yetenekleri ile, model daha yerel hale geliyor. Şu anda piyasada bulunan çoğu amiral gemisi telefon, gerekli iş yükünü işleyebilecek kapasiteye sahiptir.

Güçlü performans ve yerel olarak fedakarlık arasındaki ikilem de eskimiştir. Modeller daha verimli hale geliyor ve telefonun donanımı daha yetenekli hale geliyor. Her şey, yığının düzgün bir şekilde optimize edildiğinde gerçekleştirilebilir.

Üç ila beş yıl ilerisini düşünün, tam olarak gerçekleştirilmiş bir AI-yerli cihaz nasıl görünür ve bu vizyonun ana akım haline gelmesi için teknik ve kültürel olarak ne olması gerekir?

Gerçekleştirme, cihazlar arasında takip eden tek bir ajan olacaktır. Bilgisayarınızda bilgi bulmanızı söyleyin, ardından akıllı telefonunuzda bir satın alma yapın, ardından arabanızı ısınmasını söyleyin. Niyet aynı kalır, bağlam sabit kalır, ancak yüzey değişir. Telefonlar, en çok hesaplamanın gerçekleştiği yer olduğu için, girişin noktasıdır. Daha sonra, bilgisayarlar, TV’ler, arabalar ve sonunda akıllı gözlükler takip edecek ve Qualcomm işbirliği bu konuda büyük bir fark yaratıyor.

Teknik açıdan, cihazda akıl yürütme ve uzun vadeli güvenilirliğin devam etmesi, serta doğru cihaz geçişleri önemlidir. Kültürel açıdan, ajanlara giderek daha karmaşık görevler verilmesine dayanan değişim, ajanın size yapamayacağı her şeyi tereddütsüz söylemesi ve size yapılan basit vaatleri bozmadan dayanır.

Harika röportaj için teşekkür ederiz, daha fazla bilgi öğrenmek isteyen okuyucular AGI, Inc‘i ziyaret edebilir.

Antoine, Unite.AI'nin vizyoner lideri ve kurucu ortağı, AI ve robotik geleceğini şekillendirmeye ve tanıtmaya yönelik sarsılmaz bir tutkuya sahiptir. Bir seri girişimci olarak, AI'nin toplum için elektrik kadar yıkıcı olacağına inanmaktadır ve sık sık yıkıcı teknolojiler ve AGI'nin potansiyeli hakkında konuşmaktadır.

Bir gelecekçi olarak, bu yeniliklerin dünyamızı nasıl şekillendireceğini keşfetmeye adanmıştır. Ayrıca, Securities.io kurucusudur, bu platform geleceği yeniden tanımlayan ve tüm sektörleri yeniden şekillendiren teknolojilere yatırım yapmayı hedeflemektedir.