인터뷰

디브 가르그, AGI, Inc의 CEO 및 공동 창립자 – 인터뷰 시리즈

mm
Unite.AI를 Google의 선호 소스에 추가

디브 가르그, AGI, Inc의 CEO 및 공동 창립자는 자율 에이전트, 에지 인텔리전스, 컴퓨터 비전 및 로봇공학에 초점을 맞춘 인공지능 연구자이자 기업가입니다. AGI, Inc를 창립하기 전에 그는 컴퓨터 사용 에이전트의 초기 선구자였던 MultiOn을 공동 창립하여 이끌었고, 이후에는 그 회사의 이사회 의장을 지냈습니다. 가르그는 또한 스탠퍼드 대학교에서 4년近 동안 부교수로 재직하며, 트랜스포머 아키텍처에专注한 대학의 첫 번째 과목인 CS 25: 트랜스포머 유나이티드를 만들었습니다. 그의 이전 경험에는 NVIDIA (NVDA ) 및 Apple (AAPL )에서 인공지능 개발을 주도하고, Google, Uber 및 Cornell University에서 컴퓨터 비전 및 자율 주행 기술을 연구하는 것이 포함되었습니다. 그의 연구에는 영향력 있는 Pseudo-LiDAR 접근 방식이 포함되어 있습니다.

AGI, Inc. 는 개인용, 보안이 강화된 인텔리전스를 개발하는 인공지능 연구 회사로, 에지 디바이스에서 직접 작동합니다. 그들의 주력 기술인 AGI-0은 사용자 선호도를 이해하고 애플리케이션 전체에서 작업을 완료하는 액션 지향형 인공지능 시스템입니다. 이 회사는 또한 하드웨어 제조업체와 개발자가 기존 애플리케이션에 별도의 통합을 구축하지 않고도 화면 인식 에이전트를 추가할 수 있는 플랫폼을 제공합니다. AGI, Inc는 Lenovo와 함께 기술을 시연했으며, Qualcomm (QCOM ) Snapdragon 파워 디바이스용 에이전트 스택을 최적화하고 있습니다.

애플, 구글, 엔비디아에서 일했으며, 스탠퍼드 대학에서 박사 과정을 중단하고 AGI, Inc를 창립하기 전에 MultiOn에서 초기 에이전트 시스템을 개척했습니다. 기존 인공지능 접근 방식이 충분하지 않다는 것을 깨달은 구체적인 제한이나 순간은 무엇입니까? 그리고 온디바이스 자율 에이전트를 구축하는 것이 올바른 방향이라고 생각하는 이유는 무엇입니까?

이 변화는 2023년과 2024년 사이에 웹 에이전트를 작업하는 동안 발생했습니다. 우리는 브라우저에서 작업을 수행할 수 있는 에이전트를 만들 수 있었지만, 웹사이트가 에이전트가 작동할 수 있는 적절한 구조를 가지고 있는 경우에만 가능했습니다. 그러나何か 잘못되고 이상적인 DOM 버전과 다르게 행동하는 경우, 즉 모달 창이나 애니메이션 효과와 같은 경우, 에이전트는 작동을 중지했습니다. 반면에, 사람들이 스마트폰과 상호 작용할 때 중요하게 여기는 모든 것은 애플리케이션 내에서 발생합니다. 애플리케이션은 API를 제공하지 않습니다. 대신 화면을 표시합니다.

이 차이가 우리의 결론으로 이어졌습니다. 문제의 해결책은 더 복잡한 API나 더 큰 모델이 아니었습니다. 에이전트는 디바이스를 사람의 관점에서 작동시키는 것이었습니다. 즉, 스마트폰을 사람처럼 취급하는 것이었습니다. 화면과 상호 작용하는 것이었습니다.

오늘날 많은 인공지능 어시스턴트는 여전히 API, 통합 및 클라우드 오케스트레이션에 크게 의존합니다. 이 모델에서 무엇이 근본적으로 깨지며, 온디바이스 실행이 결여된 계층이라고 생각하는 이유는 무엇입니까?

그것에는 세 가지 문제가 있습니다. 첫 번째는 범위입니다. API는 모든 개발자가 인터페이스를 구축해야 하므로 에이전트의 기능은 가장 느린 파트너에 의해 제한됩니다. 애플의 App Intents는 이러한 기술의 좋은 예입니다. 그런 다음 개인 정보 보호 문제가 있습니다. 클라우드 오케스트레이션은 화면 콘텐츠, 메시지 및 활동이 제3자의 서버로 전송되도록 요구합니다. 마지막으로 비용과 대기 시간的问题이 있습니다. 모든 클라우드 처리는 느리고 비용이 많이 듭니다.

온디바이스 실행은 이러한 모든 문제를 해결합니다. 에이전트는 다른 사람에게 의존하지 않으며 시스템과 상호 작용하기 위해 UI와 직접 인터페이스를 설정합니다.

您的 접근 방식은 인공지능을 질문에 답변하는 것에서 실제로 애플리케이션 전체에서 작업을 완료하는 것으로 전환합니다. 에이전트가 휴대폰을 인간처럼 신뢰성 있게 작동시키는 데 필요한 가장 어려운 기술적인 도전은 무엇입니까?

휴대폰을 신뢰성 있게 제어하는 것은 생각보다 어렵습니다. 먼저 에이전트는 휴대폰 화면을 인간처럼 인식하고, 다음에 무엇이 올지 이해하고, 적절한 작업을 수행해야 합니다. 인식은 버튼, 텍스트 상자, 메뉴, 레이아웃 등을 인식할 수 있는 비전-언어 모델에 의해 수행됩니다. 작업 선택은 모호성, 부분적으로 로드된 페이지, 모달 대화 상자 및 오류를 처리하는 데 필요합니다. 마지막으로 작업은 정확해야 하므로 탭이 올바른 위치에落下합니다.

그러나 가장 큰 문제는 복잡한 애플리케이션과 장기간 동안 신뢰성 있게 상호 작용하는 능력입니다. 우버를 예약하는 것은 하나지만, 이전 상호 작용에 의존하는 여러 단계의 프로세스를 수행하는 것은 완전히 다른 게임입니다. 이는 모델을 엔드투엔드 방식으로 훈련하는 것이 제품 개발에 필수적이었던 이유입니다.

이것을 어시스턴트에서 에이전트로의 전환이라고 설명했습니다. 실제 사용자에게 이것이 어떤 의미이며, 행동이 어떻게 바뀔 것으로 예상합니까?

실제적인 변화는 인터페이스 자체에서 발생합니다. 오늘날 우리는 앱을 사용하고 앱을 사용하는 방법을 배우지만, 내일에는 에이전트가 있을 것입니다. 그리고 앱은 에이전트가 대신 구성하는 기능이 될 것입니다. 우리는 앱에 대해 생각하는 것을 중지하고, 의도를 생각하기 시작합니다. “저를 집으로 데려다주세요.” “주말에 찍은 사진을 엄마에게 보내주세요.” “다음 주말에 평화롭게 지낼 수 있는 리스본의 호텔을 보여주세요.” 에이전트는 어떤 앱을 사용해야 하는지 알고 있습니다.

행동의 변화는 처음에는 천천히 시작되지만, 점점 더 빠르게 진행됩니다. 처음에는 사람들이 신뢰할 수 있는 간단한 작업을 시도하고, 점점 더 확장합니다. 에이전트가 휴대폰에서 루틴 작업을 항상 올바르게 수행할 때, 완전한 수용의 트리거가 발생합니다.

퀄컴과 레노버와 같은 파트너십은 대규모로 에이전트 인공지능을 사용할 수 있게 하는데 하드웨어와 소프트웨어의 긴밀한 통합이 얼마나 중요한가요?

이것은 연구 목적으로 사용되는 프로토タイプ와 실제로 사용할 수 있는 애플리케이션 사이의 차이입니다. 디바이스는 신경 처리 유닛을 가지고 있으며, 이는 에이전트의 알고리즘이 디바이스에서 최소한의 지연과 에너지 소비로 작동할 수 있도록 보장합니다. 퀄컴은 이러한 최적화를 달성하기 위해 수년간 노력해 왔으며, 2026년 MWC에서 발표한 파트너십은 정확히 이러한 목표를 달성하기 위한 것이었습니다.

다른 한편으로는 레노버가 있습니다. 레노버는 스마트폰, 태블릿, PC를 통해 수백만 명의 사용자에게 도달할 수 있으며, AI를 사용하여 차별화하려고 합니다. 기존 디바이스 포트폴리오를 가진 파트너를 통해 빠르고 투명하게 도달하는 것은 대체 경로보다 낫습니다. 이것은 제가 경험을 통해 알고 있는 것입니다.

신뢰는 주요 장벽으로 보입니다. 사용자가 민감한 데이터와 여러 애플리케이션을 넘나드는 작업을 대신 수행하는 인공지능을 사용할 때 사용자가 편안하게 느끼도록 시스템을 설계하는 방법은 무엇입니까?

신뢰는 에이전트가 무엇을 할 수 있고, 무엇을 할 수 없는지에 대해 투명하게 하는 것에서 시작됩니다. 중요한 작업, 즉 실제 구매, 메시지 전송 또는 계정 설정 변경과 같은 작업에는 사용자의 승인이 필요합니다. 에이전트는 체크아웃 페이지까지 독자적으로 진행할 수 있지만, 사용자가 승인할 때까지 더 이상 진행하지 않습니다. 비자는 인증된 결제 레일을 추가합니다.

이 모든 것은 두 가지 간단한 철학에 기반합니다. 첫 번째는 “중요한 모든 것에 대해 인간이 루프에 포함”입니다. 두 번째는 “가능한 경우에는 반전”입니다. 또한 에이전트는 화면에 표시되는 것만 볼 수 있으며, 설정된 OS 권한을 존중합니다.

앱 경제가 혼란할 수 있다는 이야기가 있습니다. 에이전트가 앱을 완전히 대체할 것이라고 생각합니까, 아니면 앱에 접근하고 수익을 창출하는 방식을 재구성할 것이라고 생각합니까?

앱은 사라지지 않습니다. 다이내믹은 단순히 변경됩니다. 오늘날 앱은 브랜드가 소비자와 통신하는 방법입니다. 내일, 에이전트가 될 것입니다. 그리고 앱은 에이전트가 사용하는 도구가 될 것입니다. 앱 개발자는 여전히 필요합니다. 서비스 호출, 텍스트 메시지 또는 트랜잭션 뒤에 있는 애플리케이션이 항상 필요하기 때문입니다. 차이는 선택을 하는 인터페이스에 있습니다.

이것은 앱과 앱을 사용하는 브랜드에게 새로운 전선을 나타냅니다. 이것은 위협이 아니라, 탐험하고 개발할 수 있는驚異的な 기회입니다.

您的 시스템은 API에 의존하지 않습니다. 이것이 개발자와 플랫폼 간에 긴장을 유발합니까, 아니면 더 개방적인 생태계를 잠금합니까?

그것은 들리는 것보다 덜 논쟁적입니다. 개발자와 우리 사이에 경쟁은 없습니다. 인터페이스가 작동하는 방식은 사람이 애플리케이션을 사용하는 것과 동일한 프로세스입니다. 따라서 에이전트는 다른 사람과 동일한 인터페이스를 사용합니다. 개발자는 접근을 차단하기 위해 일반적인 기술적 관행을 사용할 수 있습니다. 우리는 그 이유를 이해합니다.

더 흥미로운 결과는 논쟁의 부재입니다. 보편적인 상호 운용성이 있는 개방형 시스템은 모든 사람에게ประโยชน를 제공합니다. 각 어시스턴트가 특정 애플리케이션에서만 사용할 수 있는 폐쇄형 시스템과는 달리, 실제 가치가 있는 애플리케이션을 도와줍니다.

온디바이스 인공지능은 종종 개인 정보 보호의 이점으로 프레이밍됩니다. 강력한 모델이 전통적으로 대규모 컴퓨팅을 요구하는 경우에 로컬 처리와 클라우드 처리의 필요성을 어떻게 균형합니까?

이것은 하이브리드 시스템입니다.それは完全한 온디바이스 시스템으로 계속 진화할 것입니다. 작업과 경량 推論은 휴대폰에서 발생하며, 무거운 推論은 클라우드에서 발생합니다. 퀄컴과의 협력 및 휴대폰의 신경 처리 유닛의 최적화를 통해 모델은 더 지역화되고 있습니다. 현재 시장에서 사용 가능한 대부분의 플래그십 휴대폰은 필요한 작업을 처리할 수 있는 능력을 가지고 있습니다.

강력한 성능과 지역화의 양립할 수 없는 딜레마는 구식입니다. 모델은 더 효율적이 되고, 휴대폰의 하드웨어는 더 능력있게 됩니다. 적절하게 최적화된 스택으로 모든 것을 달성할 수 있습니다.

3~5년 후를 내다보면, 완전히 구현된 AI 네이티브 디바이스는 어떤 모습입니까? 그리고 이 비전이 주류가 되기 전에 기술적으로, 문화적으로 무엇이 발생해야 합니까?

실제 구현은 단일 에이전트가 디바이스를 따라 다니는 것입니다. 컴퓨터에서 정보를 찾으라고 말하고, 스마트폰으로 구매를 하고, 차를 시동 걸라고 말합니다. 의도는 동일하지만, 컨텍스트는 일정하고, 표면은 변경됩니다. 휴대폰은 현재 대부분의 컴퓨팅이 발생하는 곳이므로 삽입점입니다. 이후에는 PC, TV, 자동차 및 궁극적으로 스마트 글래스로 이동합니다. 퀄컴과의 협력은 이 점에서 큰 차이를 만듭니다.

기술적으로는 온디바이스 推論을 계속하고, 장기적인 신뢰성을 증가시키는 것입니다. 또한 적절한 디바이스 간 전환입니다. 문화적으로는 에이전트에 점점 더 복잡한 작업을 맡기는 변화입니다. 이는 에이전트가 할 수 없는 것을 без 주저 말하고, 간단한 약속을 지키는 것을 기반으로 합니다.

偉大한 인터뷰에 감사드립니다. 더 많은 것을 배우고 싶은 독자는 AGI, Inc를 방문하십시오.

앙투안은 유나이트.AI의 비전적인 리더이자 공동 설립자로서 AI와 로봇공학의 미래를 형성하고 촉진하는 데 대한 불변의 열정을 가지고 있습니다. 연속적인 기업가로서, 그는 AI가 사회에 전기와 같은 변화를 가져올 것이라고 믿으며, 종종 파괴적인 기술과 AGI의 잠재력에 대해 열광합니다.

作为 미래학자로서, 그는 이러한 혁신이 우리 세계를 어떻게 형성할지 탐구하는 데 헌신하고 있습니다. 또한, 그는 Securities.io의 설립자로서, 미래를 재정의하고 전체 부문을 재구성하는 최첨단 기술에 투자하는 플랫폼을 운영하고 있습니다.