Phỏng vấn
Div Garg, CEO và Đồng sáng lập của AGI, Inc – Loạt phỏng vấn

Div Garg, CEO và Đồng sáng lập của AGI, Inc, là một nhà nghiên cứu AI và doanh nhân tập trung vào các tác nhân tự động, trí tuệ cạnh, thị giác máy tính và robot. Trước khi thành lập AGI, Inc., ông đã đồng sáng lập và lãnh đạo MultiOn, một người tiên phong sớm trong lĩnh vực các tác nhân sử dụng máy tính, và sau đó từng là chủ tịch hội đồng quản trị của công ty. Garg cũng đã dành gần bốn năm làm thành viên giảng dạy phụ trợ tại Đại học Stanford, nơi ông đã tạo ra CS 25: Transformers United, khóa học đầu tiên của trường đại học dành cho kiến trúc biến đổi. Kinh nghiệm trước đây của ông bao gồm lãnh đạo phát triển trí tuệ nhân tạo tại Collaborative Robotics, thực hiện nghiên cứu tại NVIDIA (NVDA ) và Apple (AAPL ), và làm việc về công nghệ thị giác máy tính và lái xe tự động tại Google, Uber và Đại học Cornell, nơi nghiên cứu của ông bao gồm phương pháp Pseudo-LiDAR có ảnh hưởng đến nhận thức 3D dựa trên camera.
AGI, Inc. là một công ty nghiên cứu AI đang phát triển trí tuệ riêng, bảo mật và có thể tiếp cận được, hoạt động trực tiếp trên các thiết bị cạnh. Công nghệ hàng đầu của công ty, AGI-0, là một hệ thống AI định hướng hành động được thiết kế để hiểu sở thích của người dùng và hoàn thành nhiệm vụ trên các ứng dụng trên điện thoại, máy tính, thiết bị đeo và các thiết bị kết nối khác, bao gồm các quy trình làm việc liên quan đến mua sắm, vận chuyển, lập lịch, nhắn tin và giải trí. Công ty cũng cung cấp một nền tảng cho phép các nhà sản xuất và phát triển thiết bị phần cứng thêm các tác nhân thông minh có thể suy luận và hành động trên các ứng dụng hiện có mà không cần xây dựng các tích hợp riêng biệt cho từng ứng dụng. AGI, Inc. đã chứng minh công nghệ của mình với Lenovo và đang tối ưu hóa ngăn xếp tác nhân của mình cho các thiết bị được hỗ trợ bởi Qualcomm (QCOM ) Snapdragon.
Bạn đã làm việc tại Apple, Google, Nvidia và giúp tiên phong các hệ thống tác nhân sớm tại MultiOn trước khi tạm dừng tiến sĩ tại Stanford để thành lập AGI, Inc. Điều gì cụ thể hạn chế hoặc khoảnh khắc thuyết phục bạn rằng các phương pháp AI hiện có không đủ, và xây dựng một tác nhân tự động trên thiết bị là con đường đúng đắn?
Thay đổi này xảy ra vào khoảng thời gian từ năm 2023 đến 2024 khi tôi đang làm việc trên các tác nhân web. Chúng tôi có thể tạo ra các tác nhân để thực hiện các hành động trong trình duyệt, nhưng chỉ khi trang web có cấu trúc phù hợp mà tác nhân có thể làm việc với nó. Ngay khi mọi thứ đi sai và không hoạt động như một phiên bản lý tưởng của DOM, chẳng hạn như một cửa sổ bật lên hoặc hiệu ứng hoạt hình, tác nhân ngừng hoạt động. Mặt khác, mọi thứ quan trọng khi mọi người muốn tương tác với điện thoại thông minh của họ đều xảy ra trong các ứng dụng. Các ứng dụng không cung cấp bất kỳ loại API nào; chúng trình bày màn hình thay vào đó.
Điều này dẫn đến kết luận của chúng tôi. Giải pháp cho vấn đề này không phải là các API tinh vi hơn hoặc các mô hình lớn hơn, mà là tác nhân sẽ hoạt động trên thiết bị từ quan điểm của một người. Điều này có nghĩa là đối xử với điện thoại thông minh như một người sẽ – tương tác với màn hình của nó.
Nhiều trợ lý AI ngày nay vẫn phụ thuộc nặng nề vào API, tích hợp và оркестration đám mây. Điều gì cơ bản bị hỏng trong mô hình đó, và tại sao bạn tin rằng thực hiện trên thiết bị là lớp thiếu?
Có ba vấn đề với điều đó. Đầu tiên là phạm vi bao phủ. API đòi hỏi tất cả các nhà phát triển phải giao diện với bạn, điều này hạn chế khả năng của tác nhân của bạn với đối tác chậm nhất. App Intents từ Apple là một ví dụ tuyệt vời về công nghệ như vậy đã được bắt đầu làm việc trở lại tại WWDC 2024. Sau đó, có vấn đề về quyền riêng tư. Оркестration đám mây đòi hỏi rằng nội dung màn hình, tin nhắn và hoạt động của bạn được gửi đến máy chủ của bên thứ ba. Cuối cùng, có vấn đề về chi phí và độ trễ. Tất cả quá trình xử lý vòng tròn qua đám mây làm cho nó chậm và tốn kém.
Thực hiện trên thiết bị giải quyết tất cả các vấn đề này. Tác nhân của bạn không phụ thuộc vào bất kỳ ai khác và giao diện với hệ thống bằng cách tương tác với giao diện người dùng trực tiếp.
Phương pháp của bạn chuyển đổi AI từ trả lời câu hỏi sang thực sự hoàn thành nhiệm vụ trên các ứng dụng. Những thách thức kỹ thuật khó khăn nhất trong việc cho phép một tác nhân hoạt động đáng tin cậy trên điện thoại như một người sẽ là gì?
Điều khiển đáng tin cậy một chiếc điện thoại khó hơn nó có vẻ. Đầu tiên, một tác nhân phải đồng thời nhận thức màn hình điện thoại như một người, hiểu những gì tiếp theo và thực hiện hành động phù hợp. Nhận thức được thực hiện bởi một mô hình thị giác-ngôn ngữ có khả năng nhận ra các nút, hộp văn bản, menu, bố cục, v.v. Lựa chọn hành động được yêu cầu để xử lý các sự模糊, các trang được tải một phần, hộp thoại và lỗi. Cuối cùng, hành động phải chính xác đủ để một lần chạm vào đúng vị trí.
Vấn đề quan trọng nhất, tuy nhiên, nằm ở khả năng tương tác đáng tin cậy với các ứng dụng phức tạp trong một khoảng thời gian dài. Đặt một cuộc hẹn với Uber là một việc, nhưng thực hiện một quá trình nhiều bước trong một ứng dụng mà mỗi bước phụ thuộc vào các tương tác trước đó là một trò chơi hoàn toàn khác. Đây chính xác là lý do tại sao việc đào tạo các mô hình từ đầu đến cuối là rất quan trọng cho sự phát triển của sản phẩm.
Bạn đã mô tả điều này như chuyển từ các trợ lý sang các tác nhân. Chuyển đổi thực sự này có nghĩa là gì trong thực tế đối với người dùng hàng ngày, và bạn dự đoán hành vi sẽ thay đổi như thế nào?
Thay đổi thực tế đến từ giao diện chính nó. Ngày nay, chúng ta có ứng dụng và học cách sử dụng ứng dụng, ngày mai chúng ta sẽ có tác nhân, và ứng dụng sẽ trở thành các khả năng được tác nhân của chúng tôi tạo thành. Chúng ta ngừng nghĩ về ứng dụng và bắt đầu nghĩ về ý định: “Đặt cho tôi một chuyến đi về nhà.” “Gửi hình ảnh từ cuối tuần cho Mẹ.” “Hiển thị các khách sạn ở Lisbon nơi tôi có thể có được một chút hòa bình cho tuần cuối cùng.” Tác nhân biết ứng dụng nào để sử dụng.
Thay đổi hành vi bắt đầu từ từ và trở nên nhanh hơn khi nó diễn ra. Ban đầu, mọi người sẽ thử phương pháp này cho các nhiệm vụ đơn giản mà họ tin tưởng và sau đó mở rộng càng nhiều càng tốt. Kích hoạt cho sự chấp nhận toàn diện sẽ đến khi tác nhân thực hiện các nhiệm vụ thường xuyên trên điện thoại của chúng tôi mỗi lần.
Với các đối tác như Qualcomm và Lenovo, mức độ quan trọng của tích hợp phần cứng và phần mềm chặt chẽ để làm cho AI tác nhân có thể sử dụng được trên quy mô lớn là gì?
Đây là sự khác biệt giữa một nguyên mẫu được sử dụng cho mục đích nghiên cứu và một ứng dụng thực sự có thể sử dụng được. Các thiết bị được hỗ trợ bởi Snapdragon có các đơn vị xử lý thần kinh, điều này sẽ đảm bảo rằng các thuật toán của tác nhân có thể hoạt động trên thiết bị với độ trễ và tiêu thụ năng lượng tối thiểu. Qualcomm đã dành nhiều năm để đạt được sự tối ưu hóa này, và quan hệ đối tác mà chúng tôi đã công bố tại MWC 2026 có chính xác mục tiêu này trong tâm trí.
Mặt khác là Lenovo. Lenovo có thể tiếp cận hàng trăm triệu người dùng trên điện thoại thông minh, máy tính bảng và máy tính, tìm cách phân biệt mình bằng cách sử dụng AI. Đi qua các đối tác có danh mục thiết bị hiện có và tiếp cận chúng một cách nhanh chóng và minh bạch đánh bại con đường thay thế. Tôi biết điều này từ kinh nghiệm.
Tin cậy dường như là một rào cản lớn. Làm thế nào bạn thiết kế các hệ thống mà người dùng cảm thấy thoải mái khi để AI thực hiện hành động thay mặt cho họ, đặc biệt là khi những hành động đó bao gồm nhiều ứng dụng và dữ liệu nhạy cảm?
Tin cậy được xây dựng trên cơ sở trung thực về những gì tác nhân có thể và không thể làm. Bất kỳ hành động nào liên quan đến điều gì đó quan trọng, chẳng hạn như thực hiện một mua hàng thực sự, gửi một tin nhắn hoặc thay đổi bất kỳ cài đặt tài khoản nào, cần phải có sự chấp thuận của người dùng. Tác nhân có khả năng đi tất cả các cách đến trang thanh toán theo ý của nó, nhưng không xa hơn cho đến khi bạn thực hiện nó. Quan hệ đối tác của chúng tôi với Visa thêm các đường ray thanh toán được xác thực trên đó.
Điều này tất cả được thực hiện dựa trên hai triết lý đơn giản. Đầu tiên là “con người trong vòng lặp cho mọi thứ quan trọng.” Thứ hai là “khả năng đảo ngược ở mọi nơi có thể.” Hơn nữa, tác nhân chỉ xem những gì có thể nhìn thấy trên màn hình và tôn trọng các quyền của hệ điều hành đã được thiết lập.
Có một câu chuyện ngày càng tăng rằng nền kinh tế ứng dụng có thể bị phá vỡ. Bạn có thấy các tác nhân thay thế các ứng dụng hoàn toàn, hay thay đổi cách các ứng dụng được truy cập và kiếm tiền?
Các ứng dụng không bao giờ biến mất. Động lực đơn giản thay đổi. Đối với ngày nay, ứng dụng là cách thương hiệu giao tiếp với người tiêu dùng. Ngày mai, tác nhân sẽ là, và ứng dụng sẽ là công cụ được sử dụng bởi tác nhân. Các nhà phát triển ứng dụng ở đây để ở lại vì sẽ luôn có nhu cầu về ứng dụng đằng sau cuộc gọi dịch vụ, tin nhắn, giao dịch hoặc ứng dụng.
Sự khác biệt sẽ là giao diện trên đó các lựa chọn được thực hiện. Điều này đại diện cho một biên giới mới cho các ứng dụng và cho các thương hiệu sử dụng chúng. Điều này không đại diện cho một mối đe dọa nào cả, mà là một cơ hội tuyệt vời để khám phá và phát triển với các đối tác của chúng tôi trong phát triển và nền tảng.
Hệ thống của bạn tránh dựa vào API. Điều này có tạo ra căng thẳng với các nhà phát triển và nền tảng, hay cuối cùng nó mở ra một hệ sinh thái mở hơn?
Điều này ít gây tranh cãi hơn nó có vẻ. Không có sự cạnh tranh giữa các nhà phát triển và chúng tôi. Cách một giao diện hoạt động là cùng một quá trình mà một người sẽ sử dụng một ứng dụng, vì vậy tác nhân sử dụng cùng một giao diện như bất kỳ ai khác. Các nhà phát triển có thể sử dụng các phương pháp kỹ thuật chung để chặn quyền truy cập, và chúng tôi hiểu lý do của họ.
Kết quả thú vị hơn là sự vắng mặt của sự tranh cãi. Một hệ thống mở với khả năng tương tác phổ quát sẽ có lợi cho mọi người, so với một hệ thống đóng, nơi mỗi trợ lý chỉ có thể được sử dụng trên các ứng dụng cụ thể, vì nó chỉ hỗ trợ loại tích hợp tùy chỉnh đó. Tính phổ quát giúp người dùng, nhưng nó cũng giúp các ứng dụng có giá trị thực.
AI trên thiết bị thường được coi là một lợi thế về quyền riêng tư. Làm thế nào bạn cân bằng xử lý cục bộ với nhu cầu về các mô hình mạnh mẽ truyền thống đòi hỏi tính toán lớn?
Đây là một hệ thống lai sẽ tiếp tục phát triển thành một hệ thống hoàn toàn trên thiết bị. Cả hành động và suy luận nhẹ xảy ra trên điện thoại, trong khi suy luận nặng xảy ra trên đám mây. Với tối ưu hóa ngăn xếp thông qua công việc của chúng tôi với Qualcomm và khả năng của các NPUs của điện thoại đang trở nên tiên tiến hơn, có một sự thay đổi hướng tới mô hình được định vị hơn.
Sự đối lập giữa hiệu suất mạnh và hy sinh định vị là lỗi thời. Các mô hình đang trở nên hiệu quả hơn, và phần cứng trên điện thoại đang trở nên có khả năng hơn. Tất cả những điều này có thể đạt được khi ngăn xếp được tối ưu hóa đúng cách.
Nhìn về tương lai ba đến năm năm, một thiết bị bản địa AI hoàn chỉnh sẽ trông như thế nào, và những gì cần phải xảy ra về mặt kỹ thuật và văn hóa trước khi tầm nhìn đó trở thành phổ biến?
Thực hiện sẽ là một tác nhân duy nhất theo dõi các thiết bị của bạn. Bạn nói với PC của mình để tìm thông tin về quà tặng, chuyển sang điện thoại thông minh của mình để thực hiện mua hàng, sau đó nói với xe của mình để làm nóng lên. Ý định là như nhau; bối cảnh vẫn không thay đổi, trong khi bề mặt thay đổi. Điện thoại là điểm chèn vì đó là nơi hầu hết việc tính toán xảy ra ngay bây giờ. Sau đó, nó sẽ chuyển sang máy tính, TV, xe hơi và cuối cùng là kính thông minh, và sự hợp tác với Qualcomm tạo ra sự khác biệt lớn trong khía cạnh này.
Từ quan điểm kỹ thuật, đó là tiếp tục suy luận trên thiết bị và tăng độ tin cậy lâu dài, cũng như chuyển đổi thiết bị đúng cách. Từ quan điểm văn hóa, sự thay đổi sẽ là ngày càng tin tưởng vào các tác nhân với các nhiệm vụ phức tạp hơn, điều này dựa trên tác nhân nói với bạn mọi thứ nó không thể làm mà không do dự, và cũng không vi phạm bất kỳ lời hứa đơn giản nào được đưa ra cho bạn.
Cảm ơn cuộc phỏng vấn tuyệt vời, những người đọc muốn tìm hiểu thêm nên truy cập AGI, Inc.












