Phỏng vấn
Jeffrey Lai, Người sáng lập và Giám đốc điều hành của IrisGo – Series phỏng vấn

Jeffrey Lai, Người sáng lập và Giám đốc điều hành của IrisGo, là một doanh nhân AI và lãnh đạo sản phẩm có gốc rễ sâu sắc trong các trợ lý thông minh và công nghệ ngôn ngữ. Trước khi ra mắt IrisGo vào năm 2025 và担任 vai trò Người sáng lập tại AI Fund, Lai đã dành hơn 12 năm tại Apple (AAPL ), nơi anh đã giúp xây dựng và mở rộng Siri, cuối cùng担任 vai trò Quản lý kỹ thuật ngôn ngữ của Siri. Công việc của anh tập trung vào việc phát triển trí tuệ nhân tạo đa ngôn ngữ, bao gồm cả việc phát triển phiên bản tiếng Trung của Siri. Trước khi đến Apple, anh đã担任 vai trò kỹ sư tại Cisco Systems (CSCO ) và hoàn thành thực tập tại Nhóm Robotics Thông minh của Trung tâm Nghiên cứu Ames của NASA. Với sự nghiệp trải qua nhiều lĩnh vực như robot, phần mềm doanh nghiệp và AI tiêu dùng, Lai đã nhất quán tập trung vào việc làm cho các công nghệ phức tạp trở nên dễ tiếp cận và hữu ích hơn trong các quy trình làm việc hàng ngày.
IrisGo đang phát triển một hệ điều hành AI được thiết kế cho thế hệ mới của máy tính cá nhân AI. Thay vì hoạt động như một trợ lý độc lập, nền tảng này được xây dựng để quan sát cách người dùng thực hiện các nhiệm vụ trên các ứng dụng, học hỏi các quy trình làm việc và tự động hóa chúng thông qua một trợ lý thông minh trên thiết bị. Phương pháp cốt lõi của nó tập trung vào việc cho phép người dùng thể hiện một nhiệm vụ một lần và sau đó chuyển quy trình đó thành một quy trình làm việc có thể tái sử dụng, giúp giảm thiểu công việc kỹ thuật số lặp đi lặp lại. Bằng cách tận dụng khả năng xử lý AI chuyên dụng trên các máy tính AI hiện đại, IrisGo nhằm mục đích cung cấp tự động hóa riêng tư, phản hồi và nhận thức ngữ cảnh hơn, đồng thời định vị mình trong thị trường ngày càng tăng cho các hệ thống AI đại lý có thể thực hiện các nhiệm vụ thay mặt người dùng thay vì chỉ cung cấp khuyến nghị.
Sau khi giúp xây dựng Siri tại Apple, những kinh nghiệm cụ thể nào đã thuyết phục bạn rằng đã đến lúc bắt đầu IrisGo, và vấn đề chính trong tương tác giữa con người và máy tính mà bạn cảm thấy vẫn chưa được giải quyết?
Khi chúng tôi xây dựng Siri, chúng tôi tập trung rất nhiều vào việc hiểu ngôn ngữ tự nhiên. Nhưng Siri gặp khó khăn với ngữ cảnh, điều này rất thách thức vì cách con người thực sự làm việc và giao tiếp đầy đủ ngữ cảnh. Khi bạn yêu cầu một đồng nghiệp, “Bạn có thể gửi cho tôi báo cáo đó không?” họ biết báo cáo nào. Họ biết lịch sử chia sẻ của bạn, dự án hiện tại của bạn, những gì bạn đã thảo luận.
Trong nhiều năm, AI đã được thiết kế để phản hồi lại bạn. Nhập một thứ gì đó, nhận lại một thứ gì đó. Đó là mô hình tương tác mà chúng tôi đã thừa kế từ các công cụ tìm kiếm và trợ lý trò chuyện. Nhưng hầu hết những gì mọi người thực sự làm trên máy tính không phải là một câu hỏi, mà là một quy trình làm việc. Biên soạn báo cáo này. Đối chiếu các bảng tính này. Kéo dữ liệu từ ba ứng dụng khác nhau và định dạng nó thành một tài liệu. Loại công việc đó không phù hợp với một lời nhắc.
Điều đã thuyết phục tôi bắt đầu IrisGo là nhận ra rằng ngành công nghiệp không xây dựng cho các trường hợp sử dụng hàng ngày. Mọi người đều xây dựng các mô hình thông minh hơn, hiểu ngôn ngữ tốt hơn, phản hồi nhanh hơn. Nhưng khoảng trống cơ bản, nơi AI thực sự có thể làm việc, không chỉ phản hồi lại yêu cầu, vẫn còn đó. Đó là vấn đề chúng tôi đặt ra để giải quyết.
Nhìn lại những năm làm việc trên Siri, những bài học lớn nhất bạn đã học được về những hạn chế của các trợ lý giọng nói, đặc biệt là khi nói đến việc hiểu ngữ cảnh, ý định và hành vi của người dùng?
Bài học lớn nhất tôi đã học được là ngữ cảnh là mọi thứ. Người ta hiếm khi giao tiếp bằng các lệnh cô lập; yêu cầu của họ được định hình bởi những gì họ đang làm việc và những gì họ đang cố gắng đạt được. Các trợ lý giọng nói ban đầu được thiết kế xung quanh việc trả lời các yêu cầu riêng lẻ, điều này hoạt động tốt cho nhiều nhiệm vụ nhưng ít hiệu quả hơn cho công việc liên tục bao gồm nhiều ứng dụng và quy trình làm việc. Đó là bài học mà tôi đã rút ra từ Siri.
Điều chúng tôi đã học được là ý định thường được phân lớp. Ai đó nói một điều và có ý một điều khác, và việc hiểu đúng điều đó đòi hỏi phải hiểu người đó, không chỉ những từ ngữ. Sự hiểu biết đó được tích hợp vào IrisGo từ đầu.
IrisGo thường được mô tả là một hệ điều hành AI chứ không phải là một trợ lý AI. Sự khác biệt là gì và tại sao bạn tin rằng ngành công nghiệp cần một lớp phần mềm mới cho kỷ nguyên máy tính AI?
Một trợ lý AI chờ bạn. Bạn mở nó, nhập một thứ gì đó, nó phản hồi, và sau đó nó hoàn thành. Mô hình tương tác cơ bản giống như một công cụ tìm kiếm, nơi người dùng đưa ra yêu cầu và AI tạo ra phản hồi.
IrisGo, là một hệ điều hành AI, hoạt động cùng mọi thứ bạn đang làm, trên toàn hệ thống của bạn, mọi lúc. Nó có quyền truy cập vào tệp của bạn, ứng dụng của bạn, trình duyệt của bạn, email của bạn. Nó hiểu cách bạn làm việc vì nó đã quan sát, với sự cho phép của bạn. Và quan trọng, nó có thể hành động, không chỉ tư vấn.
Hãy nghĩ về những gì Windows đã làm cho việc tính toán cá nhân. Trước đó, bạn phải có kiến thức kỹ thuật để sử dụng máy tính. Windows đã tạo ra một lớp phổ quát, trực quan giữa người dùng và phần mềm. Kỷ nguyên máy tính AI cần có phiên bản của lớp đó, lấy sức mạnh thô của các mô hình AI và biến nó thành hữu ích thực sự cho những người làm việc hàng ngày.
Đó là những gì IrisGo là: lớp thông minh của máy tính AI. Khi bạn xuất xưởng máy tính AI mà không có lớp đó, bạn chỉ có một con chip mạnh mẽ đang vô dụng. Điều bạn cần là phần mềm biết cách tận dụng nó vì lợi ích của người dùng.
Một trong những ý tưởng cốt lõi của IrisGo là người dùng có thể dạy hệ thống một nhiệm vụ thông qua một lần thể hiện. Tại sao bạn tin rằng mô hình “quan sát và học” là tự nhiên hơn so với việc nhắc hoặc xây dựng quy trình làm việc thủ công?
Điều làm cho tính năng “Quan sát và Học” trở nên mạnh mẽ là nó dựa trên cách chúng ta thực sự dạy lẫn nhau. Khi bạn giới thiệu một nhân viên mới, bạn không viết cho họ một hướng dẫn 40 bước. Bạn chỉ cho họ cách làm một lần, họ quan sát, họ học, và họ tiếp tục từ đó. Đó là trực giác. Đó là tự nhiên.
Vấn đề với việc nhắc là nó đặt gánh nặng lên người dùng để thể hiện chính xác những gì họ muốn, theo định dạng mà AI có thể hiểu. Đối với các truy vấn đơn giản, điều đó hoạt động tốt. Nhưng đối với các quy trình làm việc phức tạp, đa bước liên quan đến tệp cụ thể và cách làm việc cụ thể của bạn? Nó có thể nhanh chóng bị phá vỡ. Hầu hết mọi người không thể mô tả quy trình làm việc của họ với đủ độ chính xác để nhắc AI thực hiện chúng một cách chính xác.
Thể hiện dễ hơn là giải thích. Đó không phải là một cái nhìn mới; đó là lẽ thường. Điều mà “Quan sát và Học” làm là áp dụng logic đó vào tự động hóa. Bạn thực hiện nhiệm vụ một lần, theo cách bạn thường làm. IrisGo học mẫu. Và từ đó, nó xử lý quy trình làm việc đó cho bạn.
Nhiều tác nhân AI ngày nay vẫn đòi hỏi thiết lập và giám sát đáng kể. Điều gì phân biệt một tác nhân tự chủ thực sự với một trợ lý trò chuyện chỉ thực hiện theo hướng dẫn?
Câu trả lời ngắn gọn là một tác nhân tự chủ thực sự có ngữ cảnh của riêng nó, đưa ra quyết định phán xét của riêng mình và tiếp tục làm việc ngay cả khi bạn không giám sát.
Một trợ lý trò chuyện được thiết kế để phản ứng. Nó sống và chết theo lời nhắc. Bạn đưa ra một hướng dẫn, nó thực hiện, và sau đó nó dừng lại. Nếu có điều gì thay đổi, nếu một bước thất bại, hoặc nếu nó cần thích nghi, nó sẽ bị lạc. Nó sẽ hỏi bạn phải làm gì tiếp theo.
Một tác nhân tự chủ thực sự có mục tiêu, không chỉ là hướng dẫn. Nó có ngữ cảnh về môi trường nó đang hoạt động. Nó có thể xử lý các ngoại lệ. Nó có thể quyết định liệu có tiếp tục, thử lại hoặc đánh dấu một thứ gì đó để xem xét của con người. Và quan trọng, nó có thể chạy ở chế độ nền trong khi bạn làm việc trên các thứ khác.
Hầu hết những gì được bán dưới dạng “tác nhân AI” ngày nay thực sự chỉ là các trợ lý trò chuyện tinh vi với các bước bổ sung. Khoảng cách giữa những sản phẩm đó và sự tự chủ thực sự là khổng lồ. Điều làm cho IrisGo khác biệt là nó bắt đầu từ một mô hình về cách bạn làm việc, được học trực tiếp từ việc quan sát bạn, và sử dụng điều đó để đưa ra quyết định phán xét đúng, không chỉ theo hướng dẫn.
Bạn đã nói về tầm quan trọng của bộ nhớ liên tục và ngữ cảnh cục bộ. Tại sao những khả năng này là thiết yếu nếu AI sẽ vượt ra ngoài việc trả lời câu hỏi và bắt đầu hành động thay mặt người dùng?
Hãy tưởng tượng bạn thuê một trợ lý mà mỗi sáng đều không nhớ ai bạn là, bạn đang làm việc trên dự án gì, hoặc bạn thích việc được thực hiện như thế nào. Bạn sẽ dành nửa ngày để giải thích lại ngữ cảnh, và bạn sẽ trở nên vô cùng thất vọng. Đó cơ bản là những gì các công cụ AI yêu cầu bạn làm ngày nay.
Bộ nhớ liên tục có nghĩa là hệ thống biết bạn. Nó biết dự án của bạn, quy trình làm việc của bạn, sở thích của bạn và cách mọi thứ đã tiến hóa theo thời gian. Bạn không cần thiết lập lại ngữ cảnh mỗi phiên. AI sẽ tiếp tục thực hiện.
Ngữ cảnh cục bộ cũng quan trọng không kém, vì công việc của bạn không sống trên đám mây. Nó sống trên máy tính của bạn, trong tệp, ứng dụng, email, tab trình duyệt. IrisGo chạy trên thiết bị của bạn, điều đó có nghĩa là nó có quyền truy cập vào toàn bộ môi trường làm việc của bạn và có thể hoạt động thay mặt bạn trên tất cả.
Hai điều này cùng nhau — bộ nhớ và quyền truy cập cục bộ — là những gì cho phép AI ngừng trở thành một công cụ bạn sử dụng và bắt đầu trở thành một hệ thống làm việc cho bạn. Chúng tôi đang thấy nhiều công ty công nghệ bắt đầu nhận ra tầm quan trọng của cách tiếp cận này, bao gồm cả các công ty Big Tech, vì vậy đó là sự xác nhận rõ ràng về cách tiếp cận của chúng tôi.
Quyền riêng tư vẫn là một trong những mối quan ngại lớn nhất xung quanh AI. Bạn làm thế nào để cân bằng nhu cầu về tính cá nhân hóa và bộ nhớ với kỳ vọng của người dùng về bảo mật và quyền sở hữu dữ liệu?
Giả định rằng quyền riêng tư và tính cá nhân hóa đang trong tình trạng căng thẳng là điều đầu tiên cần thách thức. Chúng tôi đã xây dựng IrisGo để cá nhân hóa có thể xảy ra trên thiết bị, không chỉ trên đám mây.
Hầu hết quá trình xử lý của IrisGo diễn ra cục bộ, trên máy tính của bạn. Quy trình làm việc của bạn, tệp của bạn, ngữ cảnh của bạn đều ở với bạn. Xử lý trên đám mây chỉ xảy ra khi bạn ủy quyền rõ ràng, và khi nó xảy ra, nó được mã hóa từ đầu đến cuối. Bạn kiểm soát những gì đi đến đâu.
Mô hình này làm cho IrisGo trở nên mạnh mẽ hơn, vì nó có quyền truy cập vào toàn bộ ngữ cảnh của môi trường làm việc của bạn. Và điều đó có nghĩa là người dùng không phải lựa chọn giữa một AI hữu ích và một AI an toàn.
Người dùng tin tưởng máy tính cá nhân của họ với công việc nhạy cảm. Mục tiêu của chúng tôi là làm cho IrisGo xứng đáng với sự tin tưởng đó. Đây là điều cơ bản trong cách sản phẩm được thiết kế.
IrisGo hiện đang được xuất xưởng trên máy tính AI của Acer, với kế hoạch mở rộng sang các nhà sản xuất khác. Bạn nghĩ quan hệ đối tác phân phối sẽ quan trọng như thế nào trong việc xác định哪 các nền tảng AI cuối cùng sẽ đạt được sự áp dụng rộng rãi?
Phân phối là tuyệt đối quan trọng đối với việc áp dụng rộng rãi. Hãy nhìn vào lịch sử cạnh tranh nền tảng trong công nghệ. Windows đã thắng vì nó có trên gần như mọi máy tính. Android đã thắng vì nó là hệ điều hành được sử dụng rộng rãi nhất cho các thiết bị di động không phải của Apple. Các công ty đã cố gắng thắng bằng chất lượng sản phẩm thuần túy, mà không có phân phối để hỗ trợ, hầu hết đều không thành công.
Thị trường máy tính AI đang theo một mô hình tương tự. Khi IrisGo được cài đặt sẵn trên một thiết bị, nó có sẵn khi bạn mở hộp. Bạn không cần tìm kiếm nó, tải nó xuống hoặc quyết định cho nó một cơ hội. Đó là một lợi thế khổng lồ.
Chúng tôi đã có 3 triệu thiết bị laptop Acer sẽ được xuất xưởng trong năm nay, và chúng tôi đang trong các cuộc thảo luận với các nhà sản xuất máy tính hàng đầu khác. Mục tiêu là trở thành Hệ điều hành AI cho máy tính bằng cách mặc định. Chiến lược phân phối này là trung tâm của cách chúng tôi trở thành tiêu chuẩn trong loại này.
Khi các tác nhân AI trở nên có khả năng xử lý hóa đơn, nghiên cứu, báo cáo và các quy trình làm việc kinh doanh khác, những thách thức quản trị, giám sát và tin cậy mới nào mà các tổ chức nên chuẩn bị từ hôm nay?
Thách thức đầu tiên là khả năng kiểm toán. Khi một tác nhân AI hoàn thành một quy trình làm việc, chẳng hạn như xử lý hóa đơn hoặc tạo báo cáo, bạn có thể thấy nó đã làm gì, tại sao nó làm như vậy và dữ liệu đến từ đâu không? Loại hồ sơ kiểm toán minh bạch này là thiết yếu cho việc tuân thủ và bắt lỗi trước khi chúng trở nên nghiêm trọng.
Thách thức thứ hai là định nghĩa ranh giới. Những quy trình làm việc nào phù hợp cho việc thực hiện tự động và những quy trình nào yêu cầu xem xét của con người? Các công ty cần có chính sách rõ ràng xung quanh điều này. Xu hướng là để cho AI làm nhiều hơn và nhiều hơn, dần dần, và sau đó nhận ra quá muộn rằng các quyết định quan trọng đang được đưa ra mà không có sự giám sát đủ.
Thứ ba là hiệu chỉnh tin cậy. Nhân viên cần hiểu những gì AI có thể và không thể làm, và khi nào để xác minh đầu ra của nó thay vì giả định nó là chính xác. Đó là một vấn đề về văn hóa và đào tạo cũng như công nghệ.
Tôi tin rằng các tổ chức chuẩn bị cho điều này từ hôm nay sẽ có lợi thế đáng kể, vì khi khả năng của AI tăng lên, các khuôn khổ quản trị sẽ tăng lên.
Năm năm từ nay, bạn có nghĩ rằng mọi người sẽ vẫn dành phần lớn thời gian tương tác với AI thông qua các giao diện trò chuyện, hay AI sẽ ngày càng mờ dần vào nền và tự động hoàn thành công việc mà không cần được yêu cầu?
Quỹ đạo đang chỉ ra rằng AI sẽ ngày càng di chuyển vào nền. Mô hình chúng tôi đang xây dựng hướng tới là một trong đó máy tính của bạn hiểu công việc của bạn và chăm sóc các phần thường xuyên của nó, vì vậy sự chú ý của bạn được giải phóng cho những thứ thực sự đòi hỏi bạn.
Hãy nghĩ về cách hệ thống lái tự động hoạt động trong hàng không. Các phi công không phải lúc nào cũng trực tiếp điều khiển trong suốt chuyến bay. Hệ thống xử lý baseline, và con người tham gia khi cần phán quyết và chuyên môn. Đó là tương lai của công việc trí tuệ được hỗ trợ bởi AI. Máy tính của bạn xử lý các quy trình làm việc lặp đi lặp lại, quy tắc dựa trên. Bạn tập trung vào chiến lược, sáng tạo và các quyết định đòi hỏi phán quyết của con người thực sự.
Năm năm từ nay, những người sản xuất nhất sẽ là những người bên cạnh các hệ thống hiểu cách người dùng hoạt động. Trong quá khứ, con người đã làm tất cả công việc trên máy tính của họ. Trong tương lai, máy tính của bạn cũng sẽ làm việc cho bạn.
Cảm ơn vì cuộc phỏng vấn tuyệt vời, độc giả muốn tìm hiểu thêm nên truy cập IrisGo.












