Phỏng vấn
Bo Li, CEO, Virtue AI – Phỏng vấn Series

Bo Li, CEO của Virtue AI, là một nhà nghiên cứu và doanh nhân nổi bật chuyên về an toàn và bảo mật của các hệ thống trí tuệ nhân tạo. Cô lãnh đạo Virtue AI đồng thời cũng là Giáo sư tại Đại học Illinois Urbana-Champaign, nơi nghiên cứu của cô tập trung vào bảo mật học máy, trí tuệ nhân tạo đáng tin cậy và độ bền chống lại các cuộc tấn công. Sự nghiệp của cô bao gồm cả học thuật và công nghiệp, cho phép cô chuyển đổi nghiên cứu trí tuệ nhân tạo tiên tiến thành các ứng dụng thực tế giúp các tổ chức xây dựng công nghệ trí tuệ nhân tạo an toàn và linh hoạt hơn.
Virtue AI là một công ty tập trung vào việc bảo vệ và quản lý các hệ thống trí tuệ nhân tạo được sử dụng trong môi trường doanh nghiệp. Nền tảng của công ty cung cấp các khả năng như kiểm tra đỏ tự động, rào cản thời gian thực và giám sát liên tục để xác định các điểm yếu như tiêm lệnh, ảo giác và rò rỉ dữ liệu. Bằng cách tích hợp trực tiếp vào quy trình phát triển và triển khai trí tuệ nhân tạo, công ty giúp các tổ chức triển khai an toàn quy mô lớn các mô hình ngôn ngữ và ứng dụng trí tuệ nhân tạo trong khi duy trì các tiêu chuẩn bảo mật và quản lý mạnh mẽ.
Điều gì đã thúc đẩy bạn chuyển từ sự nghiệp học thuật thuần túy sang việc thành lập và lãnh đạo Virtue AI, và vấn đề nào trong ngành công nghiệp bạn cảm thấy chưa được giải quyết tại quy mô lớn?
Các công cụ bảo mật truyền thống được xây dựng cho các ứng dụng có đường dẫn cố định. Chúng không được thiết kế cho các hệ thống lý luận, thích nghi và hoạt động tự chủ. Tôi và các đồng sáng lập của tôi nhận thấy một khoảng trống giữa những gì nghiên cứu cơ bản về bảo mật trí tuệ nhân tạo đã sản xuất và những gì các doanh nghiệp thực sự có sẵn. Nghiên cứu đã tồn tại. Thực tế sản xuất không.
Virtue AI tập trung vào an toàn, bảo mật và tuân thủ cho các mô hình ngôn ngữ lớn và các tác nhân tự động. Trong số các lĩnh vực này, bạn tin rằng các doanh nghiệp đánh giá thấp nhất hiện nay?
Các doanh nghiệp hiểu tất cả các lĩnh vực này ở một mức độ nhất định, đặc biệt là bảo mật, nhưng vẫn còn một khoảng cách lớn.
Các doanh nghiệp đã bắt đầu coi trọng bảo mật mô hình, ít nhất là trên bề mặt. Nhưng các tác nhân là một vấn đề khác. Chúng được trao quyền truy cập vào các phần nhạy cảm nhất của cơ sở hạ tầng doanh nghiệp: thực hiện mã, gọi API, duyệt web và đưa ra quyết định liên kết chạm vào dữ liệu, tài chính và hoạt động. Hầu hết các đội bảo mật không được thiết lập để lý luận về loại hệ thống như vậy. Công cụ họ có không được xây dựng cho nó.
Rủi ro không phải là lý thuyết. Nếu không có bảo mật được xây dựng cụ thể cho các hệ thống tác nhân, các thất bại nhỏ có thể tích lũy nhanh chóng. Một cuộc gọi công cụ không mong muốn, một hướng dẫn mơ hồ, một lệnh tiêm mà trượt qua rào cản—bất kỳ điều nào trong số đó có thể leo thang thành hành động không được ủy quyền hoặc lộ dữ liệu trước khi ai đó nhận thấy điều gì đó đã đi sai.
Kiểm tra đỏ liên tục là trung tâm của phương pháp tiếp cận của Virtue AI. Những loại thất bại hoặc rủi ro nào thường chỉ xuất hiện một lần hệ thống đã hoạt động trong sản xuất?
Hầu hết các rủi ro nghiêm trọng.
Trong môi trường được kiểm soát, bạn đang kiểm tra mô hình và các tác nhân. Trong sản xuất, bạn đang kiểm tra hệ thống—và những thứ đó là khác nhau. Một khi mô hình được kết nối với các công cụ, đường ống truy xuất, đầu vào người dùng và các tác nhân khác, không gian hành vi mở rộng theo những cách mà kiểm tra trước khi triển khai không thể nắm bắt được. Một tác nhân được “cấu hình an toàn” có thể hành động rất khác khi nó được kết nối với các cơ sở dữ liệu thực, máy chủ MCP mới hoặc các tác nhân khác. Hệ thống trở nên không xác định. Nó bắt đầu đưa ra quyết định dựa trên ngữ cảnh mà không tồn tại trong quá trình đánh giá.
Đó là khi bạn tìm thấy những thất bại thực sự quan trọng.
Làm thế nào bạn nghĩ về việc đo lường “an toàn trí tuệ nhân tạo” trong thực tế, đặc biệt là khi các hệ thống tiến hóa thông qua tinh chỉnh, truy xuất và sử dụng công cụ?
Trong thực tế, an toàn trí tuệ nhân tạo không thể được đo lường thông qua một điểm chuẩn tĩnh duy nhất vì các hệ thống trí tuệ nhân tạo hiện đại liên tục tiến hóa thông qua tinh chỉnh, tăng cường truy xuất và tương tác công cụ hoặc tác nhân. Thay vào đó, an toàn cần được đánh giá như một thuộc tính của hệ thống trên toàn bộ vòng đời của một ứng dụng trí tuệ nhân tạo. Điều này bao gồm kiểm tra căng thẳng mô hình và tác nhân với các cuộc tấn công đỏ đa dạng, giám sát hành vi thời gian thực như lệnh, cuộc gọi công cụ và hành động, và đánh giá kết quả so với các chính sách rủi ro được xác định (ví dụ: lạm dụng, ảo giác, rò rỉ dữ liệu hoặc hành động không được ủy quyền).
Ví dụ, bài báo giành giải thưởng của chúng tôi (Bài báo hay nhất tại Cơ quan An ninh Quốc gia và NeurIPS), DecodingTrust, đã cung cấp kiểm tra an toàn và an toàn toàn diện cho các mô hình nền tảng. Nền tảng DecodingTrust-Agent của chúng tôi đã xây dựng một trình mô phỏng tác nhân thực tế lưu trữ các môi trường đa dạng với các tác nhân đỏ bản địa để thực hiện kiểm tra đỏ động, thích ứng và liên tục.
Quan trọng là, việc đo lường an toàn phải liên tục và thích ứng, vì các bản cập nhật cho lệnh, nguồn truy xuất hoặc công cụ có thể giới thiệu các điểm yếu mới. Trong thực tế, điều này có nghĩa là kết hợp kiểm tra đỏ tự động, rào cản thời gian thực và khả năng quan sát để đo lường không chỉ phản hồi mô hình mà còn an toàn của hệ thống trí tuệ nhân tạo cuối cùng hoạt động trong thế giới thực.
Nền tảng nghiên cứu của bạn bao gồm độ bền, quyền riêng tư và các cuộc tấn công đối thủ. Trong số các lĩnh vực này, lĩnh vực nào đã chứng minh là khó nhất để chuyển thành các biện pháp phòng thủ trong thế giới thực?
Chuyển đổi nghiên cứu về độ bền, quyền riêng tư và các cuộc tấn công đối thủ thành các biện pháp phòng thủ trong thế giới thực thực sự rất khả thi. Trên thực tế, nhiều hướng nghiên cứu trong nhóm của tôi được trực tiếp truyền cảm hứng từ các thách thức bảo mật thực tế được quan sát trong các hệ thống trí tuệ nhân tạo được triển khai. Khó khăn thực sự nằm không ở việc xây dựng các biện pháp phòng thủ, mà ở việc cung cấp các đảm bảo bảo mật đáng tin cậy trong các môi trường động và thực tế.
Trong nghiên cứu học thuật, nhóm của tôi đã đạt được những tiến bộ mạnh mẽ như độ bền được chứng nhận và đảm bảo quyền riêng tư, nhưng những kết quả này thường phụ thuộc vào các giả định có thể không hoàn toàn giữ vững trong các hệ thống sản xuất phức tạp. Các ứng dụng trí tuệ nhân tạo hiện đại liên tục tiến hóa thông qua dữ liệu mới, tinh chỉnh, đường ống truy xuất và tích hợp công cụ, điều này có thể giới thiệu các điểm yếu mới theo thời gian.
Do đó, bảo mật trí tuệ nhân tạo hiệu quả không thể dựa vào sự bảo vệ một lần—nó đòi hỏi phải kiểm tra đỏ liên tục, khám phá rủi ro và rào cản thích ứng mà tiến hóa cùng với hệ thống. Đây chính là triết lý đằng sau Virtue AI: kết hợp nghiên cứu lâu dài của chúng tôi về bảo mật trí tuệ nhân tạo với kiểm tra đỏ tự động quy mô lớn và bảo vệ thời gian thực để liên tục xác định các rủi ro mới nổi và cập nhật các biện pháp phòng thủ, cho phép bảo mật thực tế và có thể mở rộng cho các hệ thống trí tuệ nhân tạo trong thế giới thực.
Cái gì làm cho việc bảo mật các tác nhân trí tuệ nhân tạo tự động cơ bản khác với việc bảo mật phần mềm truyền thống hoặc thậm chí các bot trò chuyện?
Các tác nhân không phải là các chương trình tĩnh. Chúng không theo các đường dẫn có thể dự đoán và chúng không ở trong giới hạn mà bạn đã vẽ cho chúng tại thời điểm triển khai.
Bảo mật truyền thống giả định các đường dẫn thực hiện cố định, API ổn định và hành vi xác định. Các tác nhân tự động vi phạm tất cả những giả định đó. Chúng lý luận về việc phải làm tiếp theo, chọn công cụ dựa trên ngữ cảnh và tạo ra các hiệu ứng trên nhiều hệ thống trong một lần chạy.
Bạn không thể quét một lệnh, làm cứng một mô hình hoặc giám sát một cuộc gọi API đơn lẻ và coi việc đó là xong. Bạn phải bảo mật tác nhân như một hệ thống hoàn chỉnh—lý luận của nó, sử dụng công cụ, môi trường của nó và những gì xảy ra sau đó.
Đó là điểm vấn đề cốt lõi mà các biện pháp kiểm soát không thể giải quyết. Chúng không được thiết kế cho nó.
Ở đâu các công cụ bảo mật hiện có thất bại khi các tác nhân có thể hành động trên nhiều hệ thống, công cụ và nguồn dữ liệu cùng một lúc?
Họ khiến bạn bị mù về cách tác nhân thực sự hoạt động từ đầu đến cuối.
Hầu hết các công cụ được xây dựng cho các ứng dụng có ranh giới rõ ràng và hành vi ổn định. Chúng có thể cho bạn biết một cuộc gọi API đơn lẻ trông như thế nào. Chúng không thể cho bạn biết một tác nhân đã lý luận cách thức đi qua năm cuộc gọi công cụ để tạo ra một kết quả mà không ai dự định.
Khoảng trống về khả năng hiển thị là vấn đề. Nếu bạn không thể nhìn thấy toàn bộ chuỗi hành động và quyết định, bạn không thể quản lý nó và bạn không thể kiểm toán nó sau khi sự việc đã xảy ra.
Làm thế nào các rào cản thời gian thực giảm thiểu rủi ro so với việc chỉ giám sát hoặc ghi nhật ký?
Ghi nhật ký cho bạn biết điều gì đã sai sau khi thiệt hại đã được thực hiện. Nó hữu ích cho pháp y và tuân thủ, nhưng nó không ngăn chặn bất cứ điều gì.
Với các tác nhân tự động, độ trễ giữa hành động và phát hiện có thể thực sự tốn kém. Một tác nhân đã thực hiện một cuộc gọi API không mong muốn hoặc đã làm rò rỉ dữ liệu không chờ đợi đường ống ghi nhật ký của bạn bắt kịp.
Rào cản thời gian thực chặn hành động trước khi thực hiện. Nếu một tác nhân cố gắng làm điều gì đó không theo chính sách, nó sẽ bị chặn hoặc đánh dấu trước khi nó chạy, không phải sau đó.
Sự kết hợp cũng quan trọng. Ngăn chặn thời gian thực cộng với một điểm thực thi nhất quán trên tất cả các tương tác công cụ-tác nhân là một hồ sơ rủi ro khác so với việc giám sát thụ động các thành phần riêng lẻ.
Virtue AI được thành lập bởi các nhà nghiên cứu kỹ thuật sâu. Điều này ảnh hưởng như thế nào đến các quyết định sản phẩm so với các công ty khởi nghiệp trí tuệ nhân tạo được thúc đẩy thương mại hơn?
Bảo mật và quản lý trí tuệ nhân tạo cơ bản là một vấn đề kỹ thuật sâu. Các hệ thống chúng tôi đang bảo vệ—như các mô hình ngôn ngữ lớn, mô hình đa phương thức và hệ thống tác nhân—chính chúng được xây dựng trên nghiên cứu tiên tiến. Không có chuyên môn trí tuệ nhân tạo cơ bản mạnh mẽ, gần như không thể thiết kế các giải pháp bảo mật hiệu quả cho chúng.
Trong nhiều trường hợp, thách thức lớn nhất trong bảo mật trí tuệ nhân tạo là khi một thuật toán đỏ tiên tiến xác định các điểm yếu của các tác nhân trí tuệ nhân tạo trong một bài báo nghiên cứu—làm thế nào để chuyển đổi sự hiểu biết đó thành một biện pháp phòng thủ cấp sản xuất có thể bảo vệ đáng tin cậy các hệ thống thực tại quy mô lớn? Tại Virtue AI, việc đóng khoảng cách giữa nghiên cứu và triển khai là cốt lõi của cách chúng tôi hoạt động và những gì chúng tôi có kinh nghiệm.
Bởi vì Virtue AI được thành lập bởi các nhà nghiên cứu đã dành nhiều thập kỷ làm việc về độ bền trí tuệ nhân tạo, học tập đối thủ và trí tuệ nhân tạo đáng tin cậy, các nhóm nghiên cứu và kỹ thuật của chúng tôi làm việc trên cùng một vấn đề đồng thời. Các nhà nghiên cứu của chúng tôi liên tục nghiên cứu các kiến trúc mô hình mới nổi, các công việc tác nhân và các kỹ thuật tấn công đang phát triển, trong khi các nhóm kỹ thuật của chúng tôi tích hợp những hiểu biết đó trực tiếp vào các hệ thống sản xuất.
Khi chúng tôi xác định một điểm yếu mới—như một mẫu tiêm lệnh mới hoặc chiến lược thao túng tác nhân—nó có thể nhanh chóng được chuyển thành các mô hình phát hiện mới, rào cản hoặc chiến lược đỏ. Điều này xảy ra liên tục, không chỉ trên một đường dẫn sản phẩm hàng quý.
Kết quả là, các sản phẩm của chúng tôi vẫn luôn tiên tiến và sẵn sàng cho doanh nghiệp, giúp các tổ chức bảo mật các hệ thống trí tuệ nhân tạo khi họ xây dựng và triển khai chúng. Nhiều khách hàng của chúng tôi cho biết rằng cách tiếp cận nghiên cứu này chính xác là điều cho phép họ di chuyển nhanh hơn trong khi vẫn duy trì an toàn và tuân thủ.
Ngược lại, các đội được thúc đẩy hoàn toàn bởi thương mại thường tối ưu hóa những gì khách hàng đang yêu cầu ngày hôm nay, điều này có thể dẫn đến các tính năng tăng dần nhưng có thể tụt lại phía sau cảnh quan mối đe dọa đang phát triển nhanh chóng của các hệ thống trí tuệ nhân tạo. Trong bảo mật trí tuệ nhân tạo, các mối đe dọa phát triển nhanh như chính công nghệ. Một nền tảng nghiên cứu đầu tiên cho phép chúng tôi dự đoán các rủi ro mới trước và xây dựng các biện pháp phòng thủ trước khi chúng trở thành vấn đề rộng rãi.
Điều gì là sự hiểu lầm phổ biến nhất mà các doanh nghiệp có về bảo mật trí tuệ nhân tạo khi họ lần đầu tiên đến với Virtue AI?
Một trong những sự hiểu lầm phổ biến nhất mà các doanh nghiệp có khi họ lần đầu tiên đến với Virtue AI là bảo mật trí tuệ nhân tạo có thể được giải quyết đơn giản bằng cách áp dụng các công cụ bảo mật truyền thống hoặc các bộ lọc kiểm duyệt nội dung cơ bản.
Trên thực tế, các hệ thống trí tuệ nhân tạo giới thiệu các bề mặt đe dọa hoàn toàn mới, chẳng hạn như tiêm lệnh, jailbreak, lạm dụng do ảo giác, rò rỉ dữ liệu thông qua hệ thống truy xuất và thao túng tác nhân thông qua công cụ hoặc API bên ngoài. Những rủi ro này xuất phát từ hành vi và lý luận của mô hình bản thân, không chỉ từ cơ sở hạ tầng xung quanh.
Do đó, việc bảo vệ các hệ thống trí tuệ nhân tạo đòi hỏi các cơ chế bảo mật hiểu mô hình và các tác nhân đầu vào, đầu ra và quy trình ra quyết định trên toàn bộ vòng đời của một ứng dụng trí tuệ nhân tạo, điều này đòi hỏi khả năng nghiên cứu trí tuệ nhân tạo cơ bản.
Điều này là lý do tại sao chúng tôi nhấn mạnh vào bảo mật bản địa trí tuệ nhân tạo: kết hợp kiểm tra đỏ tự động để khám phá các điểm yếu, rào cản thời gian thực để thực thi các chính sách và khả năng quan sát hệ thống để giám sát lệnh, cuộc gọi công cụ và hành động của tác nhân.
Một khi các doanh nghiệp nhìn thấy sự khác biệt giữa các rủi ro trí tuệ nhân tạo và rủi ro phần mềm truyền thống, họ nhanh chóng nhận ra rằng việc bảo mật trí tuệ nhân tạo đòi hỏi một ngăn xếp bảo mật hoàn toàn mới.
Cuối cùng, “triển khai trí tuệ nhân tạo có trách nhiệm” có nghĩa là gì với bạn trong thực tế—không phải trong lý thuyết, mà trong một doanh nghiệp đang vận chuyển sản phẩm ngày hôm nay?
Nhanh hơn và an toàn hơn không phải là những điều đối lập, mặc dù hầu hết các doanh nghiệp đều coi chúng như vậy. Giả định là bảo mật nghiêm ngặt sẽ làm chậm bạn—hơn các chu kỳ xem xét, hơn các cổng, hơn ma sát trước khi điều gì đó được vận chuyển.
Trong thực tế, các doanh nghiệp triển khai các tác nhân một cách tự tin là những doanh nghiệp xây dựng bảo mật vào quy trình thay vì gắn nó vào cuối: kiểm tra đỏ tự động trước khi triển khai, kiểm soát thời gian thực một khi tác nhân đang hoạt động và khả năng hiển thị tập trung trên toàn bộ vòng đời của tác nhân.
Điều đó không phải là một bài tập tuân thủ. Đó là điều thực sự cho phép bạn di chuyển nhanh, vì bạn không phát hiện ra trong sản xuất những gì bạn nên đã bắt gặp sớm hơn.
Triển khai có trách nhiệm, theo nghĩa cụ thể, có nghĩa là bạn biết những gì các tác nhân của bạn có thể làm, bạn có thể thấy những gì họ đang làm và bạn có thể dừng chúng khi điều gì đó đi sai.
Phát triển trí tuệ nhân tạo có trách nhiệm cho phép triển khai hệ thống trí tuệ nhân tạo liên tục và quy mô lớn với sự tự tin, thay vì làm chậm sự đổi mới trí tuệ nhân tạo.
Cảm ơn vì cuộc phỏng vấn tuyệt vời, những người đọc muốn tìm hiểu thêm nên truy cập Virtue AI.












