Lãnh đạo tư tưởng

Giám sát AI có ba điểm mù — và hầu hết các công ty đều không theo dõi bất kỳ điểm nào trong số đó

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Hầu hết các cuộc thảo luận về an toàn AI trong các công ty đều nhắm vào mục tiêu sai. Các đội dành hàng tuần để tranh luận về việc nên sử dụng mô hình nào, sau đó kết nối mô hình đó với email, thanh toán, cơ sở dữ liệu khách hàng và mã của họ, mà không dừng lại để đặt một câu hỏi đơn giản hơn: khi điều này xảy ra, ai đang theo dõi và liệu ai có thể ngăn chặn nó?

Số liệu cho thấy điều này sắp trở nên tốn kém. Gartner ước tính rằng ít nhất 15% quyết định công việc thường xuyên sẽ được thực hiện tự động bởi AI vào năm 2028, tăng từ gần như không có vào năm 2024. Trong cùng một nghiên cứu, nó cảnh báo rằng hơn 40% dự án AI có khả năng sẽ bị hủy bỏ vào cuối năm 2027, và một trong những lý do nó đưa ra là kiểm soát rủi ro yếu. Đọc lại điều đó. Các dự án không chết vì mô hình kém. Chúng chết vì không ai xây dựng một cách để quản lý chúng.

Tôi xây dựng hệ thống quản lý cho AI để kiếm sống, vì vậy tôi thấy những khoảng trống giống nhau lặp đi lặp lại. Có ba khoảng trống như vậy. Hầu hết các công ty đều không theo dõi đúng bất kỳ khoảng trống nào trong số đó, và nhiều công ty không theo dõi bất kỳ khoảng trống nào.

Đại lý là điểm mù lớn

Mọi người đều lo lắng về các đại lý tự động, và họ có lý do để lo lắng. Nhưng hầu hết mọi người lo lắng về phần sai của nó. Điều đáng lo ngại về một đại lý không phải là nó lý luận. Đó là nó hành động. Nó không đề xuất việc hoàn tiền; nó trả tiền. Nó không soạn thảo email; nó gửi email. Trao cho mô hình một tập hợp các công cụ và bạn đã trao cho nó khả năng chạm vào các hệ thống thực và thay đổi chúng.

Nếu bạn làm sai điều đó, sự thất bại không phải là một câu nói vụng về. Đó là tiền mất, hoặc một bảng bị xóa khỏi cơ sở dữ liệu. Và có một cạnh sắc hơn. Tiêm lệnh.prompt nằm ngay trên đầu danh sách rủi ro của OWASP cho các ứng dụng LLM, và có lý do chính đáng: cho mô hình một văn bản sai và nó có thể bị thuyết phục để làm điều gì đó mà không ai yêu cầu. Khi mô hình chỉ có thể nói, đó là một điều phiền toái. Khi mô hình có thể gọi các công cụ, đó là một kẻ tấn công đang nắm giữ khóa API của bạn.

Câu trả lời tiêu chuẩn là ghi lại mọi thứ mà đại lý làm và theo dõi các dấu vết. Tốt. Nhưng một dấu vết là mô tả về điều gì đó đã xảy ra. Đó là đoạn phim CCTV sau khi tiền đã bị lấy, hữu ích cho cuộc điều tra, vô ích để ngăn chặn việc trộm cắp.

Điểm mù im lặng không ai đề cập

Điểm mù thứ hai không bao giờ xuất hiện trên một trang trình bày, vì nó nhàm chán. Đó là cuộc gọi API đơn giản. Không phải là một đại lý, không phải là một khung, chỉ là một đoạn mã ở đâu đó trong một dịch vụ mà tạo ra một lệnh và gửi nó đến mô hình.

Hầu hết AI trong sản xuất thực sự trông như thế này, và đó là phần ít được quản lý nhất trong toàn bộ ngăn xếp chính xác vì nó quá bình thường. Đó là một yêu cầu HTTP bị chôn sâu ba lớp trong một số dịch vụ, được viết bởi một kỹ sư đã không bao giờ nghe về chính sách AI của bạn và sẽ không biết nơi tìm nó. Cuộc gọi đó có thể gửi dữ liệu của khách hàng đến một mô hình của bên thứ ba, hoặc kích hoạt một hành động ở khâu tiếp theo, và không có gì kiểm tra xem nó có nên, và không có gì độc lập ghi lại rằng nó đã làm.

Điểm mù lộn xộn là con người

Điểm mù thứ ba là con người, đó là lý do tại sao nó là điểm mù tồi tệ nhất. Nhân viên của bạn đã tìm ra cách dán một nhiệm vụ vào ChatGPT hoặc Claude để làm việc nhanh hơn, vì vậy họ làm điều đó cả ngày, thường từ các tài khoản cá nhân mà bạn không thể nhìn thấy. Điều này không phải là giả thuyết. Cyberhaven’s xem xét việc sử dụng thực tế tại nơi làm việc cho thấy rằng một tỷ lệ thực sự của nhân viên đã dán dữ liệu công ty bí mật vào ChatGPT, nhiều trong số đó thông qua các tài khoản mà công ty không có cửa sổ nào để nhìn vào.

Nếu bạn muốn một câu chuyện cảnh báo, đó là Samsung. Vào năm 2023, nó cấm AI sinh nội bộ sau khi các kỹ sư dán mã nguồn độc quyền vào ChatGPT, ba lần riêng biệt trong vòng chưa đầy một tháng. Những người này không phải là những kẻ xấu. Họ là những kỹ sư tốt đang cố gắng gỡ lỗi nhanh hơn. Đó là toàn bộ cái bẫy: sự rò rỉ trông giống hệt với năng suất. Và các công cụ mất dữ liệu cũ của bạn sẽ không bắt được nó, vì đó là một sao chép và dán vào một tab trình duyệt, không phải là một tệp rời khỏi tòa nhà.

Vậy điều gì thực sự hoạt động

Đặt ba điểm mù lên và giải pháp ngừng tập trung vào các đại lý cụ thể và trở thành một ý tưởng đơn giản: quản lý mọi thứ mà AI làm trước khi nó làm, không phải sau. Một số điều thực sự quan trọng, được học chủ yếu theo cách khó khăn.

Ngồi trước hành động, không phải sau nó. Đây là toàn bộ trò chơi, và đó là lý do tại sao tôi vẫn khăng khăng rằng khả năng quan sát và quản lý không phải là từ đồng nghĩa. Một bảng điều khiển cho bạn biết một đại lý đã di chuyển 40.000 bảng Anh vào ngày hôm qua là một báo cáo mất mát. Một thứ gì đó có thể giữ lại chuyển khoản đó để một con người xem trước khi nó rời đi là một điều khiển. Nếu thiết lập của bạn chỉ có thể cho bạn biết điều gì đã xảy ra, bạn không có sự giám sát. Bạn có tầm nhìn sau.

Sử dụng một điểm kiểm soát, không phải một điểm cho mỗi công cụ. Các đại lý, cuộc gọi API và nhân viên dán vào một trình trò chuyện cảm thấy như ba vấn đề riêng biệt, vì vậy các công ty mua ba công cụ riêng biệt và kết thúc với ba tập hợp khoảng trống giữa chúng. Những điều tồi tệ sống trong khoảng trống. Mọi thứ mà AI làm, từ bất kỳ nơi nào nó đến, nên phải vượt qua cùng một cổng.

Giữ một nhật ký mà AI không thể viết lại. Nếu hệ thống thực hiện việc đó cũng là hệ thống duy nhất ghi lại việc nó đã làm, bạn không có một bản ghi. Bạn có một nhật ký nó được phép chỉnh sửa. Đây chính xác là nơi các quy tắc đang đi. Yêu cầu lưu giữ bản ghi của Đạo luật AI EU, Điều 12, tồn tại để những gì một hệ thống rủi ro cao đã làm có thể được tái tạo bởi một người khác ngoài hệ thống. Trong thực tế, điều đó có nghĩa là một nhật ký được giữ ngoài thứ được ghi, một thứ không thể bị thay đổi im lặng sau khi thực tế.

Đặt một con người trên các cuộc gọi không thể đảo ngược lớn. Không phải mọi thứ, làm điều đó và bạn sẽ nhấn chìm mọi người trong các phê duyệt cho đến khi họ phê duyệt tất cả. Nhưng những cuộc gọi bạn không thể lấy lại, di chuyển tiền, xuất dữ liệu, xóa hồ sơ, nên dừng lại và chờ. Đạo luật AI EU đã làm giám sát của con người bắt buộc cho các hệ thống rủi ro cao, Điều 14. Điều đáng nhớ là giám sát chỉ tính nếu người đó có thời gian và ngữ cảnh để thực sự nói không. Một phê duyệt mà không ai đọc chỉ là kịch.

Kiểm tra trực giác trung thực

Không có điểm mù nào trong số ba điểm mù đó là một trường hợp ngoại lệ. Đó là cách thông thường mà hầu hết các công ty đang chạy AI ngay bây giờ, im lặng, mà không có nhiều lưới an toàn. Các đội sẽ vượt qua những năm tới mà không có một sự cố xấu sẽ không phải là những đội có biểu đồ đẹp nhất. Họ sẽ là những đội đã quyết định sớm rằng mọi thứ mà AI của họ làm, đại lý, cuộc gọi API, đoạn văn được dán, đều đi qua một cổng trước khi nó xảy ra, không phải sau.

Nếu bạn muốn một bài kiểm tra nhanh về thiết lập của mình, hãy trả lời hai câu hỏi trung thực. Trong số ba bề mặt đó, bao nhiêu bạn thực sự có thể nhìn thấy? Và trong số những bề mặt bạn có thể nhìn thấy, bao nhiêu bạn có thể ngăn chặn? Đối với nhiều công ty, câu trả lời trung thực cho câu thứ hai là không. Đó là số bạn cần sửa đầu tiên.

Soji Mathew Joseph là người sáng lập và CEO của TrustLoop, nơi ông làm việc về quản lý và kiểm soát thời gian chạy cho AI. Ông đã dành hơn 15 năm trong lĩnh vực công nghệ và vận hành con người tại các công ty tăng trưởng cao.