Lãnh đạo tư tưởng

Kiến Trúc Đánh Giá Quan Trọng Hơn Mô Hình Trong Trí Tuệ Nhân Tạo Doanh Nghiệp

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Giai đoạn tiếp theo của sự trưởng thành AI trong doanh nghiệp phụ thuộc ít hơn vào các mô hình tốt hơn và nhiều hơn vào việc xây dựng kiến trúc đáng tin cậy xung quanh chúng.

Mỗi cuộc thảo luận về quản trị AI mà tôi đã tham gia trong hai năm qua đều quay lại những mối quan tâm giống nhau: tỷ lệ ảo, điểm chuẩn chính xác, và kiểm tra phù hợp. Những vấn đề này là thực sự, nhưng cuộc thảo luận đã bị neo vào đầu sai của vấn đề.

Mặc dù các mô hình đã được cải thiện đáng kể, nhưng số lượng đầu ra AI không được xác minh đã tăng lên cùng với chúng. Sự thiếu sót này cho thấy một vấn đề kiến trúc đánh giá, và ngành công nghiệp hầu như không nói về nó.

Câu Chuyện Tập Trung Vào Mô Hình Đã Vượt Qua Hiện Thực

Khung chủ đạo trong trí tuệ nhân tạo doanh nghiệp vẫn coi chất lượng mô hình là biến số chính: nếu mô hình đủ chính xác, đầu ra là đáng tin cậy. Logic này có thể hiểu được hai năm trước khi các mô hình LLM đầu tiên không nhất quán và dễ bị ảo hơn, nhưng tình hình đã thay đổi. 

Các mô hình ngày nay tạo ra các phản hồi được đánh bóng, cấu trúc tốt, giàu tài liệu tham khảo trên một loạt các nhiệm vụ, được định dạng bằng ngôn ngữ sẵn sàng cho các bên liên quan. Các tổ chức hiện đang sử dụng AI với khối lượng vượt quá khả năng xử lý của quy trình đánh giá của họ. Nghiên cứu về việc áp dụng AI trong doanh nghiệp đã ghi lại sự không phù hợp này trong phát triển phần mềm, nơi các nhà phát triển được hỗ trợ bởi AI hoàn thành 21% nhiều nhiệm vụ hơn trong khi thời gian xem xét yêu cầu kéo dài tăng 91%. Sản xuất tăng lên, vì vậy khả năng không còn là nút thắt. Khả năng đánh giá là trở ngại thực sự. 

Những Gì Dữ Liệu Chỉ Ra Trong Công Việc Insights

Ngành công nghiệp insights là một nơi thuận lợi để nghiên cứu vấn đề này vì các chuyên gia nghiên cứu là những người hoài nghi. Họ biết sự khác biệt giữa tương quan, nguyên nhân, phát hiện, và kết luận. Việc đặt câu hỏi về chất lượng dữ liệu là một phần của công việc. 

Theo Knit AI Trust Index, 92% chuyên gia insights doanh nghiệp được khảo sát cho biết rằng đầu ra AI được tạo ra đã đến lãnh đạo cấp cao mà không có đánh giá toàn diện.
Các phát hiện của Chỉ số Tin cậy xác định ba điểm áp lực chính:

  • Khối lượng đã vượt quá khả năng xác minh. Các đội tạo ra nhiều đầu ra hơn so với khả năng kiểm tra kỹ lưỡng của họ.
  • Sự tự tin đã tăng nhanh hơn so với thay đổi trong hành vi xác minh. Các nhà nghiên cứu cảm thấy tích cực về chất lượng AI trong khi thừa nhận rằng các thực tiễn đánh giá của họ chưa theo kịp.
  • Công cụ để xem xét công việc AI tụt lại phía sau so với công cụ để tạo ra nó. Các tổ chức đã đầu tư nhiều vào khả năng tạo ra và tương đối ít vào cơ sở hạ tầng để xem xét và theo dõi những gì AI đã tạo ra.

Đầu Ra Được Đánh Bóng Mời Ít Kiểm Tra

Chế độ thất bại khó hơn không phải là trường hợp AI tạo ra một câu trả lời rõ ràng sai và ai đó bắt được nó. Vấn đề khó hơn là thiên vị tự động hóa,  xu hướng giảm kiểm tra đầu ra có vẻ có thẩm quyền và được cấu trúc tốt. Một đánh giá hệ thống năm 2025 được xuất bản trên AI & Society đã kiểm tra điều này trên 35 nghiên cứu được đánh giá ngang hàng và phát hiện ra rằng đầu ra AI được đánh bóng, có độ tin cậy cao nhất quán giảm độ sâu của việc xem xét của con người — ngay cả trong số các chuyên gia có kinh nghiệm. Khi điều gì đó trông đúng, chúng tôi phân bổ ít sự chú ý hơn để kiểm tra xem nó có đúng hay không.

Sự thiếu sót này tạo ra một vấn đề lan truyền. Một đầu ra nghiên cứu mà một nhà phân tích chỉ xem xét nhẹ nhàng trở thành điểm dữ liệu trong một bản trình bày cấp VP, trở thành cơ sở cho một cuộc thảo luận cấp hội đồng quản trị. Khi một lỗi đi xa như vậy, nguồn gốc của nó trở nên vô hình và việc sửa chữa nó trở nên tốn kém. Thiệt hại kinh doanh toàn cầu do sai sót tạo ra bởi AI vượt quá 67 tỷ đô la vào năm 2024. Chi phí xác minh mỗi nhân viên có thể đạt 14.200 đô la mỗi năm, chỉ để kiểm tra xem nội dung tạo ra bởi AI có chính xác hay không. Một lần nữa, đây không phải là vấn đề chất lượng mô hình; chúng là vấn đề kiến trúc đánh giá.

Các Lưu Trình AI Trưởng Thành Thực Sự Trông Như Thế Nào

Các tổ chức quản lý vấn đề này tốt không sử dụng mô hình tốt hơn bất kỳ ai khác. Thay vào đó, họ đã xây dựng cơ sở hạ tầng đánh giá toàn diện hơn xung quanh các mô hình họ tận dụng. Bốn nguyên tắc định nghĩa cách tiếp cận của họ: 

  1. Nguyên Nhân Có Thể Xem

Mỗi đầu ra AI mang theo một hồ sơ minh bạch về nơi các đầu vào của nó đến từ. Hồ sơ này cấp cho người xem xét thông tin quý giá về những gì người xem xét cần đánh giá đầu ra một cách hiệu quả. Bạn không thể đánh giá một tuyên bố không thể theo dõi. 

  1. Đánh Giá Cấp Bậc Theo Cấp Độ

Không tất cả đầu ra AI đều mang theo cùng một mức độ rủi ro. Các lưu trình trưởng thành áp dụng cường độ đánh giá tỷ lệ với hậu quả hạ lưu của việc sai lầm. Đầu ra có rủi ro cao nhận được nhiều sự chú ý và các bước xác minh có cấu trúc. Đầu ra thường xuyên di chuyển nhanh hơn.

  1. Ma Sát Ở Những Địa Điểm Đúng

Các tổ chức đang vật lộn nhiều nhất với niềm tin AI đã loại bỏ ma sát đồng đều, coi tốc độ là mục tiêu phổ quát. Những tổ chức thành công đã chọn lọc: giữ lại ma sát có chủ ý tại các điểm giao tiếp nơi đầu ra AI trở thành quyết định của tổ chức. Các quy trình của họ yêu cầu xác nhận trước khi một phát hiện được tạo ra bởi AI đi vào một bản trình bày hội đồng quản trị, hoặc một bước thách thức có cấu trúc trước khi các phát hiện đi vào các cuộc thảo luận chiến lược. 

  1. Vòng Lặp Phản Hồi Quay Lại Lớp Mô Hình

Các lưu trình tốt nhất coi đánh giá như một quá trình tạo ra dữ liệu, không phải là một điểm kiểm tra. Khi một người xem xét đánh dấu một lỗi hoặc ghi đè một khuyến nghị của AI, tín hiệu đó được bắt và đưa trở lại vào cách AI được triển khai trong công việc tương lai. Báo cáo Trạng Thái Trí Tuệ Nhân Tạo Doanh Nghiệp của OpenAI đã tìm thấy rằng các tổ chức có hiệu suất cao nhất được phân biệt không phải bởi sự tinh vi của các mô hình mà bởi sự nghiêm ngặt của các quy trình triển khai. Các tổ chức không có vòng lặp phản hồi này bắt đầu từ đầu mỗi lần. 

Giai Đoạn Tiếp Theo Được Chiến Thắng Tại Lớp Đánh Giá

Ưu thế cạnh tranh thực sự trong ngành công nghiệp insights là ai có thể nhất quán tin tưởng vào những gì họ sản xuất. Niềm tin đó đến từ việc biết nơi một đầu ra đến từ, ai đã xem xét nó, và những gì xảy ra khi có điều gì đó sai. Lịch sử gần đây đã trả lời câu hỏi về mô hình; cơ sở hạ tầng tổ chức để triển khai mô hình một cách có trách nhiệm ở quy mô là nơi ngành công nghiệp vẫn đang theo kịp. 

Sự thật rằng 92% chuyên gia insights đã thấy nội dung AI không được xem xét đã đến lãnh đạo cấp cao không phải là một thất bại công nghệ. Đó là một thất bại thiết kế tổ chức, và nó xuất hiện trên các ngành công nghiệp bất cứ nơi nào tốc độ đã được tối ưu hóa và đánh giá đã được coi là một chi phí. Công ty có mô hình thông minh nhất sẽ không thắng giai đoạn tiếp theo của trí tuệ nhân tạo doanh nghiệp, nhưng công ty có kiến trúc đánh giá đáng tin cậy nhất xung quanh nó sẽ. 

Aneesh Dhawan là đồng sáng lập và CEO của Knit, Cơ quan Nghiên cứu AI-Native. Ông đã dành 5 năm qua tại giao điểm của AI doanh nghiệp và phương pháp nghiên cứu. Knit làm việc với các tổ chức bao gồm Google, Amazon, T-Mobile và ESPN để cung cấp thông tin sẵn sàng quyết định với tốc độ AI.