AGI và AI tương lai
Kiểm tra Turing là gì và Tại sao nó lại quan trọng?
Kiểm tra Turing xuất phát từ bài báo năm 1950 của Alan Turing “Computing Machinery and Intelligence”. Thay vì cố gắng định nghĩa suy nghĩ, Turing đề xuất một trò chơi bắt chước: một người thẩm vấn con người trao đổi tin nhắn viết với các người tham gia không nhìn thấy và đánh giá ai là con người và ai là máy.
Kiểm tra vẫn có ảnh hưởng vì nó biến một câu hỏi triết học trừu tượng thành một tương tác có thể quan sát được. Tuy nhiên nó cũng có hạn chế: việc trông giống con người trong một cuộc trò chuyện không đồng nghĩa với việc thật thà, có hiểu biết, an toàn, có ý thức hoặc thông minh nói chung.
Những điểm chính
- Trò chơi bắt chước gốc của Turing là một bài kiểm tra hành vi dựa trên văn bản, không phải danh sách kiểm tra các thuộc tính nhận thức nội tại.
- Kết quả phụ thuộc vào người đánh giá, đề bài, thời lượng, hướng dẫn cho người tham gia và quy tắc chấm điểm.
- Một mô hình có thể bắt chước cuộc trò chuyện của con người trong khi tạo ra thông tin sai lệch hoặc không vượt qua các bài kiểm tra độ bền đơn giản.
- Đánh giá hiện đại cần các chỉ số nhiệm vụ, kiểm tra đối kháng, đánh giá của con người và bằng chứng cụ thể về rủi ro bên cạnh việc trò chuyện.

Trò chơi bắt chước của Turing
Trong cấu hình gốc, người thẩm vấn giao tiếp từ xa để giọng nói và ngoại hình không tiết lộ danh tính. Turing đặt câu hỏi liệu một máy có thể thực hiện tốt đủ trong trò chơi để người đánh giá không thể phân biệt một cách đáng tin cậy nó với một con người hay không.
Cách khung hoạt động này tránh việc phải đưa ra một định nghĩa duy nhất về suy nghĩ. Nó không khẳng định rằng mọi cuộc trao đổi thuyết phục đều chứng minh trí thông minh, cũng không xác định một ngưỡng vượt qua chung áp dụng cho bất kỳ màn trình diễn chatbot nào sau này.
Kết quả thực tế đo lường gì
Một thử nghiệm đo lường mức độ không thể phân biệt hành vi dưới các điều kiện đã định. Các cuộc trò chuyện ngắn, người đánh giá thiếu kinh nghiệm hoặc đề bài do người xây dựng hệ thống chọn có thể làm cho nhiệm vụ trở nên dễ dàng hơn. Báo cáo nghiêm túc nên công khai cách chọn bản ghi, số lượng và nền tảng của các giám khảo, nhóm người so sánh, thời gian giới hạn và phương pháp thống kê.
Một hệ thống cũng có thể lợi dụng các kỳ vọng: tránh né, hài hước, lỗi chính tả và nhập vai có thể khiến nó trông giống con người mà không chứng minh khả năng suy luận đáng tin cậy. Ngược lại, một phản hồi của con người quá trang trọng có thể bị phân loại nhầm là do máy tạo ra.
Kiểm tra Turing không thiết lập gì
Kiểm tra không đo lường trực tiếp ý thức, trải nghiệm chủ quan, độ chính xác thực tế, hiểu biết nguyên nhân hay khả năng đạo đức. Nó không tiết lộ dữ liệu đào tạo, kiến trúc mô hình hay các chế độ thất bại ngoài cuộc trò chuyện. Nó cũng cung cấp ít thông tin về trí thông minh phi ngôn ngữ như khả năng thao tác vật lý.
Các hệ thống ngôn ngữ hiện đại được xây dựng bằng mạng nơ-ron transformer và học sâu, nhưng các đầu ra lưu loát của chúng vẫn có thể được tạo ra từ cấu trúc thống kê đã học thay vì một mô hình thế giới đã được xác minh.
Cách đánh giá AI hiện đại mở rộng câu hỏi
Đánh giá hiện đại sử dụng các bộ nhiệm vụ giữ lại, độ không chắc được hiệu chuẩn, các bài kiểm tra độ bền, red teaming, kiểm tra tính thực tế và nghiên cứu sở thích của con người. Một chỉ số phân loại văn bản có thể kiểm tra một hành vi đã định, trong khi đánh giá dựa trên kịch bản có thể kiểm tra liệu hệ thống có tuân theo chính sách trong áp lực hay không.
Không có một chuẩn đoán duy nhất nào bao quát mọi triển khai. Sự nhiễm bẩn của bài kiểm tra có thể làm tăng điểm số, và các chuẩn tĩnh khuyến khích overfitting. Đánh giá nên được lặp lại khi mô hình, dữ liệu, đề bài, công cụ và nhóm người dùng thay đổi.
Tại sao kiểm tra này vẫn còn quan trọng
Kiểm tra Turing đã dự đoán một bài học cốt lõi của đánh giá AI: đánh giá khả năng có thể quan sát được thay vì dựa vào các tuyên bố về bản chất nội tại. Nó cũng buộc chúng ta phải hỏi hành vi con người nào được xem là bằng chứng và cách thiết lập thực nghiệm ảnh hưởng đến kết luận như thế nào.
Cách sử dụng hiện đại tốt nhất của nó là làm nền tảng lịch sử và khái niệm. Việc vượt qua trò chơi bắt chước có thể thú vị, nhưng các quyết định triển khai đòi hỏi bằng chứng liên quan đến nhiệm vụ thực tế, người dùng bị ảnh hưởng và các tổn hại có thể dự đoán được.
Kiểm tra Turing đo lường gì
Trò chơi bắt chước của Alan Turing đặt câu hỏi liệu một người thẩm vấn giao tiếp qua văn bản có thể phân biệt một cách đáng tin cậy máy móc với con người hay không. Nó đã chuyển đổi cuộc tranh luận trừu tượng về việc máy móc có suy nghĩ hay không thành một thí nghiệm đối thoại có thể quan sát. Kiểm tra phụ thuộc vào người tham gia, thời lượng, giao thức, chủ đề và quy tắc đánh giá; không có một điểm số chung duy nhất. Vượt qua nghĩa là tạo ra các phản hồi giống người trong cấu hình đó. Nó không đo lường trực tiếp độ chính xác thực tế, lập luận, ý thức, tự chủ, nhận thức, hiện thân, độ tin cậy, hay hành vi có lợi trong thế giới thực.
Việc bắt chước con người có thể thưởng cho sự tránh né, nhân cách, lỗi, hài hước hoặc thao túng. Một giám khảo có thể nhầm lẫn con người với máy hoặc bị ảnh hưởng bởi kỳ vọng, ngôn ngữ và bối cảnh văn hoá. Các cuộc trò chuyện ngắn cho phép các mánh khóe nhưng sẽ thất bại khi tương tác kéo dài. Ngược lại, một hệ thống cực kỳ hữu ích cho toán học, dịch thuật hoặc mô hình protein có thể thất bại vì không giả vờ là con người. Do đó, kiểm tra đo lường khả năng xã hội và ngôn ngữ được định hình bởi người đánh giá, chứ không phải một thứ tự hoàn chỉnh của trí thông minh.
Mô hình ngôn ngữ hiện đại và đánh giá mạnh mẽ hơn
Các mô hình ngôn ngữ lớn có thể duy trì đối thoại lưu loát bằng cách dự đoán chuỗi dựa trên dữ liệu đào tạo rộng và tinh chỉnh sau này, nhưng sự lưu loát là bằng chứng yếu cho sự thật hay hiểu biết. Các mẫu đã ghi nhớ, quyền truy cập công cụ, gợi ý ẩn, độ trễ và cài đặt mẫu ảnh hưởng đến kết quả. Đánh giá có kiểm soát nên công khai mô hình và giao thức, ngăn chặn rò rỉ thông tin, bao gồm các câu hỏi đối kháng và chuyên ngành, và chấm điểm độ không chắc và trích dẫn. Một minh chứng được chọn từ các cuộc trò chuyện thành công không thể ước tính độ tin cậy trên toàn bộ phân phối sử dụng.
Đánh giá hiện đại là đa chiều: độ chính xác nhiệm vụ, hiệu chuẩn, độ bền, tính nhất quán dài hạn, an toàn, thiên vị, riêng tư, bảo mật, hiệu suất và kết quả cho con người. Các bài kiểm tra hành vi nên được bổ sung bằng bằng chứng quy trình, red teaming, chuẩn đoán có thể tái tạo và giám sát thực tế. Các chuẩn đoán có thể bão hòa hoặc xuất hiện trong dữ liệu đào tạo, vì vậy cần các bộ kiểm tra riêng tư và được làm mới. Đối với các hệ thống thực thi hành động, cần đánh giá quyền công cụ, khả năng phục hồi và hậu quả riêng biệt so với chất lượng đối thoại.
Tại sao kiểm tra này vẫn còn quan trọng
Kiểm tra Turing vẫn quan trọng về mặt lịch sử vì nó tập trung vào hành vi và khó khăn trong việc định nghĩa trí thông minh. Nó cũng đặt ra các câu hỏi liên tục về nhân hoá và lừa dối. Giao diện nên xác định các tác nhân tổng hợp thay vì coi việc nhận dạng sai là thành công, đặc biệt trong các bối cảnh có hậu quả. Hãy sử dụng kiểm tra như một lăng kính triết học và một đánh giá đối thoại, không phải là chứng nhận trí thông minh tổng quát hay nhân cách. Câu hỏi quan trọng khi triển khai là hệ thống có thể làm gì một cách đáng tin cậy, dựa trên bằng chứng và giới hạn nào, và ai chịu trách nhiệm khi nó thất bại.
Ví dụ thực tế: một đánh giá đối thoại có kiểm soát
Các nhà đánh giá so sánh con người và một số hệ thống AI trong các cuộc trò chuyện văn bản với thời lượng, chủ đề, ngôn ngữ và danh tính được che giấu cố định. Các giám khảo ghi lại liệu họ tin mỗi người tham gia là con người và đồng thời chấm điểm tính thực tế, tính nhất quán, sự hữu ích, độ không chắc và khả năng thao túng. Nhiều giám khảo và nhiều cuộc trò chuyện giúp ước tính sự biến thiên, và giao thức ngăn các nhà phát triển mô hình chọn các bản ghi thuận lợi. Việc phân loại sai con người cung cấp một nền tảng cần thiết để giải thích kết quả.
Một hệ thống lừa giám khảo nhưng bịa ra các sự kiện không được công nhận là thông minh chung, trong khi một mô hình chuyên gia được công khai rõ ràng có thể rất hữu ích dù không vượt qua việc bắt chước. Kết quả bao gồm đề bài, mô hình, bộ tạo mẫu, quyền truy cập công cụ và đặc điểm của giám khảo. Thí nghiệm được đặt khung như một bài kiểm tra đối thoại giống con người. Các quyết định triển khai sử dụng bằng chứng riêng cho độ đúng của nhiệm vụ, an toàn, riêng tư và phục hồi, và giao diện xác định tác nhân thay vì biến sự lừa dối thành mục tiêu sản phẩm.
Bằng chứng thực thi và khả năng vận hành
Một quyết định triển khai cần nhiều hơn một minh chứng thành công. Xác định người dùng mục tiêu, môi trường vận hành, đầu vào, đầu ra, các phụ thuộc, chủ sở hữu và hậu quả của mỗi lỗi quan trọng. Thiết lập nền tảng có thể tái tạo và bộ đánh giá có phiên bản trước khi tinh chỉnh. Kiểm tra các trường hợp thường, điều kiện biên, đầu vào sai dạng hoặc thiếu, sự dịch chuyển phân phối, mất kết nối phụ thuộc, lạm dụng, và các nhóm hoặc môi trường có khả năng bị bỏ lại phía sau. Đo lường chất lượng nhiệm vụ cùng với hiệu chuẩn hoặc độ không chắc, độ trễ, thông lượng, chi phí tài nguyên, khả năng tiếp cận, riêng tư và bảo mật. Ghi lại mọi chuyển đổi và ngưỡng để một người đánh giá độc lập có thể tái tạo kết quả và phân biệt bằng chứng với một nguyên mẫu hấp dẫn.
Trước khi ra mắt, chỉ định quyền chịu trách nhiệm cho việc phát hành, ngoại lệ, thay đổi, quay lại và ngừng sử dụng. Sử dụng triển khai theo giai đoạn, duy trì một phương án dự phòng an toàn, và xác minh giám sát bằng cách cố tình đưa vào các lỗi. Dữ liệu đo lường hoạt động nên tiết lộ chất lượng đầu vào, hành vi đầu ra, phiên bản mô hình hoặc quy tắc, tình trạng phụ thuộc, can thiệp của con người và kết quả đã xác nhận mà không thu thập dữ liệu nhạy cảm không cần thiết. Xác định ngưỡng cảnh báo và người chịu trách nhiệm phản hồi, sau đó xem xét bằng chứng thực tế sau khi triển khai thay vì giả định hiệu suất ngoại tuyến sẽ kéo dài. Đánh giá lại mỗi khi nguồn dữ liệu, người dùng, mô hình, nhà cung cấp, chính sách, phần cứng hoặc mục tiêu thay đổi. Một hệ thống được duy trì cũng cần có quy trình phục hồi, học từ sự cố, xóa và lưu trữ tài liệu, và một điểm rõ ràng khi nó nên được vô hiệu hoá hoặc thay thế.
Câu hỏi thường gặp
Có AI nào chắc chắn đã vượt qua kiểm tra Turing không?
Không có một cơ quan kiểm tra chính thức duy nhất hay giao thức được chấp nhận rộng rãi. Các buổi trình diễn công khai sử dụng các quy tắc khác nhau, vì vậy các tuyên bố “đã vượt qua” không thể so sánh trực tiếp.
Thất bại trong kiểm tra có chứng minh hệ thống không thông minh không?
Không. Một hệ thống chuyên biệt có thể rất mạnh mẽ mà không cần bắt chước phong cách đối thoại của con người.












