Mô hình và nền tảng AI

Trưởng nhóm nghiên cứu Amazon Alexa cho rằng thử nghiệm Turing đã lỗi thời

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Rohit Prasad, Phó Chủ tịch và trưởng nhóm nghiên cứu của Alexa tại Amazon (AMZN ), đã lập luận gần đây rằng thử nghiệm Turing, đã được sử dụng trong nhiều năm để đo lường sự tinh vi của các mô hình AI, nên được nghỉ hưu như một tiêu chuẩn cho AI.

Nhà khoa học máy tính và toán học Alan Turing ban đầu đã giới thiệu khái niệm về thử nghiệm Turing hơn 70 năm trước. Mục đích của thử nghiệm Turing là giúp trả lời câu hỏi về trí thông minh của máy, xác định xem một máy có thể “nghĩ” theo nghĩa của con người hay không. Để trả lời câu hỏi này, Turing lập luận rằng nếu máy có thể thể hiện hành vi trò chuyện tinh vi đến mức một người quan sát không thể phân biệt giữa cuộc trò chuyện của máy tính và cuộc trò chuyện của con người, thì máy nên được coi là có khả năng nghĩ.

Giới hạn của thử nghiệm Turing

Prasad lập luận rằng thử nghiệm Turing bị giới hạn ở nhiều cách và rằng chính Turing cũng đã đề cập đến một số hạn chế trong bài báo ban đầu của mình. Khi AI trở nên tích hợp vào mọi khía cạnh của cuộc sống, mọi người quan tâm ít hơn đến việc AI không thể phân biệt được với con người và nhiều hơn đến việc tương tác của họ với AI là liền mạch, Prasad lập luận. Vì lý do này, thử nghiệm Turing nên được coi là lỗi thời và thay thế bằng các tiêu chuẩn mới hữu ích hơn.

Prasad lưu ý rằng nhiều rô-bốt trò chuyện đầu tiên được thiết kế với mục đích vượt qua thử nghiệm Turing, và trong những năm gần đây, một số rô-bốt đã liên tục thành công trong việc đánh lừa hơn một phần ba các thẩm phán con người (ngưỡng cần thiết để vượt qua thử nghiệm Turing). Tuy nhiên, việc có thể thành công trong việc bắt chước các mẫu ngôn ngữ của con người không có nghĩa là một máy có thể thực sự được coi là “thông minh”. Các mô hình AI có thể cực kỳ giỏi trong một lĩnh vực và cực kỳ thiếu trong các lĩnh vực khác, không có hình thức trí thông minh chung. Mặc dù vậy, thử nghiệm Turing vẫn là một tiêu chuẩn thường được sử dụng cho rô-bốt trò chuyện và trợ lý kỹ thuật số, với Prasad lưu ý rằng các nhà lãnh đạo kinh doanh và nhà báo liên tục hỏi khi nào Alexa sẽ có khả năng vượt qua thử nghiệm Turing.

Theo Prasad, một trong những vấn đề chính với việc sử dụng thử nghiệm Turing để đánh giá trí thông minh của máy là nó gần như hoàn toàn không tính đến khả năng của máy trong việc tìm kiếm thông tin và thực hiện các phép tính nhanh chóng. Các chương trình AI tiêm các khoảng thời gian nhân tạo vào phản hồi đối với các câu hỏi toán học và địa lý phức tạp để đánh lừa con người, nhưng chúng có câu trả lời cho các câu hỏi như vậy gần như ngay lập tức. Ngoài ra, thử nghiệm Turing không tính đến khả năng ngày càng tăng của AI trong việc sử dụng dữ liệu thu thập được từ các cảm biến bên ngoài, bỏ qua cách các AI có thể tương tác với thế giới xung quanh thông qua các thuật toán thị giác và chuyển động, chỉ dựa vào giao tiếp văn bản.

Tạo ra các tiêu chuẩn mới

Prasad lập luận rằng các hình thức đo lường trí thông minh mới nên được tạo ra, các phương pháp phù hợp hơn để đánh giá một loại trí thông minh chung. Các thử nghiệm này nên phản ánh cách AI được sử dụng trong xã hội hiện đại và mục tiêu của con người khi sử dụng nó. Các thử nghiệm nên có thể xác định xem một AI có thể tăng cường trí thông minh của con người và cải thiện cuộc sống hàng ngày của con người như thế nào. Hơn nữa, một thử nghiệm nên hiểu cách một AI thể hiện các đặc điểm thông minh giống con người, bao gồm năng lực ngôn ngữ, tự giám sát và “trí thông minh chung”.

Các lĩnh vực nghiên cứu AI hiện tại và quan trọng, như lý luận, công bằng, trò chuyện và hiểu biết cảm giác, không được đánh giá bởi thử nghiệm Turing, nhưng chúng có thể được đo lường theo nhiều cách. Prasad giải thích rằng một cách để đo lường các đặc điểm thông minh này là bằng cách chia các thách thức thành các nhiệm vụ thành phần. Một phương pháp khác để đánh giá là tạo ra một thách thức thực tế lớn cho tương tác giữa con người và máy tính.

Khi Amazon tạo ra Alexa Prize, nó đã tạo ra một tiêu chí yêu cầu các rô-bốt xã hội phải trò chuyện với con người trong 20 phút. Các rô-bốt sẽ được đánh giá dựa trên khả năng trò chuyện hợp lý về một loạt các chủ đề như công nghệ, thể thao, chính trị và giải trí. Khách hàng chịu trách nhiệm chấm điểm cho các rô-bốt trong giai đoạn phát triển, dựa trên mong muốn trò chuyện lại với rô-bốt. Trong vòng cuối, các thẩm phán độc lập chịu trách nhiệm chấm điểm cho các rô-bốt bằng thang điểm 5 điểm. Tiêu chí được các thẩm phán sử dụng dựa trên các phương pháp cho phép các AI thể hiện các thuộc tính quan trọng của con người như đồng cảm khi cần thiết.

Cuối cùng, Prasad lập luận rằng sự phổ biến ngày càng tăng của các thiết bị AI như Alexa đại diện cho một cơ hội quan trọng để đo lường tiến bộ của AI, nhưng chúng ta sẽ cần các chỉ số khác để tận dụng cơ hội mới này.

“Các AI như vậy cần phải là chuyên gia trong một số lượng lớn các nhiệm vụ, điều này chỉ có thể xảy ra với khả năng học tập tổng quát hơn thay vì trí thông minh cụ thể cho từng nhiệm vụ,” Prasad giải thích. “Do đó, trong thập kỷ tới và hơn thế nữa, tiện ích của các dịch vụ AI, với khả năng hỗ trợ trò chuyện và chủ động trên các thiết bị xung quanh, là một thử nghiệm xứng đáng.”

Blogger và lập trình viên với chuyên môn về Machine Learning Deep Learning topics. Daniel hy vọng giúp đỡ người khác sử dụng sức mạnh của AI cho lợi ích xã hội.