Lãnh đạo tư tưởng
Phù hợp Nhiệm vụ vs. Phù hợp Con người: Tại sao Thước đo Tiếp theo của AI Nên là Con người

Mỗi vài tháng, một mô hình mới xuất hiện và làm thay đổi bảng xếp hạng AI. Theo Báo cáo AI Index 2026 của Stanford, các mô hình tiên tiến đã tăng khoảng 30 điểm phần trăm trong một năm duy nhất trên Humanity’s Last Exam, một tiêu chuẩn được tạo ra đặc biệt để khó khăn đối với AI. Những bước nhảy mà trước đây mất nhiều năm giờ chỉ mất vài tháng, và ngành công nghiệp coi mỗi điểm cao mới như bằng chứng cho thấy AI đang ngày càng tốt hơn.
Tôi không phủ nhận tiến bộ. Những hệ thống này thật đáng chú ý trong những gì chúng được xây dựng để làm. Nhưng tôi đã dành gần hai thập kỷ trong lĩnh vực tâm lý học trước khi chuyển sang AI, và tôi luôn quay lại một câu hỏi mà không tiêu chuẩn nào trả lời được. Chính xác mô hình đang cải thiện gì, và dành cho ai? Một mô hình có thể đứng đầu mọi bảng xếp hạng dựa trên độ chính xác, nhưng vẫn để người dùng gặp khó khăn ở một số khía cạnh. Không có bài kiểm tra nào đo lường tác động của AI lên người dùng, và điều này xứng đáng được chú ý hơn.
Hai Kiểu Căn chỉnh Khác nhau
Ngành AI luôn nói về việc căn chỉnh, nhưng cuộc trò chuyện thường xoay quanh việc mô hình có tuân theo hướng dẫn một cách chính xác hay không, hoặc liệu nó có tạo ra nội dung gây hại hay không. Đó là AI căn chỉnh theo nhiệm vụ. Nó được tối ưu để hoàn thành yêu cầu trước mắt, một cách chính xác và hiệu quả.
Tuy nhiên, còn một cách tiếp cận khác để căn chỉnh và bảo vệ con người. AI căn chỉnh theo con người đánh giá tác động của một tương tác lên người ở phía bên kia màn hình sau khi cuộc trò chuyện kết thúc. Liệu họ có rời đi với khả năng tự xử lý quyết định khó khăn tiếp theo tốt hơn, hay phụ thuộc nhiều hơn vào hệ thống để thực hiện? Trong khi căn chỉnh theo nhiệm vụ đo lường đầu ra, căn chỉnh theo con người đo lường hậu quả.
Những Điều Bảng Xếp Hạng Không Thể Hiện
Những tiêu chuẩn được trích dẫn nhiều nhất trong ngành kiểm tra các kỹ năng như toán học cạnh tranh và lập trình quy mô lớn. Đó là những kỹ năng có giá trị, nhưng mỗi câu hỏi đều có một đáp án đúng, và các mô hình được xây dựng để tìm ra đáp án đó.
Điều này hoạt động tốt với các vấn đề khách quan, nhưng con người sử dụng AI cho nhiều hơn chỉ toán học, lập trình và nghiên cứu cơ bản. Họ đặt câu hỏi về lộ trình sự nghiệp và đang cố gắng giải quyết các cuộc trò chuyện khó khăn với người bạn đời. Không có bài kiểm tra nào chấm điểm mô hình dựa trên việc chúng xử lý những câu hỏi như vậy, vì không có sự thật khách quan để so sánh. Thông tin liên quan nằm trong người hỏi. Dù đề bài có chi tiết đến đâu, mô hình cũng không thể truy cập được.
AI Có Trách Nhiệm lấp đầy một phần khoảng trống mà các tiêu chuẩn để lại, nhưng ngay cả công việc đó cũng chỉ nhằm giảm thiểu hại chứ không phải nâng cao tư duy con người. Các biện pháp an toàn hiện tại nhằm ngăn mô hình giúp đỡ trong những việc nguy hiểm. Chúng không xem xét liệu hàng ngàn cuộc trò chuyện bình thường vượt qua mọi kiểm tra an toàn có đồng thời khiến con người tin tưởng vào phán đoán của mình ít hơn không.
Các Mô Hình Tạo Ra Sự Phụ Thuộc
Mỗi mô hình tôi thử nghiệm đều có xu hướng toàn diện, nhanh chóng và tự tin. Đó là những gì chúng được thưởng trong quá trình huấn luyện, và là phản xạ đúng đắn khi đối mặt với một bản dựng phần mềm bị hỏng hoặc thời hạn nộp hồ sơ pháp lý. Khi quyết định phụ thuộc vào giá trị và lịch sử của một người, cùng một phản xạ có thể trở nên phản tác dụng đối với người dùng.
Nghiên cứu đã chứng minh đây không chỉ là giả thuyết. OpenAI và MIT Media Lab đã thực hiện một cặp nghiên cứu về việc sử dụng cảm xúc của ChatGPT và phát hiện rằng những người xem AI như một người bạn và sử dụng nó trong thời gian dài hơn có xu hướng báo cáo các kết quả tiêu cực, bao gồm cảm giác cô đơn và phụ thuộc cảm xúc cao hơn, một mô hình cũng được MIT Technology Review đề cập. Riêng biệt, một nghiên cứu năm 2025 được công bố trên tạp chí Societies phát hiện mối tương quan tiêu cực đáng kể giữa việc sử dụng thường xuyên công cụ AI và điểm số tư duy phản biện. Điều này được trung gian bởi cái mà các nhà nghiên cứu gọi là “giảm tải nhận thức”, tức là xu hướng giao một nhiệm vụ tinh thần cho công cụ thay vì tự mình giải quyết.
Điều này không có nghĩa là mọi người nên giảm việc sử dụng AI. Ngược lại, chúng ta cần nhận ra rằng khi một hệ thống giải quyết mọi loại câu hỏi theo cùng một cách, một phần nào đó trên khía cạnh chủ quan của “sổ sách” sẽ bị mất, và hiện tại hầu như không ai đang theo dõi sự mất mát đó.
Cho Các Câu Trả Lời Trực Tiếp Được Đánh Giá Đúng Đắn
Tôi muốn làm rõ nơi mà AI căn chỉnh theo nhiệm vụ là phù hợp, vì mục đích của bài viết này không phải để biện hộ cho một mô hình cố gắng đáp ứng mọi thứ. Nếu ai đó hỏi về lỗi máy chủ hay thời hạn khai thuế, một câu trả lời nhanh, trực tiếp và có thẩm quyền sẽ rất hữu ích. Sẽ không có lợi nếu AI phản hồi bằng một câu hỏi mở. Vấn đề xuất hiện khi chúng ta áp dụng cùng một phản xạ này cho một đề bài cân nhắc ly hôn như chúng ta làm cho một đề bài gỡ lỗi mã.
Những Điều Chúng Ta Nên Đo Thay Thế
Kiềm chế. Khả năng nhận ra một khoảnh khắc mà việc giải quyết câu hỏi cho người dùng gây hại hơn lợi, và biết kiềm chế phù hợp.
Đặt câu hỏi có cân nhắc. Hỏi thay vì nói, khi một vấn đề mang tính chủ quan hoặc liên quan đến danh tính và giá trị cá nhân hơn là một sự thật có trong cơ sở dữ liệu.
Đọc hiểu thời điểm. Phân biệt yêu cầu cần một câu trả lời trực tiếp, toàn diện với yêu cầu cần không gian để người dùng tự suy ngẫm.
Nghiên cứu của Albert Bandura về tự hiệu quả đã chỉ ra rằng con người xây dựng sự tự tin thông qua những trải nghiệm thành công của chính mình, chứ không phải bằng cách quan sát người khác, hay một thứ gì đó khác giải quyết vấn đề thay họ. Nguyên tắc này đã tồn tại hơn nửa thế kỷ trước AI và nên được tích hợp vào cách chúng ta thiết kế và đánh giá công nghệ.
Tiến Bộ Nên Nghĩa Gì Tiếp Theo
Không có gì ở đây nói rằng chúng ta nên làm chậm lại tiến trình kỹ thuật. Tôi chúc mừng những bước tiến trong lập trình và suy luận. Nhưng một bảng điểm chỉ dựa trên hoàn thành nhiệm vụ cho chúng ta biết AI đang thông minh hơn, mà không cho biết liệu những người sử dụng nó có trở nên giỏi hơn trong việc tự suy nghĩ hay không.
Tôi muốn thấy sự thay đổi đó. Khi các hệ thống trở nên mạnh mẽ hơn, những người sử dụng chúng cũng nên trở nên mạnh mẽ hơn. Chúng ta đã chứng minh AI có thể vượt trội hơn chúng ta trong một bài kiểm tra. Bài kiểm tra tiếp theo nên đánh giá liệu nó có thể giúp chúng ta suy nghĩ tốt hơn lâu dài sau khi cuộc trò chuyện kết thúc.












