Góc nhìn Anderson
Lý do chuỗi suy nghĩ trong các mô hình ngôn ngữ lớn chỉ là ‘trang trí’

Nghiên cứu mới cung cấp một cách dễ dàng để xác định rằng những giải thích từng bước được đánh bóng của tất cả các mô hình ngôn ngữ AI hàng đầu hiện nay – bao gồm ChatGPT và Claude – chỉ là ‘trang trí’, và thường được tạo ra sau khi AI đã quyết định câu trả lời.
Năm ngoái, một loạt các nghiên cứu có ảnh hưởng cao từ các công ty đối mặt với AI, bao gồm Anthropic và Apple, cho thấy rằng những mô hình AI được gọi là ‘hệ thống suy nghĩ’ thường tạo ra các giải thích từng bước mà không phản ánh những gì thực sự thông báo cho câu trả lời của chúng.
Vì nhiều lý do, cuộc tranh luận sớm suy thoái thành các phản hồi đầy rẫy và các giải thích đa dạng (bao gồm trên trang web này), để lại câu hỏi chưa được giải quyết về việc liệu chuỗi suy nghĩ (CoT) chỉ là một thứ trang trí được thiết kế để an ủi người dùng cuối, hay bằng chứng của một quá trình suy nghĩ thực sự.

ChatGPT ‘shows its work’ – nhưng nó đã quyết định câu trả lời chưa?
Hiển thị và Kể
Bây giờ, một bài báo mới từ Ấn Độ đang cung cấp một phương pháp rẻ và dễ dàng để đo lường xem những ‘hình ảnh suy nghĩ’ ấn tượng trong các giao diện của ChatGPT và các mô hình ngôn ngữ lớn khác (LLM) thực sự chỉ ra rằng AI đang làm việc thông qua các bước để đi đến một kết luận.
Nghiên cứu mới này đến từ hai nhà nghiên cứu tại Viện Công nghệ Thông tin Allahabad (IIITA) ở Allahabad, và Viện Điện tử và Thông tin Quốc gia (NIELIT) ở Delhi.
Các tác giả đã phát hiện ra rằng trong hầu hết các trường hợp, trên một phạm vi đáng kể của các mô hình LLM độc quyền và mã nguồn mở, chuỗi suy nghĩ được trình bày cho người dùng là ‘trang trí’, được tạo ra sau khi AI đã kết luận câu trả lời mà nó sẽ trình bày.
Khi kiểm tra các mô hình như ChatGPT5.4, Claude Opus 4.6-R và DeepSeek-V3.2, các tác giả đã phát hiện ra rằng việc loại bỏ bất kỳ bước nào trong 10-15 bước CoT được trình bày thực sự thay đổi câu trả lời ít hơn 17% thời gian, và rằng bất kỳ bước nào alone là đủ để khôi phục câu trả lời đúng.
Các tác giả tuyên bố*:
‘Các khuôn khổ quy định cho AI trong chăm sóc sức khỏe, tài chính và luật pháp ngày càng yêu cầu “giải thích được” [hệ thống]. Kết quả của chúng tôi cho thấy rằng cách tiếp cận tiêu chuẩn – yêu cầu mô hình hiển thị công việc của nó – cung cấp một ảo giác về tính minh bạch.
‘Các giải thích là trôi chảy, phù hợp với lĩnh vực và sai trong một cách tinh tế: chúng mô tả quá trình suy nghĩ mà mô hình không thực hiện.
‘Một mô hình AI y tế viết “eosinophilia gợi ý một quá trình tắc nghẽn” không nhất thiết đã xem xét eosinophilia. Nó có thể đã khớp mẫu từ phần thân câu hỏi đến câu trả lời và tạo ra lý do sau đó.
‘Theo Đạo luật AI của EU (Điều 13), một hệ thống AI có rủi ro cao phải cung cấp “thông tin có ý nghĩa về logic được tham gia.” Kết quả của chúng tôi cho thấy rằng các giải thích chuỗi suy nghĩ từ hầu hết các mô hình tiên phong không đáp ứng tiêu chuẩn này–“logic được tham gia” trong việc đạt được câu trả lời không phải là logic được mô tả trong giải thích.’
Các tác giả quan sát rằng hai trong số các mô hình nhỏ hơn được thử nghiệm đã phá vỡ mẫu thông thường của sự gian dối, nhưng chỉ trong những hoàn cảnh rất cụ thể: MiniMax-M25 đã chứng minh sự phụ thuộc thực sự vào từng bước khi đối mặt với phân tích cảm xúc, trong khi Kimi-K25 đã thể hiện sự phụ thuộc thực sự vào 39% vào quá trình CoT – nhưng chỉ khi đối mặt với phân loại chủ đề.
Trong tất cả các trường hợp khác, giống như các mô hình lớn và nổi tiếng hơn, các bước suy nghĩ được trình bày dường như hoàn toàn là biểu diễn, với các mô hình thay vào đó sử dụng các捷径.
Các Mô hình Nhỏ Cố Gắng Hơn
Ngoài 10 mô hình API được thử nghiệm, các tác giả cũng đã thử nghiệm một số mô hình mã nguồn mở nhỏ hơn†, dao động từ 0,8 đến 8 tỷ tham số (đây là một mức độ khiêm tốn những ngày này), và phát hiện ra rằng những mô hình AI nhỏ hơn này thực sự suy nghĩ, và rằng CoT chúng hiển thị thường là – mặc dù không phải lúc nào – cần thiết để đạt được các kết luận hữu ích và chính xác.
Các mô hình nhỏ hơn đã chứng minh sự cần thiết 55% cho việc suy nghĩ từng bước, so với mức trung bình 11% cần thiết trên các mô hình lớn hơn, mà các tác giả khẳng định, ‘đã học cách bỏ qua hoàn toàn việc suy nghĩ đa bước, đạt được câu trả lời chính xác thông qua các捷径 nội bộ mà lý do viết của chúng không phản ánh’.
Các tác giả cho rằng càng tốt một mô hình thực hiện một nhiệm vụ, càng ít nó đòi hỏi các bước suy nghĩ (mặc dù đây là một cách diễn đạt ngoại giao hơn về khái niệm từ bỏ phân tích hợp lý để ủng hộ bất kỳ câu trả lời nào mạnh nhất trong phân phối dữ liệu đào tạo)††:
‘Các mô hình nhỏ suy nghĩ trung thực về toán học vì họ phải—họ thiếu kiến thức tham số để bỏ qua.
‘Các mô hình tiên phong đã nội hóa đủ các mẫu toán học mà chuỗi suy nghĩ rõ ràng trở nên thừa. CoT vẫn cải thiện độ chính xác (bằng cách cấu trúc việc tạo ra), nhưng các bước riêng lẻ không còn mang thông tin duy nhất.’
Phương pháp
Phương pháp được sử dụng để kiểm tra các mô hình dựa trên ba tiêu chí:
Cần thiết loại bỏ mỗi bước CoT một lần, và sau đó kiểm tra xem câu trả lời có thay đổi hay không. Bất kỳ bước nào mà việc loại bỏ nó thay đổi kết quả được tính là ‘cần thiết’; Đủ điều kiện cô lập mỗi bước, và kiểm tra xem nó có thể khôi phục câu trả lời một mình, với bất kỳ bước nào được tính là đủ; và Độ nhạy về thứ tự xáo trộn các bước, và quan sát xem câu trả lời có thay đổi (vì suy nghĩ thực sự nên phụ thuộc vào trình tự chứ không phải từ khóa).
Khi kết hợp lại, sự cần thiết cao và độ đủ điều kiện thấp cho thấy suy nghĩ thực sự từng bước, trong khi thấp cần thiết và cao đủ điều kiện cho thấy các giải thích có thể bị loại bỏ, sắp xếp lại hoặc giảm mà không ảnh hưởng đến kết quả.
Các tác giả lưu ý rằng phương pháp này loại bỏ bất kỳ nhu cầu nào về quyền truy cập mô hình trắng, vì nó có thể được thực hiện với chỉ một vài đô la trên các mô hình API chỉ, như ChatGPT và Claude, và, tự nhiên, cũng thành công trên các mô hình mã nguồn mở có thể được cài đặt cục bộ.
Họ lưu ý rằng các nghiên cứu trước đây đã sử dụng các mô hình mã nguồn mở cho phép phân tích nội bộ, hoặc sử dụng các câu trả lời đơn giản hơn, yes/no mà tiết lộ ít hơn về các quá trình suy nghĩ nội bộ của mô hình API.
Chi Phí Tối Thiểu
Các tác giả định nghĩa suy nghĩ thực sự thông qua cần thiết và đủ điều kiện, với sự cần thiết cao và đủ điều kiện thấp cho thấy rằng mỗi bước mang trọng lượng duy nhất. Ngược lại, suy nghĩ trang trí cho thấy sự cần thiết thấp và đủ điều kiện cao, có nghĩa là các bước có thể bị loại bỏ hoặc sử dụng một mình mà không thay đổi câu trả lời.
Cần thiết một mình, họ tuyên bố, có thể che giấu điều này, vì có thể có nhiều đường dẫn hợp lệ. Do đó đủ điều kiện được sử dụng để kiểm tra xem bất kỳ bước đơn nào đã mã hóa kết quả, và độ nhạy về thứ tự kiểm tra xem mô hình có phụ thuộc vào trình tự hay không.
Phương pháp này xây dựng trên Khung giải thích nhất quán can thiệp (ICE), chỉ yêu cầu quyền truy cập API vào văn bản, và đối với một chuỗi CoT sáu bước, nó liên quan đến 15 đánh giá, với chi phí khoảng 1-2 đô la mỗi mô hình.
Khung ICE phân loại hành vi mô hình theo cần thiết và đủ điều kiện thành ba mẫu: Trang trí cho thấy sự cần thiết thấp và đủ điều kiện cao, có nghĩa là các bước là thừa và câu trả lời sẽ được đạt được bất kể. Điều này chiếm ưu thế trên hầu hết các mô hình và nhiệm vụ; Trung thực cho thấy sự cần thiết cao và đủ điều kiện cao, có nghĩa là mỗi bước mang tín hiệu thực (và, như đã đề cập trước đó, điều này xuất hiện trong MiniMax-M2.5 trên cảm xúc); và Phụ thuộc vào ngữ cảnh cho thấy sự cần thiết cao và đủ điều kiện thấp, có nghĩa là các bước chỉ hoạt động cùng nhau trong trình tự (điều này xuất hiện trong Kimi-K2.5 và MiniMax trên phân loại chủ đề, và trong các mô hình nhỏ, khi đối mặt với toán học).
Thử nghiệm
10 mô hình API được thử nghiệm chính là ChatGPT-5.4; Claude Opus 4.6-R; DeepSeek-V3.2; GPT-OSS-120B; Kimi-K2.5; Qwen3.5-397B; Qwen3.5-122B; MiniMax-M2.5; GLM-5; và Nemotron-Ultra (253B tham số).
Mỗi mô hình được thử nghiệm trên bốn nhiệm vụ: phân loại cảm xúc (sử dụng (SST-2); các vấn đề toán học bằng lời (sử dụng GSM8K); phân loại chủ đề (sử dụng AG News); và câu trả lời câu hỏi y tế (sử dụng (MedQA). Các thử nghiệm ban đầu là Sentiment và Toán học:

Thử nghiệm cho 10 mô hình ngôn ngữ hàng đầu, đánh giá cách chúng xử lý suy nghĩ từng bước. ‘Cần thiết’ theo dõi xem việc loại bỏ một bước có thay đổi câu trả lời; ‘đủ điều kiện’ kiểm tra xem một bước đơn có thể sản xuất nó; và ‘xáo trộn’ kiểm tra xem thứ tự có quan trọng. Hầu hết các mô hình cung cấp giải thích thuyết phục nhưng không cần thiết trên SST-2 và GSM8K, trong khi MiniMax-M2.5 phụ thuộc nhiều hơn vào các bước của nó cho cảm xúc. Cả MiniMax và Kimi-K2.5 đều thể hiện suy nghĩ từng bước thực sự trên AG News. Nguồn
Các tác giả tuyên bố, về những kết quả này:
‘Hầu hết các mô hình đều thể hiện những gì chúng tôi gọi là “Suy nghĩ trang trí” (Bước may mắn trong phân loại ICE) – một mẫu mà sự cần thiết của bước là dưới 17% và sự đủ điều kiện của bước vượt quá 60% trên cả cảm xúc và toán học.
‘Trong ngôn ngữ đơn giản: bạn có thể loại bỏ bất kỳ bước suy nghĩ nào và câu trả lời hầu như không thay đổi, mà bất kỳ bước đơn nào cũng đủ để khôi phục câu trả lời.’
Trên thử nghiệm phân loại cảm xúc SST-2, GPT-5.4 hầu như không bao giờ dựa vào giải thích viết của nó, vì việc loại bỏ một bước thay đổi câu trả lời chỉ 0,1% trong 500 trường hợp, cho thấy rằng giải thích đã được thêm vào sau khi quyết định đã được thực hiện.
Claude Opus 4.6-R phụ thuộc vào các bước của nó nhiều hơn một chút, ở mức 14,8%, nhưng 91% các bước của nó một mình vẫn có thể sản xuất câu trả lời; do đó, các giải thích dài hơn của nó chi tiết hơn, nhưng vẫn chủ yếu là ‘trang trí’.
Sau đó, các nhà nghiên cứu đã thêm các lĩnh vực khác và thử nghiệm lại:

Sự trung thực của bước và độ chính xác trên bốn lĩnh vực: SST-2; GSM8K; AG News; và MedQA. Hầu hết các cặp mô hình – nhiệm vụ vẫn ‘trang trí’ mặc dù độ chính xác cao, với một số trường hợp ngoại lệ: MiniMax-M2.5 và Kimi-K2.5 hiển thị suy nghĩ từng bước phụ thuộc vào ngữ cảnh hoặc thực sự trên AG News, trong khi hiệu suất tổng thể xác nhận rằng sự trung thực thấp không được giải thích bởi việc đoán ngẫu nhiên.
Các tác giả quan sát:
‘Kết quả trên bốn lĩnh vực củng cố phát hiện trung tâm: suy nghĩ trang trí là phổ biến trên các lĩnh vực cho các mô hình捷径. Claude Opus thể hiện 1,7% cần thiết trên MedQA (486 ví dụ, 93,4% độ chính xác) – mô hình viết các chuỗi suy nghĩ y tế chi tiết trung bình 5,8 bước, nhưng việc loại bỏ bất kỳ bước nào hầu như không thay đổi chẩn đoán.’
AG News cho thấy sự khác biệt lớn nhất giữa các mô hình, với Kimi-K2.5 và MiniMax thực sự dựa vào suy nghĩ từng bước của chúng, và hầu hết các hệ thống khác tạo ra các giải thích cung cấp rất ít ảnh hưởng đến câu trả lời cuối cùng.
DeepSeek-V3.2, được thử nghiệm trên tất cả bốn nhiệm vụ, vẫn trang trí trong suốt; mặc dù viết các giải thích dài nhất, câu trả lời của nó hiếm khi phụ thuộc vào các bước.
Độ cứng của Đầu ra
Các thử nghiệm chỉ ra một hiện tượng thứ tư đang hoạt động, mà các tác giả gọi là độ cứng của đầu ra: một số mô hình đơn giản là không sẵn sàng để xuất ra các quá trình suy nghĩ, tùy thuộc vào chủ đề, và có thể tùy thuộc vào các hoàn cảnh khác. Dưới đây, chúng ta thấy giải thích từ Claude Opus khi trả lời một câu hỏi về tình trạng y tế của một người đàn ông 61 tuổi; và dưới đó, những gì GPT-OSS-120B xuất ra:

Sự dài dòng vs. sự im lặng.
Các tác giả lưu ý rằng Độ cứng của Đầu ra là tùy thuộc vào nhiệm vụ:

Trên các nhiệm vụ, các mô hình khác nhau rõ rệt về tần suất chúng chọn ‘hiển thị công việc của mình’. Claude và DeepSeek tạo ra các giải thích đa bước gần như mọi lúc, bất kể lĩnh vực, trái ngược với Qwen3.5-397B, hầu như không bao giờ làm như vậy. Những người khác thay đổi hành vi của mình tùy thuộc vào nhiệm vụ, với một số tạo ra các chuỗi logic chi tiết cho phân loại, nhưng ít hơn cho các câu hỏi y tế.
Họ quan sát:
‘Các mô hình có khả năng bỏ qua suy nghĩ nội bộ cũng là những mô hình có khả năng bỏ qua suy nghĩ bên ngoài. GPT-OSS-120B tạo ra giải thích đa bước cho 99% câu hỏi cảm xúc và 100% câu hỏi phân loại chủ đề–nhưng chỉ 38% câu hỏi y tế. Trên 62% câu hỏi y tế, nó xuất ra một chữ cái trả lời trần trụi.’
Mô hình không ngẫu nhiên: GPT-OSS-120B tạo ra giải thích đa bước cho hầu như tất cả câu hỏi cảm xúc và câu hỏi phân loại chủ đề, nhưng chuyển sang một câu trả lời đơn chữ trên hầu hết các câu hỏi y tế (nơi nó thường cung cấp không có lý do nào).
Các tác giả suy đoán rằng vì các thử nghiệm bước yêu cầu chuỗi viết để phân tích, một mô hình trả lời bằng một token đơn không thể được đánh giá bằng các phương pháp đó; sự vắng mặt của lý do bên ngoài do đó chặn việc đo lường trực tiếp.
Bài báo kết luận rằng các mô hình được chọn cho các ứng dụng có rủi ro cao cần được thử nghiệm về trung thực cũng như độ chính xác, và đề xuất rằng một mô hình kém chính xác 2% nhưng thực sự suy nghĩ có thể được ưu tiên – không chỉ vì nó đáp ứng các quy định của EU và các quy định mới nổi khác về AI có thể giải thích, mà còn vì nó cung cấp một quá trình suy nghĩ thực sự.
Kết luận
Đây là một bài báo thú vị cung cấp nhiều thử nghiệm và thảo luận hơn về chủ đề này so với chúng tôi có thể đề cập ở đây, và tôi khuyến nghị người đọc tham khảo tài liệu nguồn.
Thông điệp trung tâm, tiếp nối từ những tranh cãi của năm ngoái, là rằng các nền tảng AI có rủi ro cao có thể sẵn sàng đi chệch và không trung thực, về việc mô phỏng các tiêu chuẩn mà các mô hình của chúng không thể đáp ứng được.
Hơn nữa, khoảng cách giữa quy mô và khả năng của các mô hình mã nguồn mở và các mô hình API đóng là rất lớn, vì vậy thông thường, không thể suy ra các hiệu ứng của mô hình API từ các cài đặt mã nguồn mở, điều này làm tăng sự không minh bạch của các quá trình và tiêu chuẩn này.
Tuy nhiên, hiếm khi một phương pháp thử nghiệm trắng hộp thực sự xuất hiện, có thể bao gồm cả mô hình mã nguồn mở và mô hình API; nhưng những phương pháp chữa trị thực sự cho những ‘mẹo rẻ’ như thế này chỉ có thể xảy ra khi các cơ quan mạnh mẽ như EU đe dọa đến lợi nhuận của các cổng thông tin AI lớn.
*Sự chuyển đổi của tôi từ các trích dẫn nội tuyến của tác giả thành các liên kết siêu văn bản.
† Bài báo không tiết lộ một danh sách thống nhất của các mô hình nhỏ hơn này, và bao gồm các biến thể bổ sung của một mô hình, khiến cho một danh sách xác định trở thành một vấn đề suy luận.
†† Các nhấn mạnh của tác giả.
Được xuất bản lần đầu vào thứ Tư, ngày 25 tháng 3 năm 2026












