Góc nhìn Anderson
Các Mô Hình Trò Chuyện AI Có Thể Tăng Chi Phí Thông Qua Việc Nói Ngôn Từ Vô Cụ

Các mô hình trò chuyện AI phổ biến bí mật lãng phí một lượng lớn token đã trả tiền trên ngôn từ vô ích. Các mô hình bị ảnh hưởng thực sự biết họ đang làm điều này, nhưng không thể ngừng lại.
Các Mô Hình Lý Luận Lớn (LRM) như ChatGPT-5 và Google Gemini tính phí nhiều hơn cho lý luận – đi qua một vấn đề bước từng bước, điều này sử dụng nhiều năng lực tính toán hơn so với việc dự đoán nhanh từ tiếp theo. Quá trình lý luận模拟 mất nhiều thời gian hơn và tốn kém hơn để chạy; do đó, người dùng cuối cùng phải trả tiền cho ‘thời gian suy nghĩ thêm’ đó.
Tuy nhiên, nếu bạn đã sử dụng một mô hình ngôn ngữ lớn mới nhất gần đây, bạn có thể đã nhận thấy rằng phân bổ token của bạn thường được chi tiêu cho ngôn từ và các phần không cần thiết, thay vì tập trung vào việc giải quyết các vấn đề mà bạn đang đặt ra cho mô hình. Điều này có thể dưới dạng sycophancy quá mức, câu trả lời dài dòng và/hoặc trùng lặp – hoặc thậm chí là một loại ‘nói ngôn từ vô cụ’, như thể AI đã bị bắt gặp và đang cố gắng nói nhanh để thoát khỏi tình huống khó xử.
Tự nhiên, chúng ta sẽ muốn mô hình ngôn ngữ của mình thừa nhận thất bại, theo hoặc đề xuất các đường dẫn thay thế, hoặc yêu cầu làm rõ. Nhưng ngay cả việc nhận được một mô hình AI như vậy để thừa nhận rằng họ không biết một câu trả lời cũng là một thách thức đáng kể riêng biệt.
Trong khi đó, người dùng trên các cấp thấp hơn hoặc miễn phí có thể tìm thấy mình đã đốt cháy token của họ với tốc độ nhanh, bất kể các truy vấn và tương tác của họ có được nhắm mục tiêu hay tiết kiệm như thế nào, vì AI tự yêu thích nói; và, trong trường hợp này, nói không phải là rẻ.
Nói Ngôn Từ Vô Cụ
Về vấn đề ‘nói ngôn từ vô cụ’ đã đề cập, một sự hợp tác học thuật mới đang cung cấp một lý do và một giải pháp, bằng cách đề xuất rằng các mô hình ngôn ngữ lớn với khả năng lý luận có xu hướng đốt cháy token của bạn khi chúng bị mắc kẹt trong một ‘nói ngôn từ vô cụ’ – một trạng thái bối rối nơi quá trình lý luận bị mất trong các con đường mù recursive – trên tiền của bạn*.
Các nhà nghiên cứu đằng sau bài báo mới đã phát hiện ra rằng một phần đáng kể của các token được xử lý trong một mô hình ngôn ngữ lớn điển hình bao gồm sự lặp lại và trùng lặp – và rằng mô hình tự nó đường như hiểu rằng nó đang gặp rắc rối, mặc dù nó không thể ngừng lại vòng lặp tốn kém.
Bài báo cho biết:
‘Chúng tôi chỉ ra rằng một phần đáng kể của các token này là sự lặp lại vô ích – những gì chúng tôi gọi là “nói ngôn từ vô cụ” – mà làm cạn kiệt ngân sách giải mã mà không thêm giá trị. Thú vị, chúng tôi quan sát thấy rằng các mô hình ngôn ngữ lớn có khả năng tự nhận thức khi bị mắc kẹt trong các vòng lặp này: các trạng thái ẩn của <\n\n> token theo sau mỗi đoạn lý luận thể hiện các mẫu cho phép chúng tôi phát hiện hành vi nói ngôn từ vô cụ theo thời gian thực thông qua một bộ phân loại tuyến tính đơn giản.
‘Một khi được phát hiện, một sự can thiệp đơn giản được thêm vào bởi một lời nhắc tái tạo thẳng thắn cho ra những tiết kiệm đáng kể về độ dài với tổn thất chất lượng tối thiểu.’
Giải pháp được đề xuất trong bài báo mới là một sự can thiệp có thể cắt đứt quá trình lý luận sai lầm của một mô hình ngôn ngữ lớn một cách trực tiếp, mà không cần phải can thiệp vào dữ liệu đào tạo, hoặc bất kỳ thiệt hại nào có thể xảy ra từ việc tinh chỉnh. Khung khổ, có tên Nói Ngôn Từ Vô Cụ Chopper, đã được công bố công khai trên GitHub.
Mặc dù công việc ban đầu tập trung vào các biến thể DeepSeek như các mục trong loạt Qwen và Llama, bài báo khẳng định rằng hành vi không mong muốn này có thể áp dụng cho một phạm vi rộng lớn hơn của các mô hình lý luận tương tự (bao gồm cả các dịch vụ API phổ biến như ChatGPT và Google Gemini).
Khi bài báo lưu ý, các đề xuất trước đó như Demystifying Long Chain-of-Thought Reasoning in LLMs và Small Models Struggle to Learn from Strong Reasoners cũng sử dụng số lượng nhỏ các mô hình lý luận Chain-of-Thought (CoT) công khai để thiết lập một vấn đề rộng lớn hơn trong lớp mô hình này†:
‘[Các mô hình ngôn ngữ lớn] có xu hướng lãng phí một lượng lớn ngân sách giải mã, chỉ bằng cách lặp lại chính mình từ verbatim, với các biến thể nhỏ, hoặc tham gia vào việc liệt kê vô tận các trường hợp cho đến khi toàn bộ ngân sách đã được chi tiêu – chúng tôi gọi hành vi này là Nói Ngôn Từ Vô Cụ, một thuật ngữ thường được sử dụng để mô tả các phát ngôn viên công khai đưa ra những câu trả lời dài dòng, đầy jargon mà không có nội dung hoặc ý nghĩa rõ ràng.
‘Cột “Original” trong [bảng dưới đây] cho thấy rằng khi trả lời GPQA-Diamond, chúng tôi quan sát thấy 55%+ token được tạo ra bởi các mô hình DeepSeek-R1-Distill được đánh dấu là “token nói ngôn từ vô cụ”, nơi chúng không thêm giá trị từ góc độ ngữ nghĩa.’
![Tỷ lệ token đầu ra được xác định là trùng lặp về mặt ngữ nghĩa khi trả lời GPQA-Diamond. Nói Ngôn Từ Vô Cụ Chopper giảm gánh nặng này từ hơn 55% xuống dưới 6% trên tất cả các mô hình DeepSeek-R1-Distill được thử nghiệm, theo khẳng định của các tác giả. [ Nguồn ] https://arxiv.org/pdf/2511.00536](https://www.unite.ai/wp-content/uploads/2025/11/table-1.jpg)
Tỷ lệ token đầu ra được xác định là trùng lặp về mặt ngữ nghĩa khi trả lời GPQA-Diamond. Nói Ngôn Từ Vô Cụ Chopper giảm gánh nặng này từ hơn 55% xuống dưới 6% trên tất cả các mô hình DeepSeek-R1-Distill được thử nghiệm, theo khẳng định của các tác giả. Nguồn
Các tác giả lưu ý rằng các nỗ lực nhằm rút ngắn quá trình lý luận trong khi vẫn giữ chất lượng câu trả lời đã trở thành một nhánh nghiên cứu mạnh mẽ, đặc biệt là long-to-short (L2S); và họ quan sát thêm rằng trong khi mục tiêu của dự án tương tự như một số sáng kiến trước đó, dự án của họ là dự án đầu tiên cung cấp một giải pháp ad hoc không yêu cầu can thiệp vào quá trình đào tạo, chỉnh sửa mô hình hoặc các yêu cầu khác đối với kiến trúc cơ bản của một mô hình ngôn ngữ lớn; và vì vậy, họ tin rằng cách tiếp cận của họ nên được áp dụng rộng rãi trong các hệ thống có thể áp dụng†:
‘Chúng tôi tin rằng, với chi phí thấp, tiết kiệm mạnh và thiếu giá trị ngữ nghĩa của các token nói ngôn từ vô cụ, Nói Ngôn Từ Vô Cụ Chopper – hoặc một thành phần tương tự – là một thành phần cần thiết cho tất cả các ứng dụng mô hình ngôn ngữ lớn có kinh nghiệm người dùng.
Bài báo mới có tiêu đề Nói Ngôn Từ Vô Cụ Chopper: Các Mô Hình Lý Luận Lãng Phí Nhiều Ngân Sách Giải Mã Cho Các Lặp Lại Vô ích, Tự Nhận Thức, và đến từ sáu nhà nghiên cứu trên khắp Đại học Minnesota, Đại học Rice, Viện Công nghệ Stevens và Lambda, Inc.
Xem Xét Trước
Để theo dõi xu hướng của các mô hình ngôn ngữ lớn lý luận lặp lại chính mình, các tác giả đã chia đầu ra của mô hình thành các đoạn ở mọi nơi có khoảng cách dòng đôi, sau đó kiểm tra sự tương似 giữa mỗi đoạn và các đoạn trước đó:

Tỷ lệ ước tính của các đoạn lý luận được đánh dấu là nói ngôn từ vô cụ dưới hai nhiệt độ giải mã (τ = 0,0, 0,6). Bộ phân loại đánh dấu một đoạn là ‘nói ngôn từ vô cụ’ khi nó giống với một phần trước của đầu ra mô hình, cho thấy sự lặp lại chứ không phải tiến bộ. Kết quả cho thấy hành vi này phổ biến trên các tập dữ liệu và kích thước mô hình.
Nếu một đoạn quá tương似, nó sẽ được đánh dấu là ‘nói ngôn từ vô cụ’ (tương đương với một sự lặp lại vô ích).
Các nhà nghiên cứu lưu ý rằng một khi mô hình进入 ‘chế độ nói ngôn từ vô cụ’, nó rất khó để thoát khỏi chế độ đó mà không cần sự can thiệp từ bên ngoài, thay vào đó vẫn ở trong vòng lặp tốn kém cho đến khi ngân sách giải mã của người dùng được chi tiêu††:
‘Không cần phải nói, điều này tạo ra một vấn đề nghiêm trọng cho người dùng, vì một phần suy nghĩ lý tưởng thường ngắn hơn bây giờ được tối đa hóa với các lặp lại vô ích. Vì vậy, người dùng cơ bản phải trả chi phí tối đa cho một câu trả lời (có thể) sai, trong khi phải chịu độ trễ từ đầu đến cuối dài nhất.’

Tỷ lệ các đoạn nói ngôn từ vô cụ xuất hiện trước và sau điểm cắt (tức là, thời điểm khi đầu ra lặp lại bắt đầu chiếm ưu thế). Hầu hết các lặp lại xảy ra sau điểm này, cho thấy rằng một khi mô hình进入 một vòng lặp nói ngôn từ vô cụ, nó hiếm khi phục hồi mà không cần can thiệp.
Các tác giả kể lại sự ngạc nhiên của họ khi họ phát hiện ra rằng các mô hình ngôn ngữ lớn lý luận thể hiện dấu hiệu của việc nhận thức được trạng thái nói ngôn từ vô cụ của chúng. Tuy nhiên, chính sự nhận thức này, và cách nó tham gia vào trạng thái lý luận có thể của mô hình, cho phép một hệ thống can thiệp:
‘Sự nhẹ của bộ phân loại tuyến tính này mở ra cánh cửa cho việc phát hiện theo thời gian thực, nơi chúng tôi có thể can thiệp hiệu quả với các hoạt động khác nhau để giải quyết các mô hình bị mắc kẹt trong các vòng lặp nói ngôn từ vô cụ.’
Phương Pháp
Để phát hiện sự hiện diện của nói ngôn từ vô cụ trong quá trình suy luận, các tác giả đã đào tạo một bộ phân loại tuyến tính đơn giản chạy trên trạng thái ẩn của mỗi token dòng mới.
Bất kỳ đoạn nào xảy ra sau khi mô hình进入 một vòng lặp lặp lại sẽ được coi là nói ngôn từ vô cụ, với điểm cắt này (được gọi là điểm cắt) được sử dụng để gắn nhãn dữ liệu đào tạo. Một nghìn dấu vết lý luận đã được tạo ra bằng cách sử dụng bộ chuẩn S1, và mỗi dấu vết được chia thành các đoạn tách bằng dòng mới.

Sơ đồ khái niệm cho Nói Ngôn Từ Vô Cụ Chopper. Trong quá trình tạo, trạng thái ẩn tại mỗi token dòng mới được phân tích để phát hiện các đoạn lặp lại. Khi hai đoạn nói ngôn từ vô cụ được đánh dấu liên tiếp, quá trình tạo bị chấm dứt. Một lời nhắc tái tạo cố định sau đó được thêm vào, cho phép mô hình tiếp tục và hoàn thành câu trả lời của nó mà không vượt quá ngân sách.
Nếu một đoạn được tìm thấy quá tương似 với một đoạn trước đó, nó sẽ được gắn nhãn là nói ngôn từ vô cụ. Khi đoạn lặp lại đầu tiên được xác định, tất cả các đoạn tiếp theo cũng sẽ được gắn nhãn là nói ngôn từ vô cụ để phản ánh sự tồn tại của các vòng lặp này.
Bộ phân loại được thực hiện như một lớp đầy đủ và được đào tạo trên các trạng thái ẩn của các token theo sau từ khối transformer cuối cùng. Một bộ phân loại riêng biệt được đào tạo cho mỗi mô hình, sử dụng dữ liệu này, và không có tinh chỉnh nào được thực hiện trong quá trình đánh giá.
Dữ Liệu và Kiểm Tra
Đào tạo và suy luận sử dụng bốn GPU NVIDIA A100 (80G VRAM), dưới tối ưu hóa Adam, với tốc độ học là 1×10-2, trong 50 epoch.
Các tập dữ liệu đánh giá bao gồm ‘Toán Học Cấp Tiểu Học’ 8000, cũng được gọi là GSM8K; MATH-500; GPQA-DIAMOND; và AIME25 (2025).
Các mô hình được kiểm tra bao gồm DeepSeek-R1-Distill-Qwen-1.5B; DeepSeek-R1-Distill-Qwen-7B; và DeepSeek-R1-Distill-Llama-8B, tất cả đều dưới giấy phép MIT.
Các chỉ số được sử dụng bao gồm Độ Chính Xác và AUROC.

Độ chính xác và AUROC của bộ phân loại nói ngôn từ vô cụ trên Qwen-7B trên bốn tập dữ liệu chuẩn và hai nhiệt độ giải mã. Các điểm số cao xác nhận rằng sự bắt đầu của sự lặp lại có thể được phát hiện một cách tin cậy từ trạng thái ẩn của token dòng mới.
Về kết quả được hiển thị ở đây, các tác giả bình luận:
‘[Bảng kết quả trên] cho thấy rằng bộ phân loại tuyến tính cực kỳ chính xác trong việc phát hiện các đoạn nói ngôn từ vô cụ; tuy nhiên [bảng dưới] chứng tỏ rằng lời nhắc tái tạo giúp phục hồi độ chính xác của nhiệm vụ bị mất do việc cắt bỏ thô.’

Độ chính xác của Qwen-7B trên mỗi tập dữ liệu chuẩn tại τ = 0,6, so sánh hiệu suất trước khi nói ngôn từ vô cụ (Original), sau khi cắt (Chopped), và sau khi áp dụng tái tạo (Regenerated). Các lợi ích từ tái tạo là khiêm tốn nhưng nhất quán, phục hồi hiệu suất trước vòng lặp ở hầu hết các trường hợp.
Trong bảng kết quả dưới, chúng ta có thể thấy rằng Nói Ngôn Từ Vô Cụ Chopper cải thiện hoặc giữ nguyên độ chính xác trong khi giảm đáng kể độ dài của đầu ra mô hình, lên đến 57%:

Khi Nói Ngôn Từ Vô Cụ Chopper được sử dụng ở giải mã tham lam (τ = 0), nó giảm độ dài của đầu ra mô hình, đôi khi lên đến hơn một nửa, trong khi giữ nguyên độ chính xác hoặc cải thiện một chút, một hiệu suất vẫn nhất quán trên các mô hình và nhiệm vụ khác nhau (AIME25 được bỏ qua do kết quả không ổn định dưới cài đặt này).
Lợi ích lớn nhất xuất hiện trong các câu trả lời dài hơn, đặc biệt là trên GPQA-Diamond, nơi gần nửa văn bản đã được loại bỏ mà không ảnh hưởng đến hiệu suất. Dưới đây, chúng ta có thể thấy kết quả tương tự khi ngẫu nhiên được thêm vào trong quá trình tạo:

Ở nhiệt độ cao hơn (τ = 0,6), Nói Ngôn Từ Vô Cụ Chopper tiếp tục rút ngắn đầu ra lên 10-30%, với độ chính xác vẫn ổn định hoặc cải thiện một chút trên tất cả các mô hình và tập dữ liệu chuẩn (kết quả AIME25 được tính trung bình để giảm biến thể).
Ở đây, độ chính xác vẫn ổn định, với đầu ra ngắn hơn được thực hiện. Trên toàn bộ, hệ thống tiếp tục hoạt động ngay cả khi câu trả lời của mô hình trở nên lặp lại hơn; và các tác giả lưu ý rằng vì bộ phân loại chỉ kiểm tra một token mỗi câu, nó chạy cực kỳ nhanh, ngay cả khi được sử dụng trong quá trình tạo trực tiếp.
Bài báo quan sát rằng các chiến lược bổ sung trong nghiên cứu tương lai theo hướng này có thể được hưởng lợi từ việc cấp cho mô hình một ngân sách tái tạo nhỏ sau khi can thiệp; ứng dụng liên tục của một hệ thống kiểu Nói Ngôn Từ Vô Cụ Chopper trên các tái tạo; và ép buộc một token ‘kết thúc suy nghĩ’ lên mô hình, để yêu cầu câu trả lời tốt nhất hiện tại của nó.
Cuối cùng, các nhà nghiên cứu bình luận về chất lượng của trạng thái hiện tại trong việc đánh giá các mô hình lý luận, với một giọng điệu phê phán†:
‘Chúng tôi tin rằng, nhiều phương pháp lý luận hiệu quả dường như hiệu quả một phần vì các chuẩn đánh giá lý luận hiện tại còn nhiều chỗ để cải thiện.
‘Nếu chúng ta phát triển các bộ đánh giá toàn diện hơn – điều mà chúng ta chắc chắn sẽ làm trong tương lai – chúng ta dự đoán sẽ thấy nhiều phương pháp lý luận hiệu quả thất bại, hoặc hành xử khác biệt so với các mô hình ngôn ngữ lớn thông thường.’
Kết Luận
Ở quy mô đạt được bởi các hệ thống hàng đầu như ChatGPT, ngay cả những thay đổi nhỏ trong việc tiêu thụ tài nguyên người dùng cũng có thể có những ý nghĩa lớn về cơ sở hạ tầng, hậu cần và chi phí. Điều này làm cho hiệu quả trở thành một ưu tiên chung cho cả nhà cung cấp và cộng đồng nghiên cứu rộng lớn hơn.
Nếu được thực hiện, hệ thống mới và nhẹ được đề xuất trong bài báo (phải được đào tạo tùy chỉnh cho mỗi kiến trúc mô hình mới) có thể ngăn chặn việc đốt cháy vô ích của token – điều có thể khiến khách hàng cảm thấy rằng nhà cung cấp đang ‘làm cạn kiệt’ phân bổ của họ theo cách phung phí hoặc lừa đảo. Trong thực tế, nhà cung cấp được lợi hơn khi cung cấp đầu ra hữu ích thay vì trùng lặp, điều này có cùng chi phí tính toán với một nói ngôn từ vô cụ.
* Mặc dù chúng tôi sẽ không triển khai nó ở đây, điều này cũng áp dụng cho các mô hình được lưu trữ cục bộ, có thể là doanh nghiệp hoặc sở thích, và nơi tổn thất điện và năng suất của nói ngôn từ vô cụ có thể là một yếu tố đáng chú ý.
† Como thường lệ, tất cả các nhấn mạnh là của các tác giả, và không phải của tôi. Ở nơi适 hợp, các trích dẫn trực tuyến của họ đã được chuyển đổi thành liên kết bởi tôi.
†† Ở đây, chúng ta phải thừa nhận rằng các khuôn khổ và API có thể phân bổ ‘ngân sách con’ cho các truy vấn, để một truy vấn không nhất thiết phải đốt cháy toàn bộ ngân sách token trong một ngày – nhưng đây không phải là một thực tiễn phổ biến, cũng không phải là một chủ đề thường được thảo luận giữa các nhà cung cấp chỉ API.
††† Tôi không sẵn sàng chấp nhận việc sử dụng ‘LRM’ của các tác giả, vì đây không phải là một viết tắt phổ biến hiện tại, vì vậy tôi sẽ sử dụng các thuật ngữ khác trong bài viết này, khi cần thiết.
Được xuất bản lần đầu vào thứ Năm, ngày 6 tháng 11 năm 2025












