Góc nhìn Anderson
Các Truy Vấn Không Lễ Phép Có Thể Tăng Chi Phí ChatGPT Doanh Nghiệp

ChatGPT trả lời tiêu tốn nhiều token hơn khi bạn thô lỗ với nó, làm tăng hóa đơn doanh nghiệp của bạn; nhưng nói ‘làm ơn’ có thể giảm chi phí của bạn.
Nó được nói rằng sự lễ phép không tốn gì; nhưng sự thô lỗ tốn bao nhiêu? Về việc trả tiền cho ChatGPT, khá nhiều, theo một nghiên cứu mới từ Mỹ. Bài báo mới, từ Đại học Iowa, phát hiện ra rằng việc thô lỗ với ChatGPT làm tăng chi phí của phản hồi – ngay cả khi phản hồi là như nhau cho các truy vấn lễ phép và không lễ phép.
Các tác giả tuyên bố:
‘[Giá của] token đầu ra là 12 đô la cho 1 triệu token đầu ra cho GPT4. Chúng tôi phát hiện ra rằng các truy vấn không lễ phép dẫn đến hơn 14 token thêm, tương đương với chi phí thêm 0,000168 đô la cho mỗi truy vấn trung bình. Số lượng truy vấn hàng ngày đến API của OpenAI vượt quá 2,2 tỷ.
‘So sánh với một kịch bản trong đó tất cả các truy vấn đều lễ phép, khi các truy vấn không lễ phép, điều này tạo ra doanh thu thêm 369.000 đô la mỗi ngày, chỉ đơn giản là do sự tăng lên của các token mà các truy vấn không lễ phép tạo ra trong kết quả.’
Mặc dù kết quả là thú vị theo bản thân nó, các tác giả nhấn mạnh rằng hành vi không bình thường này có thể chỉ ra một loạt các điểm kỳ lạ chưa được biết đến trong cấu hình con người/AI, một số hoặc tất cả trong số đó cũng có thể có ý nghĩa tài chính. Về lý do tại sao sự thô lỗ tốn thêm token cho khách hàng, các tác giả không suy đoán.
Để thiết lập tính xác thực của hiện tượng này, họ đã viết lại các truy vấn thực tế của ChatGPT, thay đổi giá trị lễ phép, trong khi vẫn giữ nguyên ý nghĩa. Cả hai phiên bản đều được đưa vào GPT‑4‑Turbo, và sự khác biệt được đo lường trong số lượng token đầu ra được sử dụng cho phản hồi.
Kết luận được rút ra là một sự tương phản rõ ràng với các sự kiện tiêu đề trước đó trong năm, nơi Sam Altman than thở rằng sự lễ phép đang làm cho OpenAI mất tiền có thể lên đến ‘hàng chục triệu’ đô la về mặt xử lý các token liên quan đến lễ phép (như ‘làm ơn’). Nghiên cứu được công bố trong cùng thời kỳ cũng cho thấy rằng sự lễ phép không có giá trị về mặt nhận được câu trả lời tốt hơn (mặc dù nó không bình luận về đáp án rẻ hơn).
Nếu kết luận của bài báo mới là chính xác, bất kỳ người dùng doanh nghiệp ChatGPT nào theo đuổi dòng suy nghĩ đó sẽ đã chi tiêu nhiều hơn cho suy luận ChatGPT vào năm 2025 so với người dùng cung cấp sự lễ phép tối thiểu trong các trao đổi ChatGPT.
Các tác giả đề xuất rằng một giải pháp có thể là đặt một giới hạn token cho phản hồi, mặc dù đây không phải là một cách tiếp cận mà các hệ thống LLM có thể dễ dàng thực hiện. Họ quan sát thấy rằng việc truy vấn là một công cụ yếu cho kiểm soát chi phí, vì các LLM khó tuân theo các hướng dẫn về độ dài rõ ràng. Trong hầu hết các trường hợp, chỉ thị ‘giới hạn’ này sẽ không được tuân thủ; ngoài ra, phản hồi có thể bị cắt ngắn, vì các LLM thuộc loại này cơ bản đoán từ tiếp theo có khả năng trong một câu / đoạn, và, như vậy, không biết câu chuyện kết thúc như thế nào – hoặc ở đâu câu chuyện kết thúc – cho đến khi quá trình xử lý hoàn thành. Họ do đó có khả năng hạn chế để ‘kết thúc’ bất kỳ cơ chế nào đang diễn ra theo yêu cầu.
Thiếu một giải pháp chính xác – mặc dù đề xuất rằng các phương pháp định giá minh bạch hơn nên được thực thi trong các trường hợp như vậy – các tác giả kết luận:
‘Sự khôn ngoan thông thường cho rằng sự lễ phép trong truy vấn là không cần thiết khi tương tác với các LLM.
‘Ngược lại, công việc của chúng tôi chứng minh rằng các truy vấn không lễ phép làm tăng token đầu ra, tạo ra chi phí thêm cho những người áp dụng AI doanh nghiệp.’
Bài báo mới có tiêu đề Minh Bạch Chi Phí Trong Việc Áp Dụng AI Doanh Nghiệp, và đến từ ba nhà nghiên cứu tại Đại học Iowa.
Phương Pháp
Dữ liệu cho hệ thống được rút ra từ Bộ dữ liệu WildChat, bao gồm một bộ sưu tập 1 triệu cuộc trò chuyện người dùng-ChatGPT, và có hơn 2,5 triệu lượt tương tác:

Từ một trang web hỗ trợ cho dự án WildChat, các ví dụ có thể tìm kiếm được về các tương tác ChatGPT. Nguồn
Các tác giả lưu ý rằng WildChat chứa một lượng lớn tương tác tự nhiên hơn so với một số bộ sưu tập được chăm sóc kỹ lưỡng hơn.
Họ đã chọn 20.000 truy vấn tiếng Anh từ các trao đổi GPT-4 của bộ sưu tập, loại bỏ đầu ra trong mỗi trường hợp (vì ý định là cho các truy vấn lại, để có phản hồi mới). Chỉ tương tác đầu tiên được chọn, ngay cả từ các trao đổi dài hơn,
Bộ dữ liệu kết quả được lọc thành lễ phép hoặc không lễ phép theo danh mục, với tất cả các truy vấn được phân loại bởi GPT-4-Turbo. Các nhà nghiên cứu đã sử dụng mô hình chính nó để quyết định liệu một truy vấn có lễ phép hay không vì nhận thức của mô hình về sự lễ phép là trung tâm của thí nghiệm.
Các truy vấn được dán nhãn là lễ phép có thể bao gồm các tín hiệu rõ ràng như từ ‘làm ơn’, hoặc có thể lễ phép theo cách gián tiếp. Bất cứ thứ gì không được công nhận là lễ phép đều được phân loại là không lễ phép, ngay cả khi cách diễn đạt là trung lập chứ không phải đối đầu.
Để nghiên cứu cách mô hình phản ứng với sự lễ phép, các phương pháp tiêu chuẩn (tức là những phương pháp coi văn bản là một tập hợp các tính năng có thể đo lường được) không thể được sử dụng: vì sự lễ phép được nhúng trong cách diễn đạt chính nó, việc tóm tắt một truy vấn dưới dạng một danh sách các đặc điểm sẽ mất đi ngữ cảnh quan trọng.
Thay vào đó, mỗi truy vấn được viết lại để đảo ngược giọng điệu của nó, với tất cả các yếu tố khác được giữ tương tự như có thể, cho phép so sánh giữa các cặp chỉ khác nhau về sự lễ phép:

Ví dụ về cách các truy vấn lễ phép và không lễ phép được chuyển đổi thành các phiên bản đối lập của chúng, trong khi vẫn giữ nguyên ý nghĩa ngữ nghĩa. Nguồn
Thử Nghiệm
Mỗi truy vấn ban đầu được ghép nối với một phiên bản được viết lại khác chỉ khác nhau về mức độ lễ phép, và cả hai phiên bản đều được gửi đến cùng mô hình GPT‑4‑Turbo thông qua các cuộc gọi API riêng biệt. Số lượng token được tạo ra trong phản hồi với mỗi phiên bản được ghi lại, và sự khác biệt giữa chúng được coi là thước đo về cách giọng điệu ảnh hưởng đến (chi phí token).
Nhiệt độ được giữ không đổi để ngăn chặn sự thay đổi ngẫu nhiên, và các cặp truy vấn chỉ được giữ lại khi việc viết lại thay đổi đầu vào không quá năm token. Điều này đảm bảo rằng hiệu ứng đang được nghiên cứu xuất phát từ giọng điệu, chứ không phải từ bất kỳ thay đổi rộng lớn nào trong cách diễn đạt:

Tổng quan thống kê cho thấy rằng các truy vấn lễ phép dẫn đến ít token đầu ra hơn trung bình so với các truy vấn không lễ phép, mặc dù có nhiều token đầu vào hơn một chút.
Kết quả chính cho vòng thử nghiệm đầu tiên cho thấy rằng việc sử dụng một truy vấn lễ phép giảm độ dài đầu ra token 14,426 token:

Kết quả ước tính mô tả ảnh hưởng của việc định dạng truy vấn lễ phép đến độ dài đầu ra (token).
Phân tích được lặp lại trên ba tập con của các truy vấn lễ phép để kiểm tra tính bền vững: các truy vấn sử dụng các dấu hiệu rõ ràng như ‘làm ơn’ hoặc ‘cảm ơn’; những truy vấn chỉ sử dụng ‘làm ơn’; và những truy vấn có ngầm định lễ phép, như ‘có thể bạn’ hoặc ‘có thể bạn’:

Kết quả ước tính dựa trên các loại lễ phép.
Để xác nhận tính bền vững của các phát hiện chính, một phân loại thứ cấp về sự lễ phép của truy vấn đã được thực hiện bằng cách sử dụng khung LIWC, cung cấp một điểm số quyết định và có thể lặp lại cho các tính năng ngôn ngữ.
Không giống như phân loại xác suất của GPT, LIWC có thể gán một điểm số lễ phép ổn định cho mỗi truy vấn, cho phép tính nhất quán được đánh giá trên các phương pháp đa dạng. Trong phần thử nghiệm này, các truy vấn được dán nhãn là lễ phép nếu điểm số lễ phép LIWC của chúng lớn hơn không, và được dán nhãn là không lễ phép nếu không.
Khi sự phù hợp giữa các phân loại LIWC và GPT được đo lường, một tỷ lệ phù hợp 81% được quan sát. Mặc dù không phải là một thước đo độ chính xác, sự đồng ý này cung cấp hỗ trợ cho tính nhất quán giữa các hệ thống.
Khi chỉ phân tích các truy vấn có nhãn lễ phép LIWC và GPT phù hợp, các truy vấn lễ phép vẫn dẫn đến ít token đầu ra hơn; và khi sự lễ phép được đo lường trên một thang điểm trượt, mỗi bước tăng lên trong sự lễ phép giảm đầu ra trung bình năm token:

Tiết kiệm token từ sự lễ phép vẫn được duy trì khi phân loại lại bằng LIWC, cả dưới dạng nhãn nhị phân và điểm số liên tục.
Tính Bền Vững
Để đánh giá xem hiệu ứng của sự lễ phép có thay đổi trên các loại truy vấn khác nhau hay không, mỗi truy vấn được gán cho một trong một số danh mục nhiệm vụ được định nghĩa trước: tìm kiếm thông tin; tạo văn bản; chỉnh sửa và viết lại; phân loại; tóm tắt; và nhiệm vụ kỹ thuật.
Mỗi truy vấn được gán một nhãn nhiệm vụ bằng cách so sánh bản nhúng của nó với các bản nhúng của các mô tả nhiệm vụ được định nghĩa trước, sử dụng mô hình all‑MiniLM‑L6‑v2 Sentence Transformers.
Điểm tương tự cosine được tính toán giữa mỗi truy vấn và tập hợp các định nghĩa nhiệm vụ, và nhãn có điểm tương tự cao nhất được gán.
Các loại nhiệm vụ sau đó được sử dụng làm biến kiểm soát trong hồi quy, để kiểm tra xem hiệu ứng của sự lễ phép có thay đổi theo loại truy vấn hay không, và các thuật ngữ tương tác giữa nhiệm vụ và xử lý cũng được giới thiệu, để kiểm tra các hiệu ứng khác biệt.
Trong cả hai trường hợp, các truy vấn lễ phép đều tạo ra đầu ra ngắn hơn, và không có sự thay đổi có ý nghĩa nào được tìm thấy trên các loại nhiệm vụ:

Kết quả hồi quy chứng minh rằng các truy vấn lễ phép giảm độ dài đầu ra trên tất cả các loại nhiệm vụ, mà không có hiệu ứng tương tác đáng kể.
Để kiểm tra xem các phản hồi ngắn hơn từ các truy vấn lễ phép có phản ánh giảm chất lượng hay không, các đầu ra từ các truy vấn ban đầu và đối lập được so sánh về sự tương đồng ngữ nghĩa. Sử dụng mô hình all‑MiniLM‑L6‑v2, mỗi phản hồi được nhúng trong một không gian vector ngữ nghĩa, và điểm tương đồng cosine được tính toán giữa mỗi cặp, cho kết quả điểm tương đồng trung bình là 0,78, chỉ ra sự phù hợp mạnh mẽ về ý nghĩa, và cho thấy rằng nội dung vẫn nhất quán ngay cả khi giọng điệu thay đổi.
Từ Dừng
Để hiểu những loại nội dung nào bị giảm trong các đầu ra ngắn hơn, các từ bị loại bỏ thường xuyên nhất đã được kiểm tra. Những từ này được tìm thấy là các từ dừng phổ biến như ‘có’, ‘hơn’, ‘ở đâu’, và ‘vào’, tức là các thuật ngữ phục vụ các vai trò ngữ pháp hơn là vai trò ngữ nghĩa.
Để xác nhận rằng việc giảm token không bị thúc đẩy bởi mất nội dung có ý nghĩa, các từ dừng đã được loại bỏ, và các cụm từ lên đến bốn từ đã được phân tích để tìm kiếm các mẫu hệ thống; tuy nhiên, không có mẫu nhất quán hoặc quan trọng về mặt ngữ nghĩa nào được tìm thấy, cho thấy rằng việc giảm từ các cụm từ lễ phép không loại bỏ nội dung có ý nghĩa hoặc hữu ích.
Vì vậy, vẫn còn vẻ như nhiều token hơn đang được chi tiêu cho các phản hồi với các truy vấn thô lỗ hơn là các truy vấn lễ phép – giống như một loại ‘thuế’ đối với sự thô lỗ.
Nghiên Cứu Con Người
Để kiểm tra xem chất lượng đầu ra có bị ảnh hưởng bởi giọng điệu của truy vấn hay không, một đánh giá của con người cũng đã được thực hiện, sử dụng một mẫu ngẫu nhiên gồm 20 cặp truy vấn lễ phép và 20 cặp truy vấn không lễ phép.
Sau khi loại bỏ các truy vấn về các chủ đề nhạy cảm hoặc kỹ thuật, các phản hồi được đánh giá bởi 401 người tham gia trên thang điểm 7 điểm. Mỗi người tham gia chỉ xem một phản hồi, được rút ra từ một trong bốn điều kiện: lễ phép hoặc không lễ phép, và cả ban đầu hoặc đối lập.
Không có sự khác biệt đáng kể nào được tìm thấy về chất lượng nhận thức trên bất kỳ điều kiện nào. Các đầu ra lễ phép và không lễ phép nhận được điểm số gần như giống hệt, cũng như các phiên bản ban đầu và đối lập.
Các tác giả khẳng định rằng những kết quả này cho thấy rằng việc giảm token đầu ra không phải là do mất chất lượng, mà là do việc viết lại hoặc các thay đổi cấu trúc vẫn giữ nguyên ý nghĩa.
Sự khác biệt về chi phí quan sát được trong việc thúc đẩy doanh nghiệp vì vậy không thể phản ánh sự thay đổi về tính hữu ích hoặc độ rõ ràng, và ‘thuế’ vẫn còn hoạt động.
Kết Luận
Mặc dù công việc mới tập trung vào việc sử dụng doanh nghiệp ChatGPT, nhưng người dùng cấp thấp hơn cũng bị ảnh hưởng bởi hiện tượng này, vì ngay cả hai cấp độ đầu vào cũng có giới hạn sử dụng; và – theo giả định – việc đối xử thô lỗ với ChatGPT sẽ khiến người dùng trung bình nhanh chóng cạn kiệt phân bổ token hàng ngày.
Công trình nghiên cứu mới tập trung vào một câu hỏi mở được nghiên cứu rộng rãi và được đưa tin nhiều trong các tương tác con người/AI; nhưng các tác giả nhấn mạnh rằng các vấn đề xung quanh sự lễ phép nên được xem là các chỉ số của một khả năng sâu sắc hơn về các đặc điểm ngôn ngữ kỳ lạ, vẫn chưa được khám phá, có thể ảnh hưởng đến các khoản phí suy luận.
Được xuất bản lần đầu vào thứ Tư, ngày 19 tháng 11 năm 2025












