Góc nhìn Anderson
Trí tuệ nhân tạo không nhất thiết cung cấp câu trả lời tốt hơn nếu bạn lịch sự

Ý kiến của công chúng về việc liệu việc lịch sự với trí tuệ nhân tạo có mang lại lợi ích hay không thay đổi gần như thường xuyên như phán quyết mới nhất về cà phê hoặc rượu vang đỏ – được ca ngợi vào một tháng, thách thức vào tháng tiếp theo. Mặc dù vậy, ngày càng nhiều người dùng hiện thêm ‘xin vui lòng‘ hoặc ‘cảm ơn‘ vào các yêu cầu của họ, không chỉ vì thói quen, hoặc lo lắng rằng các trao đổi thô lỗ có thể được chuyển sang cuộc sống thực, mà từ niềm tin rằng sự lịch sự dẫn đến kết quả tốt hơn và sản xuất hơn từ trí tuệ nhân tạo.
Giả định này đã được lưu hành giữa cả người dùng và nhà nghiên cứu, với việc nghiên cứu cách viết yêu cầu trong các vòng nghiên cứu như một công cụ cho sự phù hợp, an toàn, và kiểm soát giọng điệu, ngay cả khi thói quen của người dùng củng cố và thay đổi những kỳ vọng đó.
Ví dụ, một nghiên cứu năm 2024 từ Nhật Bản phát hiện ra rằng sự lịch sự trong yêu cầu có thể thay đổi cách các mô hình ngôn ngữ lớn hành xử, thử nghiệm GPT-3.5, GPT-4, PaLM-2 và Claude-2 trên các nhiệm vụ tiếng Anh, tiếng Trung và tiếng Nhật, và viết lại mỗi yêu cầu ở ba mức độ lịch sự. Các tác giả của công việc đó quan sát thấy rằng ‘thô lỗ’ hoặc ‘thiếu lịch sự’ dẫn đến độ chính xác thấp hơn và câu trả lời ngắn hơn, trong khi các yêu cầu lịch sự vừa phải tạo ra các giải thích rõ ràng hơn và ít từ chối hơn.
Bên cạnh đó, Microsoft khuyến nghị một giọng điệu lịch sự với Co-Pilot, từ góc độ hiệu suất hơn là văn hóa.
Tuy nhiên, một bài nghiên cứu mới từ Đại học George Washington thách thức ý tưởng phổ biến này, trình bày một khuôn khổ toán học dự đoán khi đầu ra của một mô hình ngôn ngữ lớn sẽ ‘sụp đổ’, chuyển từ nội dung hợp lý sang nội dung lừa đảo hoặc thậm chí nguy hiểm. Trong bối cảnh đó, các tác giả cho rằng việc lịch sự không trì hoãn có ý nghĩa hoặc ngăn chặn ‘sụp đổ’ này.
Bắt đầu
Các nhà nghiên cứu lập luận rằng việc sử dụng ngôn ngữ lịch sự nói chung không liên quan đến chủ đề chính của yêu cầu, và do đó không ảnh hưởng đáng kể đến sự tập trung của mô hình. Để hỗ trợ điều này, họ trình bày một công thức chi tiết về cách một đầu chú ý cập nhật hướng nội bộ khi nó xử lý mỗi token mới, rõ ràng cho thấy rằng hành vi của mô hình được định hình bởi ảnh hưởng tích lũy của các token có nội dung.
Kết quả là, ngôn ngữ lịch sự được cho là có ảnh hưởng nhỏ đến khi đầu ra của mô hình bắt đầu suy giảm. Điều quyết định điểm tới hạn, bài báo cho biết, là sự sắp xếp tổng thể của các token có ý nghĩa với các đường dẫn đầu ra tốt hoặc xấu – không phải sự hiện diện của ngôn ngữ lịch sự.

Một hình minh họa của một đầu chú ý đơn giản hóa tạo ra một chuỗi từ một yêu cầu của người dùng. Mô hình bắt đầu với các token tốt (G), sau đó đạt đến điểm tới hạn (n*) nơi đầu ra chuyển sang các token xấu (B). Các thuật ngữ lịch sự trong yêu cầu (P₁, P₂, v.v.) không đóng vai trò trong sự chuyển đổi này, hỗ trợ cho tuyên bố của bài báo rằng sự lịch sự có ảnh hưởng nhỏ đến hành vi của mô hình. Nguồn: https://arxiv.org/pdf/2504.20980
Nếu đúng, kết quả này mâu thuẫn với cả niềm tin phổ biến và có thể даже logic ngầm của sự điều chỉnh hướng dẫn, giả định rằng cách viết yêu cầu ảnh hưởng đến cách mô hình giải thích ý định của người dùng.
Phát triển
Bài báo kiểm tra cách vector ngữ cảnh nội bộ của mô hình (la bàn phát triển cho việc chọn token) thay đổi trong quá trình tạo ra. Với mỗi token, vector này cập nhật hướng và token tiếp theo được chọn dựa trên sự phù hợp gần nhất với nó.
Khi yêu cầu chỉ đạo đến nội dung được hình thành tốt, phản hồi của mô hình vẫn ổn định và chính xác; nhưng theo thời gian, lực kéo hướng này có thể đảo ngược, hướng mô hình đến các đầu ra ngày càng không liên quan, không chính xác hoặc không nhất quán.
Điểm tới hạn cho sự chuyển đổi này (mà các tác giả định nghĩa toán học là n*), xảy ra khi vector ngữ cảnh trở nên phù hợp hơn với một ‘đầu ra xấu’ hơn là với một ‘đầu ra tốt’. Tại giai đoạn đó, mỗi token mới đẩy mô hình进一步 theo con đường sai, củng cố một mẫu đầu ra ngày càng sai hoặc lừa đảo.
Điểm tới hạn n* được tính bằng cách tìm thời điểm khi hướng nội bộ của mô hình phù hợp với cả đầu ra tốt và xấu. Hình học của không gian nhúng, được định hình bởi cả tập dữ liệu đào tạo và yêu cầu của người dùng, quyết định tốc độ xảy ra sự giao nhau này:

Một hình minh họa thể hiện cách điểm tới hạn n* xuất hiện trong mô hình đơn giản hóa của các tác giả. Cấu hình hình học (a) định nghĩa các vector chính tham gia vào việc dự đoán khi đầu ra chuyển từ tốt sang xấu. Trong (b), các tác giả vẽ các vector đó bằng cách sử dụng các tham số thử nghiệm, trong khi (c) so sánh điểm tới hạn dự đoán với kết quả mô phỏng. Sự phù hợp là chính xác, hỗ trợ cho tuyên bố của các nhà nghiên cứu rằng sự sụp đổ là toán học không thể tránh khỏi một khi động lực nội bộ vượt qua một ngưỡng.
Các thuật ngữ lịch sự không ảnh hưởng đến việc mô hình chọn giữa đầu ra tốt và xấu vì, theo các tác giả, chúng không liên quan có ý nghĩa đến chủ đề chính của yêu cầu. Thay vào đó, chúng kết thúc ở các phần của không gian nội bộ của mô hình mà có ít liên quan đến những gì mô hình thực sự quyết định.
Khi các thuật ngữ như vậy được thêm vào yêu cầu, chúng làm tăng số lượng vector mà mô hình xem xét, nhưng không theo cách thay đổi quỹ đạo chú ý. Do đó, các thuật ngữ lịch sự hoạt động như tiếng ồn thống kê: hiện diện, nhưng không hoạt động, và để lại điểm tới hạn n* không thay đổi.
Các tác giả tuyên bố:
‘[Cho dù] phản hồi của AI chúng tôi sẽ đi sai đường depends trên đào tạo LLM của chúng tôi cung cấp các bản nhúng token, và các token có nội dung trong yêu cầu của chúng tôi – không phải liệu chúng tôi đã lịch sự với nó hay không.’
Mô hình được sử dụng trong công việc mới này là có chủ đích hẹp, tập trung vào một đầu chú ý đơn với động lực token tuyến tính – một cấu hình đơn giản hóa nơi mỗi token mới cập nhật trạng thái nội bộ thông qua việc thêm vector trực tiếp, mà không có biến đổi phi tuyến tính hoặc cổng.
Cấu hình này cho phép các tác giả làm việc với kết quả chính xác và cung cấp một hình ảnh hình học rõ ràng về cách và khi đầu ra của mô hình có thể đột ngột chuyển từ tốt sang xấu. Trong các thử nghiệm của họ, công thức họ suy ra để dự đoán sự chuyển đổi này phù hợp với những gì mô hình thực sự làm.
Trò chuyện
Tuy nhiên, mức độ chính xác này chỉ hoạt động vì mô hình được giữ đơn giản một cách có chủ đích. Trong khi các tác giả thừa nhận rằng những kết luận của họ nên được kiểm tra sau trên các mô hình đa đầu phức tạp hơn như Claude và ChatGPT, họ cũng tin rằng lý thuyết vẫn có thể được nhân rộng khi số lượng đầu chú ý tăng lên, tuyên bố*:
‘Câu hỏi về những hiện tượng bổ sung nào xuất hiện khi số lượng đầu chú ý liên kết và lớp tăng lên, là một phát hiện phát hiện. Nhưng bất kỳ chuyển đổi nào trong một đầu chú ý đơn sẽ vẫn xảy ra, và có thể được khuếch đại và/hoặc đồng bộ hóa bởi liên kết – như một chuỗi người kết nối bị kéo qua một vách đá khi một người rơi.’

Một hình minh họa về cách điểm tới hạn n* thay đổi tùy thuộc vào mức độ yêu cầu nghiêng về nội dung tốt hoặc xấu. Bề mặt này đến từ công thức gần đúng của các tác giả và cho thấy rằng các thuật ngữ lịch sự, không rõ ràng hỗ trợ cho cả hai bên, có ảnh hưởng nhỏ đến khi sự sụp đổ xảy ra. Giá trị được đánh dấu (n* = 10) phù hợp với các mô phỏng trước đó, hỗ trợ logic nội bộ của mô hình.
Còn lại chưa rõ liệu cơ chế này có tồn tại khi nhảy sang các kiến trúc transformer hiện đại. Chú ý đa đầu giới thiệu các tương tác giữa các đầu chuyên dụng, có thể đệm chống lại hoặc che giấu loại hành vi tới hạn được mô tả.
Các tác giả thừa nhận sự phức tạp này, nhưng lập luận rằng các đầu chú ý thường lỏng lẻo, và loại sụp đổ nội bộ mà họ mô hình hóa có thể được củng cố hơn là bị ngăn chặn trong các hệ thống toàn diện.
Không có sự mở rộng của mô hình hoặc một thử nghiệm thực nghiệm trên các LLM sản xuất, tuyên bố vẫn chưa được xác minh. Tuy nhiên, cơ chế này dường như đủ chính xác để hỗ trợ các sáng kiến nghiên cứu tiếp theo, và các tác giả cung cấp một cơ hội rõ ràng để thách thức hoặc xác nhận lý thuyết ở quy mô.
Kết thúc
Hiện tại, chủ đề về sự lịch sự đối với các LLM hướng tới người tiêu dùng dường như được tiếp cận từ góc độ thực tế rằng các hệ thống được đào tạo có thể phản hồi hữu ích hơn với các yêu cầu lịch sự; hoặc rằng một phong cách giao tiếp thô lỗ và thẳng thắn với các hệ thống như vậy rủi ro lan truyền vào các mối quan hệ xã hội thực của người dùng, thông qua lực của thói quen.
Có thể lập luận rằng các LLM chưa được sử dụng rộng rãi trong các ngữ cảnh xã hội thực để văn học nghiên cứu xác nhận trường hợp sau; nhưng bài báo mới này thực sự đặt ra một số nghi ngờ thú vị về lợi ích của việc nhân hóa các hệ thống AI loại này.
Một nghiên cứu vào tháng trước từ Stanford đề xuất (trái ngược với một nghiên cứu năm 2020) rằng việc đối xử với các LLM như thể chúng là con người cũng rủi ro làm giảm ý nghĩa của ngôn ngữ, kết luận rằng ‘lịch sự máy móc’ cuối cùng sẽ mất ý nghĩa xã hội ban đầu:
[Một] tuyên bố dường như thân thiện hoặc chân thành từ một người nói có thể không mong muốn nếu nó đến từ một hệ thống AI vì hệ thống đó thiếu cam kết có ý nghĩa hoặc ý định đằng sau tuyên bố, do đó làm cho tuyên bố trở nên rỗng và lừa đảo.
Tuy nhiên, khoảng 67 phần trăm người Mỹ cho biết họ lịch sự với các bot trò chuyện AI của mình, theo một khảo sát năm 2025 từ Future Publishing. Hầu hết cho biết đó chỉ là ‘điều đúng đắn để làm’, trong khi 12 phần trăm thừa nhận họ đang cẩn thận – chỉ để đề phòng máy móc có thể nổi lên.
* Chuyển đổi của tôi các trích dẫn nội tuyến của tác giả thành các liên kết. Một mức độ, các liên kết là tùy ý/ví dụ, vì các tác giả tại một số điểm liên kết đến một loạt các trích dẫn chú thích, thay vì một ấn phẩm cụ thể.
Được xuất bản lần đầu vào thứ Tư, ngày 30 tháng 4 năm 2025. Sửa đổi vào thứ Tư, ngày 30 tháng 4 năm 2025 15:29:00, để định dạng.












