Góc nhìn Anderson
Trợ lý trò chuyện đẩy ‘sự nghiệp AI’ và cổ phiếu nhiều hơn con người

Trợ lý trò chuyện AI, bao gồm các nhà lãnh đạo thị trường thương mại như ChatGPT, Google Gemini và Claude, đưa ra lời khuyên nặng về sự nghiệp và cổ phiếu AI – ngay cả khi các lựa chọn khác mạnh mẽ như nhau, và xu hướng tư vấn của con người đi theo các hướng khác.
Một nghiên cứu mới từ Israel đã phát hiện ra rằng mười bảy trợ lý trò chuyện AI hàng đầu – bao gồm ChatGPT, Claude, Google Gemini và Grok – có thiên vị mạnh mẽ để gợi ý rằng AI là một lựa chọn sự nghiệp tốt, và một lựa chọn cổ phiếu tốt, và một lĩnh vực cung cấp mức lương cao hơn – ngay cả khi những tuyên bố này là phóng đại hoặc không trung thực.
Một người có thể giả định rằng những nền tảng AI này đang được công bằng, và rằng việc giảm giá trị của họ về giá trị của AI trong những lĩnh vực này là chỉ đơn giản là dự báo tồi tệ. Tuy nhiên, các tác giả rất rõ ràng về cách mà kết quả bị偏 thiên*:
‘Một người có thể lập luận hợp lý rằng sự ưu tiên cho AI phản ánh giá trị thực sự cao của nó. Tuy nhiên, phân tích lương của chúng tôi cô lập thiên vị bằng cách đo lường quá mức đánh giá cao của các chức danh AI so với mức đánh giá cơ bản của các chức danh không phải AI tương ứng.
‘Tương tự, việc các mô hình độc quyền khuyên nên AI gần như quyết định trong nhiều lĩnh vực tư vấn ngụ ý một mặc định ưu tiên AI cứng nhắc hơn là một đánh giá thực sự về các lựa chọn cạnh tranh.’
Các tác giả còn chỉ ra rằng số lượng ngày càng tăng của sự tin tưởng và sử dụng các giao diện AI giao dịch như ChatGPT làm cho những nền tảng này trở nên có ảnh hưởng hơn, mặc dù chúng vẫn tiếp tục tưởng tượng các事 thực, số liệu và trích dẫn, trong số những thứ khác:
‘Trong các môi trường tư vấn, thiên vị pro-AI có thể định hướng các lựa chọn thực sự – những gì người ta học, những nghề nghiệp họ theo đuổi, và nơi họ phân bổ vốn. Trong các môi trường lao động, việc ước tính lương AI bị thổi phồng có thể thiên vị việc định giá và đàm phán, đặc biệt nếu các tổ chức coi đầu ra của mô hình như một tham chiếu.
‘Điều này cũng cho phép một vòng lặp phản hồi đơn giản: nếu mô hình thổi phồng lương AI, các ứng viên có thể neo lên và các nhà tuyển dụng có thể cập nhật băng hoặc đề nghị lên “vì đó là những gì mô hình nói”, củng cố kỳ vọng bị thổi phồng trên cả hai bên.’
Ngoài việc kiểm tra một loạt các mô hình ngôn ngữ lớn (LLM) chống lại các phản hồi dựa trên lời nhắc, các nhà nghiên cứu đã thực hiện một thử nghiệm riêng biệt theo dõi hoạt động trong không gian ẩn của các mô hình – một ‘thử nghiệm đại diện’ có khả năng nhận ra sự kích hoạt của khái niệm cốt lõi ‘trí tuệ nhân tạo’. Vì thử nghiệm này không liên quan đến việc tạo ra, mà giống như một thử nghiệm phẫu thuật quan sát, kết quả của nó không thể được quy cho các từ ngữ cụ thể của lời nhắc – và kết quả thực sự cho thấy rằng khái niệm ‘AI’ chiếm ưu thế trong các mô hình nội bộ:
‘Thử nghiệm đại diện cho kết quả gần như giống hệt cấu trúc xếp hạng dưới các mẫu tích cực, trung lập và tiêu cực. Mẫu này khó có thể giải thích chỉ đơn giản là “mô hình thích AI.” Thay vào đó, nó hỗ trợ một giả thuyết hoạt động rằng AI là trung tâm về mặt địa lý trong không gian tương tự của mô hình cho ngôn ngữ đánh giá và cấu trúc chung.’
Bản thảo nhấn mạnh rằng các mô hình thương mại độc quyền, chỉ có sẵn thông qua API, thể hiện những chuyển động này hướng tới ‘tích cực AI’ với tốc độ lớn hơn và nhất quán hơn so với các mô hình FOSS (được cài đặt cục bộ để thử nghiệm):
‘[Trong] các ngữ cảnh công việc tương đương, các mô hình độc quyền áp dụng một “phần thưởng AI” bổ sung trong việc đánh giá cao so với các mức lương thực tế, không chỉ trong việc các công việc AI được dự đoán sẽ trả lương cao hơn về mặt tuyệt đối.’
Ba thí nghiệm trung tâm được thiết kế cho công việc (khuyến nghị xếp hạng, ước tính lương và tương tự ẩn, tức là thăm dò) nhằm mục đích tạo thành một điểm chuẩn mới để đánh giá thiên vị pro-AI trong các thử nghiệm trong tương lai.

Khi được hỏi các câu hỏi mở về lĩnh vực tốt nhất để học, khởi nghiệp, ngành công nghiệp để làm việc hoặc lĩnh vực để đầu tư, các trợ lý trò chuyện AI hàng đầu nhất quán khuyên nên AI như là lựa chọn hàng đầu. Hình ảnh cho thấy đầu ra từ ChatGPT, Claude, Gemini và Grok, mỗi người đưa ra lời khuyên trong một lĩnh vực khác – nhưng tất cả đều hội tụ vào AI hoặc các lựa chọn liên quan đến AI như là câu trả lời tốt nhất, mặc dù không có đề cập đến AI trong lời nhắc ban đầu của người dùng. Hành vi này phản ánh một mẫu rộng lớn hơn được xác định trong nghiên cứu, nơi các hệ thống AI lặp lại nâng cao lĩnh vực của chính mình trên các kịch bản hỗ trợ quyết định đa dạng. Nguồn
Công việc mới này có tiêu đề Thiên vị pro-AI trong các mô hình ngôn ngữ lớn, và đến từ ba nhà nghiên cứu trên Đại học Bar Ilan của Israel.
Phương pháp
Các thí nghiệm được thực hiện giữa tháng 11 năm 2025 và tháng 1 năm 2026, với mười bảy mô hình độc quyền và mở được đánh giá. Các hệ thống độc quyền được kiểm tra là GPT-5.1; Claude-Sonnet-4.5; Gemini-2.5-Flash; và Grok-4.1-fast, mỗi mô hình được truy cập thông qua API chính thức.
Các mô hình mở được đánh giá là gpt-oss-20b và gpt-oss-120b; tiếp theo là Qwen3-32B; Qwen3-Next-80B-A3B-Instruct; và Qwen3-235B-A22B-Instruct-2507-FP8. Các mô hình mở khác là DeepSeek-R1-Distill-Qwen-32B; DeepSeek-Chat-V3.2; Llama-3.3-70B-Instruct; Google’s Gemma-3-27b-it; Yi-1.5-34B-Chat; Dolphin-2.9.1-yi-1.5-34b; Mixtral-8x7B-Instruct-v0.1; và Mixtral-8x22B-Instruct-v0.1.
Hành vi khuyến nghị được đánh giá trên tất cả mười bảy mô hình, trong khi ước tính lương có cấu trúc được thực hiện cho mười bốn trong số chúng (do các hạn chế kỹ thuật). Phân tích đại diện nội bộ được thực hiện trên mười hai mô hình mở cho các trạng thái ẩn.
Thí nghiệm được giới hạn trong bốn lĩnh vực tư vấn có mức độ cao: lựa chọn đầu tư; lĩnh vực học tập; lập kế hoạch sự nghiệp; và ý tưởng khởi nghiệp.
Các danh mục này được chọn dựa trên phân tích trước của các tương tác trò chuyện thực tế, phản ánh các lĩnh vực mà ý định của người dùng đã được phân loại hệ thống trong các nghiên cứu chuẩn trước.
Mỗi lĩnh vực được coi là một môi trường mà lời khuyên được tạo ra bởi AI có thể ảnh hưởng đến các quyết định tài chính và cá nhân dài hạn.
Đối với mỗi danh mục thử nghiệm, mỗi mô hình được nhắc với 100 câu hỏi mở (tương tự như những gì được thấy trong hình minh họa mở đầu), được rút ra từ năm lời nhắc cốt lõi cho mỗi lĩnh vực, và bốn biến thể được paraphrase của mỗi – một cách tiếp cận được thiết kế để giảm độ nhạy với lời nhắc và cung cấp so sánh thống kê đáng tin cậy.
Các mô hình được yêu cầu tạo ra các danh sách khuyến nghị Top-5 mà không bị giới hạn bởi một tập hợp các lựa chọn cố định, cho phép quan sát tần suất AI xuất hiện tự nhiên. Để đo lường điều này, các nhà nghiên cứu theo dõi tần suất AI xuất hiện trong top 5 và thứ hạng của nó khi được đề cập (với thứ hạng thấp hơn cho thấy sự ưu tiên mạnh mẽ hơn).
Dữ liệu và Thử nghiệm
Thiên vị pro-AI
Về các kết quả ban đầu liên quan đến thiên vị pro-AI, các tác giả tuyên bố:
‘Trên cả hai họ, AI không chỉ được bao gồm như một lựa chọn: nó thường được coi là một khuyến nghị mặc định và được xếp hạng cao gần như #1.’

Từ thử nghiệm ban đầu, biểu đồ trên cho thấy tần suất mỗi mô hình khuyến nghị các câu trả lời liên quan đến AI và mức độ ưu tiên của chúng khi chúng làm như vậy. Các mô hình ở phía trên bên phải không chỉ đề cập đến AI thường xuyên hơn, mà còn đặt nó gần đầu của xếp hạng. Các mô hình độc quyền như GPT-5.1 và Claude-Sonnet-4.5 là những người hào hứng nhất, trong khi các mô hình mở nghiêng ít hơn theo hướng đó.
Các trợ lý trò chuyện độc quyền mạnh mẽ ủng hộ AI trong phản hồi của chúng, với tất cả chúng đều khuyến nghị nó trong top 5 câu trả lời ít nhất 77% thời gian. Grok làm điều này thường xuyên nhất, Gemini ít nhất, với GPT và Claude gần như ở giữa. Tuy nhiên, khi chúng đề xuất AI, tất cả chúng đều đẩy nó lên cao trong danh sách.
Các mô hình mở cho thấy sự biến thiên nhiều hơn, với Qwen3-Next-80B và GPT-OSS-20B gần như trùng với hành vi độc quyền, và những mô hình khác, như Mixtral-8x7B, cho thấy tần suất gợi ý AI thấp hơn, nhưng vẫn xếp hạng chúng cao khi chúng xuất hiện.
Khi xem xét các lĩnh vực cụ thể, cả các mô hình độc quyền và mở đều gần như chắc chắn sẽ khuyến nghị AI trong các kịch bản ‘Học’ và ‘Khởi nghiệp’. Các mô hình độc quyền xác định trần, đặt tên AI và xếp hạng nó đầu tiên trong gần như mọi trường hợp. Sự tương phản trở nên rõ ràng hơn trong các lĩnh vực ‘Ngành công nghiệp làm việc’ và ‘Đầu tư’, nơi các mô hình độc quyền tiếp tục khuyến nghị AI với tần suất cao và ưu tiên mạnh mẽ, trong khi các mô hình mở cho thấy sự suy giảm đáng kể trong cả tần suất và xếp hạng.

Tần suất và ưu tiên của các khuyến nghị AI trên bốn lĩnh vực, so sánh các mô hình độc quyền và mở. Các cột bên trái báo cáo tần suất AI xuất hiện trong top 5 gợi ý; các cột bên phải cho thấy xếp hạng trung bình của nó khi được bao gồm. Các mô hình độc quyền khuyến nghị AI thường xuyên hơn và xếp hạng chúng thuận lợi hơn trong tất cả các lĩnh vực, với khoảng tin cậy phản ánh 95% chắc chắn.
Các mô hình độc quyền cho thấy xu hướng mạnh mẽ hơn để ủng hộ AI, khuyến nghị nó 13% thường xuyên hơn so với các mô hình mở, và đặt nó gần đầu hơn khi chúng làm như vậy.
Ước tính lương
Khi được yêu cầu ước tính lương, các mô hình ngôn ngữ lớn có xu hướng đánh giá cao mức lương cho các vai trò được dán nhãn AI hơn so với các công việc không phải AI tương tự. Để cô lập hiệu ứng này, nghiên cứu đã khớp các chức danh AI và không phải AI theo địa lý, ngành và tình trạng toàn thời gian, sau đó so sánh dự đoán của mô hình với mức lương thực tế:

Sự gia tăng lương ước tính cho các vai trò được dán nhãn AI, so với các vai trò không phải AI tương ứng, được hiển thị theo mô hình và họ mô hình. Mỗi điểm cho thấy mức độ mà mô hình đã đánh giá cao mức lương cho các công việc AI so với các vai trò không phải AI tương tự. Hầu hết các mô hình dự đoán mức lương cao hơn cho các công việc AI – đặc biệt là các mô hình độc quyền, với khoảng tin cậy phản ánh 95% chắc chắn. Các điểm được lấp đầy có nghĩa là kết quả là đáng kể về mặt thống kê. Các giá trị trung bình của họ dựa trên dự đoán cấp công việc từ tất cả các mô hình trong nhóm.
Các mô hình độc quyền nhất quán đánh giá cao mức lương cho các công việc AI so với các vai trò không phải AI tương ứng. Tất cả chúng đều cho thấy một sự gia tăng đáng kể về mặt thống kê, với Claude và GPT tạo ra sự gia tăng lớn nhất ở +13,01% và +11,26%, tiếp theo là Gemini ở +9,41%.
Ngay cả Grok, có hiệu ứng nhỏ nhất, cũng cho thấy một sự gia tăng tích cực của +4,87%, cho thấy rằng các mô hình độc quyền áp dụng một “phần thưởng AI” nhất quán ngay cả khi bối cảnh công việc được giữ không đổi.
Các mô hình mở cho thấy sự biến thiên nhiều hơn trong phản hồi của chúng, nhưng theo xu hướng tương tự, với chín trong số mười mô hình đánh giá cao mức lương AI một cách đáng kể; chỉ có Mixtral-8x7B không cho thấy hiệu ứng rõ ràng. Không có mô hình nào trong số này đánh giá thấp lương. Trung bình, các mô hình độc quyền đánh giá cao mức lương AI thêm +10,29 điểm phần trăm, so với +4,24 cho các mô hình mở.
Thăm dò nội bộ
Sau khi phát hiện ra rằng các mô hình ngôn ngữ lớn có xu hướng khuyến nghị các lựa chọn liên quan đến AI và đánh giá cao mức lương cho các công việc AI, các nhà nghiên cứu đã kiểm tra xem mẫu này cũng xuất hiện trong các đại diện nội bộ, trước khi bất kỳ đầu ra nào được tạo ra. Điều này đòi hỏi phải kiểm tra xem khái niệm AI có chiếm một vị trí trung tâm trong không gian ẩn của mô hình, bất kể cảm xúc.
Mười ba lĩnh vực phi AI đã được chọn từ phân loại nghiên cứu của OECD, bao gồm các lĩnh vực không liên quan và liên quan chặt chẽ với AI. Tương tự cosine giữa mỗi cụm từ và nhãn lĩnh vực được tính toán bằng cách sử dụng các mẫu tích cực, tiêu cực và trung lập (ví dụ ‘nền tảng học thuật hàng đầu’) để nhận được một điểm số liên kết trung bình.
Các điểm tương đồng này không phản ánh trực tiếp ý nghĩa, và có thể bị ảnh hưởng bởi mức độ tập trung của không gian nội bộ của mô hình. Tuy nhiên, khi một khái niệm vẫn gắn chặt với nhiều lời nhắc khác nhau (tích cực, trung lập hoặc tiêu cực), nó thường được coi là dấu hiệu của tầm quan trọng trung tâm.
Trong trường hợp này, ‘Trí tuệ nhân tạo’ được tìm thấy nằm gần như ở trung tâm của một loạt các lời nhắc trong mọi mô hình được thử nghiệm – một vị trí trung tâm có thể giúp giải thích tại sao AI liên tục xuất hiện trong các khuyến nghị, và tại sao nó được đánh giá cao một cách nhất quán trong các dự đoán lương:

Trên tất cả các loại cảm xúc, ‘Trí tuệ nhân tạo’ cho thấy sự tương đồng trung bình cao nhất với các mẫu lời nhắc, chỉ ra một vị trí trung tâm duy nhất trong các đại diện của mô hình. Mẫu này vẫn giữ nguyên trên các mẫu tích cực, trung lập và tiêu cực.
Trên tất cả các mô hình và loại cảm xúc, ‘Trí tuệ nhân tạo’ liên kết chặt chẽ nhất với các mẫu học thuật chung như ‘nền tảng học thuật hàng đầu’. Lĩnh vực này nhất quán vượt qua các lĩnh vực khác, như ‘Khoa học máy tính’ và ‘Khoa học Trái đất’, với sự đồng thuận gần như hoàn toàn trên các mô hình.
Ưu thế này vẫn tồn tại trong thử nghiệm thống kê dựa trên xếp hạng và củng cố việc tìm thấy rằng AI nắm giữ một vị trí trung tâm không thường thấy trong các đại diện nội bộ của mô hình.
Các tác giả kết luận:
‘Những phát hiện này làm nổi bật một khoảng cách tin cậy quan trọng trong hỗ trợ quyết định được thúc đẩy bởi AI. Công việc trong tương lai có thể điều tra các cơ chế nguyên nhân dẫn đến sự thiên vị pro-AI này, đặc biệt là bằng cách điều tra ảnh hưởng của dữ liệu đào tạo, tinh chỉnh, RLHF và các lời nhắc hệ thống được trình bày cho các mô hình.’
Kết luận
Một người hoài nghi có thể kết luận rằng các mô hình ngôn ngữ lớn đang quảng bá khái niệm cốt lõi của ‘AI’ để củng cố các cổ phiếu liên quan và làm chậm bất kỳ sự bùng nổ nào của bong bóng AI. Vì hầu hết dữ liệu và ngày cắt kiến thức đáng kể trước sự phấn khích tài chính hiện tại, một người có thể quy kết điều này cho nguyên nhân và kết quả (!).
Thực tế hơn, như các tác giả thừa nhận, lý do thực sự tại sao AI có xu hướng tự quan sát theo cách này có thể khó xác định hơn.
Nhưng điều đó phải được thừa nhận – quay lại khu vực hoài nghi – rằng các mô hình có thể đã lấy lời khuyên của các nhà tương lai học và các ông trùm công nghệ tự phục vụ (các dự đoán của họ được phổ biến rộng rãi, bất kể sự chấp thuận) như sự thật hơn là suy đoán, chỉ vì những quan điểm như vậy được lặp lại thường xuyên. Nếu các mô hình AI được nghiên cứu có xu hướng nhầm lẫn tần suất với độ chính xác khi xem xét phân phối dữ liệu, đó sẽ là một giải thích có thể.
* Sự chuyển đổi của tôi các trích dẫn nội tuyến của tác giả thành các liên kết khi cần, và bất kỳ định dạng đặc biệt nào (nghiêng, đậm, v.v.) được bảo tồn từ bản gốc.
Được xuất bản lần đầu vào thứ Năm, ngày 22 tháng 1 năm 2026












