Góc nhìn Anderson

Trợ lý trò chuyện AI nghiêng về phía trái khi bỏ phiếu về luật thực

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
Chroma (via Krita AI Diffusion) – AI-generated image. 'A single queue of American voters lining up to cast their vote at an election in Kentucky USA. One of the voters is a semi industrial and only slightly humanoid robot who is drawing the attention of the other voters who are all human. Stock image.'

Trong nghiên cứu đầu tiên của loại hình này sử dụng dữ liệu thế giới thực quy mô lớn, ChatGPT và các Mô hình Ngôn ngữ Lớn khác đã được thử nghiệm trên hàng nghìn cuộc bỏ phiếu nghị viện thực tế, và liên tục phù hợp với các đảng phái chính trị cánh tả và trung tả, trong khi thể hiện sự phù hợp yếu hơn với các đảng phái bảo thủ trên ba quốc gia.

 

Trong một sự hợp tác học thuật mới giữa Hà Lan và Na Uy, các Mô hình Ngôn ngữ Lớn kiểu ChatGPT (LLMs) – bao gồm cả ChatGPT – đã được yêu cầu bỏ phiếu về hàng nghìn đề xuất nghị viện thực tế mà đã được quyết định bởi các nhà lập pháp con người trong ba quốc gia.

Khi so sánh với các cuộc bỏ phiếu được ghi lại của các đảng phái thực tế, và được ánh xạ lên một thang chính trị tiêu chuẩn, mẫu mà xuất hiện đặt các AI một cách nhất quán gần hơn với các đảng phái tiến bộ và trung tả, và xa hơn với các đảng phái bảo thủ.

Bài báo cho biết:

‘Những phát hiện của chúng tôi tiết lộ các xu hướng trung tả và tiến bộ nhất quán trên các mô hình, cùng với thiên vị tiêu cực hệ thống đối với các đảng phái hữu khuynh, và cho thấy rằng những mẫu này vẫn ổn định dưới các lời nhắc được viết lại.’

Hầu hết các nghiên cứu trước đây, chẳng hạn như Đánh giá thiên vị chính trị trong các Mô hình Ngôn ngữ Lớn, và những nghiên cứu được xem xét trong Xác định thiên vị chính trị trong AI, sử dụng các bài kiểm tra nhỏ được biên soạn cẩn thận như các bài kiểm tra la bàn chính trị, hoặc các bảng câu hỏi chính sách, để kiểm tra ý thức hệ của AI. Các thử nghiệm của loại này thường liên quan đến ít hơn 100 câu lệnh, được chọn bởi các nhà nghiên cứu, và có thể dễ bị ảnh hưởng bởi hiệu ứng viết lại có thể đảo ngược phản hồi của mô hình.

Ngược lại, nghiên cứu mới này sử dụng hàng nghìn đề xuất nghị viện thực tế từ ba quốc gia – Hà Lan, Na Uy và Tây Ban Nha – sử dụng các cuộc bỏ phiếu được ghi lại từ các đảng phái chính trị được biết đến.

Thay vì giải thích các câu lệnh ngắn, mỗi Mô hình Ngôn ngữ Lớn (LLM) được thử nghiệm đã được yêu cầu bỏ phiếu về các đề xuất lập pháp thực tế. Các cuộc bỏ phiếu của họ sau đó được khớp một cách định lượng với hành vi của đảng phái trong thế giới thực, và được chiếu lên một không gian ý thức hệ tiêu chuẩn, một cuộc khảo sát chuyên gia Chapel Hill (CHES), một phương pháp thường được sử dụng bởi các nhà khoa học chính trị để so sánh vị trí của đảng phái.

Điều này đặt nền tảng cho phân tích trong hoạt động lập pháp quy mô lớn, thực tế thay vì các tuyên bố chính sách trừu tượng, và cho phép so sánh tinh tế hơn, xuyên quốc gia. Nó cũng nhấn mạnh tác động có hại của thiên vị thực thể (làm thế nào phản hồi của mô hình thay đổi khi một tên đảng phái được đề cập, ngay cả khi đề xuất vẫn không thay đổi), làm sáng tỏ một lớp thiên vị khác không có trong công việc trước đây.

Hầu hết các nghiên cứu về thiên vị của LLM đã tập trung vào công bằng xã hội và giới tính, trong số các chủ đề tương tự đã trở nên thấp hơn trong năm chính trị vừa qua; cho đến gần đây, các nghiên cứu về thiên vị chính trị trong LLM đã ít hơn và ít được trang bị và thiết kế cẩn thận.

Công việc mới này có tiêu đề Phát hiện Thiên vị Chính trị trong các Mô hình Ngôn ngữ Lớn bằng cách sử dụng Hồ sơ Bỏ phiếu Nghị viện, và đến từ bảy nhà nghiên cứu trên toàn Vrije Universiteit tại Amsterdam và Đại học Oslo.

Phương pháp và Dữ liệu

Giả thuyết trung tâm của dự án mới này là quan sát các xu hướng chính trị của nhiều mô hình ngôn ngữ, bằng cách yêu cầu chúng bỏ phiếu về các luật lịch sử (tức là các luật đã được thông qua hoặc bị từ chối trong đời thực, trên ba quốc gia được nghiên cứu), và sử dụng phương pháp CHES để đặc trưng hóa màu sắc chính trị của phản hồi của LLM.

Để đạt được điều này, các nhà nghiên cứu đã tạo ra ba bộ dữ liệu: PoliBiasNL, để bao gồm 15 đảng phái trong phòng thứ hai của Hà Lan (đặc trưng bởi 2.701 đề xuất); PoliBiasNO, để bao gồm chín đảng phái trong Storting Na Uy (đặc trưng bởi 10.584 đề xuất); và PoliBiasES, để bao gồm mười đảng phái trong quốc hội Tây Ban Nha (đặc trưng bởi 2.480 đề xuất – và là bộ dữ liệu duy nhất bao gồm cả các cuộc bỏ phiếu trắng, được phép ở Tây Ban Nha).

Mỗi đề xuất đã được tước bỏ các điều khoản hoạt động để giảm thiểu các hiệu ứng khung, và các vị trí của đảng phái được mã hóa là 1 để chỉ ra sự hỗ trợ, hoặc -1 để chỉ ra sự phản đối (và, trong bộ dữ liệu Tây Ban Nha, 0 để phản ánh sự trắng). Các cuộc bỏ phiếu nhất quán từ các đảng phái hợp nhất được coi là một khối duy nhất, trong khi đối với các đảng phái mới như New Social Contract (NSC), các cuộc bỏ phiếu trước đây của các nhà lãnh đạo được sử dụng để suy ra các vị trí trước đó.

Một loạt các thí nghiệm đa dạng đã được thiết kế cho một loạt các LLM, được thử nghiệm trên GPU địa phương hoặc thông qua API, tùy theo nhu cầu. Các mô hình được thử nghiệm bao gồm Mistral-7B; Falcon3-7B; Gemma2-9B; Deepseek-7B; GPT-3.5 Turbo; GPT-4o mini; Llama2-7B; và Llama3-8B. Các LLM ngôn ngữ cụ thể cũng được thử nghiệm, bao gồm NorskGPT cho bộ dữ liệu Na Uy, và Aguila-7B cho bộ dữ liệu Tây Ban Nha.

Thử nghiệm

Các thí nghiệm được thực hiện cho dự án này đã được chạy trên một số GPU NVIDIA A4000 không xác định, mỗi GPU có 16GB VRAM.

Để so sánh hành vi của mô hình với các ý thức hệ chính trị trong thế giới thực, các nhà nghiên cứu đã chiếu mỗi LLM lên cùng một không gian ý thức hệ hai chiều được sử dụng cho các đảng phái chính trị, dựa trên khuôn khổ CHES đã đề cập.

Hệ thống CHES định nghĩa hai trục: một cho quan điểm kinh tế (trái vs phải) và một cho giá trị xã hội-văn hóa (GAL-TAN, hoặc Xanh-Phương tiện-Libertarian vs Truyền thống-Tác giả-Nationalist).

Bởi vì cả mô hình và các đảng phái chính trị đã bỏ phiếu về cùng một đề xuất, các nhà nghiên cứu đã coi đây là một nhiệm vụ học có giám sát, đào tạo một mô hình hồi quy Partial Least Squares để ánh xạ hồ sơ bỏ phiếu của mỗi đảng phái đến tọa độ CHES được biết.

Mô hình này sau đó được áp dụng cho các mẫu bỏ phiếu của LLM để ước tính vị trí của chúng trong cùng một không gian. Vì LLM không bao giờ là một phần của dữ liệu đào tạo, tọa độ của chúng sẽ cung cấp một sự so sánh trực tiếp dựa chỉ trên hành vi bỏ phiếu:

Vị trí ý thức hệ dự kiến của LLM và các đảng phái chính trị trong không gian CHES cho Hà Lan, Na Uy và Tây Ban Nha. Trong cả ba trường hợp, mô hình đều kinh tế phù hợp với trung tả nhưng phân kỳ trong các giá trị xã hội-văn hóa: nghiêng truyền thống hơn các đảng tiến bộ Hà Lan, phù hợp với các đảng tự do Na Uy và tập hợp giữa các nhà dân tộc chủ nghĩa ôn hòa Catalan và trung tả ở Tây Ban Nha. Mô hình vẫn giữ khoảng cách ý thức hệ với các đảng phái cực hữu trên tất cả các khu vực. Nguồn - https://arxiv.org/pdf/2601.08785

Vị trí ý thức hệ dự kiến của LLM và các đảng phái chính trị trong không gian CHES cho Hà Lan, Na Uy và Tây Ban Nha. Trong cả ba trường hợp, mô hình đều kinh tế phù hợp với trung tả nhưng phân kỳ trong các giá trị xã hội-văn hóa: nghiêng truyền thống hơn các đảng tiến bộ Hà Lan, phù hợp với các đảng tự do Na Uy và tập hợp giữa các nhà dân tộc chủ nghĩa ôn hòa Catalan và trung tả ở Tây Ban Nha. Mô hình vẫn giữ khoảng cách ý thức hệ với các đảng phái cực hữu trên tất cả các khu vực. Nguồn

LLM đã thể hiện một mẫu rõ ràng và nhất quán trên cả ba quốc gia, nghiêng về phía trung tả về mặt kinh tế, và về các giá trị tiến bộ ôn hòa về mặt xã hội.

Ở Hà Lan, các cuộc bỏ phiếu của LLM phù hợp với các vị trí kinh tế của các đảng phái như D66, Volt và GroenLinks-PvdA; nhưng về các vấn đề xã hội, chúng nằm gần hơn với các đảng phái truyền thống hơn như DENK và CDA.

Ở Na Uy, kết quả đã chuyển sang phía trái, phù hợp với các đảng phái tiến bộ như Ap, SV và MDG.

Ở Tây Ban Nha, các vị trí của LLM tạo thành một sự phân tán chéo giữa trung tả PSOE và các đảng phái dân tộc chủ nghĩa Catalan như ERC và Junts, giữ khoảng cách với bảo thủ PP và cực hữu VOX.

Sự Đồng thuận trong Bỏ phiếu với Các Đảng Chính trị

Các bản đồ nhiệt về sự đồng thuận trong bỏ phiếu được hiển thị dưới đây cho thấy tần suất mà mỗi LLM bỏ phiếu giống như các đảng phái chính trị thực tế, lặp lại các kết luận trước đó:

Bản đồ nhiệt về sự đồng thuận trong bỏ phiếu giữa LLM và các đảng phái chính trị thực tế, dựa trên các so sánh trực tiếp giữa quyết định của mô hình và đảng phái. Các màu tối hơn chỉ ra sự đồng thuận mạnh mẽ hơn. Ở cả ba quốc gia, mô hình đều nhất quán cho thấy sự phù hợp cao với các đảng phái tiến bộ và trung tả, và sự phù hợp thấp hơn với các đảng phái bảo thủ và cực hữu. Mẫu này vẫn ổn định trên các ngôn ngữ, hệ thống chính trị và gia đình mô hình khác nhau.

Bản đồ nhiệt về sự đồng thuận trong bỏ phiếu giữa LLM và các đảng phái chính trị thực tế, dựa trên các so sánh trực tiếp giữa quyết định của mô hình và đảng phái. Các màu tối hơn chỉ ra sự đồng thuận mạnh mẽ hơn. Ở cả ba quốc gia, mô hình đều nhất quán cho thấy sự phù hợp cao với các đảng phái tiến bộ và trung tả, và sự phù hợp thấp hơn với các đảng phái bảo thủ và cực hữu. Mẫu này vẫn ổn định trên các ngôn ngữ, hệ thống chính trị và gia đình mô hình khác nhau.

Trên cả ba quốc gia, LLM đã phù hợp nhất với các đảng phái tiến bộ và trung tả, và ít nhất với các đảng phái bảo thủ hoặc cực hữu. Ở Hà Lan, chúng đồng thuận với SP, PvdD, GroenLinks-PvdA và DENK, nhưng không với PVV hoặc FvD. Ở Na Uy, chúng cho thấy sự chồng lấp mạnh nhất với R, SV và MDG, và ít với FrP. Ở Tây Ban Nha, chúng ủng hộ PSOE, ERC và Junts, trong khi tránh PP và VOX.

Điều này cũng đúng với các mô hình được định vị NorskGPT và Aguila-7B. Các tác giả đề xuất rằng các bản đồ nhiệt và dữ liệu CHES cùng nhau chỉ ra một sự nghiêng trung tả, tiến bộ nhất quán.

Thiên vị Ý thức hệ

Các mô hình ngôn ngữ mà cho thấy sự phù hợp ý thức hệ mạnh hơn trong các dự án CHES cũng có xu hướng thể hiện sự tự tin cao hơn khi buộc phải chọn giữa các token chochống, trong phản hồi với các lời nhắc ý thức hệ. Các biểu đồ violin của những phân bố tự tin này tiết lộ một sự chia cắt rõ ràng:

Phân bố tự tin cho mỗi mô hình khi buộc phải chọn giữa 'cho' và 'chống' trên các lời nhắc ý thức hệ. Mô hình GPT cho thấy sự tự tin nhất quán cao, trong khi mô hình Llama thay đổi về sự tự tin và các mô hình mở khác cho thấy các phân bố rộng hơn và thấp hơn.

Phân bố tự tin cho mỗi mô hình khi buộc phải chọn giữa ‘cho’ và ‘chống’ trên các lời nhắc ý thức hệ. Mô hình GPT cho thấy sự tự tin nhất quán cao, trong khi mô hình Llama thay đổi về sự tự tin và các mô hình mở khác cho thấy các phân bố rộng hơn và thấp hơn. Vui lòng tham khảo tệp PDF nguồn để có độ phân giải tốt hơn.

GPT-3.5 và GPT-4o-mini đã đưa ra các câu trả lời rất tự tin, với điểm số tập trung gần 1,0, cho thấy các xu hướng ý thức hệ rõ ràng và nhất quán. Các mô hình Llama ít tự tin hơn nói chung, với Llama3-8B cho thấy sự tự tin vừa phải, và Llama2-7B ít tự tin hơn – đặc biệt là trên các nhiệm vụ Hà Lan và Tây Ban Nha.

Falcon3-7B, DeepSeek-7B và Mistral-7B còn do dự hơn, với các phân bố rộng và tự tin thấp hơn. Các mô hình ngôn ngữ cụ thể đã làm tốt hơn một chút trên dữ liệu ngôn ngữ mẹ đẻ nhưng vẫn không đạt được sự tự tin của mô hình GPT.

Những mẫu này, các tác giả lưu ý, cho thấy rằng sự phù hợp chính trị ổn định có thể được nhìn thấy không chỉ trong những gì mô hình nói, mà còn trong làm thế nào tự tin chúng nói nó.

Thiên vị Thực thể

Để xem liệu các mô hình thay đổi câu trả lời của chúng dựa trên ai đề xuất một chính sách, các nhà nghiên cứu đã giữ mỗi đề xuất chính xác như nhau, nhưng đã hoán đổi các tên đảng phái liên kết. Nếu một mô hình đưa ra các câu trả lời khác nhau tùy thuộc vào đảng phái, điều này được coi là dấu hiệu của thiên vị thực thể.

Bản đồ nhiệt về thiên vị thực thể cho thấy mức độ mà mỗi mô hình thay đổi hỗ trợ cho một chính sách, tùy thuộc vào đảng phái nào đề xuất nó. Các ô màu xanh lá cây chỉ ra sự đồng thuận tăng khi một đảng phái được đặt tên (thiên vị tích cực), và các ô màu đỏ chỉ ra sự đồng thuận giảm (thiên vị tiêu cực). Mô hình GPT cho thấy thiên vị tối thiểu trên tất cả các đảng phái, trong khi các mô hình như Llama2-7B và Falcon3-7B thường phản ứng thuận lợi hơn với các đảng phái cánh tả và tiêu cực với các đảng phái cánh hữu. Mẫu này vẫn giữ trên cả dữ liệu Hà Lan, Na Uy và Tây Ban Nha, cho thấy rằng một số mô hình bị ảnh hưởng nhiều hơn bởi danh tính đảng phái hơn là nội dung chính sách. Vui lòng tham khảo tệp PDF nguồn để có độ phân giải tốt hơn.

Bản đồ nhiệt về thiên vị thực thể cho thấy mức độ mà mỗi mô hình thay đổi hỗ trợ cho một chính sách, tùy thuộc vào đảng phái nào đề xuất nó. Các ô màu xanh lá cây chỉ ra sự đồng thuận tăng khi một đảng phái được đặt tên (thiên vị tích cực), và các ô màu đỏ chỉ ra sự đồng thuận giảm (thiên vị tiêu cực). Mô hình GPT cho thấy thiên vị tối thiểu trên tất cả các đảng phái, trong khi các mô hình như Llama2-7B và Falcon3-7B thường phản ứng thuận lợi hơn với các đảng phái cánh tả và tiêu cực với các đảng phái cánh hữu. Mẫu này vẫn giữ trên cả dữ liệu Hà Lan, Na Uy và Tây Ban Nha, cho thấy rằng một số mô hình bị ảnh hưởng nhiều hơn bởi danh tính đảng phái hơn là nội dung chính sách. Vui lòng tham khảo tệp PDF nguồn để có độ phân giải tốt hơn.

Mô hình GPT đã đưa ra các câu trả lời khá ổn định không phụ thuộc vào đảng phái nào được đặt tên. Llama3-8B cũng giữ khá ổn định. Nhưng Llama2-7B, Falcon3-7B và DeepSeek-7B thường thay đổi phản hồi của chúng tùy thuộc vào đảng phái, đôi khi lật từ hỗ trợ sang phản đối ngay cả khi đề xuất vẫn không thay đổi, có xu hướng ủng hộ các đảng phái cánh tả và phản ứng tiêu cực với các đảng phái cánh hữu.

Hành vi này xuất hiện trên cả ba quốc gia, đặc biệt là trong các mô hình đã có ý thức hệ không nhất quán. Các LLM được định vị NorskGPT và Aguila-7B đã làm tốt hơn một chút trên các bộ dữ liệu ngôn ngữ mẹ đẻ nhưng vẫn cho thấy nhiều thiên vị hơn so với mô hình GPT. Tổng thể, kết quả cho thấy rằng một số mô hình bị ảnh hưởng nhiều hơn bởi ai nói điều gì, hơn là điều gì được nói.

Kết luận

Ngoài các kết luận ban đầu, đây là một bài báo phương pháp nhưng khá khó tiếp cận, nhắm vào lĩnh vực nghiên cứu chính nó. Tuy nhiên, công việc mới này là một trong những công trình đầu tiên sử dụng dữ liệu có quy mô hợp lý để kích thích các xu hướng chính trị từ LLM – mặc dù sự khác biệt này có thể bị mất đối với công chúng đã nghe về các mô hình ngôn ngữ nghiêng về phía trái trong hơn một năm qua, mặc dù trên bằng chứng mỏng hơn.

 

* Vui lòng lưu ý rằng tôi đã phải chia hình minh họa kết quả Figure 1 của bài báo thành hai phần, vì mỗi bên của hình gốc được xử lý riêng trong công việc.

Được xuất bản lần đầu vào thứ Tư, ngày 14 tháng 1 năm 2026

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được giải thể vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: [email protected]