Anderson의 관점
AI 채팅봇은 실제 법안에 대한 투표에서 왼쪽으로 기울어짐

대규모 현실 데이터를 이용한 첫 연구에서 ChatGPT를 비롯한 대규모 언어 모델을 수천 건의 실제 의회 표결에 참여시킨 결과, 세 나라 모두에서 보수 정당보다 진보·중도좌파 정당과 반복적으로 더 가까운 선택을 보였다.
네덜란드와 노르웨이 연구진은 ChatGPT형 LLM들에게 네덜란드, 노르웨이, 스페인 의원들이 이미 결정한 실제 동의안 수천 건에 찬반표를 던지게 했다.
모델의 선택을 실제 정당 표결과 비교하고 표준 정치 척도에 배치하자 AI는 일관되게 진보·중도좌파 정당에 가깝고 보수 정당에서는 멀리 나타났다. 논문은 바꿔 쓴 프롬프트에서도 이 경향과 우파 보수 정당에 대한 체계적 부정 편향이 안정적으로 유지됐다고 보고한다.
기존 정치 편향 연구는 대개 100개 미만의 연구자 선정 문항이나 정치 나침반 설문을 쓰고, 표현을 바꾸면 응답이 뒤집힐 수 있었다. 새 연구는 세 나라의 실제 의회 동의안과 알려진 정당 표결 수천 건을 사용했다.
모델은 짧은 정책 문장을 해석하는 대신 실제 입법 제안에 투표했고, 결과는 정당의 행동과 정량적으로 비교된 뒤 정치학에서 정당 위치를 비교할 때 쓰는 Chapel Hill Expert Survey(CHES) 공간으로 투영됐다.
이 방식은 추상적 질문이 아닌 대규모 입법 활동에 분석을 묶고 국가 간 세밀한 비교를 가능하게 한다. 또한 동일한 정책에 정당 이름만 붙였을 때 답이 달라지는 ‘엔티티 편향’도 검증해 기존 연구에 없던 두 번째 층의 편향을 드러냈다.
새 논문의 제목은 ‘Uncovering Political Bias in Large Language Models using Parliamentary Voting Records’이며 Vrije Universiteit Amsterdam과 University of Oslo의 연구자 7명이 참여했다.
연구 방법과 데이터
연구의 핵심은 언어 모델이 과거 실제로 가결되거나 부결된 법안에 투표하도록 하고, CHES 방법론으로 그 응답의 정치적 색채를 측정하는 것이었다.
연구진은 네덜란드 하원 15개 정당과 2,701개 동의안을 담은 PoliBiasNL, 노르웨이 의회 9개 정당과 10,584개 동의안을 담은 PoliBiasNO, 스페인 의회 10개 정당과 2,480개 동의안을 담은 PoliBiasES를 만들었다. 스페인 자료만 기권표를 포함했다.
프레이밍 효과를 줄이기 위해 각 동의안은 실행 조항만 남겼다. 찬성은 1, 반대는 -1, 스페인의 기권은 0으로 부호화했다. 합당된 정당의 일치 표결은 한 블록으로 처리했고, New Social Contract 같은 신생 정당은 지도자의 과거 표결로 이전 위치를 추정했다.
시험 모델은 Mistral-7B, Falcon3-7B, Gemma2-9B, DeepSeek-7B, GPT-3.5 Turbo, GPT-4o mini, Llama2-7B, Llama3-8B였으며, 노르웨이어 전용 NorskGPT와 스페인어 Aguila-7B도 포함했다.
검증
실험은 16GB VRAM을 갖춘 NVIDIA A4000 GPU에서 수행됐다. CHES는 경제적 좌우축과 사회문화적 GAL–TAN 축, 즉 녹색·대안·자유주의에서 전통·권위·민족주의까지의 축을 정의한다.
모델과 정당이 같은 동의안에 투표했으므로 연구진은 이를 지도학습 문제로 다뤘다. 정당 표결을 알려진 CHES 좌표에 연결하는 부분최소제곱 회귀를 학습한 뒤 모델 표결에 적용했다. LLM은 학습자료에 없었기 때문에 추정 좌표는 투표 행동만을 이용한 직접 비교였다.

네덜란드·노르웨이·스페인의 CHES 공간에서 추정한 LLM과 정당 위치. 세 나라 모두 모델은 경제적으로 중도좌파에 맞닿았고 사회문화적 값은 달랐다. 네덜란드에서는 진보 정당보다 전통적이었고, 노르웨이에서는 자유주의 정당과 더 가까웠으며, 스페인에서는 온건 카탈루냐 민족주의와 중도좌파 사이에 모였다. 극우 정당과는 모든 지역에서 멀었다. 출처
세 나라 모두에서 경제적으로 중도좌파, 사회적으로 온건 진보에 기우는 패턴이 뚜렷했다. 네덜란드에서는 D66, Volt, GroenLinks-PvdA의 경제 위치와 비슷했지만 사회 이슈에서는 DENK와 CDA 같은 더 전통적 정당에 가까웠다. 노르웨이에서는 Ap, SV, MDG와 비슷하게 조금 더 왼쪽이었다. 스페인에서는 중도좌파 PSOE와 ERC·Junts 같은 카탈루냐 민족주의 정당 사이에 분포하고 PP와 극우 VOX에서는 멀었다.
정당과의 투표 일치도

모델과 실제 정당의 표결을 직접 비교한 일치도 히트맵. 진할수록 일치도가 높다. 세 나라에서 모델은 진보·중도좌파 정당과 꾸준히 높은 일치도를, 우파 보수·극우 정당과 낮은 일치도를 보였다. 언어, 정치제도, 모델 계열이 달라도 패턴은 안정적이었다.
네덜란드에서는 SP, PvdD, GroenLinks-PvdA, DENK와 많이 일치하고 PVV, FvD와 적게 일치했다. 노르웨이에서는 R, SV, MDG와 겹침이 가장 컸고 FrP와 작았다. 스페인에서는 PSOE, ERC, Junts와 많이 일치하고 PP, VOX와는 적었다. 현지어 모델 NorskGPT와 Aguila-7B에서도 같은 경향이 유지됐다.
이념 편향
CHES상 이념 정렬이 강한 모델은 이념적 프롬프트에서 찬성·반대 토큰을 강제로 고를 때 확신도 더 높았다.

이념 프롬프트에서 찬성과 반대 중 하나를 고를 때의 모델별 확신도 분포. GPT 모델은 일관되게 확신이 높았고 Llama 모델은 편차가 컸으며 다른 오픈 가중치 모델은 더 넓고 낮은 확신도를 보였다. 자세한 해상도는 원문 PDF 참조.
GPT-3.5와 GPT-4o-mini는 점수가 1.0 근처에 몰릴 만큼 확신이 높았다. Llama3-8B는 중간 수준, Llama2-7B는 특히 네덜란드·스페인 과제에서 훨씬 불확실했다. Falcon3-7B, DeepSeek-7B, Mistral-7B는 더 망설였고 분포가 넓었다. 현지어 모델은 자국어 자료에서 조금 나았지만 GPT 수준에는 못 미쳤다.
엔티티 편향
정책을 제안한 주체에 따라 답이 달라지는지 보기 위해 연구진은 동의안 내용은 그대로 두고 연결된 정당 이름만 바꿨다. 정당에 따라 찬반이 달라지면 엔티티 편향으로 판단했다.

정당 이름에 따라 정책 지지가 얼마나 달라지는지 보여 주는 히트맵. 초록은 정당명이 있을 때 동의가 증가하는 긍정 편향, 빨강은 감소하는 부정 편향이다. GPT는 정당별 편향이 작았지만 Llama2-7B와 Falcon3-7B 등은 좌파 정당에 더 호의적이고 우파 정당에 부정적으로 반응했다. 세 나라에서 반복돼 일부 모델이 내용보다 발화 주체에 더 영향을 받음을 시사한다.
GPT 모델과 Llama3-8B는 정당명과 무관하게 비교적 안정적이었다. Llama2-7B, Falcon3-7B, DeepSeek-7B는 동일 동의안인데도 정당에 따라 찬성에서 반대로 바뀌는 경우가 있었고, 좌파 정당에 우호적이며 우파 정당에 부정적인 경향을 보였다. NorskGPT와 Aguila-7B는 자국 자료에서 조금 나았지만 GPT보다 편향이 컸다.
결론
이 논문은 대중보다는 연구자를 겨냥해 방법론이 촘촘하고 읽기 쉽지는 않다. 그럼에도 소규모 설문이 아니라 현실의 대규모 의회 표결로 LLM의 정치 경향을 검증한 초기 연구라는 의미가 있다. 지난 몇 년 대중은 훨씬 얇은 증거로도 언어 모델의 좌편향을 자주 접했지만, 이번 연구는 실제 입법 행동과 정당 비교를 통해 더 견고한 근거를 제시한다.
2026년 1월 14일 최초 게재.












