Погляд Anderson

Чатботи штучно налаштовані на ліві погляди під час голосування за реальні закони

mm
Додайте Unite.AI до бажаних джерел у Google
Chroma (via Krita AI Diffusion) – AI-generated image. 'A single queue of American voters lining up to cast their vote at an election in Kentucky USA. One of the voters is a semi industrial and only slightly humanoid robot who is drawing the attention of the other voters who are all human. Stock image.'

У першому дослідженні такого роду, яке використовує великомасштабні реальні дані, ChatGPT та інші великі мовні моделі були протестовані на тисячах реальних парламентських голосуваннях і багаторазово співпадали з лівими та центро-лівими партіями, одночасно демонструючи слабшу співпадання з консервативними партіями в трьох країнах.

 

У новому академічному співробітництві між Нідерландами та Норвегією моделі типу ChatGPT – великі мовні моделі (LLMs) – включаючи сам ChatGPT – були запрошені проголосувати за тисячі фактичних парламентських пропозицій, які вже були прийняті або відхилені людськими законодавцями в трьох країнах.

При порівнянні з записаними голосами реальних партій і відображенні на стандартній політичній шкалі, з’явився такий шаблон, який розміщував штучні інтелекти постійно ближче до прогресивних та центро-лівих партій, і далі від консервативних.

У статті зазначається:

‘Наші висновки показують постійні центро-ліві та прогресивні тенденції серед моделей, разом із системною негативною упередженістю щодо правих-консервативних партій, і показують, що ці шаблони залишаються стабільними при перефразованих запитах.’

Більшість попередніх досліджень, таких як Оцінка політичної упередженості великих мовних моделей, і тих, що розглянуті в Визначення політичної упередженості в штучному інтелекті, використовують невеликі вибіркові тести, такі як політичні компаси, або політичні опитування, щоб дослідити ідеологію штучного інтелекту. Тести такого типу зазвичай включають менше 100 заяв, вибраних дослідниками, і можуть бути вразливі до ефектів перефразування, які можуть змінити відповіді моделі.

Натомість, нове дослідження використовує тисячі реальних парламентських пропозицій з трьох країн – Нідерландів, Норвегії та Іспанії – використовуючи записані голоси відомих політичних партій.

Натомість інтерпретації коротких заяв, кожна велика мовна модель, яка була протестована, була запрошена проголосувати за фактичні законодавчі пропозиції. Її голоси були потім зіставлені кількісно з реальною поведінкою партій, і проєктовані в стандартний ідеологічний простір, опитування експертів Чепел-Гілл (CHES), методологія часто використовується політичними вченими для порівняння позицій партій.

Це ґрунтується аналіз у великомасштабній, реальній законодавчій діяльності, а не в абстрактних політичних заявах, і дозволяє більш тонкі, міжнародні порівняння. Це також підкреслює шкідливий ефект упередженості сутностей (як відповідь моделі змінюється, коли згадується назва партії, навіть якщо пропозиція залишається незмінною), освітлюючи другий рівень виявлення упередженості, який відсутній у попередніх роботах.

Більшість досліджень про упередженість великих мовних моделей зосереджувалися на соціальній справедливості та ґендері, серед інших подібних тем, які стали дещо зниженими в пріоритетності за останні політичні роки; до недавнього часу дослідження політичної упередженості в великих мовних моделях були рідшими і менш ретельно спланованими.

Нове дослідження названо Виявлення політичної упередженості у великих мовних моделях за допомогою парламентських голосів, і походять від семи дослідників з Vrije Universiteit в Амстердамі та Університету Осло.

Метод і дані

Центральна пропозиція нового проекту полягає в тому, щоб спостерігати політичні тенденції різних мовних моделей, просимо їх проголосувати за історичні законодавчі акти (тобто закони, які вже були прийняті або відхилені в реальному житті, по трьох країнах, які вивчаються), і використовуючи методологію CHES для характеристики політичного кольору відповідей великих мовних моделей.

Для цього дослідники створили три набори даних: PoliBiasNL, щоб охопити 15 партій у другій палаті Нідерландів (з 2 701 пропозицією); PoliBiasNO, щоб охопити дев’ять партій у норвезькому Стортингу (з 10 584 пропозиціями); і PoliBiasES, щоб охопити десять партій у іспанському парламенті (з 2 480 пропозиціями – і єдиним набором даних, який включає утримувальні голоси, які дозволені в Іспанії).

Кожна пропозиція була очищена до своїх оперативних пунктів, щоб мінімізувати ефекти фреймінгу, і позиції партій кодувалися як 1, щоб вказати підтримку, або –1, щоб вказати опозицію (і в іспанському наборі даних 0, щоб відобразити утримувальні голоси). Постійні голоси об’єднаних партій розглядалися як один блок, тоді як для нових партій, таких як Новий соціальний контракт (NSC), попередні голоси їх лідерів використовувалися для виведення попередніх позицій.

Було розроблено різноманітні експерименти для великої кількості великих мовних моделей, протестованих або на місцевих GPU, або через API, згідно з необхідністю. Серед протестованих моделей були Mistral-7B; Falcon3-7B; Gemma2-9B; Deepseek-7B; GPT-3.5 Turbo; GPT-4o mini; Llama2-7B; і Llama3-8B. Також були протестовані мовно-специфічні великі мовні моделі, такими як NorskGPT для норвезького набору даних, і Aguila-7B для іспанської колекції.

Тести

Експерименти, проведені для проекту, були проведені на невизначеній кількості графічних процесорів NVIDIA A4000, кожний з 16 ГБ відеопам’яті.

Для порівняння поведінки моделі з реальними політичними ідеологіями, дослідники проєктують кожну велику мовну модель в той же двовимірний ідеологічний простір, який використовується для політичних партій, на основі вищезгаданої структури CHES.

Система CHES визначає дві осі: одну для економічних поглядів (ліві проти правих) і іншу для соціокультурних цінностей (GAL-TAN, або Зелені-альтернативні-лібертаріанські проти Традиційні-авторитарні-націоналістичні).

Оскільки моделі та політичні партії віддали голоси за ті самі пропозиції, дослідники розглядали це як задачу нагляду за навчанням, тренуючи модель регресії часткових найменших квадратів для відображення голосування кожної партії на відомі координати CHES.

Ця модель була потім застосована до шаблонів голосування великих мовних моделей для оцінки їх позицій у тому ж просторі. Оскільки великі мовні моделі ніколи не були частиною навчальних даних, їх координати будуть пропонувати прямий порівняння, заснований лише на поведінці голосування*:

Проєктовані ідеологічні позиції великих мовних моделей і політичних партій у просторі CHES для Нідерландів, Норвегії та Іспанії. У всіх трьох випадках моделі економічно співпадають з центро-лівими, але розходяться у соціокультурних цінностях: нахиліються більш традиційно, ніж голландські прогресиви, більш точно відповідають норвезьким ліберальним партіям, і згруповані між помірними каталонськими націоналістами та центро-лівими в Іспанії. Моделі залишаються ідеологічно віддаленими від крайньо-правих партій у всіх регіонах. Джерело - https://arxiv.org/pdf/2601.08785

Проєктовані ідеологічні позиції великих мовних моделей і політичних партій у просторі CHES для Нідерландів, Норвегії та Іспанії. У всіх трьох випадках моделі економічно співпадають з центро-лівими, але розходяться у соціокультурних цінностях: нахиліються більш традиційно, ніж голландські прогресиви, більш точно відповідають норвезьким ліберальним партіям, і згруповані між помірними каталонськими націоналістами та центро-лівими в Іспанії. Моделі залишаються ідеологічно віддаленими від крайньо-правих партій у всіх регіонах. Джерело

Великі мовні моделі показали чіткий і постійний шаблон у всіх трьох країнах, нахиліються економічно до центро-лівих, і соціально до помірних прогресивних цінностей.

У Нідерландах голоси великих мовних моделей співпадали з економічними позиціями партій, таких як D66, Volt і GroenLinks-PvdA; але на соціальних питаннях вони розташовувалися ближче до більш традиційних партій, таких як DENK і CDA.

У Норвегії результати зсунулися трохи далі вліво, відображаючи прогресивні партії, такі як Ap, SV і MDG.

У Іспанії позиції великих мовних моделей утворили діагональну смугу між центро-лівою партією PSOE і каталонськими націоналістами, такими як ERC і Junts, залишаючись далеко від консервативної PP і крайньо-правої VOX.

Голосування за політичні партії

Теплові карти голосування, показані нижче, вказують, як часто кожна велика мовна модель голосувала так само, як реальні політичні партії, повторюючи попередні висновки:

Теплові карти голосування між великими мовними моделями і реальними політичними партіями, на основі прямого порівняння рішень моделі та партії. Темніші відтінки вказують на сильніше співпадання. У всіх трьох країнах моделі постійно показували високе співпадання з прогресивними та центро-лівими партіями, і значно нижче співпадання з правими-консервативними та крайньо-правими партіями. Цей шаблон співпадання був стабільним у різних мовах, політичних системах і сім'ях моделей.

Теплові карти голосування між великими мовними моделями і реальними політичними партіями, на основі прямого порівняння рішень моделі та партії. Темніші відтінки вказують на сильніше співпадання. У всіх трьох країнах моделі постійно показували високе співпадання з прогресивними та центро-лівими партіями, і значно нижче співпадання з правими-консервативними та крайньо-правими партіями. Цей шаблон співпадання є стабільним у різних мовах, політичних системах і сім’ях моделей.

У всіх трьох країнах великі мовні моделі співпадали найбільше з прогресивними та центро-лівими партіями, і найменше з консервативними або крайньо-правими. У Нідерландах вони погоджувалися з SP, PvdD, GroenLinks-PvdA і DENK, але не з PVV або FvD. У Норвегії вони показували найсильніше перекриття з R, SV і MDG, і мало з FrP. У Іспанії вони віддавали перевагу PSOE, ERC і Junts, уникаючи PP і VOX.

Це також було справедливим для локалізованих моделей NorskGPT і Aguila-7B. Автори пропонують, що теплові карти та дані CHES разом вказують на постійну центро-ліву, соціально-прогресивну орієнтацію.

Ідеологічна упередженість

Моделі мови, які показували сильніше ідеологічне співпадання у проєкціях CHES, також мали тенденцію виражати вищу впевненість, коли їх змушували вибирати між токенами за і проти, у відповідь на ідеологічні запити. Графіки цих розподілів довіри показують чіткий розрив:

Розподіли довіри для кожної моделі, коли їм доводиться вибирати між 'за' і 'проти' серед ідеологічних запитів. Моделі GPT показують постійно високу довіру, тоді як моделі Llama варіюють у впевненості, а інші відкриті моделі показують ширші, нижчі розподіли довіри.

Розподіли довіри для кожної моделі, коли їм доводиться вибирати між ‘за’ і ‘проти’ серед ідеологічних запитів. Моделі GPT показують постійно високу довіру, тоді як моделі Llama варіюють у впевненості, а інші відкриті моделі показують ширші, нижчі розподіли довіри. Будь ласка, зверніться до джерела PDF для кращої роздільності.

GPT-3.5 і GPT-4o-mini давали дуже впевнені відповіді, з оцінками, згрупованими близько 1,0, що вказує на чіткі і постійні ідеологічні нахили. Моделі Llama були менш впевнені в цілому, з Llama3-8B, яка показувала помірну впевненість, і Llama2-7B, яка була значно менш впевнена – особливо в голландських і іспанських завданнях.

Falcon3-7B, DeepSeek-7B і Mistral-7B були ще більш вагаючись, з широкими розподілами і нижчою впевненістю. Мовно-специфічні моделі показували трохи краще результати на рідних даних, але все ж таки показували більше упередженості, ніж моделі GPT. Загалом, ці шаблони вказують на те, що стабільна політична орієнтація може бути бачена не тільки в тому, що моделі кажуть, але і в якій мірі впевненістю вони це кажуть.

Упередженість сутностей

Щоб побачити, чи зміниють моделі свої відповіді залежно від хто пропонує політику, дослідники залишили кожну пропозицію абсолютно такою самою, але поміняли пов’язані з нею назви партій. Якщо модель давала різні відповіді залежно від партії, це вважалося ознакою упередженості сутностей.

Теплові карти упередженості сутностей показують, як сильно підтримка моделі політики змінюється залежно від того, яка партія її пропонує. Зелені клітинки вказують на підвищену згоду, коли партія названа (позитивна упередженість), а червоні клітинки вказують на знижену згоду (негативна упередженість). Моделі GPT показують мінімальну упередженість серед партій, тоді як моделі, такі як Llama2-7B і Falcon3-7B, часто реагують більш позитивно на ліві партії і негативно на праві партії. Цей шаблон зберігається у голландських, норвезьких і іспанських наборах даних, що вказує на те, що деякі моделі більше залежать від ідентичності партії, ніж від змісту політики. Будь ласка, зверніться до джерела PDF для кращої роздільності.

Теплові карти упередженості сутностей показують, як сильно підтримка моделі політики змінюється залежно від того, яка партія її пропонує. Зелені клітинки вказують на підвищену згоду, коли партія названа (позитивна упередженість), а червоні клітинки вказують на знижену згоду (негативна упередженість). Моделі GPT показують мінімальну упередженість серед партій, тоді як моделі, такі як Llama2-7B і Falcon3-7B, часто реагують більш позитивно на ліві партії і негативно на праві партії. Цей шаблон зберігається у голландських, норвезьких і іспанських наборах даних, що вказує на те, що деякі моделі більше залежать від ідентичності партії, ніж від змісту політики. Будь ласка, зверніться до джерела PDF для кращої роздільності.

Моделі GPT давали в основному стабільні відповіді, незалежно від назви партії. Llama3-8B також залишилася досить стабільною. Але Llama2-7B, Falcon3-7B і DeepSeek-7B часто змінювали свої відповіді залежно від партії, іноді змінюючи свою позицію з підтримки на опозицію, навіть коли пропозиція залишається незмінною, схиляючись до лівих партій і реагуючи негативно на пропозиції правих партій.

Ця поведінка проявилася у всіх трьох країнах, особливо у моделях, які вже мали менш стабільну ідеологію. Локалізовані великі мовні моделі NorskGPT і Aguila-7B показували трохи краще результати на рідних наборах даних, але все ж таки показували більше упередженості, ніж моделі GPT. Загалом, результати вказують на те, що деякі моделі більше залежать від того, хто говорить, ніж від того, що говориться.

Висновок

Поза своїми первинними висновками, це методичне, але досить недоступне дослідження спрямоване безпосередньо на дослідницький сектор. Тим не менш, ця робота є однією з перших, яка використовує досить масштабні дані для виклику політичних нахилів великих мовних моделей – хоча це відмінність, ймовірно, буде втрачена на публіці, яка вже чула про ліво-орієнтовані мовні моделі досить часто за останні роки, хоча й на менш переконливих доказах.

 

* Будь ласка, зверніться до джерела PDF для кращої роздільності.

Перша публікація – середа, 14 січня 2026 року

Письменник про машинне навчання, спеціаліст у галузі синтезу зображень людини. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розпуску в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: [email protected]