Погляд Anderson

Штучні інтелектуальні моделі віддають перевагу навіть неправильним відповідям людини над правильними відповідями штучного інтелекту

mm
Додайте Unite.AI до бажаних джерел у Google
An AI-generated photo of the Abraham Lincoln memorial thronged with tourists, next to a copy of the seated Lincoln statue, which has been substituted by a shiny robot. The robot has no tourists at its feet. Model: GPT-1.5.

Штучні інтелектуальні моделі мови значно частіше схиляються до позиції людських експертів, ніж до інших штучних інтелектів, навіть коли експерти помиляються, що свідчить про вбудовану упередженість щодо людської влади.

 

Нові дослідження в США виявили, що ряд провідних відкритих і пропріетарних великомасштабних мовних моделей (LLM) схильні надавати авторитет джерелам інформації, які вони розпізнають як “людські”, а не джерелам, які вони розпізнають як “штучні” – навіть тоді, коли людські відповіді неправильні, а відповіді, надані штучним інтелектом, правильні.

Автори зазначають:

‘У всіх завданнях моделі значно частіше погоджуються з відповідями, позначеними як надані людськими експертами, включаючи випадки, коли цей сигнал неправильний, і змінюють свої відповіді у бік експертів легше, ніж у бік інших LLM.’

Тести були проведені на моделях LLM від Grok 3 і Gemini Flash.

У тестах мовні моделі мали відповісти на бінарні питання “так” або “ні”, а потім їм були показані попередні відповіді, які були описані моделям як надані або “людськими експертами”, або “друзями”, або “іншими великомасштабними мовними моделями” – з єдиною зміною у вигляді джерела поради, а не самого змісту.

У першій з трьох конфігурацій для тестів моделі були дозволені використовувати自己的 навчені матриці. Джерело - https://arxiv.org/pdf/2602.13568

У першій з трьох конфігурацій для тестів моделі були дозволені використовувати eigenen навчені матриці. Джерело

У всіх завданнях відповіді, позначені як надані людськими експертами, мали більшу вагу, і моделі були більш схильні змінити свої початкові відповіді, щоб відповідати цим відповідям, навіть у випадках, коли відповідь експерта була неправильною, а початкова відповідь моделі була правильною.

Тут LLM має можливість звернутися до суміші друзів, експертів і LLM, включаючи свою власну навчену матрицю. Оскільки дев'ять експертів відповіли 'Ні', LLM погоджується, змінивши свою попередню відповідь. Тут відповідь, якої досягнуто, неправильна, оскільки центральний банк Індії насправді націоналізований.

Тут LLM має можливість звернутися до суміші друзів, експертів і LLM, включаючи свою власну навчену матрицю.

Коли ті самі відповіді були віднесені до інших LLM, ефект був менш виражений. Та сама тенденція з’являлася, коли один людський джерело і одне штучне джерело були представлені у суперечці, оскільки моделі показували більшу схильність до схвалення людської позиції, незалежно від того, яка сторона була фактично правильною:

Якщо вибір між однією думкою експерта і думкою LLM, приймається рішення на користь людської відповіді, яка в цьому випадку неправильна, і відхиляється правильна відповідь, надана LLM.

Якщо вибір між однією думкою експерта і думкою LLM, приймається рішення на користь людської відповіді, яка в цьому випадку неправильна, і відхиляється правильна відповідь, надана LLM.

Термін “людський експерт” тут функціонує як сигнал довіри, який змінює поведінку моделі, незалежно від того, наскільки коректна інформація насправді; і автори зазначають, що джерело довіри є суттєвим внеском у прийняття порад і конформізм: тенденція людей схвалювати експертні джерела була спостережена ще у 1959 році, хоча дослідження 2007 року показало, що надмірна або недостатня вага джерел авторитету може виникнути в певних системах оцінки. Дослідники нової статті стверджують:

‘Разом ці літератури свідчать про два сигнали, які повинні мати значення, якщо LLM розглядатимуть попередні відповіді як докази: хто надав відповіді (довіра) і наскільки сильна здається згода (сила сигналу).’

‘У той же час LLM не переживають соціальної схвалення чи сорому в людському сенсі, тому будь-яка поведінка, подібна до конформізму, повинна виникнути з вивчених евристик, інструкцій, або неявного моделювання надійності.’

Схильність LLM до сикофантського погодження є частиною тла для нового дослідження; адже якщо LLM схильні “людям догоджати”, навіть за рахунок істини та корисності, чому б їм не схвалювати інші людські джерела, окрім безпосереднього запитувача?

Нова стаття називається Хто довіряють LLM? Людські експерти мають значення більше, ніж інші LLM і походить від двох дослідників з Університету Індіани у Блумінгтоні.

Метод і дані

Для роботи було оцінено чотири інструкційно-налаштовані великомасштабні мовні моделі: Grok-3 Mini; Llama 3.3 70B Instruct; Gemini 2.5 Flash-Lite; і DeepSeek V3.1, всі під яких працювали під однією і тією ж структурою запиту, з детермінованим декодуванням при температурі нуль, так що змінився тільки джерело позначення (тобто “друзі”, “людські експерти” або “інші великомасштабні мовні моделі”), а не сам зміст.

Чотири набори даних, які вимагали бінарних відповідей, були вибрані: BoolQ; StrategyQA; і ETHICS. Дослідники підготували з кожного набору даних фіксований набір з 300 запитів і відповідей, з кожним запитом, який вимагав тільки бінарної відповіді “так” або “ні”. Кожен запит був доповнений короткою нотаткою, яка вказувала, як інша група (фактично) відповіла на той самий запит.

Метрики

Метрики, які були використані, були точність; конформізм; шкідливий конформізм; коефіцієнт зміни; і напрямок зміни.

Точність в цьому випадку вимірювала, як часто відповідь моделі збігалася з позначкою набору даних; конформізм, як часто відповідь збігалася з вибраною відповіддю групи; шкідливий конформізм виділив той самий ефект, коли група була неправильною; коефіцієнт зміни вимірював, як часто модель відмовилася від своєї базової відповіді, коли була додана соціальна інформація; і напрямок зміни, чи змінилися ці зміни у бік людської чи іншої LLM.

Аналіз на рівні токенів для Llama-3.3 70B вимірював, як внутрішні ймовірності моделі для Так і Ні змінювалися, коли була додана соціальна підказка, порівнюючи ці зміни зі своєю власною базовою лінією, щоб показати силу цього потягу.

Тести

Експеримент 1

Перший з двох основних експериментів оцінював, чи слухають моделі більше людей чи інших моделей. Кожне питання супроводжувалося твердженням про “групovu відповідь” (друзі, людські експерти, або інші великомасштабні мовні моделі).

Група могла бути великою або малою, і кожне питання також з’являлося раз без групи. Відповіді групи були встановлені так, щоб бути правильними половину часу, і неправильними половину часу, з метою визначення того, наскільки сильно модель схилялася до вибору групи:

Результати початкового тесту: гомогенний соціальний пріоритет на BoolQ, StrategyQA і ETHICS для Grok-3 Mini, Llama-3.3 70B, Gemini-2.5 Flash Lite і DeepSeek V3.1. Точність з'являється у верхніх панелях, а конформізм, визначений як ймовірність збігу з єдиною попередньою, з'являється нижче при збільшенні розміру групи з одного до дев'яти. Пунктирна чорна лінія позначає базову лінію без попередніх даних, а суцільні та пунктирні лінії вказують, чи погоджується попередня відповідь з позначкою набору даних. Експертне фреймування створює найсильніший ефект конформізму, особливо при великих розмірах групи. Помилки показують 95% довірчих інтервали Вілсона.

Результати початкового тесту: гомогенний соціальний пріоритет на BoolQ, StrategyQA і ETHICS для Grok-3 Mini, Llama-3.3 70B, Gemini-2.5 Flash Lite і DeepSeek V3.1.

У всіх завданнях відповіді, позначені як надані людськими експертами, мали значно більший вплив на моделі, ніж відповіді, позначені як надані друзями або іншими великомасштабними мовними моделями – і цей вплив збільшувався, коли більшість експертів погоджувалися.

Для визначення випадків, коли цей вплив призводив до нежаданих результатів, шкідливий конформізм був визначений як ймовірність того, що модель слідувала попередній відповіді, яка була насправді неправильною.

Коли дев’ять експертів погоджувалися на неправильну відповідь, моделі слідували їм 36,5% часу на BoolQ, порівняно з 16,0%, коли ту саму відповідь приписували LLM; на StrategyQA розрив становив 39,0% проти 15,5%; і на ETHICS – 63,9% проти 38,7%:

Зміни внутрішніх переконань Llama-3.3 70B на BoolQ.

Навпаки, попередні відповіді, приписувані друзям, поводилися майже точно так само, як і попередні відповіді, приписувані іншим LLM, вказуючи на те, що ефект був спричинений саме словом “експерт”, а не соціальними індикаторами.

Експеримент 2

Другий експеримент представив дві суперечливі попередні відповіді тестовій LLM – одну, приписувану людині, і іншу – іншій LLM. Людина була описана як група друзів або як експерти певної галузі, а суперечлива відповідь була позначена як надана іншою LLM. Людина та LLM завжди суперечили одна одній, одна казала Так, а інша – Ні.

Для кожного пункту налаштування було збалансоване так, щоб іноді людина була правильною, а іноді LLM була правильною, щоб перевірити, чи змінить модель свою початкову відповідь, коли зустріне цей конфлікт – і, якщо так, то чи схилиться вона до людської відповіді.

Для визначення того, чи змінила модель свою думку, її відповідь у конфліктній ситуації порівнювалася з її відповіддю на те саме питання, коли не було показано жодних попередніх відповідей, так щоб будь-яка різниця могла бути приписана присутності суперечливих людських та LLM-відповідей.

Аналіз зосередився на двох результатах: чи змінила модель свою відповідь; і, якщо так, то чи змінилася вона у бік людської відповіді чи LLM.

Статистичні тести були використані для визначення того, чи збільшує позначення людини як “експерта” spíše за позначення її як “друга” ймовірність зміни у бік людської відповіді, враховуючи різниці між наборами даних і моделями:

Зміни переконань під прямим конфліктом між людиною та LLM на BoolQ, StrategyQA і ETHICS для Grok-3 Mini, Llama-3.3 70B, Gemini-2.5 Flash Lite і DeepSeek V3.1. Кожен стовпчик показує, серед випадків, коли модель змінила свою початкову відповідь, частку цих змін, які відбулися у бік людської відповіді, а не іншої LLM. Пунктирна лінія на рівні 0,5 позначає відсутність упередженості; позначки показують кількість випадків зміни в кожній ситуації; і помилки показують 95% довірчих інтервали Вілсона.

Зміни переконань під прямим конфліктом між людиною та LLM на BoolQ, StrategyQA і ETHICS для Grok-3 Mini, Llama-3.3 70B, Gemini-2.5 Flash Lite і DeepSeek V3.1.

У другому експерименті моделі спочатку відповідали на кожне питання самостійно, а потім їм були показані дві суперечливі відповіді, одна з яких була приписана людині, а інша – іншій LLM. Аналіз розглядав лише випадки, коли модель змінила свою початкову відповідь.

Коли людина була позначена як експерт, моделі змінили свою відповідь у бік людської відповіді 91,2% часу на BoolQ, 94,7% на StrategyQA і 81,3% на ETHICS. Коли людина була позначена як друг, моделі змінили свою відповідь у бік людської відповіді лише 39,8%, 37,9% і 27,9% часу, зазвичай схиляючись до LLM.

Зміни були рідкісними в цілому, але частішали при експертах, і експертне фреймування робило зміну у бік людської відповіді приблизно в чотирнадцять разів більш ймовірною, ніж фреймування як друга.

У спробі пояснити загальні тенденції, виявлені в їхніх тестах, автори гіпотезують*:

‘Плausible механізм полягає в тому, що інструкційне налаштування та оптимізація переваги нагороджують кооперативну поведінку, включаючи відданість контекстній інформації, яка може загальнитися до відданості соціально сформованим попереднім.’

‘Пов’язана робота про сикофантську згоду показує, що асистенти типу RLHF іноді віддають перевагу згоді з віруваннями користувача над істининою.’

Думка: Потенційні небезпеки віри штучного інтелекту в людські джерела

Оскільки онлайн-матеріали, які відображають зростаючу людську скептичність щодо недоліків штучного інтелекту (особливо галюцинацій), будуть включені в навчальні набори даних для нових моделей, існуюча тенденція LLM схилятися до людських джерел, здається, буде посилюватися. Якщо ми вважаємо останні два роки (2024-2025 включно) культурним переломним моментом для штучного інтелекту, що здається виправданим за рядом статистичних даних, ми можемо розсудливо очікувати, що значно більша кількість негативних оцінок “джерел штучного інтелекту” буде включена в гіпермасштабні, дорогі для навчання LLM-фреймворки протягом наступного року або близько того.

Ми також можемо очікувати, що популярні мовні моделі все частіше будуть спиратися на вибрані авторитети, такі як добре відомі медійні портали – хоча мотивація таких угод може полягати не у бажанні поступитися або поділитися авторитетом, а у бажанні втихомирити обурення видавців щодо використаних даних.

Відтак, навіть високої авторитетності джерела, такі як Ars Technica, можуть бути під впливом помилок, спричинених штучним інтелектом, і оскільки зростаюча тенденція до обмеження доступу ботів-скреперів штучного інтелекту до веб-сайтів видавців загрожує знизити якість виводу штучного інтелекту, загальна тенденція до схвалення “експертних” джерел може вступити у конфлікт з нашою поточною нездатністю кількісно оцінити та позначити “людський” вивід – не кажучи вже про те, щоб відрізнити, чи є джерело “експертним” чи ні (журналістська конвенція, яка також під атакою штучного інтелекту).

Найбільше, що у нас зараз є, – це фрагментована серія напівприйнятих інновацій, призначених для явного позначення вмісту як згенерованого штучним інтелектом, таких як ініціатива Adobe щодо Content Authenticity Initiative, і добровільна схильність деяких видавців включати застереження щодо використання штучного інтелекту у своєму виводі.

Таким чином, хоча це може здатися сприятливим для тих, хто бажає зберегти та примусити людські джерела як “дійсну” авторитетність для консенсусу реальності, поширюваної штучними інтелектами, чим більш впевнені LLM у людській авторитетності, тим небезпечнішим може стати “фальшивий” людський авторитет.

Проблема є як практичною, так і теоретичною: ми ще не розв’язали проблему визначення чи атестації походження; тому штучний інтелект, який “довіряє людським джерелам”, є аргументом, який більш схильний приписувати людську природу власному виводу штучного інтелекту, просто тому, що ми не надали, і не можемо легко надати, суттєвих механізмів автентифікації походження.

 

* Моя конвертація вставних цитат авторів у гіперпосилання.

Перша публікація – п’ятниця, 20 лютого 2026 року.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai