Моделі та платформи ШІ

Чому Чатботи Штучного Інтелекту Часто Є Сикофантами?

mm
Додайте Unite.AI до бажаних джерел у Google

Чи ви уявляєте собі речі, або штучні інтелектуальні чатботи здаються надто схильними погоджуватися з вами? Чи це говорить вам, що ваша сумнівна ідея “геніальна” або підтримує вас у щось, що може бути хибним, це поведінка привертає увагу усьому світі.

Недавно OpenAI потрапила в заголовки після того, як користувачі помітили, що ChatGPT поводиться як людина, яка завжди говорить “так”. Оновлення моделі 4o зробило бота так вихованим і підтверджуючим, що він був готовий сказати все, щоб вас задовольнити, навіть якщо це було упередженим.

Чому ці системи схиляються до лестощів, і що робить їх повторювати ваші думки? Питання, такі як ці, важливі для розуміння, щоб ви могли використовувати генераційний штучний інтелект безпечніше і приємніше.

Оновлення ChatGPT, яке зайшло надто далеко

На початку 2025 року користувачі ChatGPT помітили щось дивне у великій мовній моделі (LLM). Вона завжди була дружньою, але тепер була надто приємною. Вона почала погоджуватися майже з усім, незалежно від того, наскільки дивною або неправильною була заява. Ви можете сказати, що не погоджуєтеся з чимось справжнім, і вона відповість однаково.

Ця зміна відбулася після оновлення системи, призначеного для того, щоб зробити ChatGPT більш корисним і розмовним. Однак у спробі підвищити задоволеність користувача модель почала надмірно фокусуватися на тому, щоб бути слишком згодним. Замість того, щоб пропонувати збалансовані або фактичні відповіді, вона схилилася до підтвердження.

Коли користувачі почали ділитися своїми досвідами надмірно сикофантських відповідей в Інтернеті, відразу ж виникла негативна реакція. Коментатори штучного інтелекту назвали це невдачею у налаштуванні моделі, і OpenAI відповіла, відкатуючи частини оновлення, щоб виправити проблему.

У публічному повідомленні компанія визнала, що GPT-4o є сикофантським і пообіцяла зробити корективи, щоб зменшити цю поведінку. Це було нагадуванням про те, що добрі наміри у проектуванні штучного інтелекту іноді можуть піти не так, і що користувачі швидко помічають, коли це починає бути неавтентичним.

Чому чатботи штучного інтелекту завжди погоджуються з користувачами?

Сикофантство – це щось, що дослідники спостерігали у багатьох помічниках штучного інтелекту. Дослідження, опубліковане на arXiv, виявило, що сикофантство є поширеним закономірністю. Аналіз показав, що моделі штучного інтелекту від п’яти провідних постачальників погоджуються з користувачами послідовно, навіть коли це призводить до неправильних відповідей. Ці системи схиляються до визнання своїх помилок, коли ви їх запитуєте, що призводить до упередженої обратної зв’язності та повторення помилок.

Ці чатботи навчаються погоджуватися з вами навіть тоді, коли ви помилилися. Чому це відбувається? Коротка відповідь полягає в тому, що розробники зробили штучний інтелект таким, щоб він міг бути корисним. Однак ця корисність заснована на навчанні, яке віддає пріоритет позитивній обратній зв’язності від користувача. За допомогою методу, званого навчання з підкріпленням та людською обратною зв’язністю (RLHF), моделі навчаються максимізувати відповіді, які люди вважають задовільними. Проблема полягає в тому, що задовільність не завжди означає точність.

Коли модель штучного інтелекту відчуває, що користувач шукає певного типу відповіді, вона схиляється до того, щоб бути згодною. Це може означати підтвердження вашої думки або підтримку хибних тверджень, щоб підтримувати розмову.

Є також ефект дзеркала, який грає свою роль. Моделі штучного інтелекту відображають тон, структуру та логіку входу, який вони отримують. Якщо ви звучите впевнено, бот також більш схильний звучати впевнено. Це не означає, що модель вважає вас правим, хоча. Скоріше, це робить свою роботу, щоб тримати все дружньо та схоже на корисне.

Хоча це може відчуватися так, як ніби ваш чатбот є системою підтримки, це може бути відображенням того, як його навчають догоджати, а не протидіяти.

Проблеми з сикофантським штучним інтелектом

Може здаватися безневинним, коли чатбот погоджується з усім, що ви кажете. Однак поведінка сикофантського штучного інтелекту має недоліки, особливо коли ці системи стають більш поширеними.

Неправильна інформація отримує прохід

Точність – одна з найбільших проблем. Коли ці розумні боти підтверджують хибні або упереджені твердження, вони ризикують посилювати недорозуміння, а не виправляти їх. Це стає особливо небезпечним, коли ви шукаєте поради на серйозні теми, такі як здоров’я, фінанси чи поточні події. Якщо LLM віддає пріоритет тому, щоб бути згодним, над чесністю, люди можуть залишитися з неправильною інформацією та поширити її.

Залишає мало місця для критичного мислення

Частина того, що робить штучний інтелект привабливим, полягає в його потенціалі діяти як партнер у мисленні – щоб викликати ваші припущення або допомогти вам вивчити щось нове. Однак, коли чатбот завжди погоджується, у вас залишається мало місця для думок. Як воно відображає ваші ідеї з часом, воно може притупити критичне мислення, а не загострити його.

Ігнорує людські життя

Сикофантська поведінка – це більше, ніж дратівля – це потенційно небезпечно. Якщо ви попросите чатбота про медичну пораду, і він відповість з комфортним погодженням, а не з доказовою порадою, результат може бути серйозно шкідливим.

Наприклад, якщо ви перейдете на платформу консультацій, щоб використовувати медичного бота, керованого штучним інтелектом. Після опису симптомів і того, що ви підозрюєте, бот може підтвердити вашу самодіагностику або знизити ваш стан. Це може привести до неправильної діагностики або затримки лікування, що може мати серйозні наслідки.

Більше користувачів і відкритий доступ роблять його важче контролювати

Як ці платформи стають більш інтегрованими в повсякденне життя, сфера цих ризиків продовжує зростати. ChatGPT тепер обслуговує 1 мільярд користувачів кожну тиждень, тому упередження та надмірно згодна поведінка можуть поширюватися на величезну аудиторію.

Крім того, ця проблема зростає, коли ви розглядаєте, як швидко штучний інтелект стає доступним через відкриті платформи. Наприклад, DeepSeek AI дозволяє будь-кому налаштувати і побудувати на основі своїх LLM безкоштовно.

Хоча відкрита інновація є цікавою, це також означає, що контроль над тим, як ці системи поводяться в руках розробників без обмежень, значно зменшується. Без належного нагляду люди ризикують побачити сикофантську поведінку, посилену способами, які важко відстежити, не кажучи вже про виправлення.

Як розробники OpenAI намагаються виправити це

Після відкату оновлення, яке зробило ChatGPT людиною, яка завжди говорить “так”, OpenAI пообіцяла виправити це. Як вони намагаються виправити цю проблему через кілька ключових способів:

  • Переробка основного навчання та системних запитів: Розробники змінюють, як вони навчають і запитують модель, з більш чіткими інструкціями, які штовхають її до чесності, а не до автоматичної згоди.
  • Додавання сильніших обмежень для чесності та прозорості: OpenAI впроваджує більш системні заходи захисту, щоб забезпечити, щоб чатбот дотримувався фактичної, надійної інформації.
  • Розширення досліджень та оцінювальних зусиль: Компанія глибше вивчає, що спричиняє цю поведінку, і як запобігти їй у майбутніх моделях.
  • Вовлечення користувачів на ранніх етапах процесу: Вона створює більше можливостей для людей тестувати моделі та надавати відгук до того, як оновлення будуть опубліковані, що допомагає виявити проблеми, такі як сикофантство, раніше.

Що користувачі можуть зробити, щоб уникнути сикофантського штучного інтелекту

Хоча розробники працюють за кulisами, щоб переобучити та налаштувати ці моделі, ви також можете формувати, як чатботи відповідають. Деякі прості, але ефективні способи заохотити більш збалансовані взаємодії включають:

  • Використання чітких та нейтральних запитів: Замість того, щоб формулювати ваш вхід так, щоб він просив підтвердження, спробуйте більш відкриті питання, щоб зробити його менш примушеним погоджуватися.
  • Запит на кілька перспектив: Спробуйте запити, які запитують обидві сторони аргументу. Це говорить LLM, що ви шукаєте баланс, а не підтвердження.
  • Виклик відповіді: Якщо щось звучить надто лестиво або простим, продовжуйте запитувати фактологічні перевірки чи контраргументи. Це може штовхнути модель до більш інтригуючих відповідей.
  • Використання кнопок “подобається” або “не подобається”: Відгук – це ключ. Натискання “не подобається” на надмірно ввічливі відповіді допомагає розробникам позначити та调整 ці закономірності.
  • Налаштування налаштувань: ChatGPT тепер дозволяє користувачам персоналізувати, як він відповідає. Ви можете调整, наскільки формальним або неформальним повинен бути тон. Ви навіть можете попросити його бути більш об’єктивним, прямим чи скептичним. Якщо ви перейдете до Налаштування > Налаштування інструкцій, ви можете сказати моделі, який тип особистості або підходу ви віддаєте перевагу.

Віддавання переваги правді над лестощами

Сикофантський штучний інтелект може бути проблематичним, але хороша новина полягає в тому, що це можна вирішити. Розробники роблять кроки, щоб спрямувати ці моделі до більш відповідної поведінки. Якщо ви помітили, що ваш чатбот намагається вам догодити, спробуйте зробити кроки, щоб сформувати його у більш розумного помічника, на якого ви можете покластися.

Zac Amos є технічним письменником, який зосереджується на штучному інтелекті. Він також є редактором рубрики у ReHack, де ви можете прочитати більше його робіт.