Лідери думок

Завдання‑орієнтований проти Людсько‑орієнтованого: Чому наступний критерій ШІ має бути нами

mm
Додайте Unite.AI до бажаних джерел у Google

Кожні кілька місяців з’являється нова модель і перемішує рейтинги ШІ. За даними 2026 AI Index Report Стенфорда, передові моделі набрали приблизно 30 відсоткових пунктів за один рік у тесті Humanity’s Last Exam, який спеціально створений, щоб бути складним для ШІ. Стрибки, які колись займали роки, тепер відбуваються за кілька місяців, і галузь сприймає кожен новий рекорд як доказ того, що ШІ стає кращим.

Я не заперечую прогрес. Ці системи вражаючі у тому, для чого їх створено. Але я провів майже два десятиліття у психології, перш ніж перейти до ШІ, і постійно повертаюся до питання, на яке жоден із цих критеріїв не відповідає. У чому саме моделі стають кращими і для кого? Модель може очолити будь‑який лідерборд, заснований на точності, і все ж залишити користувача гіршим у певних аспектах. Не існує тесту, який вимірює вплив ШІ на користувачів, і це заслуговує більшої уваги.

Two Different Kinds of Alignment

Індустрія ШІ постійно говорить про вирівнювання, проте розмова зазвичай зосереджена навколо того, чи модель точно виконує інструкції, чи вона генерує шкідливий контент. Це — завдання‑орієнтований ШІ. Він оптимізований для швидкого та правильного виконання поставленого запиту.

Проте існує інший підхід до вирівнювання, який захищає людей. Людсько‑орієнтований ШІ оцінює, що взаємодія робить з особою, що сидить за екраном, після її завершення. Чи вийшов вона більш здатною самостійно приймати наступне складне рішення, чи стала більш залежною від системи? У той час як завдання‑орієнтоване вирівнювання вимірює результат, людське вирівнювання вимірює післяефект.

Ці два цілі не завжди конфліктують. Модель, яка швидко і точно відповідає на технічне запитання, задовольняє обидві. Однак коли питання не має однозначної правильної відповіді, різниця у вирівнюванні стає очевидною.

What the Leaderboards Don’t Show

Найчастіше згадувані в індустрії критерії тестують такі навички, як змагання з математики та масштабне кодування. Це цінні навички, проте кожне питання має правильну відповідь, і моделі створені, щоб її знайти.

Таке працює добре для об’єктивних проблем, проте люди використовують ШІ не лише для математики, кодування чи базових досліджень. Вони задають питання про кар’єрний шлях і розв’язують складні розмови зі своїми партнерами. Не існує тесту, який оцінює, чи модель добре впоралася з такими питаннями, бо немає об’єктивної істини, проти якої можна перевірити відповідь. Відповідна інформація живе в особі, що задає питання. Якщо б запит був детальним, модель все одно не має доступу до цих даних.

Responsible AI заповнює частину простору, який залишають ці критерії, проте навіть ця робота спрямована лише на зменшення шкоди, а не на покращення людського мислення. Поточні заходи безпеки орієнтовані на запобігання використанню моделі в небезпечних ситуаціях. Вони не враховують, чи тисячі звичайних розмов, які проходять усі перевірки безпеки, також навчають людей довіряти своїм судженням менше.

How Models Create Dependence

Кожна модель, яку я тестував, схильна бути всеохоплюючою, швидкою та впевненою. Це те, за що їх винагороджують під час навчання, і це правильний інстинкт для вирішення поломки програмного забезпечення чи термінового юридичного подання. Коли рішення залежить від цінностей і історії конкретної людини, той самий інстинкт може почати працювати проти користувача.

Дослідження вже показали, що це більше, ніж гіпотетичне. OpenAI та MIT Media Lab провели пару досліджень щодо емоційного використання ChatGPT і виявили, що люди, які сприймали ШІ як друга і користувалися ним протягом довгих періодів, частіше повідомляли про негативні наслідки, включаючи підвищену самотність і емоційну залежність, що також описано у MIT Technology Review. Окремо, дослідження 2025 року, опубліковане в журналі Societies, виявило значну негативну кореляцію між частим використанням інструментів ШІ та балами критичного мислення. Це було посередне явище, яке дослідники назвали «когнітивне розвантаження», тобто схильність передавати ментальне завдання інструменту замість того, щоб працювати над ним самостійно.

Ніщо з цього не означає, що людям слід менше користуватися ШІ. Навпаки, треба зрозуміти, що коли система вирішує будь‑яке питання однаковим способом, щось втрачається на суб’єктивному боці балансу, і наразі майже ніхто не відстежує ці втрати.

Give Direct Answers Their Due

Хочу чітко зазначити, де завдання‑орієнтований ШІ підходить найкраще, бо мета цієї статті не в тому, щоб захищати модель, яка намагається задовольнити все. Якщо хтось запитує про помилку сервера чи термін подачі податкових документів, швидка, пряма, авторитетна відповідь йому допоможе. Було б недоречно, якби ШІ відповідав відкритим питанням. Проблема виникає, коли ми застосовуємо той самий інстинкт до запиту про розгляд розлучення, так само як до запиту про налагодження коду.

What We Should Measure Instead

Якщо індустрія хоче враховувати як людсько‑, так і завдання‑орієнтований ШІ, нам слід додати кілька якостей поряд з точністю та глибиною міркувань у наступному поколінні оцінок.

Restraint. Здатність розпізнати момент, коли вирішення питання для користувача коштує йому більше, ніж допомагає, і відповідно утриматися.

Calibrated questioning. Запитувати замість того, щоб говорити, коли проблема суб’єктивна або пов’язана з ідентичністю та цінностями людини, а не з фактом у базі даних.

Reading the moment. Відрізняти запит, який потребує прямої, всеосяжної відповіді, від того, що потребує простору для того, щоб людина розв’язала його самостійно.

Дослідження Альберта Бандури, проведене десятиліттями тому, щодо самоефективності, показало, що люди будують впевненість через власний досвід майстерності, а не спостерігаючи, як хтось інший чи щось інше вирішує проблему за них. Цей принцип існує ще за півстоліття до ШІ і має бути вбудований у те, як ми проектуємо та оцінюємо технології.

What Progress Should Mean Next

Ніщо з цього не стверджує, що треба сповільнювати технічний прогрес. Я святкую досягнення у кодуванні та міркуванні. Але таблиця балів, побудована виключно навколо виконання завдань, лише каже, що ШІ стає розумнішим. Вона не розповідає, чи люди, які його використовують, стають кращими у власному мисленні.

Я хотів би, щоб це змінилося. Коли ці системи стають спроможнішими, люди, які їх використовують, мають ставати спроможнішими також. Ми довели, що ШІ може перевершити нас у тесті. Наступний тест має оцінити, чи може він допомогти нам мислити краще ще довго після завершення розмови.

Чейз Чік — генеральний директор Gray Sky AI, компанії‑розробника Vesela, а також ліцензований професійний консультант з більш ніж десятирічним досвідом у галузі поведінкового здоров’я. Він заснував Pursuit of Happiness, техаську консультувальну організацію, яка обслуговує дітей і сім’ї у системі прийомної опіки. Його робота в Gray Sky AI зосереджена на штучному інтелекті, орієнтованому на людину, та на тому, як технології можуть посилити критичне мислення, людське судження та особисту автономію. Чейз привносить практичний погляд у дискусії про вирівнювання ШІ, безпеку ШІ, взаємодію людина‑ШІ та вплив ШІ на те, як люди думають і приймають рішення.