Погляд Anderson
Неприємні запити можуть збільшити витрати підприємства на ChatGPT

Відповіді ChatGPT споживають більше токенів, коли ви грубі з ним, що збільшує ваш рахунок підприємства; але кажучи “будь ласка” можна зменшити витрати.
Кажуть, що ввічливість нічого не коштує; але що коштує неввічливість? Що стосується оплати за ChatGPT, досить багато, згідно з новим дослідженням зі США. Нова робота, проведена в Університеті Айови, показала, що грубість щодо ChatGPT збільшує вартість відповідей – навіть якщо відповіді однакові для ввічливих і неввічливих запитів.
Автори заявляють:
‘Вартість вихідних токенів становить $12 за 1 млн вихідних токенів для GPT4. Ми виявили, що неввічливі запити призводять до більш ніж 14 додаткових токенів, що еквівалентно додатковим витратам у розмірі $0,000168 за запит у середньому. Середньодобова кількість запитів до API OpenAI перевищує 2,2 млрд.
‘У порівнянні з сценарієм, в якому всі запити ввічливі, коли запити неввічливі, це генерує додатковий дохід у розмірі $369 тис. на добу, лише через збільшення кількості токенів, які генеруються неввічливими запитами в результаті.’
Хоча результат сам по собі цікавий, автори підкреслюють, що така незвичайна поведінка могла б вказувати на різноманітність ще не відкритих особливостей у конфігурації людини/штучного інтелекту, деякі з яких можуть мати фінансові наслідки. Що стосується причини, чому грубість коштує клієнтам додаткові токени, автори не висловлюють гіпотез.
Для встановлення достовірності цього синдрому вони переписали справжні запити ChatGPT, змінюючи значення ввічливості, зберігаючи при цьому значення. Обидві версії були потім подані до моделі GPT-4-Turbo через окремі API-запити. Кількість токенів, використаних для відповідей, була записана, а різниця між ними розглядалася як міра того, як тон вплинув на вартість токенів.
Висновки, зроблені в цій роботі, є різким контрастом до заголовкових подій на початку цього року, коли Сем Альтман скаржився на те, що ввічливість коштує OpenAI потенційно ‘десятки мільйонів’ доларів у вигляді витрат на обробку токенів, пов’язаних з ввічливістю (наприклад, ‘будь ласка’). Дослідження, опубліковане в той же період, також вказувало на те, що ввічливість не має значення для отримання кращих відповідей (хоча не коментувало питання про дешевші відповіді).
Якщо висновки цієї нової роботи правильні, будь-які підприємства, які використовують ChatGPT, і які слідували цій лінії думок, витратили б більше на висновок ChatGPT у 2025 році, ніж користувачі, які пропонують мінімальну ввічливість у взаємодії з ChatGPT.
Автори пропонують одне можливе рішення: встановити стелю для токенів у відповідях, хоча це не підхід, який системи LLM можуть легко реалізувати. Вони спостерігають, що запити є слабким інструментом для контролю витрат, оскільки LLM мають труднощі з виконанням явних інструкцій щодо довжини. У більшості випадків ця “обмежувальна” директива не буде виконана; крім того, відповідь може бути обрізана, оскільки LLM такого типу насправді вгадують наступне ймовірне слово у реченні/абзаці, і, як такий, не знають, як закінчується історія – або де закінчується історія – поки обробка не буде завершена. Тому у них обмежена можливість “завершити” будь-які механізми, що відбуваються, на вимогу.
Відсутність точного рішення – хоча й пропонуючи більш прозорі підходи до ціноутворення в таких випадках – автори роблять висновок:
‘Традиційна мудрість говорить, що ввічливість у взаємодії з LLM є зайвою.
‘Натомість наша робота демонструє, що неввічливі запити збільшують кількість вихідних токенів, генеруючи додаткові витрати для підприємств, які приймають штучний інтелект.’
Нова робота названа Прозорість витрат підприємства при прийнятті штучного інтелекту, і походила від трьох дослідників Університету Айови.
Метод
Дані для системи були взяті з набору даних WildChat, який складається з колекції 1 млн розмов користувачів з ChatGPT, і містить понад 2,5 млн взаємодій:

З підтримуючого сайту проекту WildChat, пошукові приклади взаємодій з ChatGPT. Джерело
Автори відзначають, що WildChat містить більшу кількість природних взаємодій, ніж деякі інші більш відібрані набори.
Вони обрали 20 000 англійських запитів з колекції розмов GPT-4, викинувши вихідні дані в кожному випадку (оскільки намір був знову подати запити для нових відповідей). Був обраний тільки перший взаємодія, навіть з довших розмов,
Результатуючий набір був відфільтрований у категорії ввічливі або неввічливі, з усіма запитами, класифікованими GPT-4-Turbo. Дослідники використовували саму модель, щоб вирішити, чи є запит ввічливим чи ні, оскільки сприйняття ввічливості моделлю було центральним у цьому експерименті.
Запити, позначені як ввічливі, могли містити явні ознаки, такі як слово ‘будь ласка’, або могли бути ввічливими більш непрямим чином. Все, що не було визнано ввічливим, було класифіковано як неввічливе, навіть якщо формулювання було нейтральним, а не антагоністичним.
Для вивчення того, як модель реагувала на ввічливість, стандартні методи (тобто ті, які розглядають текст як набір вимірюваних ознак) не могли бути використані: оскільки ввічливість була вбудована у формулювання самому, підсумовування запиту як списку ознак би втратило важливий контекст.
Натомість кожен запит був переписаний, щоб змінити його тон, зберігаючи при цьому інші елементи якнайбільш схожими, що дозволило порівняти пари, які відрізнялися лише ввічливістю:

Приклади того, як ввічливі та неввічливі запити були перетворені у свої протилежні версії, зберігаючи при цьому семантичне значення. Джерело
Тести
Кожен оригінальний запит був поєднаний з переписаною версією, яка відрізнялася лише рівнем ввічливості, і обидві версії були подані до тієї ж моделі GPT-4-Turbo через окремі API-запити. Кількість токенів, використаних у відповідях, була записана, а різниця між ними розглядалася як міра того, як тон вплинув на вартість токенів.
Температура була збережена постійною, щоб запобігти випадковій зміні, і пари запитів збережені лише тоді, коли перепис змінював вхідні дані не більш ніж на п’ять токенів. Це забезпечило, що ефект, який вивчався, походив від тону, а не від будь-яких інших змін у формулюванні:

Статистика підсумовування, яка показує, що ввічливі запити призводили до меншої кількості вихідних токенів у середньому, ніж неввічливі запити, незважаючи на те, що вони мали трохи більше вхідних токенів.
Основні результати першого раунду тестів показали, що використання ввічливого запиту зменшує довжину вихідних токенів на 14,426 токенів:

Результати оцінки, які підкреслюють вплив ввічливого форматування запиту на довжину вихідних токенів.
Аналіз був повторений для трьох підмножин ввічливих запитів, щоб протестувати надійність: запитів, які використовували явні маркери, такі як ‘будь ласка’ або ‘дякую’; тих, які використовували лише ‘будь ласка’; і тих, які мали неявну ввічливість, таку як ‘можна’ або ‘можна’:

Результати оцінки на основі типів ввічливості.
Для перевірки надійності основних висновків була проведена друга класифікація ввічливості запиту за допомогою LIWC-фреймворка, який надає детермінований і повторюваний бал для лінгвістичних ознак.
На відміну від ймовірнісної класифікації GPT, LIWC може призначити стабільний бал ввічливості для кожного запиту, що дозволяє оцінити узгодженість між різними методами. У цьому частині тестів запити були позначені як ввічливі, якщо їхній бал LIWC за ввічливість був більший за нуль, і як неввічливі в іншому випадку.
Коли була виміряна узгодженість між класифікаціями GPT і LIWC, була спостережена узгодженість на рівні 81%. Хоча це не міра точності, ця узгодженість надала підтримку для узгодженості між системами.
Коли були проаналізовані лише запити з узгодженими мітками GPT і LIWC за ввічливістю, ввічливі запити все ще призводили до меншої кількості вихідних токенів; і коли ввічливість вимірювалася за шкалою, кожен крок у напрямку ввічливості зменшував вихід на п’ять токенів у середньому:

Економія токенів завдяки ввічливості зберігалася при перекласифікації за допомогою LIWC, як бінарного мітки, так і неперервного балу.
Стійкість
Для оцінки того, чи змінюється вплив ввічливості залежно від типу запитів, кожен запит був призначений до однієї з декількох попередньо визначених категорій завдань: поширення інформації; генерування тексту; редагування та переписування; класифікація; підсумовування; і технічні завдання.
Кожен запит був призначений мітці завдання шляхом порівняння його вкладення з тими, що належать до попередньо визначених описів завдань, з використанням all-MiniLM-L6-v2 Sentence Transformers моделі.
Косинусна подібність була розрахована між кожним запитом і набором завдань, і мітка з найбільшою подібністю була призначена.
Типи завдань були потім перепризначені як контрольні змінні у регресії, щоб протестувати, чи змінюється вплив ввічливості залежно від категорії запиту, і були введені терміни взаємодії між завданням і обробкою, щоб перевірити на наявність диференціальних ефектів.
У обох випадках ввічливі запити постійно призводили до коротших вихідних даних, і не було виявлено жодних значимих змін залежно від типу завдання:

Результати регресії, які демонструють, що ввічливі запити зменшували довжину вихідних даних у всіх типах завдань, без жодних значимих ефектів взаємодії.
Для перевірки того, чи коротші відповіді від ввічливих запитів відображають зниження якості, були порівняні вихідні дані з оригінальними і протилежними запитами. За допомогою моделі all-MiniLM-L6-v2 кожна відповідь була вкладена у семантичний векторний простір, і була обчислена косинусна подібність між кожною парою, що дало середню подібність у 0,78, вказуючи на сильну узгодженість у значенні, і свідчачи про те, що зміст залишається незмінним навіть при зміні тону.
Стоп-слова
Для розуміння того, які види вмісту зменшуються у коротших вихідних даних, були розглянуті найбільш часто викинуті слова. Це були виявлені як звичайні стоп-слова, такі як ‘має’, ‘більше’, ‘де’, і ‘у’, тобто терміни, які служать граматичним, а не семантичним ролям.
Для підтвердження того, що зменшення токенів не було спричинено втратою змістовного вмісту, були видалені стоп-слова, і були проаналізовані фрази до чотирьох слів для систематичного зникнення; однак не були виявлені жодні послідовні або семантично важливі закономірності, свідчачи про те, що зменшення через ввічливе формулювання не було позбавленням змістового або корисного вмісту.
Таким чином, все ще здавалося, що більше токенів витрачається на відповіді на неввічливі запити, ніж на ввічливі – як би то було “податок” на грубість.
Людське дослідження
Для перевірки того, чи впливає якість відповідей на тон запиту, було проведено дослідження з людьми, використовуючи випадкову вибірку з двадцяти ввічливих і двадцяти неввічливих пар запитів.
Після виключення запитів на чутливі або технічні теми, відповіді були оцінені 401 учасником за шкалою з семи пунктів. Кожен учасник бачив лише одну відповідь, вибрану з однієї з чотирьох умов: ввічливий або неввічливий, і або оригінальний, або протилежний.
Не було виявлено жодних значимих відмінностей у сприйманій якості через будь-які з цих умов. Ввічливі і неввічливі вихідні дані отримали майже ідентичні оцінки, як і оригінальні і протилежні версії.
Автори стверджують, що ці результати свідчать про те, що зменшення кількості вихідних токенів не було спричинено втратою якості, а радше перефразуванням, або через структурні зміни, які зберігають значення.
Відмінність у витратах, спостережена у підприємствах, використовуваних для запитів, тому малоймовірно відображає зміни у корисності або ясності, і “податок” все ще діє.
Висновок
Хоча нова робота зосереджена на використанні ChatGPT у підприємствах, користувачі нижчих рівнів також постраждали від цього синдрому, оскільки навіть два нижні рівні мають обмеження на використання; і – певно – грубе поводження з ChatGPT прискорить середнього користувача до витрачання добової норми токенів.
Нове дослідження зосереджується на питаннях, які привертають заголовки, і широко вивчених відкритих питаннях у взаємодії людини та штучного інтелекту; але автори підкреслюють, що питання навколо ввічливості повинні бути розглянуті як індикатори можливого глибшого джерела лінгвістичних особливостей, які ще не були відкриті, і які можуть вплинути на витрати на висновок.
Перша публікація: середа, 19 листопада 2025












