Моделі та платформи ШІ

Розкриття Tokenmaxxing: виклики вартості штучної інтелекту

mm
Додайте Unite.AI до бажаних джерел у Google
Closeup of stacks of gold tokens.

Розширення використання генераційної штучної інтелекту (ШІ) відбулося завдяки інтеграції ШІ в бізнес-операції. По мірі зростання використання ШІ зростає кількість обчислювальної потужності, необхідної для його підтримки, що приділяє особливу увагу токенам, які моделі споживають для обробки та генерації інформації. Кожен запит, відповідь та автоматизований робочий процес залежить від них, що робить споживання токенів важливим для визначення вартості розгортання ШІ.

Це сприяло зростанню токен-максінгу, практиці максимізації вартості, витягнутої з моделей ШІ за допомогою більших запитів та триваліших розмов. Хоча це застосування демонструє зростаючі можливості та корисність сучасних систем ШІ, воно також підкреслює зростаючі витрати, пов’язані з вищим рівнем споживання токенів.

Що таке токен-максінг?

Токен-максінг включає використання більших запитів та призначення складних завдань системам ШІ. Замість обмеження ШІ простими запитами або короткими запитами, користувачі надають розширений контекст та покладаються на моделі для виконання багаторівневих робочих процесів за одну взаємодію. Тренд набув імпульсу, оскільки постачальники ШІ вводять більші вікна контексту, які дозволяють моделям обробляти більше інформації одночасно.

Більш потужні моделі також розширили спектр завдань, які може виконувати ШІ. Це спонукає користувачів та організації консолідувати дослідження, аналіз та діяльність підтримки прийняття рішень у меншу кількість, але більш вимогливих запитів. В результаті токен-максінг став природною реакцією на зростаючі можливості сучасних систем ШІ.

Як працюють токени ШІ?

Токени ШІ є основними одиницями тексту, які моделі мови використовують для обробки та генерації інформації. Замість читання тексту як повних слів, моделі ШІ розбивають вміст на менші частини, які можуть включати цілі слова, частини слів або окремі символи. Взаємодії ШІ включають два основних типи токенів: вхідні та вихідні. Вхідні токени складаються з запитів та супровідного контексту, тоді як вихідні токени представляють текст, згенерований у відповідь.

Більшість постачальників ШІ використовують токен-орієнтовану ціну, тобто клієнти сплачують за кількість вхідних та вихідних токенів, які споживаються. Витрати зростають, коли запити стають довшими, відповіді стають більш детальними або програми обробляють більші об’єми запитів. Споживання токенів впливає на багато застосунків ШІ, включаючи чат-боти служби підтримки клієнтів та інструменти пошуку ШІ, що робить використання токенів важливим для загальної вартості розгортання.

Чому зростаючі витрати на токени стають проблемою?

По мірі розширення використання генераційної ШІ споживання токенів зростає швидше, ніж очікувалося. Що починається як керований операційний витрат, швидко може стати суттєвою проблемою витрат, оскільки навантаження ШІ масштабуються по командам та бізнес-процесам.

Зростаючий попит на обчислювальну потужність ШІ

Розширення прийняття ШІ призводить до різкого зростання витрат на висновок, оскільки більше осіб та організацій покладаються на інструменти ШІ протягом дня. Насправді, 26% американців повідомляють про взаємодію з ними декілька разів на день, чи то через віртуальних асистентів, чи через рекомендаційні двигуни. По мірі зростання використання зростають обчислювальні вимоги та споживання токенів.

Одночасно більші вікна контексту та багатомодальні можливості збільшують кількість інформації, яку моделі повинні обробляти під час кожної взаємодії. Користувачі тепер можуть завантажувати довгі документи та зображення, очікуючи детальних, контекстно-обізнаних відповідей.

Агенти ШІ посилюють ці витрати, здійснюючи декілька моделей викликів, витягуючи інформацію та виконуючи багаторівневі процеси висновку за лаштунками. Що виглядає як один запит користувача, насправді може включати декілька взаємодій ШІ, що збільшує споживання токенів та операційні витрати.

Бізнес-виклики, створені токен-орієнтованою ціною

Прогнозування витрат ШІ залишається викликом, оскільки споживання токенів може коливатися суттєво по мірі зміни моделей використання. Проект, який здається вартісним під час тестування, може генерувати суттєво вищі витрати, коли розгортається по організації. Сезонний попит та розширення навантаження ШІ можуть зробити складним прогнозування місячних витрат.

Багато компаній також стикаються з парадоксом, що успішні розгортання ШІ призводять до вищих операційних витрат. По мірі того, як компанії звертаються до агентів ШІ для підвищення продуктивності та автоматизації більшої кількості завдань, агреговані витрати можуть зростати суттєво навіть якщо ціна кожного токену падає. Агенти ШІ виконують декілька дій за лаштунками, що спричиняє швидке зростання споживання токенів по мірі зростання прийняття.

Ці тенденції викликали занепокоєння щодо прибутковості та підприємницької системи управління ШІ. Компанії повинні визначити, як розподіляти витрати по відділам та забезпечити, щоб інвестиції в ШІ приносили міруємий результат. Одночасно вони стикаються з постійним викликом балансування продуктивності моделі з ефективністю витрат, оскільки найбільш потужні моделі супроводжуються найбільшими операційними витратами.

Як компанії знижують витрати на токени ШІ

Зростаючі витрати на токени спонукали компанії шукати способи максимізувати вартість своїх інвестицій в ШІ без жертвування продуктивністю. По мірі розширення прийняття ШІ вони реалізують ряд стратегій для контролю споживання токенів та підтримання передбачуваних операційних витрат.

Стратегії оптимізації для користувачів ШІ

Компанії знижують споживання токенів за допомогою технік інженерії запитів, які ліквідують зайвий текст та покращують ефективність. Чіткі, зосереджені запити та стандартизовані шаблони можуть генерувати кращі результати, використовуючи менше токенів. Багато компаній також використовують маршрутизацію моделей, де менші, нижчої вартості моделі обробляють звичайні завдання, а просунуті моделі зарезервовані для складних робіт, які вимагають більшої здатності висновку.

Інша популярна стратегія – генерація з підтримкою витягування, яка витягує лише найбільш актуальну інформацію, а не надсилає більші об’єми контексту з кожним запитом. Цей підхід знижує споживання токенів, зберігаючи точність. Для подальшого контролю витрат організації реалізують інструменти моніторингу та системи управління ШІ, які забезпечують видимість у моделях споживання та підтримують відповідальне прийняття ШІ.

Навчання в реальному світі: компроміс між витратами та продуктивністю

Компанії обирають моделі ШІ нижчої вартості для звичайних завдань, таких як резюмування, класифікація та витягування даних, де преміум-можливості висновку можуть забезпечити обмежену додаткову вартість. Витратні міркування також можуть впливати на більш широкі стратегічні рішення.

Наприклад, Microsoft (MSFT ), як повідомляється, припинив ліцензії на Claude Code, оскільки він більше не хоче орендувати інтелект конкурента. Замість цього він спрямовує розробників до власної моделі кодування для Copilot. Рішення, подібні до цих, відображають зростаючу спробу зниження витрат на ШІ, зберігаючи контроль над технологічними інвестиціями.

Однак, надмірна економія може створити нові виклики. Моделі нижчої вартості можуть генерувати менш точні результати або вимагати додаткового людського нагляду, що знижує деякі очікувані заощадження. Компанії повинні оцінювати фактори, такі як складність завдань та бізнес-вплив, при виборі моделей ШІ. Метою є балансування ефективності та продуктивності, забезпечення того, щоб зниження витрат не відбувалося за рахунок якості чи досвіду користувача.

Як компанії ШІ реагують

Постачальники ШІ пропонують опції моделей та гнучкі цінові структури для задоволення різних моделей використання та бюджетів. Компанії можуть обирати з ряду моделей з різними рівнями продуктивності та вартості, що дозволяє їм відповідати можливостям ШІ конкретним навантаженням.

Наприклад, OpenAI пропонує плани підписки для користувачів, які хочуть передбачуваний доступ та стабільніші місячні витрати. Він також пропонує токен-орієнтовану ціну для клієнтів з більшими або менш передбачуваними навантаженнями.

Поза традиційним обліком використання деякі постачальники експериментують з підписками та моделями ціноутворення на основі завдань, які роблять витрати легшими для прогнозування. Одночасно відкриті моделі та самозахистові розгортання набувають популярності як альтернативи токен-орієнтованому обліку. Ці варіанти можуть забезпечити компаніям більший контроль над операційними витратами та інфраструктурою, хоча вони вимагають додаткової технічної експертизи та обчислювальних ресурсів для ефективного управління.

Балансування продуктивності ШІ та витрат

По мірі розширення прийняття ШІ зростаюче споживання токенів створює нові виклики витрат для компаній та постачальників ШІ. Компанії реагують стратегіями, такими як оптимізація запитів, маршрутизація моделей та сильніші практики управління для контролю витрат на токен-максінг, зберігаючи продуктивність. В результаті розуміння економіки токенів стає важливою частиною успішного масштабування та управління технологіями ШІ.

Zac Amos є технічним письменником, який зосереджується на штучному інтелекті. Він також є редактором рубрики у ReHack, де ви можете прочитати більше його робіт.