Лідери думок

Інфраструктура штучного інтелекту розбита. Жетони стають новою мірою вартості.

mm
Додайте Unite.AI до бажаних джерел у Google

Індустрія штучного інтелекту має проблему з вимірюваннями.

Тривалий час успіх визначався доступом до обчислювальних ресурсів, таких як кількість GPU, найбільші кластери або найшвидші тренувальні запуски. Більярди були вкладені в інфраструктуру, щоб виграти цю гонку.

Але коли штучний інтелект переходить від експериментів до виробництва, ця модель починає ламатися.

Корпорації не купують GPU. Вони навіть не купують інферентну потужність. Вони купують результати, такі як підсумки, рекомендації, рішення, контент. Інакше кажучи, вони купують жетони.

Але більшість інфраструктури штучного інтелекту все ще спроектована так, якби обчислювальна потужність була кінцевою метою. Це не так.

Фактичною одиницею вартості в штучному інтелекті є жетон. І компанії, які визнають цю зміну раніше, визначать наступну епоху ринку.

Поява фабрик жетонів штучного інтелекту

Якщо жетони є продуктом, то інфраструктура штучного інтелекту повинна поводитися як система виробництва, а не як науковий проєкт. Саме тут з’являється концепція фабрик жетонів штучного інтелекту.

Фабрика жетонів штучного інтелекту не є просто ще одним програмним шаром у стеку. Це переосмислення самого стеку. Замість оптимізації для ізольованої моделі або сировинної апаратної потужності, вона зосереджена на одному результаті: ефективному виробництві жетонів у великих масштабах.

Це означає абстрагування складності інфраструктури, динамічне розподілення робочих навантажень у гетерогенних середовищах та безперервну оптимізацію для пропускної здатності, затримки, використання та вартості на жетон.

Сьогоднішня модель по суті є орендою GPU з додатковими кроками. Організації забезпечують дороге обладнання, швють разом фрагментовані інструменти та сподіваються, що використання в кінцевому підсумку виправдає інвестиції.

Фабрика жетонів повністю змінює цю рівність. Вона забезпечує виходи, а не інфраструктуру, і вважає ефективність основним принципом дизайну з дня першого. Це не інкрементальний прогрес. Це зміна від інфраструктури як потужності до інфраструктури як виробництва.

Чому стара модель не може триматися

Поточна інфраструктура штучного інтелекту не тільки неефективна. Вона все більш невтримна.

Дефіцит GPU викрив перший тріщину. Попит продовжує перевищувати пропозицію, змушуючи організації до фрагментованих, багатопостачальних розгортань. Що почалося як тимчасове рішення швидко стало нормою: гетерогенних середовищ, швених без уніфікованого оперативного шару.

Проблема полягає в тому, що більшість існуючих стеків не були спроектовані для цієї реальності. Вони не оптимізуються ефективно через архітектури, не адаптуються в реальному часі та не забезпечують явної видимості виконання та вартості.

В результаті складність зростає швидше, ніж масштаб.

Кожна нова модель, каркас, прискорювач або хмарна платформа вводить ще один шар оперативної складності. Команди витрачають величезну кількість часу на управління оркестрацією, сумісністю, маршрутизацією, плануванням та спостереженням за проблемами, а не на покращення результатів.

Що повинно бути перевагою масштабу швидко стає проблемою координації.

Водночас економіка стає все важчою для ігнорування. Ранні розгортання штучного інтелекту могли маскувати неефективність за допомогою зростання та експериментів. Це вікно закривається.

Виконавці зараз ставлять більш складні питання: Чому витрати на інферентну потужність так непередбачувані? Чому використання GPU все ще так низьке? Чому організації платять преміум-ціни за апаратне забезпечення, яке часто сидить без діла? Чому так складно зв’язати витрати на інфраструктуру з бізнес-результатами?

Відповідь проста: Система була спроектована для доступу, а не для ефективності.

Від центричного обчислення до центричної архітектури жетонів

Зміна до фабрик жетонів є як філософською, так і архітектурною.

По-перше, ринок переходить від GPU як послуги до результату як послуги. Клієнти не хочуть керувати інфраструктурою; вони хочуть гарантовані результати. Логічний кінцевий стан – споживання на основі виходів, а не ресурсів.

По-друге, фрагментовані стеки поступаються місцем уніфікованим контрольним площинам. У гетерогенному середовищі видимість та контроль є всім. Фабрики жетонів забезпечують реальний час розуміння використання, вартості та виконання, а також можливість діяти на нього. Організації повинні розуміти: Хто генерує жетони? За яку вартість? На якому апаратному забезпеченні? Під яким робочим навантаженням? І з яким рівнем ефективності? Без цих відповідей оптимізація стає вгадуванням.

Нарешті, фокус галузі зсувається від виконання до безперервної оптимізації. Викликом вже не є просто запуск моделей, а їх інтелектуальний запуск, оскільки організації визначають: Які робочі навантаження належать на яке апаратне забезпечення? Як максимізувати пропускну здатність, контролюючи вартість? Як запобігти неконтрольованому використанню жетонів?

Фабрики жетонів вважають ці питання першочерговими, а не післяthoughts.

Чому сьогоднішня модель доставки штучного інтелекту не достатня

Традиційний стек штучного інтелекту (від виробників апаратного забезпечення до хмарних платформ та послуг інференції) був побудований в першу чергу для швидкого зростання, а не системної ефективності.

Кожен шар додає вартість, але також вартість, абстракцію та оперативну фрагментацію. Результатом є система зі складеними маржами, обмеженою прозорістю та збільшенням залежності від постачальників. Організації опиняються в ситуації, коли вони оптимізують всередині сіл, а не по всій системі.

Фабрики жетонів фундаментально викликають цю модель під сумнів.

Відокремлюючи апаратне забезпечення від доставки вартості, вони забезпечують оптимізацію з кінця в кінець. Робочі навантаження можуть рухатися вільно через середовища. Архітектури можуть еволюціонувати без потреби в масових переписах. Ефективність стає вимірюваною, керованою та безперервно поліпшуваною.

Це саме те, як корпорації та нові хмарні постачальники можуть конкурувати більш ефективно з гіперсเกลерами. Не тим, що вони дорівнюють їхньому масштабу, а тим, що вони перевершують їх на ефективності.

Хто переможе

Можливо, найбільш деструктивним аспектом цього переходу є те, кого він емансипує. Вам не потрібно володіти дата-центром або навіть GPU, щоб експлуатувати фабрику жетонів.

Що має значення, це контроль над оркестрацією, оптимізацією та доставкою. Це відкриває двері для набагато ширшого кола гравців:

  • Корпорації з великими, постійними робочими навантаженнями штучного інтелекту.
  • Нові хмарні постачальники, які оптимізують для конкретних вертикалей або випадків використання.
  • Постачальники інфраструктури, які рухаються вгору по стеку.

У цій моделі конкурентна перевага не полягає в накопиченні обчислювальної потужності. Вона полягає у виробництві жетонів краще, швидше та дешевше, ніж будь-хто інший.

Нова битва: Вартість на жетон

Наступна фаза конкуренції штучного інтелекту не буде виграна лише на якість моделі. Вона буде виграна на ефективності. Конкретніше, вартість на жетон.

Хто може забезпечити еквівалентні або кращі виходи за частину вартості? Хто може масштабуватися без неконтрольованої інфраструктурної витрати? Хто може перетворити штучний інтелект на передбачуваний, прибутковий бізнес?

Ці не інфраструктурні питання. Це питання виробництва, які вимагають виробництва мислення.

Майбутнє не будується на GPU

GPU не зникнуть, але вони вже не є історією. Жетони є.

Організації, які залишаються зосередженими на обчислювальній потужності, стикаються з зростаючими витратами та зменшенням доходності. Ті, хто перейде до систем, орієнтованих на жетони, відкриють фундаментально іншу модель, одну, яка вирівнює інфраструктуру з результатами та вартістю з цінністю.

Фабрики жетонів штучного інтелекту не є далеким поняттям. Вони є невідворотним еволюційним розвитком ринку. Єдине справжнє питання – хто їх побудує першим і хто залишиється позаду.

Гаурав Шах є віце-президентом з розвитку бізнесу та стратегії в NeuReality, де він очолює зусилля клієнтів з революціонізування висновків штучного інтелекту та прискорення його прийняття в різних секторах, включаючи фінтех, хелс-тех та уряд. Гаурав має три десятиліття досвіду роботи в галузі технологій, працюючи на посадах з маркетингу продукції та управління в NVIDIA, Marvell, Tenstorrent та GlobalFoundries. Він базується в районі затоки Сан-Франциско.