Моделі та платформи ШІ
Як DeepSeek подолала бар’єр вартості за $5,6 млн
Традиційна мудрість штучного інтелекту говорить про те, що створення більших мовних моделей (LLM) вимагає великих коштів – зазвичай це мільярди інвестицій. Але DeepSeek, китайський стартап штучного інтелекту, тільки що розбив цю парадигму своїм останнім досягненням: розробкою світового класу моделі штучного інтелекту за всього $5,6 мільйона.
Модель V3 DeepSeek може конкурувати з гігантами галузі, такими як Google’s Gemini і OpenAI’s latest offerings, при цьому використовуючи лише частину звичайних обчислювальних ресурсів. Це досягнення привернуло увагу багатьох лідерів галузі, і те, що робить це особливо примітним, полягає в тому, що компанія досягла цього, незважаючи на обмеження експорту США, які обмежували їхній доступ до останніх чипів Nvidia (NVDA ).
Економіка ефективного штучного інтелекту
Цифри розповідають переконливу історію про ефективність. Хоча більшість просунутих моделей штучного інтелекту вимагають від 16 000 до 100 000 графічних процесорів для навчання, DeepSeek впоралася лише з 2 048 графічними процесорами, які працювали протягом 57 днів. Навчання моделі зайняло 2,78 мільйона годин роботи графічних процесорів на чипах Nvidia H800 – це досить скромно для моделі з 671 мільярдом параметрів.
Щоб поставити це в перспективу, Meta потребувала приблизно 30,8 мільйона годин роботи графічних процесорів – майже в 11 разів більше обчислювальної потужності – для навчання своєї моделі Llama 3, яка насправді має менше параметрів – 405 мільярдів. Підхід DeepSeek нагадує майстер-клас з оптимізації під обмеженнями. Працюючи з графічними процесорами H800 – чипами штучного інтелекту, розробленими Nvidia спеціально для китайського ринку з зменшеними можливостями – компанія перетворила потенційні обмеження на інновації. Замість використання готових рішень для зв’язку процесорів вони розробили власні рішення, які максимізували ефективність.
Хоча конкуренти продовжують працювати під припущенням, що величезні інвестиції необхідні, DeepSeek демонструє, що винахідливість і ефективне використання ресурсів можуть зрівняти шанси.

Image: Artificial Analysis
Інженерія неможливого
Досягнення DeepSeek полягає в їхньому інноваційному технічному підході, який демонструє, що іноді найважливіші прориви відбуваються при роботі в умовах обмежень, а не при використанні необмежених ресурсів для вирішення проблеми.
У центрі цієї інновації лежить стратегія, яку називають “балансування навантаження без додаткових втрат”. Подумайте про це як про оркестрування величезної системи паралельної обробки, де традиційно вам потрібно були б складні правила та штрафи, щоб все працювало гладко. DeepSeek перевернула традиційну мудрість з ніг на голову, розробивши систему, яка природно підтримує баланс без додаткових витрат.
Команда також розробила техніку, яку вони називають “передбачення多 токенів” (MTP) – техніку, яка дозволяє моделі думати наперед, передбачаючи кілька токенів одночасно. На практиці це означає вражаючий рівень прийняття цих передбачень – 85-90% на різних темах, забезпечуючи швидкість обробки в 1,8 рази швидшу, ніж попередні підходи.
Сама технічна архітектура – це шедевр ефективності. Модель V3 DeepSeek використовує підхід “змішання експертів” з загальною кількістю параметрів 671 мільярд, але ось в чому річ – вона активує лише 37 мільярдів параметрів для кожного токену. Така вибіркова активація означає, що вони отримують переваги величезної моделі, зберігаючи при цьому практичну ефективність.
Вибір ними змішаної точності навчання FP8 – ще один крок вперед. Замість того, щоб приймати традиційні обмеження зменшеної точності, вони розробили власні рішення, які зберігають точність, значно зменшуючи вимоги до пам’яті та обчислювальних ресурсів.
Ефект доміно в екосистемі штучного інтелекту
Вплив досягнення DeepSeek розливається далеко за межі однієї успішної моделі.
Для розвитку штучного інтелекту в Європі це досягнення особливо важливе. Багато просунутих моделей не потрапляють до Європи, оскільки компанії, такі як Meta та OpenAI, не можуть або не хочуть адаптуватися до закону ЄС про штучний інтелект. Підхід DeepSeek показує, що створення передових моделей штучного інтелекту не завжди вимагає величезних кластерів графічних процесорів – це більше про ефективне використання наявних ресурсів.
Цей розвиток також показує, як обмеження експорту можуть фактично стимулювати інновації. Обмежений доступ DeepSeek до високопродуктивних апаратних засобів змусив їх думати інакше, що призвело до програмних оптимізацій, які могли б ніколи не з’явитися в середовищі з великими ресурсами. Ця принципова позиція могла б змінити підхід до розвитку штучного інтелекту у світі.
Імплікації демократизації глибокі. Хоча гіганти галузі продовжують витрачати мільярди, DeepSeek створила план ефективного та економічно ефективного розвитку штучного інтелекту. Це може відкрити двері для менших компаній та дослідницьких інститутів, які раніше не могли конкурувати через обмеження ресурсів.
Однак, це не означає, що великомасштабна обчислювальна інфраструктура стає застарілою. Галузь зрушується в бік масштабування часу висновку – часу, необхідного моделі для генерації відповідей. Коли ця тенденція продовжується, значні обчислювальні ресурси все ще будуть необхідні, ймовірно, навіть більше з часом.
Але DeepSeek фундаментально змінила розмову. Довгострокові наслідки ясні: ми вступаємо в епоху, де інноваційне мислення та ефективне використання ресурсів можуть мати більшу вагу, ніж сурова обчислювальна потужність. Для спільноти штучного інтелекту це означає фокус не лише на тих ресурсах, які у нас є, а й на тому, як творчо та ефективно ми їх використовуємо.












