Лідери думок

DeepSeek: Ефективність, а не парадигмальний зсув в інноваціях штучного інтелекту

mm
Додайте Unite.AI до бажаних джерел у Google

Нещодавнє збудження навколо DeepSeek, передової великомасштабної мови (LLM), зрозуміло, враховуючи значно покращену ефективність, яку воно приносить у цій сфері. Однак деякі реакції на його випуск здаються неправильним тлумаченням масштабу його впливу. DeepSeek представляє стрибок вперед у очікуваному напрямку розвитку LLM, але воно не сигналізує про революційний зсув у бік штучного загального інтелекту (AGI), ні про раптову трансформацію центру тяжіння інновацій штучного інтелекту.

Натомість досягнення DeepSeek є природним прогресом уздовж добре простеженої траєкторії – однієї з експоненціального зростання технологій штучного інтелекту. Це не деструктивний парадигмальний зсув, а потужне нагадування про прискорення темпу технологічних змін.

Ефективність DeepSeek: Стрибок уздовж очікуваної траєкторії

Ядро збудження навколо DeepSeek лежить у його вражаючих поліпшеннях ефективності. Його інновації в основному стосуються того, щоб зробити LLM швидшими та дешевшими, що має значні наслідки для економіки та доступності моделей штучного інтелекту. Однак, незважаючи на ажіотаж, ці досягнення не є фундаментально новими, а радше вдосконаленнями існуючих підходів.

У 1990-х роках висококласне відтворення комп’ютерної графіки вимагало суперкомп’ютерів. Сьогодні смартфони здатні виконувати ту саму задачу. Аналогічно, розпізнавання обличч – раніше ніша, високо витратна технологія – тепер стала універсальною, готовою до використання функцією в смартфонах. DeepSeek вписується у цю схему технологій: оптимізацію існуючих можливостей, яка забезпечує ефективність, але не новий, революційний підхід.

Для тих, хто знайомий з принципами технологічного зростання, цей швидкий прогрес не є несподіваним. Теорія технологічної сингулярності, яка передбачає прискорення прогресу в ключових областях, таких як штучний інтелект, передбачає, що прориви стануть частішими, коли ми наближаємося до точки сингулярності. DeepSeek – лише один момент цього тривалого тренду, і його роль полягає у тому, щоб зробити існуючі технології штучного інтелекту більш доступними та ефективними, а не представляти раптовий стрибок у нові можливості.

Інновації DeepSeek: Архітектурні доробки, а не стрибок до AGI

Головний внесок DeepSeek полягає в оптимізації ефективності великомасштабних мовних моделей, зокрема завдяки своїй архітектурі Mixture of Experts (MoE). MoE – це добре встановлена техніка ансамблевого навчання, яка використовується в дослідженнях штучного інтелекту протягом років. Що DeepSeek зробило особливо добре, так це вдосконалило цю техніку, включивши інші заходи ефективності для мінімізації обчислювальних витрат та зробити LLM більш доступними.

  • Параметрична ефективність: Проект MoE DeepSeek активує лише 37 мільярдів зі своїх 671 мільярда параметрів одночасно, знижуючи обчислювальні вимоги до 1/18 традиційних LLM.
  • Зміцнювальне навчання для висновків: Модель R1 DeepSeek використовує зміцнювальне навчання для покращення ланцюгових висновків, життєво важливого аспекту мовних моделей.
  • Багатотокове навчання: Можливість DeepSeek-V3 передбачати кілька фрагментів тексту одночасно збільшує ефективність навчання.

Ці поліпшення роблять моделі DeepSeek драматично дешевшими для навчання та виконання у порівнянні з конкурентами, такими як OpenAI чи Anthropic. Хоча це і є значним кроком вперед для доступності LLM, це залишається інженерним вдосконаленням, а не концептуальним проривом у бік AGI.

Вплив відкритого штучного інтелекту

Одним з найпомітніших рішень DeepSeek було зробити свої моделі відкритими – це явний відхід від пропрієтарних, закритих підходів компаній, таких як OpenAI, Anthropic та Google. Цей відкритий підхід, який підтримується дослідниками штучного інтелекту, такими як Ян Лекун з Meta, сприяє більш децентралізованій екосистемі штучного інтелекту, де інновації можуть процвітати завдяки колективному розвитку.

Економічна логіка рішення DeepSeek про відкритий код також зрозуміла. Відкритий штучний інтелект – це не лише філософська позиція, а й бізнес-стратегія. Роблячи свою технологію доступною для широкого кола дослідників та розробників, DeepSeek позиціонує себе для отримання вигоди від сервісів, корпоративної інтеграції та масштабованого хостингу, а не залежить виключно від продажу пропрієтарних моделей. Цей підхід надає глобальному співтовариству штучного інтелекту доступ до конкурентоспроможних інструментів та зменшує домінування великих західних технологічних гігантів у цій сфері.

Ростуча роль Китаю у гонці штучного інтелекту

Для багатьох те, що прорив DeepSeek відбувся в Китаї, може бути несподіваним. Однак це розвиток не повинен розглядатися з шоком або як частина геополітичної боротьби. Після років спостереження за ландшафтом штучного інтелекту Китаю стало зрозуміло, що країна зробила суттєві інвестиції в дослідження штучного інтелекту, що призвело до зростання пула талантів та експертизи.

Натомість цей розвиток повинен розглядатися як ознака все більш глобальної природи досліджень штучного інтелекту. Відкрита співпраця, а не національна конкуренція, є найперспективнішим шляхом до відповідальної та етичної розробки AGI. Децентралізована, глобально розподілена робота значно ймовірніше призведе до AGI, яка принесе користь усім людству, а не служитиме інтересам однієї нації чи корпорації.

Ширші імплікації DeepSeek: Погляд за межі LLM

Хоча значна частина збудження навколо DeepSeek пов’язана з його ефективністю у сфері LLM, важливо зробити крок назад і розглянути ширші імплікації цього розвитку.

Незважаючи на свої вражаючі можливості, моделі на основі трансформерів, такі як LLM, все ще значно відстали від досягнення AGI. їм бракує таких важливих якостей, як абстракція та самоорієнтоване висновування, які необхідні для загального інтелекту. Хоча LLM можуть автоматизувати широкий спектр економічних завдань та інтегруватися у різні галузі, вони не представляють собою ядро розвитку AGI.

Якщо AGI має з’явитися у наступному десятилітті, воно малоймовірно буде засноване виключно на архітектурі трансформерів. Альтернативні моделі, такі як OpenCog Hyperon або нейроморфне обчислення, можуть бути більш фундаментальними для досягнення справжнього загального інтелекту.

Комодітизація LLM змінить інвестиції у штучний інтелект

Ефективність DeepSeek прискорює тенденцію до комодітизації LLM. Коли витрати на ці моделі продовжують знижуватися, інвестори можуть почати шукати за межами традиційних архітектур LLM наступний великий прорив у штучному інтелекті. Ми можемо побачити зміщення фінансування у бік архітектур AGI, які виходять за межі трансформерів, а також інвестиції в альтернативне апаратне забезпечення штучного інтелекту, таке як нейроморфні чіпи або асоціативні обробні одиниці.

Децентралізація формуватиме майбутнє штучного інтелекту

Когда ефективність DeepSeek сприяє розгортанню моделей штучного інтелекту, вона також сприяє більш широкій тенденції до децентралізації архітектури штучного інтелекту. З акцентом на приватності, інтероперабельності та контролі користувача децентралізований штучний інтелект зменшить нашу залежність від великих централізованих технологічних компаній. Ця тенденція критична для забезпечення того, щоб штучний інтелект служив потребам глобального населення, а не контролювався кількома потужними гравцями.

Місце DeepSeek у камбрійському вибуху штучного інтелекту

У висновку, хоча DeepSeek і є значним етапом у ефективності LLM, це не революційний зсув у ландшафті штучного інтелекту. Натомуість це прискорює прогрес уздовж добре встановленої траєкторії. Ширший вплив DeepSeek відчувається у кількох областях:

  • Тиск на лідерів: DeepSeek викликає компанії, такі як OpenAI та Anthropic, переглянути свої бізнес-моделі та знайти нові способи конкуренції.
  • Доступність штучного інтелекту: Роблячи високоякісні моделі більш доступними, DeepSeek демократизує доступ до передових технологій.
  • Глобальна конкуренція: Ростуча роль Китаю у розвитку штучного інтелекту сигналізує про глобальну природу інновацій, яка не обмежується Заходом.
  • Експоненційний прогрес: DeepSeek – це явний приклад того, як швидкий прогрес у штучному інтелекті стає нормою.

Найважливіше, DeepSeek служить нагадуванням про те, що хоча штучний інтелект розвивається швидко, справжній AGI, ймовірно, виникне через нові, фундаментальні підходи, а не оптимізацію сучасних моделей. Коли ми спішимо до Сингулярності, важливо забезпечити, щоб розвиток штучного інтелекту залишався децентралізованим, відкритим та колаборативним.

DeepSeek не є AGI, але воно представляє значний крок вперед у тривалому шляху до трансформативного штучного інтелекту.

Доктор Бен Гертцель є дослідником штучного інтелекту та підприємцем, який спеціалізується на штучному загальному інтелекті (AGI), машинному навчанні та децентралізованих системах штучного інтелекту. З більш ніж трьома десятилітнями досвіду, він очолював розвиток передових框ок штучного інтелекту, включаючи проєкт OpenCog та SingularityNET, децентралізовану платформу штучного інтелекту. Він написав численні книги та науково-дослідницькі статті з питань штучного інтелекту, когнітивної науки та складних систем, і часто виступає на тему трансформативного потенціалу AGI.