AGI та майбутній ШІ
Наступний закон масштабування ІІ: не більше даних, а краще світові моделі
Тривалий час галузь штучного інтелекту слідувала простому та жорстокому правилу: більший – краще. Ми тренували моделі на величезних наборах даних, збільшували кількість параметрів та кидали величезну обчислювальну потужність на проблему. Цей рецепт працював більшість часу. Від GPT-3 до GPT-4, та від примітивних чат-ботів до двигунів розуміння, “закон масштабування” свідчив, що якщо ми просто продовжимо годувати машину більшою кількістю тексту, вона врешті-решт стане розумною.
Але зараз ми натикаємося на стіну. Інтернет є скінченним. Якісні публічні дані вичерпуються, а повернення на просто збільшенні моделей зменшуються. Ведучі дослідники штучного інтелекту стверджують, що наступний великий стрибок у штучному інтелекті не прийде з читання більшого тексту самостійно. Він прийде з розуміння реальності за текстом. Ця віра свідчить про фундаментальну зміну фокусу штучного інтелекту, що започатковує епоху Світової Моделі.
Ліміти наступної передбачення токену
Щоб зрозуміти, чому нам потрібен новий підхід, ми повинні спочатку подивитися, що роблять поточні системи штучного інтелекту. Незважаючи на їхні вражаючі можливості, моделі типу ChatGPT або Claude фундаментально є статистичними двигунами. Вони передбачають наступне слово в послідовності на основі ймовірності того, що було до цього. Вони не розуміють, що розбитий склянка розіб’ється; вони просто знають, що в мільйонах історій слово “розіб’ється” часто слідує за фразою “розбитий склянка.”
Цей підхід, відомий як авторегресивне моделювання, має критичний недолік. Він повністю залежить від кореляції, а не причинності. Якщо ви тренуєте LLM на тисячі описів автомобільної аварії, вона вчиться мови аварій. Але вона ніколи не вчиться фізики імпульсу, тертя чи крихкості. Вона є глядачем, а не учасником.
Ця обмеження стає “Стіною Даних“. Ми майже повністю скопіювали весь публічний інтернет. Щоб масштабувати далі за допомогою поточного методу, нам потрібно було б експоненційно більше даних, ніж існує. Синтетичні дані (тобто текст, згенерований штучним інтелектом) пропонують тимчасове рішення, але часто призводять до “колапсу моделі“, де система посилює свої власні упередження та помилки. Ми не можемо масштабувати наш шлях до штучного загального інтелекту (AGI) за допомогою тексту самостійно, оскільки текст є низькочастотним стисненням світу. Він описує реальність, але не є реальністю сама по собі.
Чому Світові Моделі мають значення
Лідери штучного інтелекту, такі як Ян Лекун, довгий час стверджували, що поточні системи штучного інтелекту відсутні фундаментальним аспектом людської когніції, який навіть молоді діти природно володіють. Це наша здатність підтримувати внутрішню модель того, як працює світ, яку вони часто називають Світовою Моделлю. Світова Модель не просто передбачає наступне слово; вона будує внутрішню ментальну карту того, як працює фізичне середовище. Коли ми бачимо м’яч, який котиться за диван, ми знаємо, що він все ще там. Ми знаємо, що він з’явиться на іншому боці, якщо його не зупинять. Нам не потрібно читати підручник, щоб зрозуміти це; ми запускаємо ментальну симуляцію на основі нашої внутрішньої “світової моделі” фізики та постійності об’єктів.
Щоб штучний інтелект розвинувся, йому потрібно перейти від статистичної імітації до цього типу внутрішньої симуляції. Йому потрібно зрозуміти основні причини подій, а не тільки їх тексти описи.
Спільна Предиктивна Архітектура Вбудовування (JEPA) є основним прикладом цього парадигматичного зсуву. На відміну від LLM, які намагаються передбачити кожен окремий піксель або слово (процес, який є обчислювально дорогим і шумним), JEPA передбачає абстрактні представлення. Він ігнорує непередбачувані деталі, такі як рух окремих листків на дереві, та фокусується на високорівневих концепціях, таких як дерево, вітер та сезон. Навчаючись передбачати, як ці високорівневі стани змінюються з часом, штучний інтелект вчиться структури світу, а не поверхневих деталей.
Від передбачення до симуляції
Ми вже бачимо перші ознаки цього переходу у відео-генераторах. Коли OpenAI випустила Sora, вони описали її не просто як інструмент відео, а як “світовий симулятор.”
Ця відмінність є життєво важливою. Стандартний генератор відео може створити відео людини, яка йде, передбачаючи, які кольорові пікселі зазвичай йдуть один за одним. Світовий симулятор, однак, намагається підтримувати тривимірну послідовність, освітлення та постійність об’єктів з часом. Він “розуміє”, що якщо людина йде за стіну, вона не зникне з існування.
Хоча поточні відео-моделі ще далекі від досконалості, вони представляють нову тренувальну площадку. Фізичний світ містить значно більше інформації, ніж тексти. Одна секунда відео містить мільйони візуальних даних про фізику, світло та взаємодію. Навчаючи моделі на цій візуальній реальності, ми можемо навчити штучний інтелект “здорового глузду”, якого зараз не вистачає LLM.
Це створює новий закон масштабування. Успіх тепер не буде вимірюватися кількістю трильйонів токенів, які модель прочитала. Він буде вимірюватися вірністю її симуляції та її здатністю передбачати майбутні стани середовища. Штучний інтелект, який може точно симулювати наслідки дії без виконання цієї дії, є штучним інтелектом, який може планувати, розуміти та діяти безпечно.
Ефективність та шлях до AGI
Цей зсув також вирішує проблему нестійких енергетичних витрат поточного штучного інтелекту. LLM є неефективними, оскільки їм потрібно передбачити кожну деталь, щоб згенерувати узгоджене виведення. Світова Модель є більш ефективною, оскільки вона є вибірковою. Як і людина-драйвер фокусується на дорозі та ігнорує узор хмар на небі, Світова Модель фокусується на відповідних причинних факторах завдання.
Лекун стверджував, що цей підхід дозволяє моделям навчатися значно швидше. Система типу V-JEPA (Відео-Спільне Вбудовування Предиктивної Архітектури) показала, що вона може зійти на рішення з значно менше тренувальних ітерацій, ніж традиційні методи. Навчаючись “форми” даних, а не запам’ятовуючи самі дані, Світові Моделі будують більш надійну форму інтелекту, яка краще узагальнюється до нових, невиданих ситуацій.
Це є відсутнім ланком для AGI. Правда інтелект вимагає навігації. Їй потрібно, щоб агент подивився на мету, симулював різні шляхи до досягнення цієї мети, використовуючи свою внутрішню модель світу, та вибрав шлях з найбільшою ймовірністю успіху. Текстові генератори не можуть цього зробити; вони можуть тільки написати план, але не зрозуміти обмеження його виконання.
Резюме
Галузь штучного інтелекту знаходиться на розі шляху. Стратегія “просто додати більше даних” досягає свого логічного кінця. Ми переходимо від епохи чат-бота до епохи Симулятора.
Наступне покоління масштабування штучного інтелекту не буде про читання всього інтернету. Воно буде про спостереження за світом, розуміння його правил та будівництво внутрішньої архітектури, яка дзеркально відображає реальність. Це не просто технічне оновлення; це фундаментальна зміна того, що ми вважаємо “навчанням”.
Для підприємств та дослідників фокус повинен зсуватися. Нам потрібно зупинити нашу одержимість підрахунком параметрів та почати оцінювати, наскільки добре наші системи розуміють причину та наслідок. Штучний інтелект майбутнього не просто скаже вам, що сталося; він покаже вам, що могло б статися, і чому. Це є обіцянкою Світових Моделей, і це єдиний шлях вперед.












