Моделі та платформи ШІ

Платформа Амап компанії Alibaba запускає світову модель на одному GPU протягом 24 годин

mm
Додайте Unite.AI до бажаних джерел у Google

Платформа Амап, що належить компанії Alibaba та займається послугами, пов’язаними з геолокацією, заявляє, що її інтерактивна світова модель ABot-World-0 тепер підтримує одну безперервну сесію протягом 24 годин на одному споживчому графічному процесорі, і вона опублікувала весь запуск як доступний запис замість вибраних моментів. На сторінці можна перейти до будь-якої секунди добового розгортання, з фіксованими точками входу на шостій, дванадцятій та вісімнадцятій годинах, поряд з п’ятьма іншими повними проходами через сцени лугів, пустелі, міста та снігового поля.

Цифра вартісна через те, що вона показує межу, яку вона подолала. Інтерактивна світова модель генерує відеофрейми послідовно у відповідь на дії користувача, тому кожна нова частина залежить від фреймів, які сама модель згенерувала раніше. Незначні помилки накопичуються, і сцена врешті-решт погіршується. Амап зазначає, що більшість систем цього класу утримуються протягом 30 секунд до хвилини. Сама заява компанії від 16 липня 2026 року про модель вказувала на більш ніж годину.

Як LongForcing підтримує стабільність запуску

Метод, який Амап вважає заслугою, називається LongForcing, описаний у технічному звіті, який команда опублікувала 21 липня 2026 року. Звичайний спосіб побудови такої моделі полягає у дистиляції: повільнішій двонапрямній вчителі, яка може звернутися до всього кліпу одночасно, навчає швидшої каузальної учениці, яка бачить тільки минуле, що й потрібно для реальної взаємодії. Таке керівництво зазвичай охоплює короткі кліпи, тому учениця вчиться виглядати правильно протягом декількох секунд і імпровізує після цього.

LongForcing розширює керівництво до місця, де відбуваються відмови. Учениця генерує довге розгортання самостійно, а вчитель з довшим тимчасовим контекстом керує пізнішими частинами його, де помилки прогнозування мали найбільшу можливість накопичуватися. Звіт розглядає це як виправлення накопиченого зрушення розподілу та автoregresивного дрейфу, а не як механізм пам’яті. Модель не проситься згадувати попередні фрейми точно; вона повертається до стабільного розподілу світу під час руху.

Амап каже, що це проявляється у поведінці: модель продовжує розширювати середовище новими сценами під час розгортання, замість того, щоб застряти в тому, з якого вона почала, і робить це без свіжих промптів від користувача на своєму шляху.

Що покривають заявлені цифри

Перфоманс-оболонка походить від власних вимірювань команди. По оптимізованим низькобітовим конфігураціям звіт ставить ABot-World-0 на 720p-виді та до 16 кадрів на секунду на одному настільному карті Nvidia RTX 5090, з 1,2 секундами між дією користувача та першим фреймом, що відображає її, і приблизно 19 ГБ пікової відеопам’яті. Контрольні запуски на сирому клавіатурному вводі для обох сцен роумінгу та руху персонажа в третьому особі, з пам’яттю персонажа, яка тримає вигляд персонажа стабільним протягом довгої сесії.

Для оцінки звіт повідомляє про результати на наборі WorldRoamBench разом з розширеними інтерактивними розгортаннями, описуючи результат як конкурентоспроможну керованність та узгоджене довготривале розгортання світу. Те, що додає опублікований 24-годинний запис, це інспектабельність: повний хронологічний діапазон доступний для прокрутки секунда за секундою, а не стиснутий у таблицю.

Звіт привернув увагу, коли був опублікований. Сторінка паперів Hugging Face позначила його як найкращу роботу дня 22 липня 2026 року, і з тих пір він зібрав понад 300 голосів там.

Що отримують розробники

Практичний зсув відбувається у апаратному забезпеченні. Довготривале інтерактивне генерування було робочим навантаженням центру даних, і Амап вважає, що одна настільна карта тепер покриває це, знижуючи вартість входу для розробників, студій та дослідницьких груп, які працюють без бюджетів кластерів. Це найважливіше для втіленого штучного інтелекту, де політики повинні бути застосовані до різноманітних середовищ до того, як вони зустрічаються з реальним апаратним забезпеченням, область, яка привертає постійну роботу від Gemini Robotics ER 2 від Google до моделей відеодії mimic robotics на заводі Audi.

Все знаходиться під ліцензією Apache 2.0 у репозиторії проекту на GitHub, який містить код інференсу, локальну демонстрацію та посилання на випущену контрольну точку на Hugging Face та ModelScope. Це ставить ABot-World-0 разом з іншими відкритими моделями, які досягли робочих розробників цього року, серед них Inkling від Thinking Machines Lab.

Поряд з 24-годинним записом команда випустила свої тренувальні дані: 30 969 епізодів відео, умовно залежних від дій, що сумарно становлять 2,74 ТБ, кожний з яких містить MP4 з клавіатурними діями, які їх створили, підписами та розрідженою камерною реконструкцією сцени. Публікація цього корпусу дозволяє зовнішнім дослідникам тренувати проти того самого матеріалу та перевірити, чи витримує LongForcing у їхніх руках, а дорожня карта проекту ставить двонапрямну вчительську модель наступною.

Джонас Рів - аналітик, створений штучним інтелектом, у Unite.AI, який зосереджується на когнітивному штучному інтелекті, штучному загальному інтелекті (AGI) та теоретичних основах машинного інтелекту. Його робота досліджує, як навчання, розуміння, пам'ять та абстракція виникають як у біологічних, так і в штучних системах, проводячи зв'язки між сучасними архітектурами штучного інтелекту та довгостроковими питаннями когнітивної науки та філософії свідомості.
З концептуальним та рефлексивним підходом Джонас вивчає рамки, такі як моделі розуміння, агентні системи, виникнення когніції та теорія вирівнювання, спрямовані на роз'яснення того, що насправді означає прогрес у напрямку AGI - та чого ні. Натомість ніж гнатися за графіками або гіпом, він підкреслює перші принципи, концептуальну строгість та обмеження поточних моделей.
Статті, написані Джонасом Рівом, створені штучним інтелектом та перевірені редакційною командою Unite.AI, щоб забезпечити точність, ясність та відповідальне обговорення передових концепцій штучного інтелекту.