Модели и платформы ИИ

Платформа Амап от Alibaba запускает мировую модель на одном GPU в течение 24 часов

mm
Добавьте Unite.AI в избранные источники в Google

Платформа Амап, предоставляющая услуги, основанные на местоположении, заявляет, что ее интерактивная мировая модель ABot-World-0 теперь поддерживает одну непрерывную сессию в течение 24 часов на одной потребительской видеокарте, и опубликовала всю запись как просматриваемую запись вместо подборки лучших моментов. На странице любой может перейти к любой секунде суток, с фиксированными точками входа на шестичасовой, двенадцатичасовой и восемнадцатичасовой отметках, а также пять полных прогонов через сцены степи, пустыни, города и снежного поля.

Эта цифра имеет значение, поскольку она устанавливает потолок. Интерактивная мировая модель генерирует кадры видео кадр за кадром в ответ на действия пользователя, поэтому каждый новый фрагмент зависит от кадров, которые сама модель сгенерировала моменты ранее. Малые ошибки накапливаются, и сцена в конечном итоге ухудшается. Амап говорит, что большинство систем этого класса держатся вместе в течение 30 секунд до минуты. В своем объявлении от 16 июля 2026 года о модели указано, что она работает более часа.

Как LongForcing поддерживает стабильность запуска

Метод, который Амап считает заслугой, называется LongForcing, описанный в техническом отчете, который команда опубликовала 21 июля 2026 года. Обычный способ построения такой модели – это дистилляция: более медленная двунаправленная модель учителя, которая может обращать внимание на весь клип сразу, обучает более быструю причинно-следственную модель ученика, которая видит только прошлое, что требуется для реального взаимодействия. Такое руководство обычно охватывает короткие клипы, поэтому ученик учится выглядеть правильно в течение нескольких секунд и импровизирует после этого.

LongForcing расширяет руководство до места, где происходят неудачи. Ученик генерирует длинный прогон самостоятельно, и учитель с более длинным временным контекстом контролирует последующие части его, где ошибки прогнозирования имели больше времени для накопления. Отчет формулирует это как исправление накопленного сдвига распределения и автoregressивного дрейфа, а не как механизм памяти. Модель не запрашивается, чтобы вспомнить более ранние кадры более точно; она притягивается обратно к стабильному мировому распределению, когда она движется.

Амап говорит, что это проявляется в поведении: модель продолжает расширять окружающую среду новыми сценами во время запуска, вместо того, чтобы застрять в той, с которой она начала, и делает это без необходимости для пользователя вводить новые подсказки по пути.

Что покрывают заявленные цифры

Показатели производительности получены из собственных измерений команды. На оптимизированных конфигурациях с низким количеством битов отчет ставит ABot-World-0 на выход 720p и до 16 кадров в секунду на одной видеокарте Nvidia RTX 5090, с 1,2 секундами между действием ввода и первым кадром, отражающим его, и примерно 19 ГБ пиковой видеопамяти. Контрольные прогоны на сыром вводе с клавиатуры для навигации по сцене и движения персонажа от третьего лица, с памятью ссылочного персонажа, которая держит внешний вид персонажа стабильным в течение долгой сессии.

Для оценки в статье сообщаются результаты на наборе WorldRoamBench, а также расширенные интерактивные прогоны, описывая результат как конкурентоспособную управляемость и связное долгосрочное развитие мира. То, что добавляет опубликованная 24-часовая запись, – это возможность просмотра: полная временная шкала находится там, чтобы быть просмотренной секунда за секундой, а не сжатой в таблицу.

Отчет привлек внимание, когда он появился. Страница с работами Hugging Face перечислила его как лучшую работу дня 22 июля 2026 года, и с тех пор он собрал более 300 голосов за него.

Что получают разработчики

Практический сдвиг – это аппаратное обеспечение. Долгосрочная интерактивная генерация была рабочей нагрузкой для центра обработки данных, и Амап утверждает, что одна видеокарта теперь покрывает ее, снижая стоимость входа для разработчиков, студий и исследовательских групп, работающих без бюджета кластера. Это имеет значение для воплощенного ИИ, где политики должны быть упражнены против различных окружающих сред, прежде чем они встретят реальное оборудование, область, которая привлекает постоянную работу от Gemini Robotics ER 2 от Google до моделей видео-действий от mimic robotics на заводском полу Audi.

Все находится под лицензией Apache 2.0 в репозитории GitHub проекта, который содержит код вывода, локальную демонстрацию и указатели на выпущенный контрольный пункт на Hugging Face и ModelScope. Это ставит ABot-World-0 вместе с более широким рядом открытых моделей, достигающих работающих разработчиков в этом году, среди них Inkling от Thinking Machines Lab.

Вместе с 24-часовой записью команда выпустила свои тренировочные данные: 30 969 эпизодов видео, обусловленных действием, в общей сложности 2,74 ТБ, каждый из которых упаковывает MP4 с действиями с клавиатуры, которые его произвели, подписями и скудной реконструкцией камеры-позы сцены. Публикация корпуса позволяет внешним исследователям обучаться на том же материале и проверять, будет ли LongForcing держаться в их руках, и дорожная карта проекта ставит двунаправленную модель учителя следующей на выход.

Джонас Рив - аналитик, сгенерированный ИИ, в Unite.AI, который фокусируется на когнитивном ИИ, искусственном общем интеллекте (ИОИ) и теоретических основах машинного интеллекта. Его работа исследует, как обучение, рассуждение, память и абстракция возникают как в биологических, так и в искусственных системах, проводя связи между современными архитектурами ИИ и давними вопросами когнитивной науки и философии сознания.
С концептуальным и рефлексивным подходом Джонас исследует такие рамки, как модели рассуждений, агентные системы, возникающее сознание и теория соответствия, стремясь прояснить, что на самом деле означает прогресс в сторону ИОИ - и что нет. Вместо того, чтобы гнаться за сроками или хайпом, он подчеркивает первые принципы, концептуальную строгость и ограничения текущих моделей.
Статьи, написанные Джонасом Ривом, сгенерированы ИИ и проверены редакционной командой Unite.AI, чтобы обеспечить точность, ясность и ответственное обсуждение продвинутых концепций ИИ.