Модели и платформы ИИ
Стена GPU трескается: Невидимая революция в пост-трансформерных архитектурах

В течение последних пяти лет искусственный интеллект был практически синонимом одного слова: Трансформер. С момента выхода семинальной статьи “Attention Is All You Need” в 2017 году, эта архитектура захватила поле. От GPT до Claude, практически каждая модель, которая привлекла внимание, полагается на один и тот же основной механизм само-внимания. Мы в значительной степени предполагали, что путь к лучшему ИИ заключается просто в масштабе. На практике это означает обучение более крупных Трансформеров с большим количеством данных на более крупных кластерах GPU.
Хотя это убеждение привело к многим прорывам, оно теперь достигает своих пределов. Мы сталкиваемся с “Стеной GPU”, барьером не только сырой вычислительной мощности, но и памяти и экономической устойчивости. Пока мир фокусируется на гонке за моделями с триллионом параметров, происходит радикальный сдвиг в исследовательских лабораториях. Новая волна “пост-трансформерных архитектур” появляется, чтобы разрушить ограничения текущей парадигмы. Этот сдвиг обещает сделать ИИ более эффективным, доступным и способным рассуждать над бесконечными контекстами.
Кремниевый потолок: Почему Трансформеры сталкиваются со стеной
Чтобы понять, почему нам нужен сдвиг, мы сначала должны понять узкое место текущего режима. Трансформеры невероятно мощны, но они такжеremarkably неэффективны в определенных аспектах. Ядро их способности лежит в “механизме внимания”, который позволяет модели смотреть на каждый токен в последовательности и рассчитать его отношение к каждому другому токену. Это дает им способность понимать контекстremarkably хорошо.
Однако эта способность имеет фатальный недостаток квадратичного масштабирования. Если вы удвоите длину документа, который вы хотите, чтобы ИИ прочитал, вычислительная работа, необходимая не просто удваивается, а квадруплируется. Когда мы стремимся к моделям “бесконечного контекста”, которые могут прочитать целые библиотеки или кодовые базы, вычислительные требования становятся чрезвычайно высокими.
Но более непосредственная проблема заключается в памяти, конкретно в “KV Cache” (Кэш ключ-значение). Чтобы генерировать текст плавно, Трансформер должен поддерживать текущую историю всего, что он только что сказал, в высокоскоростной памяти GPU (VRAM). Когда разговор становится длиннее, этот кэш разрастается, потребляя огромные объемы памяти, чтобы просто запомнить, что произошло три абзаца назад.
Это создает “Стену GPU”. Мы не просто заканчиваемся микросхемами; мы заканчиваемся памятью, чтобы их запитать. Мы построили двигатели, которые становятся все больше и больше, но они становятся невозможными для заправки. В течение долгого времени решение отрасли было просто купить больше NVIDIA H100 (NVDA ). Но этот брутальный подход достигает точки уменьшающихся доходов. Нам не нужен двигатель, который потребляет топливо квадратично, а новая архитектура.
Невидимая революция
Пока основные исследования были сосредоточены на LLM, группа исследователей пересматривает старую идею: Рекуррентные нейронные сети (RNN). До Трансформеров RNN были стандартом для языка. Они обрабатывали текст последовательно, слово за словом, обновляя скрытое внутреннее “состояние” по мере продвижения. Они были невероятно эффективны, потому что не нуждались в том, чтобы смотреть назад на всю историю; они просто поддерживали “суть” ее в своей памяти.
RNN не удалось, потому что они не могли справиться с длинными зависимостями; они “забывали” начало предложения к тому времени, когда они достигали конца. Они также были медленными в обучении, потому что их нельзя было параллелизировать. Это означает, что вам нужно было обработать слово А, прежде чем вы могли обработать слово Б. Трансформеры решили эту проблему, обрабатывая все одновременно (параллелизация) и поддерживая все в памяти (внимание).
Теперь мы свидетели появления архитектур, которые объединяют лучшее из обоих миров. Эти архитектуры известны как Модели пространства состояний (SSM). Они предлагают скорость обучения Трансформеров (параллелизуемость), но эффективность вывода RNN (линейное масштабирование).
Одна из заметных архитектур в этой новой волне – Mamba. Выпущенная в конце 2023 года и усовершенствованная в 2024 году, Mamba является фундаментальным сдвигом в том, как модели обрабатывают информацию. В отличие от Трансформера, который поддерживает исходную копию каждого слова, которое он когда-либо видел, в буфере памяти, Mamba использует “селективное пространство состояний”.
Мы можем понять разницу между Трансформером и Mamba, представив Трансформер как ученого, который поддерживает каждую книгу, которую он когда-либо прочитал, открытой на огромном столе, постоянно сканируя туда и обратно, чтобы найти связи. Mamba, с другой стороны, является ученым, который читает книгу один раз и сжимает ключевые идеи в высокоэффективную тетрадь. Когда Mamba генерирует следующее слово, он не нужно смотреть назад на исходный текст; он смотрит на свое сжатое состояние.
Эта разница меняет экономику развертывания ИИ. С Mamba и подобными архитектурами, такими как RWKV (Весовое ключ-значение), стоимость генерации текста не взрывается, когда последовательность становится длиннее. Вы можете теоретически подать этим моделям миллион слов контекста, и вычислительная стоимость генерации следующего токена остается такой же, как если бы вы подали им десять слов.
Возвращение рекуррентности
Технический прорыв за Mamba – “селективность”. Предыдущие попытки модернизировать RNN не удалось, потому что они были слишком жесткими. Они сжимали информацию одинаково, независимо от того, была ли она важна или шумом. Mamba вводит механизм, который позволяет модели динамически решать, что запомнить и что забыть, когда она обрабатывает данные.
Если модель получает важную информацию, например, определение переменной в кодовом блоке, она “открывает ворота” и записывает ее сильно в свое состояние. Если она сталкивается с заполнителями или нерелевантным шумом, она закрывает ворота, сохраняя свою ограниченную емкость памяти для того, что имеет значение.
Эта селективность эффективно решает проблему “забывания”, которая бросала вызов старым RNN. Во многих тестах модели на основе Mamba соответствуют производительности Трансформеров одного и того же размера, но работают до пяти раз быстрее во время вывода. Более важно, что их след памяти намного меньше. Это открывает дверь для высокопроизводительных LLM, чтобы запускаться на устройствах, которые ранее считались неспособными их обработать, таких как ноутбуки, сети edge-вычислений или даже смартфоны, без выгрузки в облако.
Мы также свидетели появления Hyena, другой суб-квадратичной архитектуры, которая использует длинные свертки для обработки данных. Как и Mamba, Hyena стремится удалить тяжелые “слой внимания” Трансформера и заменить их математическими операциями, которые намного дешевле для аппаратного обеспечения. Эти модели теперь начали бросать вызов инкумбентам Трансформера на основных досках лидеров.
Возрождение гибридных моделей
Революция, однако, может не быть полной заменой Трансформера, а скорее эволюцией в гибридные формы. Мы уже видим появление моделей, таких как Jamba (от AI21 Labs), которая объединяет слои Трансформера с слоями Mamba.
Этот гибридный подход предлагает практический способ решить ограничения Трансформера. Трансформеры остаются исключительно сильными в определенных задачах, особенно для копирования точных деталей из контекста. Объединив слои Mamba (которые обрабатывают основную часть данных и долгосрочной памяти) с несколькими слоями внимания Трансформера (которые обрабатывают острое, непосредственное рассуждение), мы получаем модель, которая объединяет лучшее из обоих миров.
Гибридная модель создает огромное окно контекста, которое фактически используется. В настоящее время многие “длинные контекстные” Трансформеры утверждают, что могут обработать 100 000 токенов, но их производительность быстро ухудшается, когда контекст заполняется. Это явление известно как “потерянный в середине“. Гибридная архитектура сохраняет свою связность намного лучше на длинных расстояниях, потому что слои SSM специально разработаны для сжатия и переноса состояния во времени.
Эти разработки меняют фокус отрасли от “Обучения” (насколько большого кластера мне нужно построить, чтобы построить модель?) к “Экономике вывода” (насколько дешево я могу обслужить эту модель для миллиарда пользователей?). Если гибридная модель может обслужить пользователя за 10% стоимости Трансформера, бизнес-случай для приложений ИИ меняется за одну ночь.
Будущее развертывания ИИ
Последствия этой пост-трансформерной революции не ограничиваются только центром обработки данных. Стена GPU исторически служила воротником, гарантируя, что только самые крупные технологические гиганты с миллиардами долларов в аппаратном обеспечении могли построить и запустить модели высшего класса. Эффективные архитектуры, такие как Mamba и RWKV, демократизируют эту власть. Если вы можете запустить модель уровня GPT-4 на потребительской карте, потому что вам больше не нужны терабайты VRAM для кэша ключ-значение, централизованное управление ИИ начинает ослабевать. Мы можем увидеть возрождение локальных, частных агентов ИИ, которые живут полностью на вашем компьютере, обрабатывая ваши частные данные без отправки пакета в облако.
Кроме того, эта эффективность является ключом к разблокировке “Агентских систем ИИ“, которые запускаются в фоновом режиме в течение часов или дней, чтобы выполнить сложные задачи. Текущие Трансформеры слишком дорогие и медленные, чтобы запускаться в непрерывных циклах в течение длительного времени. Эффективная, линейная архитектура может “думать” и обрабатывать циклы непрерывно без банкротства пользователя или перегрева аппаратного обеспечения.
Основной вывод
Трансформер доминировал в заголовках ИИ, но за кулисами тихая революция проходит. Стена GPU толкает исследователей к переосмыслению того, как модели обрабатывают память и вычисления. Пост-трансформерные архитектуры, такие как Mamba и гибридные модели, доказывают, что эффективность, а не только масштаб, определит следующую эру. Эти инновации делают огромные окна контекста практичными, вывод более дешевым и передовые ИИ доступными за пределами центров обработки данных. Будущее ИИ лежит не в более крупных моделях, а в более умных, которые запоминают, рассуждают и масштабируются эффективно.












