Интервью

Bing Xu, основатель и генеральный директор INT21 — серия интервью

mm
Добавьте Unite.AI в избранные источники в Google

Bing Xu, основатель и генеральный директор INT21, является инженером по ИИ‑инфраструктуре и предпринимателем с глубоким опытом в оптимизации GPU, системах машинного обучения и автономных ИИ‑агентах. До основания INT21 в 2026 году Сюй был выдающимся инженером в NVIDIA, где работал над разработкой программного обеспечения, управляемого агентами, и создал несколько поколений кодирующих агентов, включая работу над VibeTensor и AVO. Он присоединился к NVIDIA после её приобретения HippoML, стартапа по инференсу на GPU, который он основал и возглавлял как CEO. Ранее Сюй работал старшим инженером‑программистом в Meta, где создал AITemplate и помог повысить эффективность инференса на GPU в производственных нагрузках, а также занимал инженерные и исследовательские позиции в OctoML, Facebook AI, Apple и Turi. Его карьера постоянно сосредоточена на улучшении программного обеспечения и инфраструктуры, лежащих в основе современных ИИ‑систем.

INT21 строит самосовершенствующуюся ИИ‑инфраструктуру, предназначенную для использования автономных роёв агентов, которые непрерывно разрабатывают, тестируют, проводят бенчмарки и оптимизируют программное обеспечение, поддерживающее ИИ‑нагрузки. В настоящее время её внимание сосредоточено на Inference Engine Factory, которая использует специализированных агентов для параллельного исследования стратегий оптимизации и создания полных инференс‑движков, охватывающих ядра CUDA и PTX, драйверы и инфраструктуру обслуживания, при этом производительность проверяется непосредственно на целевом оборудовании. Технология компании построена на SwarmOS — облачно‑нативной платформе, позволяющей большому числу агентов координировать свои действия вокруг измеримых инженерных целей, сохраняя доказательства и выводы между поколениями. INT21 первоначально продемонстрировала этот подход через PTX Kernel Factory, которая создавала и тестировала GPU‑ядра для аппаратуры NVIDIA Hopper и Blackwell; с тех пор компания перенаправила вычислительные ресурсы на оптимизацию полных инференс‑движков.

Вы основали INT21 после того, как неоднократно сталкивались с проблемой найма специализированных инженеров‑инфраструктурщиков достаточно быстро, чтобы строить и оптимизировать ИИ‑системы. Что убедило вас в том, что решение заключается не просто в лучших инструментах для разработчиков, а в автономных, самосовершенствующихся ро́ях агентов, способных самостоятельно выполнять эту работу?

Это широко известная проблема: спрос на специалистов по ИИ‑инфраструктуре в разных областях значительно превышает предложение, и я столкнулся с этим лично. Именно это подтолкнуло меня к рассмотрению самосовершенствующихся роёв агентов как варианта. За последние несколько лет я работал над самосовершенствующимися ИИ‑решениями, и сейчас технология развивается настолько быстро, что такие системы действительно способны самостоятельно создавать, запускать и оптимизировать инфраструктуру.

Основная философия INT21 заключается в том, что, как и люди, агенты становятся умнее благодаря накопленным знаниям. Это принципиально отличается от устаревших инструментов разработчиков, которые всё ещё ограничены тем, сколько часов может работать человек и какие задачи он способен решить. Использование самосовершенствующихся роёв агентов делает нас быстрее, точнее и эффективнее с каждым производственным циклом. Поскольку наши агенты способны работать без ограничений существующих фреймворков, мы можем создавать решения с нуля, адаптированные под каждую конкретную нагрузку.

До создания INT21 вы основали HippoML, который был приобретён NVIDIA всего через 14 месяцев после запуска, а позже стали выдающимся инженером в NVIDIA. Чему вас научил этот опыт относительно узких мест в ИИ‑инфраструктуре, которые в конечном итоге сформировали архитектуру и миссию INT21?

В HippoML мы специализировались на высокопроизводительном инференсе генеративного ИИ, разрабатывая инструменты оптимизации программного обеспечения для более быстрого и эффективного запуска больших языковых моделей. Мы поняли, что без привлечения талантливых подрядчиков из Восточной Европы и других регионов нам не удаётся масштабироваться, чтобы успевать за спросом на оптимизацию инференса ИИ.

После того как NVIDIA приобрела нас, я начал разрабатывать подход к разработке на основе агентов внутри компании. Мы опубликовали исследование, доказывающее, что «оболочка» (инфраструктурный слой вокруг модели) действительно определяет производительность агента, а не сама модель. Это подтвердило, что реальное узкое место в ИИ‑инфраструктуре — не поиск лучших моделей, а оптимизация систем, их запускающих.

По мере улучшения моделей их инфраструктура должна масштабироваться соответствующим образом. Однако циклы оптимизации, управляемые людьми, не успевают за темпами. Вы оптимизируете цикл обучения для одной архитектуры модели, развертываете его, а затем, если архитектура меняется или появляется новое поколение GPU, приходится начинать всё заново. Сейчас кажется, что каждую неделю появляется новое обновление модели, и такой подход становится неустойчивым. Это осознание убедило меня, что следующий прорыв заключается в самосовершенствующейся инфраструктуре, что и привело к созданию INT21.

INT21 описывает свой подход как «самосовершенствующаяся инфраструктура», что сильно отличается от рекурсивного самосовершенствования, когда исследователи пытаются сделать саму базовую ИИ‑модель более способной. Как работает ваш подход и почему вы считаете, что улучшение систем вокруг существующих моделей может дать значительные выгоды гораздо быстрее?

Подход рекурсивного самосовершенствования сосредоточен на обучении собственных моделей, формировании исследовательских команд и привлечении огромного капитала. Это десятилетнее, дорогостоящее путешествие, поскольку вы заставляете модель рассуждать о собственном процессе обучения.

Наш подход отличается. В INT21 мы не пытаемся улучшать передовые модели сами по себе, что заняло бы годы и миллиарды долларов. Вместо этого мы создаём ро́и агентов, которые оптимизируют «оболочку» — инфраструктурный слой между моделью и её производительностью. Именно это доказало моё исследование в Nvidia: что именно оболочка, а не модель, определяет производительность агента в сложных задачах. Агенту не нужно понимать возможности передовой модели, чтобы достичь 10 % повышения эффективности. Достаточно исследовать пространство дизайна, измерять, проверять и сохранять то, что работает.

Один из способов сравнить два подхода — это представить, что один строит электростанцию, а другой использует уже существующее электричество. Мы можем двигаться быстрее и удовлетворять реальный и немедленный спрос. И это означает, что уже сегодня мы наблюдаем значительные измеримые выгоды от самосовершенствующейся инфраструктуры.

INT21 недавно запустила Inference Engine Factory, расширив концепцию от отдельных GPU‑ядер до полных инференс‑движков. Что на самом деле означает, что рой агентов автономно создаёт и оптимизирует инференс‑движок, и какие части этого процесса традиционно требовали наибольшей специализированной человеческой экспертизы?

Инференс‑движок — это программное обеспечение, которое запускает модель на аппаратуре. Это сложная система, требующая одновременно десятков проектных решений, например, какие операции выполнять совместно в одном ядре или как распределять работу по ядрам процессора. Эти решения взаимосвязаны, поэтому изменение одного требует повторного тестирования всех остальных.

Традиционно инженер вручную настраивает всё это для каждой модели. Для генерации видео, музыки и речи это особенно сложно, поскольку они представляют собой многоэтапные, многомасштабные архитектуры без готовых фреймворков. Рои агентов INT21 создают полный стек от отдельных ядер до полного инференс‑движка. Наши стеки для генерации видео и аудио не требуют человеческого ревью кода и превосходят передовые решения по инференсу при тех же настройках параллелизма.

Ваш PTX Kernel Factory создал реализации, которые превосходят существующие базовые показатели до 59 % в некоторых нагрузках. На техническом уровне, где агенты находят улучшения производительности, которые упускают сильно оптимизированные реализации, написанные людьми, или традиционные компиляторы?

Наш PTX Kernel Factory превзошёл лучшую доступную базу до 59 % по сравнению с KDA (Kimi Linear Attention). Это объясняется тем, что наши самосовершенствующиеся ро́и агентов способны генерировать тысячи вариантов за долю времени, что слишком трудоёмко и дорого для человеческих инженеров.

Отличие в том, что ядра, написанные людьми, опираются на предметно‑специфические языки (DSL), шаблоны и компиляторы, заранее созданные для GPU. DSL хорошо работает для типовых шаблонов, но при новой нагрузке, такой как KDA, универсальный компилятор часто не может достичь оптимального результата. Наши агенты полностью обходят эти абстракции, то есть они не ограничены предположениями DSL или компилятора. Эта свобода исследовать всё пространство дизайна без привязки к предопределённым шаблонам и даёт прирост производительности.

ИИ‑созданная инфраструктура создает необычную проблему верификации: оптимизация бесполезна, если она быстрее, но слегка некорректна. Как ваши ро́и агентов тестируют, проводят бенчмарки, отбрасывают неудачные варианты и сохраняют успешные находки, и насколько важен этот цикл обратной связи для того, чтобы система действительно была самосовершенствующейся, а не просто ИИ‑кодером?

Цикл обратной связи критически важен, потому что оптимизация теряет ценность, если она корректна лишь при определённых предположениях или только для конкретного распределения входных данных. В INT21 мы гарантируем, что цикл обратной связи строгий.

Мы начинаем с модели, ограничений развертывания и метрики обслуживания, которая имеет значение. Затем самосовершенствующиеся ро́и агентов одновременно исследуют конфигурации и пути оптимизации, оценивая каждый кандидат по критериям корректности и производительности. Сохраняются только те реализации, которые работают.

То, что делает процесс действительно самосовершенствующимся, — это улучшение самой валидационной базы данных. Эти данные возвращаются в ро́и агентов, позволяя им уточнять понимание того, что работает, и постоянно закрывать цикл обратной связи. Без такой строгости система представляла бы лишь правдоподобный, сгенерированный ИИ код, который можно быстрее выпускать, но с техническим долгом, незаметно накапливающимся и подрывающим доверие к создаваемому продукту.

В NVIDIA вы работали над проектами, включая VibeTensor и Agentic Variation Operators, где агенты генерировали значительные объёмы системного программного обеспечения и автономно искали оптимизации GPU. Что эти проекты показали о типах инженерных задач, которые ИИ‑агенты уже способны решать, хотя многие разработчики всё ещё считают, что они требуют человеческой экспертизы?

VibeTensor научил меня тому, что я назвал «эффектом Франкенштейна». ИИ корректно справлялся со всеми уровнями, но когда собрать все эти части в единую систему, результат отставал от того, что могли построить человеческие эксперты.

Работа над Agentic Variation Operators показала противоположный результат. Она продемонстрировала, что ИИ может превзойти человеческих экспертов в узко ограниченных задачах. Генерация ядер — хороший пример, поскольку задача узкая, измеримая и имеет единую цель.

«Эффект Франкенштейна» — именно то, что решает INT21. Инженерные образцы из нашего Inference Engine Factory превосходят высокопроизводительные открытые инференс‑движки, такие как SGLang и vLLM, потому что мы научились правильно структурировать задачу. Мы задаём агентам чёткие ограничения, измеримые цели и плотные циклы обратной связи. Человеческие эксперты всё ещё необходимы, но вместо выполнения оптимизации они дают ценное направление и интерпретируют результаты. ИИ усиливает влияние эксперта, исполняя задачи быстрее и систематичнее, чем любой человек.

INT21 использует несколько специализированных агентов, а не полагается на одного агента с постоянно растущим окном контекста. Почему вы считаете оркестрацию множественных агентов более масштабируемым подходом к сложным инженерным задачам, и как агенты распределяют работу, делятся находками и избегают дублирования или конфликтов друг с другом?

Большее окно контекста позволяет удерживать больше информации одновременно, но это не помогает решать многомерные задачи, где всё взаимосвязано. Мы используем облачно‑нативную платформу для запуска специализированных агентов, все из которых работают над одной измеримой целью. Агенты исследуют параллельно и постоянно сходятся к более сильным решениям.

Это более масштабируемо по нескольким причинам. Во‑первых, каждый агент остаётся сфокусированным. Во‑вторых, вы не заставляете одного агента рассуждать обо всём одновременно, поэтому процесс более эффективен. И, наконец, это отражает реальный способ работы инфраструктурных команд, где каждая команда владеет своей областью, но синхронизируется, когда решения влияют друг на друга.

Если ро́и агентов смогут непрерывно оптимизировать ядра, инференс‑движки, компиляторы и другие уровни стека ИИ, как изменится роль инженера‑инфраструктурщика? Ожидаете ли вы, что эти системы в первую очередь решат проблему нехватки специализированных инженеров, или со временем автоматизируют значительную часть разработки инфраструктуры?

Работа инженера‑инфраструктурщика полностью изменится. Он больше не будет «мять» код ядер и настраивать память. Вместо этого он будет ставить цели, определять пространство дизайна, устанавливать ограничения и интерпретировать результаты.

Со временем понадобится меньше инженеров‑инфраструктурщиков для поддержания работы и улучшения систем. Однако стратегическая работа, которая останется, станет более ценной, а не менее. На практике это означает, что организации смогут управлять сложной ИИ‑инфраструктурой с гораздо меньшим числом специализированных инженеров, чем требуется сегодня. Это важно для любой компании, стремящейся построить производственные ИИ‑системы.

Ваше долгосрочное видение — чтобы самосовершенствующиеся ро́и агентов работали на всех уровнях ИИ‑инфраструктуры. Как будет выглядеть этот стек, если видение реализуется, и сможем ли мы в конечном итоге достичь того, что ИИ‑инфраструктура будет постоянно переписывать и оптимизировать себя по мере изменения моделей, нагрузок и аппаратного обеспечения?

Сейчас каждый уровень стека ИИ оптимизируется независимо: от низкоуровневых ядер до базовых фреймворков и интерфейсов. Но они не координируются между собой. Поэтому можно оптимизировать один уровень, а затем случайно нарушить работу другого уровня ниже.

В INT21 мы видим, что ро́и агентов могут автономно координировать свои действия на всех этих уровнях, постоянно корректируя и адаптируя их. Когда появляется новая модель, весь стек переоптимизируется под неё, так что инфраструктура никогда не отстаёт от текущих задач.

Ранее это было невозможно, поскольку человеческим инженерам не хватает скорости. Но с постоянной оптимизацией роёв агентов самосовершенствующаяся инфраструктура появляется как отдельная категория вычислений. Инфраструктура, способная адаптироваться так же быстро, как меняются модели и оборудование, будет выигрывать. Всё остальное становится обузой.

Спасибо за отличное интервью, читатели, желающие узнать больше, должны посетить INT21.

Антуан - видный лидер и сооснователь Unite.AI, движимый непоколебимой страстью к формированию и продвижению будущего ИИ и робототехники. Как серийный предприниматель, он считает, что ИИ будет столь же разрушительным для общества, как и электричество, и часто увлекается потенциалом разрушительных технологий и ИИ.

Как футуролог, он посвящен исследованию того, как эти инновации будут формировать наш мир. Кроме того, он является основателем Securities.io, платформы, ориентированной на инвестиции в передовые технологии, которые переопределяют будущее и меняют целые сектора.