Интервью

Kismat Singh, соучредитель и генеральный директор MachGen AI — серия интервью

mm
Добавьте Unite.AI в избранные источники в Google

Kismat Singh, соучредитель и генеральный директор MachGen AI, является руководителем в области инфраструктуры ИИ и инженерии с более чем двадцатилетним опытом создания систем высокопроизводительных вычислений и машинного обучения. До основания MachGen AI Сингх занимал пост вице-президента по инженерии AI‑фреймворков в Intel и ранее работал на старших инженерных должностях в NVIDIA, AMD, HP и других технологических компаниях. Его работа включала вклад в библиотеки глубокого обучения и компиляторы, оптимизацию AI‑фреймворков и улучшения устойчивости гипермасштабного обучения. В Intel он тесно участвовал в инициативах компании по PyTorch и публично выступал о том, как сделать AI‑фреймворки более доступными на разных аппаратных платформах.

MachGen AI — компания, занимающаяся инфраструктурой ИИ, сосредоточенная на том, чтобы генеративные модели изображений и видео работали значительно быстрее и экономичнее. Основанная Кисматом Сингхом и Мано Дж. Кришнаном, компания разрабатывает высокопроизводительный стек вывода и дообучения, специально предназначенный для диффузионных моделей, а не адаптируя инфраструктуру, изначально построенную для больших языковых моделей. MachGen оптимизирует такие области, как вычисления внимания, кэширование, GPU‑ядра, управление памятью, параллелизм, планирование и развертывание, чтобы снизить задержку генерации при сохранении качества модели. Платформа предоставляет API для генерации «текст‑в‑изображение», «изображение‑в‑изображение», «текст‑в‑видео», «изображение‑в‑видео» и «референс‑в‑видео», а базовая технология направлена на поддержку приложений с низкой задержкой, таких как интерактивное создание контента, аватары в реальном времени, игры и персонализированная реклама.

Вы более двадцати лет работаете с видео, вычислениями на GPU и производительностью ИИ, включая TensorRT в NVIDIA, AI‑программным обеспечением в Intel, оптимизацией GPU в AMD и ранними проектами по кодированию видео в реальном времени. Что вы увидели за эти годы, что в конечном итоге убедило вас покинуть крупные технологические компании и соучредить MachGen, и почему вы считаете, что вывод диффузионных моделей представляет собой инфраструктурную проблему, достойную создания компании?

Мой соучредитель Мано и я играли в бадминтон в одном зале почти 10 лет. Большую часть этого времени мы пытались нанять друг друга. В конце концов мы решили, что работать вместе проще, чем постоянно нанимать друг друга.

Причина, по которой мы выбрали эту проблему, заключается в том, что оба наблюдали, как стек вывода созревает изнутри. Я помогал создавать команду платформы вывода в NVIDIA, а затем возглавлял AI‑программное обеспечение в Intel. Мано построил инфраструктуру обучения больших моделей, лежащую в основе PyTorch в Meta. Мы наблюдали, как годы работы над кэшированием, пакетированием, планированием и ядрами превратили ранние исследовательские системы LLM в производственную инфраструктуру, обслуживающую триллионы токенов.

Диффузия находится примерно там, где три года назад была инференция LLM. Модели изображений и видео быстро развивались, но системы их обслуживания остаются медленными, дорогими и сложными в масштабировании. Большинство существующей инфраструктуры была разработана для LLM, а диффузия была добавлена позже.

Три фактора, сделавших время подходящим: модели стали достаточно хорошими для создания реальных продуктов, проблема требовала именно тех навыков, которые мы развивали в течение своей карьеры, и влияние достаточно велико, чтобы построить вокруг него поколенческую компанию. Когда видео, которое ранее требовало нескольких минут для генерации, теперь может быть создано за секунды при доле стоимости, становятся возможными интерактивная генерация, персонализированная реклама, аватары в реальном времени и совершенно новые креативные продукты.

MachGen утверждает, что многие техники, трансформировавшие инференцию больших языковых моделей, не переносятся на диффузионные модели без потерь. Что фундаментально отличается в обслуживании моделей изображений и видео, и где находятся крупнейшие узкие места производительности, которые традиционная AI‑инфраструктура обычно упускает?

LLM и диффузионные модели имеют принципиально разные вычислительные паттерны. LLM являются автрегрессивными, с вычислительно тяжёлой предзаполнением (prefill), за которым следует декодирование токен за токеном, ограниченное памятью. Техники, такие как KV‑кэширование и разъединение предзаполнения/декодирования, были разработаны под эту структуру.

Диффузионные модели не являются автрегрессивными и остаются вычислительно ограниченными на протяжении всего процесса денойзинга. Генерация видео также включает большие объёмы пространственных и временных данных, создавая иные требования к вниманию, памяти, коммуникации и параллелизму.

В результате многие оптимизации, разработанные для LLM, не переносятся без потерь. Обычное KV‑кэширование не решает ту же задачу, стандартный параллелизм может вводить значительные накладные расходы на коммуникацию, а доступные открытые ядра гораздо менее зрелы. Планировщик, модель памяти, стратегия кэширования, ядра и параллелизм должны быть спроектированы непосредственно под диффузию. Поэтому мы построили MachGen, сделав диффузию первоклассным элементом.

MachGen сообщает о приблизительно 4–6‑кратном снижении задержки на некоторых моделях изображений и около 6‑кратных улучшениях на нескольких видеомоделях при работе с оригинальными, не дистиллированными моделями. Какие ключевые технические прорывы лежат в основе этих достижений, и как вы гарантируете, что улучшения производительности не идут в ущерб качеству вывода?

Эти улучшения достигаются за счёт совместной работы нескольких компонентов стека. В большинстве видеомоделей внимание занимает большую часть вычислительного бюджета, поэтому мы сосредотачиваемся на рецептах с более низкой точностью, разреженном внимании и связанных техниках. Мы также разработали методы кэширования, использующие пространственную и временную избыточность, высокооптимизированные ядра для диффузионных архитектур и техники параллелизма, снижающие накладные расходы на коммуникацию.

В совокупности эти улучшения позволяют MachGen генерировать HiDream за одну секунду вместо шести и Flux за 1,5 секунды вместо 6,2. Для видео Wan 2.2 работает за 16,5 секунды против 98, а LTX 2.3 — за 10,7 секунды против 67. Стоимость вывода также в 2–4 раз ниже для моделей изображений и в 2–3 раз ниже для видео.

Эти результаты получены с использованием оригинальных, не дистиллированных моделей. Мы улучшаем их работу без ущерба качеству вывода. Для внедрения в продакшн скорость, стоимость и качество должны работать совместно.

Trusted TV — интересный пример, потому что сокращение времени генерации с минут до секунд меняет не только инфраструктурный счёт. Как только генерация видео становится достаточно быстрой, чтобы создавать тысячи кампаний и персонализированные креативные варианты, появляются новые бизнес‑модели и продуктовые опыты, которые ранее просто не были жизнеспособны.

TrustedTV помогает бизнесу создавать готовые к трансляции рекламные ролики с помощью ИИ и размещать их на платформах подключённого ТВ, таких как Prime Video, Roku и DirecTV. Большинство их клиентов — малый бизнес. Традиционный способ создания рекламного ролика требовал съёмочной и монтажной бригады, с затратами от нескольких тысяч до десятков тысяч долларов. Trusted TV сводит эти расходы к нулю. Владелец малого бизнеса может создать полноценный ролик со смартфона за примерно пять минут и увидеть его до того, как заплатит что‑либо. На платформе создано более 10 000 кампаний.

Иан, генеральный директор Trusted TV, увидел бенчмарк задержки MachGen на Artificial Analysis и не поверил в него. Он зарегистрировался, чтобы протестировать систему сам. Первый рендер вернулся примерно за 25 секунд без потери качества, и при проведении тестов на параллельность улучшения сохранялись при масштабировании. Они перенесли весь производственный процесс на MachGen менее чем за 48 часов, и теперь MachGen обеспечивает всю их новую видеопродукцию. В последнем развертывании мы приближаемся к 10–11 секундам на этой модели и будем продолжать её улучшать.

Эффект продукта заключается в том, что рекламодатели перестают создавать одну‑две общие рекламные ролики. Их пользователи получают две‑три новые рекламы каждую неделю, тестируют креативы в разных сегментах аудитории и итеративно улучшают их, а не фиксируют один вариант. Далее наступает персонализация по географии и аудитории в масштабе, ранее доступная только компаниям с многомиллионными бюджетами.

Версия, о которой я думаю лично: сегодня я получаю рекламу кроссовок, снятую на улице в Манхэттене. Я живу в районе залива, поэтому она для меня ничего не значит. Мне нужна та же реклама, но с фоном в виде Mission Peak. Это не более дешёвая реклама; это иной тип рекламирования, который становится экономически оправданным только тогда, когда генерация достаточно быстра и дешева, чтобы создавать тысячи вариантов.

Для компаний, встраивающих генерацию изображений или видео непосредственно в продукты, как им следует оценивать экономику вывода? При каком масштабе оптимизация использования GPU становится стратегически важной, а не просто оплатой провайдера API за каждую генерацию?

Точка перелома наступает, когда вывод начинает влиять либо на опыт клиента, либо на маржу компании.

Общий API может иметь смысл, пока команда проверяет продукт. Как только генерация становится центральной частью продукта, команды должны смотреть дальше простого указания цены за вывод. Задержка, параллельность, качество, надёжность и использование GPU становятся частью экономики.

Генерация может казаться недорогой, но всё равно создаёт бизнес‑проблему, если пользователи вынуждены ждать несколько минут и бросают процесс. Архитектура, требующая роста GPU‑емкости пропорционально росту использования, также будет усиливать давление на маржу.

Нет единого порога объёма запросов, потому что вычисления, необходимые для короткого 540p‑клипа, сильно отличаются от более длительного 1080p‑видео. Оптимизация становится стратегической, когда рост использования приводит к почти одинаковому росту расходов, пиковый спрос создаёт очереди или задержка начинает ограничивать пользовательский опыт продукта.

MachGen работает на нескольких уровнях, включая пользовательские GPU‑ядра, кэширование, оптимизацию точности, планирование и параллелизм. По мере того как модели продолжают быстро развиваться, какой уровень стека вывода, по вашему мнению, предлагает наибольшие оставшиеся возможности для драматических улучшений скорости и стоимости?

Для генерации видео внимание представляет одну из крупнейших оставшихся возможностей, поскольку оно доминирует в вычислительном бюджете многих моделей. Всё ещё есть значительный потенциал для улучшения рецептов с более низкой точностью, разреженного внимания и специализированных ядер внимания для диффузии.

Внимание — лишь часть возможностей. Наибольшие общие выгоды будут получены за счёт комбинирования улучшений по всему стеку. Кэширование — один из примеров. Техники KV‑кэширования, используемые в LLM, не переносятся напрямую, но диффузионные модели содержат пространственную и временную избыточность, которую можно использовать при правильном подходе.

Параллелизм представляет еще одну возможность. Добавление GPU не приводит автоматически к пропорциональному ускорению, потому что накладные расходы на коммуникацию могут компенсировать выгоду. Мы разрабатываем специализированные ядра, которые совмещают коммуникацию с независимыми от данных вычислениями и конвейеризуют их с зависимыми от данных задачами.

Внимание, кэширование, ядра, параллелизм, память и планирование влияют друг на друга. Оптимизация только одного уровня в конечном итоге создаёт узкое место где‑то ещё. Наибольшие улучшения будут достигнуты, если рассматривать стек как целостную систему, разработанную под вычислительный профиль диффузии.

С учётом того, что новые видеомодели сокращают время генерации до почти реального времени, насколько мы приближены к действительно интерактивному генеративному видео, и какие технические барьеры всё ещё нужно преодолеть, прежде чем генерация видео в реальном времени станет обычным делом?

Мы уже достигаем интерактивных скоростей для некоторых приложений. MachGen генерирует пятисекундное видео Vidu Q3 Turbo в 720p примерно за шесть секунд и в 540p менее чем за три секунды. Это достаточно быстро для быстрой творческой итерации и делает доступными отзывчивые аватары и интерактивное видео.

Пример того, что я считаю интерактивным. Представьте, что вы смотрите историю и видите, к чему ведёт конец, но вам это не нравится. Вместо того чтобы сидеть пассивно, вы перенаправляете её: эти два персонажа должны выяснить, что скрывает третий, и противостоять ему, а не позволять событиям разворачиваться самостоятельно. Контент, которым вы управляете, а не получаете. Именно это делает возможным быстрая и недорогая генерация, и это меняет почти всё, что мы потребляем.

Для достижения этой цели обычно требуется более одного надёжного теста задержки. Весь опыт должен оставаться отзывчивым при производственной нагрузке, сохраняя визуальное качество, согласованность кадров и предсказуемую стоимость. Более длинные видео, более высокие разрешения и одновременные запросы увеличивают нагрузку на инфраструктуру, и система всё равно должна обеспечивать ёмкость, маршрутизировать запросы и восстанавливаться после аппаратных сбоев, не давая пользователю заметить проблемы.

Это появится постепенно, кейс за кейсом. Короткие клипы, аватары, игры и творческие инструменты, скорее всего, будут первыми, поскольку генерация в масштабе секунд уже достаточна для них. По мере одновременного улучшения качества моделей и производительности вывода всё больше приложений перейдут этот порог.

По мере того как AI‑агенты всё чаще генерируют изображения и видео автономно, а не ждут, пока человек нажмёт кнопку, как это меняет требования к инфраструктуре? Создают ли нагрузки, управляемые агентами, принципиально иные требования к задержке, параллелизму, стоимости и надёжности?

Агент превращает один пользовательский запрос в десятки или сотни задач генерации. Он создаёт несколько вариантов, оценивает их, корректирует запрос и повторяет процесс без вмешательства человека между шагами.

Это делает задержку, параллелизм, стоимость и надёжность гораздо более важными. Если каждая генерация занимает минуты, рабочий процесс агента будет слишком медленным, чтобы быть полезным. Если каждая попытка дорогая, автономная итерация становится экономически нецелесообразной. Система также должна надёжно обрабатывать множество одновременных запросов, поскольку один сбой может прервать всю цепочку работы.

Здесь такие возможности, как предоставление GPU, авто‑масштабирование и маршрутизация, имеют такое же значение, как и оптимизация на уровне модели. Спрос со стороны агентов гораздо более всплесковый, чем спрос от творческого приложения, где человек просто нажимает кнопку.

Соответствующая единица работы уже не отдельное изображение или видео. Это полный цикл генерации, оценки и доработки контента. Инфраструктура должна сделать весь этот цикл быстрым, доступным и надёжным.

Существует острая конкуренция между поставщиками GPU, облачными сервисами вывода, разработчиками моделей и платформами оптимизации. По мере того как само оборудование становится быстрее, зачем компаниям всё ещё нужен специализированный слой вывода, такой как MachGen, вместо того чтобы полагаться на улучшения от NVIDIA, AMD, облачных провайдеров или самих разработчиков моделей?

Более быстрое оборудование повышает потолок. Программное обеспечение определяет, насколько этого потолка будет достигнуто.

Мы видели, как это проявилось в LLM. Новые ускорители улучшали сырую производительность с каждым поколением, а непрерывный батчинг, управление KV‑кешем, спекулятивное декодирование и специализированные ядра всё равно оставались теми факторами, которые привели отрасль к производственной пропускной способности и экономике. Ничего из этого не пришло от аппаратного обеспечения.

Постоянная оптимизация полного производственного пути для генерации изображений и видео — это другая задача, чем то, чем занимаются поставщики аппаратного обеспечения, облачные провайдеры и разработчики моделей, и она не является основной приоритетной для никого из них.

Существует несколько подходов к этой задаче. Один из них — модель маркетплейса, где модели агрегируются и маршрутизируют запросы. Мы считаем, что это неустойчиво в долгосрочной перспективе, потому что нет контроля над уровнем, где находится производительность. Мы решили построить стек самостоятельно и размещать его нативно, что единственный способ достичь тех показателей задержки и стоимости, которые мы наблюдаем.

Это означает настройку внимания, кэширования, ядер, точности, памяти и параллелизма для каждой модели и каждого ускорителя, а также поддержку управляемых API, выделенного облака и самостоятельного развертывания. По мере увеличения количества моделей и вариантов аппаратного обеспечения растёт и сложность. Наша задача — поглощать эту сложность, чтобы наши клиенты могли тратить своё время на то, что отличает их продукты.

Вы описали мировые модели как часть долгосрочного видения MachGen, при этом многие их вычислительные характеристики напоминают нагрузки диффузионных моделей. Как должна выглядеть инфраструктура для мировых моделей промышленного масштаба и какие приложения станут возможными, если генерация и симуляция визуальных окружений со временем станет такой же дешёвой и отзывчивой, как сегодня генерация текста?

Один из способов представить нашу платформу — сравнить её с универсальной LLM. Та же модель составляет юридический договор и отвечает на вопрос о ресторанах. Для нас тот же стек обслуживает компании, создающие видеo‑аватары, AI‑рекламу, генерацию историй и микродрам, а в дальнейшем — мировые модели. Разные отрасли, один набор базовых проблем производительности.

Мировые модели сейчас не являются нашим основным бизнесом, но к ним мы стремимся и активно работаем. Мировые модели промышленного масштаба потребуют чрезвычайно высокой пропускной способности и крайне низкой задержки, поскольку они постоянно генерируют и обновляют окружение, а не создают единичный вывод. Им также необходима пространственная и временная согласованность, способность реагировать на действия и часто возможность одновременно симулировать несколько возможных исходов. Это создаёт серьёзные проблемы с памятью, перемещением данных, параллелизмом и надёжностью. Модель, управляющая роботом или игрой, не может тратить минуты на вычисление следующего состояния. Производительность определяет, пригодны ли такие системы к использованию.

С вычислительной точки зрения современные мировые модели сильно похожи на диффузионные модели, поэтому создаваемый нами стек естественно служит их фундаментом. Пока нет зрелого производственного уровня слоя обслуживания для них, сравнимого с тем, что существует для LLM. Мы планируем его построить.

Если симуляция станет такой же отзывчивой и доступной, как сейчас генерация текста, роботы смогут отрабатывать редкие ситуации до их реального появления, игры смогут генерировать окружения, реагирующие на каждого игрока, а дизайнеры смогут протестировать десятки вариантов до их воплощения в реальном мире. Диффузия — это то, на чём мы сегодня зарабатываем. Мировые модели являются нашей путеводной звездой.

Спасибо за отличное интервью, читатели, желающие узнать больше, должны посетить MachGen AI.

Антуан - видный лидер и сооснователь Unite.AI, движимый непоколебимой страстью к формированию и продвижению будущего ИИ и робототехники. Как серийный предприниматель, он считает, что ИИ будет столь же разрушительным для общества, как и электричество, и часто увлекается потенциалом разрушительных технологий и ИИ.

Как футуролог, он посвящен исследованию того, как эти инновации будут формировать наш мир. Кроме того, он является основателем Securities.io, платформы, ориентированной на инвестиции в передовые технологии, которые переопределяют будущее и меняют целые сектора.