Інтерв’ю
Кісмат Сінгх, співзасновник і генеральний директор MachGen AI — серія інтерв’ю

Кісмат Сінгх, співзасновник і генеральний директор MachGen AI, є керівником у сфері AI‑інфраструктури та інженерії з більш ніж двадцятирічним досвідом створення високопродуктивних обчислювальних та машинних навчальних систем. До заснування MachGen AI Сінгх працював віце‑президентом інженерії AI‑фреймворків у Intel, а раніше займав старші інженерні посади в NVIDIA, AMD, HP та інших технологічних компаніях. Його робота включала внесок у бібліотеки глибокого навчання та компілятори, оптимізацію AI‑фреймворків та покращення стійкості гіпермасштабного навчання. В Intel він був тісно залучений до ініціатив компанії щодо PyTorch і публічно виступав про те, як зробити AI‑фреймворки більш доступними на різних апаратних платформах.
MachGen AI — це компанія AI‑інфраструктури, орієнтована на значне прискорення та зниження вартості запуску генеративних моделей зображень і відео. Заснована Кісматом Сінгхом і Маноєм Крішнаном, компанія розробляє високопродуктивний стек інференції та донастройки, спеціально призначений для дифузійних моделей, а не адаптуючи інфраструктуру, спочатку створену для великих мовних моделей. MachGen оптимізує такі області, як обчислення уваги, кешування, ядра GPU, управління пам’яттю, паралелізм, планування та розгортання, щоб зменшити затримку генерації при збереженні якості моделі. Її платформа надає API для генерації текст‑у‑зображення, зображення‑у‑зображення, текст‑у‑відео, зображення‑у‑відео та референція‑у‑відео, а базова технологія спрямована на забезпечення низьколатентних застосувань, таких як інтерактивне створення контенту, аватари в реальному часі, ігри та персоналізована реклама.
Ви працювали понад два десятиліття над відео, обчисленнями на GPU та продуктивністю AI, включаючи TensorRT у NVIDIA, AI‑програмне забезпечення в Intel, оптимізацію GPU в AMD та ранню роботу над кодуванням відео в реальному часі. Що ви спостерігали протягом цих років, що врешті‑решт переконало вас залишити великі технологічні компанії та співзаснувати MachGen, і чому ви вважали, що інференція дифузії — це інфраструктурна проблема, навколо якої варто будувати компанію?
Мій співзасновник Маноґ і я грали в бадмінтон у одному залі майже 10 років. Протягом більшої частини цього часу ми намагалися найняти один одного. Зрештою ми вирішили, що легше працювати разом, ніж постійно рекрутувати один одного.
Причина, чому ми обрали цю проблему, полягає в тому, що ми обидва спостерігали, як інференційний стек зростав зсередини. Я допомагав будувати команду інференційної платформи NVIDIA, а потім очолював AI‑програмне забезпечення в Intel. Маноґ створив інфраструктуру навчання великих моделей, що стоїть за PyTorch у Meta. Ми спостерігали, як роки роботи над кешуванням, пакетною обробкою, плануванням та ядрами перетворювали ранні дослідницькі системи LLM у виробничу інфраструктуру, що обслуговує трильйони токенів.
Дифузія приблизно знаходиться там, де інференція LLM була три роки тому. Моделі зображень і відео швидко розвивалися, але системи, що їх обслуговують, залишаються повільними, дорогими та важкими для масштабування. Більшість існуючої інфраструктури була спроектована для LLM, а дифузія була додана пізніше.
Три фактори, які зробили час підходящим: моделі стали достатньо добрими, щоб на їх основі створювати реальні продукти, проблема вимагала саме тих навичок, які ми розвивали протягом кар’єри, і вплив достатньо великий, щоб побудувати поколіннєву компанію. Коли відео, яке раніше займало кілька хвилин, можна згенерувати за секунди за частину вартості, стають можливими інтерактивна генерація, персоналізована реклама, аватари в реальному часі та зовсім нові креативні продукти.
MachGen стверджує, що багато технік, які трансформували інференцію великих мовних моделей, не переносяться чисто на дифузійні моделі. Чим фундаментально відрізняється обслуговування моделей зображень і відео, і де знаходяться найбільші вузькі місця продуктивності, які традиційна AI‑інфраструктура часто пропускає?
LLM та дифузійні моделі мають фундаментально різні обчислювальні патерни. LLM є автокорегувальними, з обчислювально інтенсивним поповненням (prefill), за яким слідує декодування токен за токеном, обмежене пам’яттю. Техніки, такі як KV‑кешування та розділення поповнення/декодування, були розроблені навколо цієї структури.
Дифузійні моделі не є автокорегувальними і залишаються обчислювально обмеженими протягом усього процесу денойзингу. Генерація відео також включає великі об’єми просторових і часових даних, створюючи різні вимоги щодо уваги, пам’яті, комунікації та паралелізму.
У результаті багато оптимізацій, розроблених для LLM, не переносяться чисто. Традиційне KV‑кешування не вирішує ту ж проблему, стандартний паралелізм може створювати значне навантаження на комунікації, а доступні відкриті ядра набагато менш зрілі. Планувальник, модель пам’яті, стратегія кешування, ядра та паралелізм мають бути спроектовані навколо самої дифузії. Ось чому ми створили MachGen, роблячи дифузію першокласним елементом.
MachGen повідомляє приблизно 4–6‑разове зниження затримки на деяких моделях зображень і близько 6‑разове покращення на кількох відео‑моделях, працюючи з оригінальними, не дистильованими моделями. Які найважливіші технічні прориви стоять за цими досягненнями, і як ви гарантуєте, що покращення продуктивності не шкодять якості вихідних результатів?
Покращення походять від кількох частин стеку, які працюють разом. У багатьох відео‑моделях увага домінує у бюджеті обчислень, тому ми зосереджуємось на рецептах нижчої точності, розрідженій увазі та пов’язаних техніках. Ми також розробили методи кешування, що використовують просторову та часову надлишковість, високоперфомансні ядра для дифузійних архітектур та техніки паралелізму, які зменшують накладні витрати на комунікацію.
Разом ці покращення дозволяють MachGen генерувати HiDream за одну секунду замість шести, а Flux — за 1,5 секунди замість 6,2 секунди. Для відео Wan 2.2 працює за 16,5 секунди проти 98 секунд, тоді як LTX 2.3 — за 10,7 секунди проти 67 секунд. Витрати на інференс також у 2–4 рази нижчі для моделей зображень і у 2–3 рази нижчі для відео.
Ці результати отримані з використанням оригінальних, не дистильованих моделей. Ми покращуємо їхню роботу без шкоди для якості вихідних даних. Для впровадження у виробництво швидкість, вартість і якість мають працювати разом.
Trusted TV — цікавий приклад, оскільки скорочення часу генерації з хвилин до секунд змінює більше, ніж просто рахунок за інфраструктуру. Коли генерація відео стає достатньо швидкою, щоб створювати тисячі кампаній і персоналізовані креативні варіанти, які нові бізнес‑моделі чи продуктові досвіди стають можливими, які раніше були нереальними?
TrustedTV допомагає компаніям створювати готові до трансляції рекламні ролики за допомогою ШІ та розміщувати їх на платформах підключеного телебачення, таких як Prime Video, Roku і DirecTV. Багато їхніх клієнтів — малі підприємства. Традиційний спосіб створення телевізійної реклами вимагав знімальної та монтажної команди, причому витрати починалися з тисяч доларів і часто сягали десятків тисяч доларів. Trusted TV зводить це до нуля. Власник малого бізнесу може створити повний ролик зі смартфона за приблизно п’ять хвилин і переглянути його, не сплачуючи нічого. На платформі створено понад 10 000 кампаній.
Іан, CEO Trusted TV, побачив бенчмарк затримки MachGen у Artificial Analysis і не повірив у результати. Він підписався, щоб протестувати це самостійно. Перший рендер повернувся приблизно за 25 секунд без втрати якості, і коли він провів тести на паралельність, покращення залишились стабільними у масштабі. Вони перенесли весь свій виробничий процес на MachGen менш ніж за 48 годин, і тепер MachGen живить усі їхні нові відео‑створення. У останньому розгортанні ми наблизилися до 10‑11 секунд на цій моделі і будемо продовжувати її вдосконалювати.
Ефект продукту полягає в тому, що рекламодавці перестають створювати один‑два загальних рекламних ролика. Їхні користувачі змінюють два‑три нових оголошення щотижня, тестують креативи в різних сегментах аудиторії та ітерують, а не фіксуються. Наступний крок — географічна та аудиторна персоналізація у масштабі, яка раніше була доступна лише компаніям з багатомільйонними бюджетами.
Версія, яку я розмірковую особисто: сьогодні я бачу рекламу кросівок, зняту на вулиці Манхеттену. Я живу в районі залива, тому це для мене нічого не значить. Я хочу ту ж рекламу, але з фоном у вигляді Mission Peak. Це не дешевша реклама; це інший тип реклами, і вона стає економічно виправданою лише тоді, коли генерація достатньо швидка та дешева, щоб створювати тисячі варіантів.
Для компаній, які вбудовують генерацію зображень або відео безпосередньо в продукти, як їм слід розглядати економіку інференсу? При якому масштабі оптимізація використання GPU стає стратегічно важливою, а не просто оплатою постачальнику API за кожну генерацію?
Точка перелому настає, коли інференс починає впливати або на досвід клієнта, або на маржу компанії.
Універсальний API може мати сенс, коли команда валідує продукт. Коли генерація стає центральною частиною продукту, командам потрібно виходити за межі вказаної ціни за результат. Затримка, паралельність, якість, надійність та використання GPU стають частиною економіки.
Генерація може здаватися недорогою, але вона все одно створює бізнес‑проблему, якщо користувачі змушені чекати кілька хвилин і відмовляються від процесу. Архітектура, яка потребує збільшення GPU‑потужності пропорційно до використання, також підвищуватиме тиск на маржу.
Не існує єдиного порогу обсягу запитів, оскільки обчислення, необхідні для короткого кліпу 540p, дуже відрізняються від довшого відео 1080p. Оптимізація стає стратегічною, коли зростання використання призводить до майже пропорційного збільшення витрат, піковий попит створює черги або затримка починає обмежувати досвід користувача.
MachGen працює на кількох рівнях, включаючи кастомні ядра GPU, кешування, оптимізацію точності, планування та паралелізм. Оскільки моделі швидко розвиваються, який рівень стеку інференсу, на вашу думку, пропонує найбільший залишковий потенціал для драматичних покращень у швидкості та вартості?
Для генерації відео увага є однією з найбільших залишкових можливостей, оскільки вона домінує у бюджеті обчислень у багатьох моделях. Все ще є значний простір для покращення рецептів нижчої точності, розрідженої уваги та спеціалізованих ядер уваги для дифузії.
Увага — лише одна частина можливості. Найбільші загальні вигоди будуть досягнуті шляхом комбінування покращень по всьому стеку. Кешування — один із прикладів. Техніки KV‑кешування, що використовуються в LLM, не передаються безпосередньо, проте дифузійні моделі містять просторову та часову надлишковість, яку можна використати правильним підходом.
Паралелізм відкриває ще одну можливість. Додавання GPU не забезпечує автоматично пропорційного прискорення, оскільки накладні витрати на комунікацію можуть нейтралізувати вигоду. Ми розробляємо спеціалізовані ядра, які накладають комунікацію на обчислення, незалежні від даних, і організовують їх у конвеєр разом із обчисленнями, що залежать від даних.
Увага, кешування, ядра, паралелізм, пам’ять і планування впливають один на одного. Оптимізація лише одного рівня зрештою створює вузьке місце в іншому місці. Найбільші покращення будуть досягнуті, коли стек розглядатиметься як цілісна система, розроблена під обчислювальний профіль дифузії.
З новішими відеомоделями, які скорочують час генерації до майже реального часу, наскільки ми вже близькі до справді інтерактивного генеративного відео і які технічні бар’єри ще потрібно подолати, щоб генерація відео в режимі реального часу стала звичною?
Ми вже досягаємо інтерактивних швидкостей для певних застосувань. MachGen генерує п’ятисекундне відео Vidu Q3 Turbo у 720p приблизно за шість секунд і у 540p — менш ніж за три секунди. Це достатньо швидко для швидкої творчої ітерації і робить реактивні аватари та інтерактивне відео доступними.
Приклад того, що я вважаю інтерактивністю. Уявіть, що ви дивитеся історію і бачите, куди прямує кінець, і вам це не подобається. Замість того, щоб пасивно спостерігати, ви змінюєте хід подій: ці два персонажі повинні з’ясувати, що приховує третій, і протистояти йому, а не дозволяти події розвиватися самостійно. Контент, яким ви керуєте, а не контент, який ви отримуєте. Ось що робить можливим швидке, недороге генерування, і це змінює майже все, що ми споживаємо.
Для досягнення цієї мети зазвичай потрібен більше ніж один сильний показник затримки. Увесь досвід має залишатися реактивним під час виробничого навантаження, зберігаючи візуальну якість, послідовність кадр за кадром і передбачувану вартість. Довші відео, вища роздільна здатність і одночасні запити підвищують навантаження на інфраструктуру, і система все одно повинна забезпечувати потужність, маршрутизувати запити та відновлюватися після апаратних збоїв, не помічаючи цього користувачем.
Воно з’явиться поступово, випадок за випадком. Короткі кліпи, аватари, ігри та творчі інструменти, ймовірно, будуть першими, оскільки генерація за секунди вже достатня для них. У міру того, як якість моделей і продуктивність інференсу покращуються одночасно, більше застосувань перейде цей поріг.
Оскільки AI‑агенти все частіше генерують зображення та відео автономно, без очікування, коли людина натисне кнопку, як це змінює вимоги до інфраструктури? Чи створюють навантаження, керовані агентами, принципово інші вимоги щодо затримки, одночасності, вартості та надійності?
Агент перетворює один запит користувача на десятки або сотні завдань генерації. Він створює кілька варіантів, оцінює їх, коригує підказку і повторює процес без людського втручання між кроками.
Тому затримка, одночасність, вартість і надійність стають набагато важливішими. Якщо кожна генерація триває хвилини, робочий процес агента занадто повільний, щоб бути корисним. Якщо кожна спроба дорога, автономна ітерація стає економічно невиправданою. Система також повинна надійно обробляти багато одночасних запитів, оскільки один збій може перервати всю ланку роботи.
Саме тут такі можливості, як забезпечення GPU, автоскейлінг і маршрутизація, мають таке ж значення, як і оптимізація на рівні моделі. Попит агентів набагато більш сплесковий, ніж попит від творчих застосувань, де людина просто натискає кнопку.
Відповідна одиниця роботи вже не є окремим зображенням або відео. Це повний цикл генерації, оцінки та уточнення контенту. Інфраструктура повинна зробити цей цикл швидким, доступним і надійним.
Серед постачальників GPU, хмарних сервісів інференсу, розробників моделей та платформ оптимізації спостерігається інтенсивна конкуренція. Оскільки апаратне забезпечення саме по собі стає швидшим, навіщо компаніям все ж потрібен спеціалізований шар інференсу, такий як MachGen, замість того, щоб покладатися на покращення від NVIDIA, AMD, хмарних провайдерів або самих розробників моделей?
Швидше апаратне забезпечення підвищує верхню межу. Програмне забезпечення визначає, наскільки ця межа буде досягнута.
Ми спостерігали це на прикладі LLM. Нові прискорювачі підвищували чисту продуктивність кожного покоління, а безперервне батчування, управління KV‑кешем, спекулятивна декодування та спеціалізовані ядра залишалися тим, що забезпечувало індустрії продуктивність і економічність на рівні виробництва. Жодне з цього не походило від апаратури.
Безперервна оптимізація повного виробничого шляху для генерації зображень і відео — це інша робота, ніж те, що роблять постачальники апаратури, хмарні провайдери та розробники моделей, і це не є їхньою головною пріоритетною задачею.
Існує кілька підходів до цієї задачі. Один із них — модель маркетплейсу, коли моделі агрегуються і маршрутизуються запити. Ми вважаємо, що це не є довгостроково захисним, оскільки немає контролю над шаром, де розташована продуктивність. Ми вирішили створити стек самостійно і розміщувати його нативно, що є єдиним шляхом досягти затримки та вартості, які ми бачимо.
Це означає налаштування уваги, кешування, ядер, точності, пам’яті та паралелізму для кожної моделі та кожного прискорювача, а також підтримку керованих API, виділеного хмари та розгортання на власних серверах. У міру зростання кількості моделей і апаратних варіантів зростає і складність. Наша роль — поглинути це, щоб наші клієнти могли витрачати час на те, що відрізняє їхні продукти.
Ви описали світові моделі як частину довгострокового бачення MachGen, причому багато їхніх обчислювальних характеристик схожі на навантаження дифузії. Яким має бути інфраструктура для світових моделей у виробничому масштабі і які застосування стануть можливими, якщо генерування та симуляція візуальних середовищ зрештою стануть настільки ж недорогими та швидкими, як сьогодні генерується текст?
Один спосіб розглядати нашу платформу — це порівняти її з універсальним LLM. Та сама модель створює юридичний договір і відповідає на питання про ресторани. Для нас той самий стек обслуговує компанії, що створюють відео‑аватари, AI‑рекламу, генерування історій та мікродрам, а згодом і світові моделі. Різні вертикалі, один набір базових проблем продуктивності.
Сьогодні світові моделі не є нашим основним бізнесом, але саме до них ми прагнемо, і активно працюємо над ними. Світові моделі у виробничому масштабі потребуватимуть дуже високої пропускної здатності та наднизької затримки, оскільки вони постійно генерують і оновлюють середовище, а не створюють один вихідний результат. Вони також потребують просторової та часової узгодженості, здатності реагувати на дії та часто здатності одночасно симулювати кілька можливих результатів. Це створює складні проблеми з пам’яттю, переміщенням даних, паралелізмом та надійністю. Світова модель, що керує роботом або грою, не може витрачати хвилини на створення наступного стану. Продуктивність визначає, чи будуть ці системи взагалі придатними до використання.
З обчислювальної точки зору сьогоднішні світові моделі дуже схожі на моделі дифузії, тому стек, який ми будуємо зараз, є природною основою. Поки що немає зрілої виробничої шарі обслуговування для них, порівнянної з існуючою для LLM. Ми плануємо її створити.
Якщо симуляція стане такою ж швидкою та доступною, як сьогодні генерується текст, роботи зможуть репетирувати рідкісні ситуації перед їхнім виникненням, ігри зможуть створювати середовища, що реагують на окремих гравців, а дизайнери зможуть протестувати десятки варіантів перед їхньою реалізацією у фізичному світі. Дифузія — це те, на чому ми сьогодні заробляємо. Світові моделі — наш Північний Зірка.
Дякуємо за чудове інтерв’ю, читачі, які хочуть дізнатися більше, повинні відвідати MachGen AI.












