인터뷰
Kismat Singh, MachGen AI 공동 창업자 겸 CEO – 인터뷰 시리즈

Kismat Singh, MachGen AI 공동 창업자 겸 CEO는 고성능 컴퓨팅 및 머신러닝 시스템 구축에 20년 이상 경험을 가진 AI 인프라 및 엔지니어링 임원이다. MachGen AI를 공동 설립하기 전에 Singh는 인텔에서 AI 프레임워크 부문 부사장(Engineering VP)으로 근무했으며, 이전에 NVIDIA, AMD, HP 및 기타 기술 기업에서 선임 엔지니어 역할을 맡았다. 그의 작업에는 딥러닝 라이브러리와 컴파일러에 대한 기여, AI 프레임워크 최적화, 그리고 초대규모 학습 복원력 향상이 포함된다. 인텔에서는 회사의 PyTorch 이니셔티브에 깊이 관여했으며, 다양한 하드웨어 플랫폼에서 AI 프레임워크를 보다 접근하기 쉽게 만드는 것에 대해 공개적으로 발언했다.
MachGen AI는 생성 이미지 및 비디오 모델을 훨씬 더 빠르고 경제적으로 실행할 수 있도록 하는 데 초점을 맞춘 AI 인프라 회사이다. Kismat Singh와 Manoj Krishnan이 설립한 이 회사는 대규모 언어 모델용으로 구축된 인프라를 적용하는 대신, 확산 모델에 특화된 고성능 추론 및 미세조정 스택을 개발하고 있다. MachGen은 어텐션 연산, 캐싱, GPU 커널, 메모리 관리, 병렬 처리, 스케줄링 및 배포 등 영역을 최적화하여 모델 품질을 유지하면서 생성 지연 시간을 줄인다. 이 플랫폼은 텍스트‑투‑이미지, 이미지‑투‑이미지, 텍스트‑투‑비디오, 이미지‑투‑비디오, 레퍼런스‑투‑비디오 생성을 위한 API를 제공하며, 기본 기술은 인터랙티브 콘텐츠 제작, 실시간 아바타, 게임, 맞춤형 광고와 같은 저지연 애플리케이션을 가능하게 한다.
당신은 NVIDIA에서 TensorRT, 인텔에서 AI 소프트웨어, AMD에서 GPU 최적화, 그리고 실시간 비디오 인코딩 작업 등 비디오, GPU 연산 및 AI 성능 분야에서 20년 이상을 일해 왔습니다. 그 기간 동안 무엇을 보고 결국 대기업을 떠나 MachGen을 공동 설립하게 되었으며, 왜 확산 추론이 회사를 설립할 가치가 있는 인프라 문제라고 믿게 되었나요?
내 공동 창업자 Manoj와 나는 거의 10년 동안 같은 체육관에서 배드민턴을 쳤다. 그 기간 대부분에 우리는 서로를 채용하려고 애썼다. 결국 서로를 계속 채용하려 하기보다 함께 일하는 것이 더 쉽다고 판단했다.
우리가 이 문제를 선택한 이유는 두 사람 모두 내부에서 추론 스택이 성숙해가는 과정을 지켜봤기 때문이다. 나는 NVIDIA의 추론 플랫폼 팀을 구축하는 데 도움을 주었고 이후 인텔에서 AI 소프트웨어를 이끌었다. Manoj는 Meta에서 PyTorch 뒤의 대규모 모델 학습 인프라를 구축했다. 우리는 캐싱, 배치 처리, 스케줄링 및 커널에 대한 수년간의 작업이 초기 LLM 연구 시스템을 트릴리언(조) 토큰을 처리하는 프로덕션 인프라로 전환하는 모습을 목격했다.
확산은 대략 3년 전 LLM 추론이 있던 단계와 비슷하다. 이미지와 비디오 모델은 빠르게 발전했지만, 이를 서비스하는 시스템은 여전히 느리고 비용이 많이 들며 확장하기 어렵다. 대부분의 기존 인프라는 LLM을 위해 설계되었으며, 확산은 나중에 추가된 것이다.
시기를 맞춘 세 가지 요인: 모델이 실제 제품을 만들기에 충분히 우수해졌고, 문제 해결에 우리 경력 전반에 걸쳐 개발해 온 정확한 기술이 필요했으며, 그 영향력이 세대적 회사를 설립할 만큼 크다. 한때 몇 분이 걸리던 비디오가 이제는 몇 초 안에 비용의 일부만으로 생성될 수 있게 되면, 인터랙티브 생성, 맞춤형 광고, 실시간 아바타 및 완전히 새로운 창작 제품이 가능해진다.
MachGen은 대규모 언어 모델 추론을 혁신한 많은 기술이 확산 모델에는 깨끗하게 적용되지 않는다고 주장한다. 이미지 및 비디오 모델을 서비스할 때 근본적으로 다른 점은 무엇이며, 기존 AI 인프라가 놓치기 쉬운 가장 큰 성능 병목 현상은 어디에 있는가?
LLM과 확산 모델은 근본적으로 다른 계산 패턴을 가진다. LLM은 자동회귀 방식으로, 연산 집약적인 프리필(pre-fill) 단계 뒤에 메모리 제한적인 토큰 단위 디코드 단계가 이어진다. KV 캐싱 및 프리필/디코드 분리와 같은 기술은 이러한 구조를 전제로 설계되었다.
확산 모델은 비자동회귀 방식이며, 디노이징 과정 전반에 걸쳐 연산에 의존한다. 비디오 생성은 또한 방대한 공간 및 시간 데이터를 포함해 어텐션, 메모리, 통신 및 병렬 처리에 대한 서로 다른 요구를 만든다.
그 결과, LLM을 위해 개발된 많은 최적화 기법이 깨끗하게 적용되지 않는다. 기존 KV 캐싱은 동일한 문제를 해결하지 못하고, 표준 병렬 처리 방식은 상당한 통신 오버헤드를 초래하며, 사용 가능한 오픈소스 커널은 아직 성숙도가 낮다. 스케줄러, 메모리 모델, 캐싱 전략, 커널 및 병렬 처리 모두 확산 자체를 중심으로 설계되어야 한다. 그래서 우리는 확산을 일등 시민으로 간주하여 MachGen을 구축했다.
MachGen은 일부 이미지 모델에서 대략 4–6배 낮은 지연 시간, 여러 비디오 모델에서는 약 6배 향상을 원본(비증류) 모델을 그대로 실행하면서 보고한다. 이러한 성능 향상의 핵심 기술적 돌파구는 무엇이며, 출력 품질을 희생하지 않으면서 성능을 개선하려면 어떻게 보장하나요?
이러한 향상은 스택의 여러 부분이 함께 작동하면서 얻어집니다. 많은 비디오 모델에서 어텐션이 연산 예산을 지배하므로 우리는 낮은 정밀도의 레시피, 희소 어텐션 및 관련 기술에 집중합니다. 또한 우리는 공간 및 시간적 중복성을 활용하는 캐싱 방법, 확산 아키텍처를 위한 고도로 최적화된 커널, 그리고 통신 오버헤드를 줄이는 병렬 처리 기술을 개발했습니다.
이러한 개선을 통해 MachGen은 HiDream을 1초에 제공할 수 있게 되었으며, 기존 6초 대비 크게 단축되었습니다. Flux는 1.5초에 제공되며, 기존 6.2초와 비교됩니다. 비디오의 경우 Wan 2.2는 16.5초에 실행되며, 기존 98초와 비교됩니다. LTX 2.3은 10.7초에 실행되어 기존 67초보다 빠릅니다. 이미지 모델의 추론 비용은 2~4배 낮아지고, 비디오 모델은 2~3배 낮아집니다.
이 결과는 원본 비증류 모델을 사용한 것입니다. 우리는 출력 품질을 희생하지 않으면서 모델 실행 방식을 개선하고 있습니다. 실제 적용을 위해서는 속도, 비용, 품질이 모두 함께 작동해야 합니다.
Trusted TV는 흥미로운 사례입니다. 생성 시간이 분에서 초로 단축되면 인프라 비용 이상의 변화가 일어나기 때문입니다. 비디오 생성 속도가 충분히 빨라져 수천 개의 캠페인과 개인화된 크리에이티브 변형을 만들 수 있게 되면, 이전에는 실현 불가능했던 새로운 비즈니스 모델이나 제품 경험이 가능해집니다.
TrustedTV는 AI를 활용해 기업이 방송 수준의 광고를 만들고 Prime Video, Roku, DirecTV와 같은 연결 TV 플랫폼에 배포하도록 돕습니다. 고객의 대부분은 소규모 기업입니다. 전통적인 방식으로 TV 광고를 제작하려면 촬영 및 편집 팀이 필요하며, 비용은 수천 달러에서 수만 달러에 이릅니다. Trusted TV는 이를 제로로 낮춥니다. 소규모 사업자는 스마트폰만으로 약 5분 만에 완전한 광고를 제작하고 비용을 지불하기 전에 미리 확인할 수 있습니다. 현재까지 플랫폼에서 10,000개 이상의 캠페인이 생성되었습니다.
Ian, Trusted TV의 CEO는 Artificial Analysis에서 MachGen의 지연 시간 벤치마크를 보고 믿지 못했습니다. 그는 직접 테스트해 보기 위해 가입했습니다. 첫 번째 렌더링은 약 25초 만에 반환되었으며 품질 저하가 없었고, 동시성 테스트에서도 개선 효과가 규모에 따라 유지되었습니다. 그들은 전체 제작 워크플로를 48시간 이내에 MachGen으로 전환했으며, 현재 MachGen은 모든 새로운 비디오 제작을 지원하고 있습니다. 최신 배포에서는 해당 모델에서 10~11초 수준에 가까워졌으며, 앞으로도 지속적으로 개선할 예정입니다.
이러한 제품 효과는 광고주가 하나 또는 두 개의 일반 광고만 만드는 것이 아니라, 사용자에게 매주 두세 개의 새로운 광고를 순환시키고, 다양한 청중 세그먼트에 걸쳐 크리에이티브를 테스트하며, 반복적으로 개선할 수 있게 만든다는 점입니다. 다음 단계는 지리적 및 청중 수준의 개인화를 대규모로 구현하는 것으로, 이는 이전에 수백만 달러 규모의 예산을 가진 기업만이 가능했던 일입니다.
제가 개인적으로 생각하는 한 가지 예시: 오늘 나는 맨해튼 거리에서 촬영된 스니커즈 광고를 보았습니다. 저는 베이 지역에 살고 있기 때문에 전혀 의미가 없습니다. 제가 원하는 것은 배경에 미션 피크가 있는 동일한 광고입니다. 이는 더 저렴한 광고가 아니라 전혀 다른 형태의 광고이며, 생성 속도가 충분히 빠르고 저렴해져 수천 개의 변형을 만들 수 있을 때만 경제적으로 실현 가능해집니다.
제품에 이미지 또는 비디오 생성을 직접 삽입하는 기업은 추론 비용 경제성을 어떻게 고려해야 할까요? 어느 규모에서 GPU 활용 최적화가 단순히 API 제공자에게 생성당 비용을 지불하는 것보다 전략적으로 중요해질까요?
추론이 고객 경험이나 기업 마진에 영향을 미치기 시작할 때가 전환점이 됩니다.
팀이 제품을 검증하는 단계에서는 범용 API가 의미가 있을 수 있습니다. 그러나 생성이 해당 제품의 핵심이 되면, 팀은 출력당 가격 외에도 지연 시간, 동시성, 품질, 신뢰성 및 GPU 활용도 등을 경제성의 일부로 고려해야 합니다.
생성 비용이 저렴해 보일 수 있지만, 사용자가 몇 분씩 기다려야 하고 작업 흐름을 포기한다면 비즈니스 문제를 야기합니다. 사용량 증가에 따라 GPU 용량을 동일 비율로 확장해야 하는 아키텍처는 마진에 지속적인 압박을 가합니다.
단일 요청량 임계값은 없습니다. 짧은 540p 클립에 필요한 연산량은 긴 1080p 비디오와 크게 다르기 때문입니다. 사용량 증가가 비용 상승과 거의 동일한 비율로 진행되거나, 피크 수요가 대기열을 만들거나, 지연 시간이 제품 경험을 제한하기 시작하면 최적화가 전략적으로 중요해집니다.
MachGen은 맞춤형 GPU 커널, 캐싱, 정밀도 최적화, 스케줄링 및 병렬 처리 등 여러 계층에 걸쳐 작동합니다. 모델이 빠르게 진화함에 따라, 추론 스택의 어느 계층이 속도와 비용 측면에서 가장 큰 남은 개선 기회를 제공한다고 보십니까?
비디오 생성의 경우, 어텐션은 많은 모델에서 연산 예산을 지배하기 때문에 가장 큰 남은 기회 중 하나입니다. 낮은 정밀도 레시피, 희소 어텐션 및 확산 전용 어텐션 커널을 개선할 여지가 아직 많이 남아 있습니다.
어텐션은 기회의 한 부분에 불과합니다. 전체적인 가장 큰 향상은 스택 전반에 걸친 개선을 결합함으로써 얻을 수 있습니다. 캐싱이 한 예시입니다. LLM에서 사용되는 KV 캐싱 기술은 직접 적용되지 않지만, 확산 모델은 공간 및 시간적 중복성을 가지고 있어 적절한 접근법으로 활용할 수 있습니다.
병렬성은 또 다른 기회를 제공합니다. GPU를 추가한다고 해서 통신 오버헤드가 이점을 상쇄할 수 있기 때문에 비례적인 속도 향상이 자동으로 발생하는 것은 아닙니다. 우리는 통신을 데이터 독립적인 연산과 겹치게 하고 이를 데이터 의존 작업과 파이프라인화하는 맞춤형 커널을 개발합니다.
어텐션, 캐싱, 커널, 병렬성, 메모리, 그리고 스케줄링은 모두 서로에게 영향을 미칩니다. 하나의 계층만 최적화하면 결국 다른 곳에 병목 현상이 발생합니다. 가장 큰 개선은 확산 모델의 계산 프로파일에 맞춘 전체 스택을 하나의 시스템으로 다룰 때 이루어질 것입니다.
새로운 비디오 모델이 생성 시간을 실시간에 가깝게 만들면서, 실제로 인터랙티브한 생성 비디오에 얼마나 근접했는지, 그리고 실시간 비디오 생성이 일반화되기 전에 아직 극복해야 할 기술적 장벽은 무엇인지 궁금합니다.
우리는 이미 특정 애플리케이션에서 인터랙티브한 속도에 도달하고 있습니다. MachGen은 5초 길이의 Vidu Q3 Turbo 비디오를 720p에서는 약 6초, 540p에서는 3초 이하로 생성합니다. 이는 빠른 창작 반복에 충분히 빠르며 반응형 아바타와 인터랙티브 비디오를 현실화합니다.
제가 생각하는 인터랙티브의 예시입니다. 이야기를 보고 있는데 결말이 어디로 갈지 알게 되었지만 마음에 들지 않는다고 상상해 보세요. 수동적으로 앉아 있는 대신, 이야기를 전환합니다: 두 캐릭터가 세 번째 캐릭터가 숨기고 있는 것을 찾아내고, 그것을 그냥 진행시키는 대신 맞서게 합니다. 받는 콘텐츠가 아니라 스스로 조종하는 콘텐츠입니다. 이것이 빠르고 저렴한 생성이 가능하게 하는 것이며, 우리가 소비하는 거의 모든 것을 바꿔놓습니다.
그 목표에 도달하려면 일반적으로 하나 이상의 강력한 지연 시간 벤치마크가 필요합니다. 전체 경험은 생산 트래픽 하에서도 시각적 품질, 프레임 간 일관성, 예측 가능한 비용을 유지하면서 반응성을 유지해야 합니다. 더 긴 비디오, 높은 해상도, 동시 요청은 모두 인프라 부담을 증가시키며, 시스템은 여전히 용량을 할당하고 요청을 라우팅하며 하드웨어 장애에서 사용자가 눈치채지 못하도록 복구해야 합니다.
이는 사용 사례별로 차례로 도입될 것입니다. 짧은 클립, 아바타, 게임, 창작 도구가 먼저 적용될 가능성이 높으며, 초 단위의 생성 속도만으로도 충분하기 때문입니다. 모델 품질과 추론 성능이 동시에 향상되면서 더 많은 애플리케이션이 그 문턱을 넘어설 것입니다.
AI 에이전트가 인간이 버튼을 누르기를 기다리는 대신 점점 더 자율적으로 이미지와 비디오를 생성함에 따라 인프라 요구사항은 어떻게 변할까요? 에이전트 기반 워크로드가 지연 시간, 동시성, 비용, 신뢰성 측면에서 근본적으로 다른 요구를 만들까요?
에이전트는 단일 사용자 요청을 수십에서 수백 개의 생성 작업으로 전환합니다. 여러 옵션을 만들고 이를 평가한 뒤 프롬프트를 수정하고 과정을 반복하며, 단계 사이에 인간의 입력이 없습니다.
이로 인해 지연 시간, 동시성, 비용, 신뢰성이 훨씬 더 중요해집니다. 각 생성에 몇 분이 걸린다면 에이전트의 워크플로는 실용적이지 않습니다. 각 시도가 비용이 많이 든다면 자율적인 반복은 경제적으로 비현실적입니다. 또한 시스템은 다수의 동시 요청을 신뢰성 있게 처리해야 하는데, 하나의 실패가 전체 작업 체인을 중단시킬 수 있기 때문입니다.
여기서 GPU 프로비저닝, 자동 스케일링, 라우팅과 같은 기능이 모델 수준 최적화만큼 중요해집니다. 에이전트의 수요는 사용자가 버튼을 클릭하는 창작 애플리케이션의 수요보다 훨씬 더 급증하는 특성을 가집니다.
관련 작업 단위는 더 이상 단일 이미지나 비디오가 아닙니다. 생성, 평가, 그리고 콘텐츠를 다듬는 전체 루프가 됩니다. 인프라는 그 전체 루프를 빠르고 저렴하며 신뢰할 수 있게 만들어야 합니다.
GPU 공급업체, 추론 클라우드, 모델 개발자, 최적화 플랫폼 간에 치열한 경쟁이 있습니다. 하드웨어 자체가 빨라짐에 따라, 기업들은 NVIDIA, AMD, 클라우드 제공업체 또는 모델 개발자 자체의 개선에 의존하기보다 왜 MachGen과 같은 특화된 추론 레이어가 여전히 필요한 걸까요?
더 빠른 하드웨어는 한계를 높입니다. 소프트웨어가 그 한계에 얼마나 도달할지를 결정합니다.
우리는 이것이 대형 언어 모델(LLM)에서 어떻게 나타나는지 보았습니다. 새로운 가속기가 매 세대마다 순수 성능을 향상시켰지만, 지속적인 배칭, KV‑캐시 관리, 사전 디코딩, 특수 커널이 여전히 산업을 생산 수준의 처리량과 경제성에 도달하게 만든 요소였습니다. 그 중 어느 것도 하드웨어에서 온 것이 아닙니다.
이미지와 비디오 생성 전체 생산 경로를 지속적으로 최적화하는 일은 하드웨어 공급업체, 클라우드 제공업체, 모델 개발자가 하는 일과 다르며, 이들 중 어느 누구에게도 핵심 우선순위가 아닙니다.
그 작업에는 몇 가지 접근 방식이 있습니다. 하나는 모델을 집계하고 요청을 라우팅하는 마켓플레이스 모델입니다. 우리는 성능이 존재하는 레이어에 대한 제어가 없기 때문에 장기적으로는 방어할 수 없다고 생각합니다. 우리는 스택을 직접 구축하고 네이티브하게 호스팅하기로 선택했으며, 이것이 우리가 보는 지연 시간과 비용 수치를 달성할 수 있는 유일한 방법입니다.
이는 모델 및 가속기별로 어텐션, 캐싱, 커널, 정밀도, 메모리 및 병렬성을 조정하고, 관리형 API, 전용 클라우드 및 자체 호스팅 배포를 지원한다는 의미입니다. 모델과 하드웨어 옵션의 수가 증가함에 따라 복잡성도 증가합니다. 우리의 역할은 이를 흡수하여 고객이 제품 차별화에 집중할 수 있도록 하는 것입니다.
당신은 세계 모델을 MachGen의 장기 비전의 일부로 설명했으며, 그들의 많은 계산 특성이 확산 작업과 유사합니다. 생산 규모의 세계 모델을 위한 인프라가 어떤 모습이어야 하며, 시각적 환경을 생성하고 시뮬레이션하는 것이 텍스트 생성만큼 저렴하고 반응성이 높아질 경우 어떤 응용 프로그램이 가능해질까요?
우리 플랫폼을 생각하는 한 가지 방법은 범용 LLM과 유사하다는 것입니다. 동일한 모델이 법률 계약서를 초안하고 레스토랑에 관한 질문에 답합니다. 우리에게는 동일한 스택이 비디오 아바타 기업, AI 광고, 스토리 및 마이크로드라마 생성, 그리고 궁극적으로 세계 모델에 서비스를 제공합니다. 서로 다른 분야이지만 근본적인 성능 문제는 동일합니다.
세계 모델은 현재 우리의 핵심 사업은 아니지만, 우리가 지향하고 적극적으로 작업 중인 분야입니다. 생산 규모의 세계 모델은 환경을 지속적으로 생성하고 업데이트하기 때문에 단일 출력을 생성하는 것이 아니라 매우 높은 처리량과 매우 낮은 지연 시간이 필요합니다. 또한 공간적·시간적 일관성, 행동에 대한 반응 능력, 그리고 종종 여러 가능한 결과를 동시에 시뮬레이션하는 능력이 요구됩니다. 이는 메모리, 데이터 이동, 병렬성 및 신뢰성 측면에서 어려운 문제를 야기합니다. 로봇이나 게임을 구동하는 세계 모델이 다음 상태를 생성하는 데 몇 분이 걸려서는 안 됩니다. 성능이 이러한 시스템의 사용 가능성을 결정합니다.
계산적으로 오늘날의 세계 모델은 확산 모델과 매우 유사하므로, 현재 구축 중인 스택이 자연스러운 기반이 됩니다. 아직 LLM에 존재하는 것과 비교할 만한 성숙한 프로덕션 급 서빙 레이어는 없습니다. 우리는 이를 구축할 계획입니다.
시뮬레이션이 현재 텍스트 생성만큼 반응성이 높고 비용 효율적이 된다면, 로봇은 드문 상황을 사전에 연습할 수 있고, 게임은 개별 플레이어에 반응하는 환경을 생성할 수 있으며, 디자이너는 물리적 세계에 구현하기 전에 수십 가지 가능성을 테스트할 수 있습니다. 확산은 오늘날 우리가 가치를 창출하는 분야이며, 세계 모델은 우리의 North Star입니다.
훌륭한 인터뷰에 감사드립니다. 더 알아보고자 하는 독자분들은 MachGen AI를 방문하십시오.












