访谈
Kismat Singh,MachGen AI 联合创始人兼 CEO – 访谈系列

Kismat Singh,MachGen AI 的联合创始人兼 CEO,是一位拥有超过二十年构建高性能计算和机器学习系统经验的 AI 基础设施与工程高管。在共同创立 MachGen AI 之前,Singh 曾担任 Intel AI 框架部门的工程副总裁,并曾在 NVIDIA、AMD、HP 等科技公司担任高级工程职务。他的工作包括对深度学习库和编译器的贡献、AI 框架的优化以及对超大规模训练弹性的改进。在 Intel 时,他深度参与了公司对 PyTorch 的相关计划,并公开发言,倡导让 AI 框架在不同硬件平台上更易获取。
MachGen AI 是一家专注于让生成式图像和视频模型运行速度显著提升、成本显著降低的 AI 基础设施公司。该公司由 Kismat Singh 和 Manoj Krishnan 创立,致力于开发专为扩散模型设计的高性能推理与微调堆栈,而不是改造最初为大语言模型构建的基础设施。MachGen 对注意力计算、缓存、GPU 内核、内存管理、并行化、调度和部署等环节进行优化,以在保持模型质量的同时降低生成延迟。其平台提供文本到图像、图像到图像、文本到视频、图像到视频以及参考到视频的生成 API,底层技术旨在支持交互式内容创作、实时化身、游戏以及个性化广告等低延迟应用。
您在视频、GPU 计算和 AI 性能领域工作了超过二十年,曾涉及 NVIDIA 的 TensorRT、Intel 的 AI 软件、AMD 的 GPU 优化以及早期的实时视频编码工作。在这些年里,您看到了哪些关键点最终促使您离开大型科技公司并共同创立 MachGen?以及为何您认为扩散推理是值得围绕其构建公司的一项基础设施问题?
我的联合创始人 Manoj 和我在同一家体育馆打羽毛球近 10 年。大部分时间里,我们一直在尝试招聘对方。最终我们决定,与其相互招聘,不如直接合作共事更为简便。
我们选择这个问题的原因是我们都亲眼见证了推理堆栈从内部的成熟过程。我曾帮助建立 NVIDIA 的推理平台团队,随后在 Intel 负责 AI 软件。Manoj 在 Meta 构建了支撑 PyTorch 的大模型训练基础设施。我们看到多年在缓存、批处理、调度和内核方面的工作,使早期的 LLM 研究系统转变为服务数万亿 token 的生产级基础设施。
扩散模型大致处于 LLM 推理三年前的阶段。图像和视频模型发展迅速,但为其提供服务的系统仍然慢、成本高且难以扩展。大多数现有基础设施是为 LLM 设计的,扩散模型是后来才被加入的。
时机恰当的三个因素:模型已足够成熟,可用于构建真实产品;该问题正好需要我们职业生涯中积累的技能;以及其影响力足以支撑一家跨时代的公司。当曾经需要数分钟才能生成的视频如今可以在几秒钟内、以极低成本完成时,交互式生成、个性化广告、实时化身以及全新的创意产品皆有可能实现。
MachGen 认为,许多改变大语言模型推理的技术并不能直接迁移到扩散模型上。服务图像和视频模型在根本上有哪些不同之处?传统 AI 基础设施往往忽视的最大性能瓶颈又在哪里?
LLM 与扩散模型在计算模式上根本不同。LLM 采用自回归方式,先进行计算密集的预填充(prefill),随后进行受内存限制的逐 token 解码。KV 缓存和预填充/解码分离等技术正是围绕这种结构设计的。
扩散模型是非自回归的,在去噪过程的整个阶段均受计算限制。视频生成还涉及大量的空间和时间数据,对注意力、内存、通信和并行性提出了不同的需求。
因此,许多针对 LLM 开发的优化并不能直接迁移。传统的 KV 缓存并未解决相同的问题,标准的并行化可能带来大量通信开销,而现有的开源内核也远未成熟。调度器、内存模型、缓存策略、内核以及并行化都必须围绕扩散模型本身进行设计。这也是我们将扩散模型作为首要对象来构建 MachGen 的原因。
MachGen 报告称,在运行原始未蒸馏模型时,部分图像模型的延迟降低约 4–6 倍,多个视频模型的性能提升约 6 倍。实现这些提升的最关键技术突破是什么?以及您如何确保性能提升不会以输出质量为代价?
这些收益来自于堆栈的多个部分协同工作。注意力在许多视频模型中占据了计算预算的主要部分,因此我们专注于低精度配方、稀疏注意力以及相关技术。我们还开发了利用空间和时间冗余的缓存方法、高度优化的扩散架构内核,以及降低通信开销的并行技术。
这些改进使得 MachGen 能够在 1 秒内完成 HiDream(相较于 6 秒),在 1.5 秒内完成 Flux(相较于 6.2 秒)。在视频方面,Wan 2.2 的运行时间为 16.5 秒(相较于 98 秒),而 LTX 2.3 为 10.7 秒(相较于 67 秒)。图像模型的推理成本降低了 2–4 倍,视频模型降低了 2–3 倍。
这些结果使用的是原始的、未蒸馏的模型。我们正在改进模型的运行方式,同时不牺牲输出质量。要实现生产采纳,速度、成本和质量必须协同工作。
Trusted TV 是一个有趣的案例,因为将生成时间从分钟缩短到秒数会改变的不仅仅是基础设施账单。一旦视频生成足够快,能够产生成千上万的广告活动和个性化创意变体,哪些以前不可行的商业模式或产品体验将变得可能?
TrustedTV 帮助企业使用 AI 创建可在 Prime Video、Roku 和 DirecTV 等联网电视平台上投放的广播级商业广告。其许多客户都是小型企业。传统方式制作电视广告需要拍摄团队和剪辑团队,成本从数千美元起,通常会达到数万美元。Trusted TV 将成本降至零。小企业主可以用智能手机在约五分钟内完成完整广告的制作,并在付费前先预览。平台上已创建超过 10,000 个广告活动。
Trusted TV 的 CEO Ian 在看到 MachGen 在 Artificial Analysis 上的延迟基准后并不相信。他亲自报名进行测试。第一次渲染大约在 25 秒内返回,且质量没有下降;在进行并发测试时,改进在规模上依然保持。他们在不到 48 小时内将整个生产工作流迁移到 MachGen,且 MachGen 现在为他们所有新的视频创作提供动力。在最新的部署中,该模型的运行时间已接近 10 到 11 秒,我们将继续改进。
这种产品效应导致广告主不再只制作一两个通用广告。他们的用户每周会轮换两三条新广告,在不同受众细分上测试创意,并进行迭代,而不是一次性投入。接下来将是地理位置和受众层面的个性化,规模之大以前只有拥有数百万美元预算的公司才能实现。
我个人想到的一个版本:今天,我在曼哈顿的街道上看到一则运动鞋广告。我住在湾区,这对我毫无意义。我想要的是同样的广告,但背景是 Mission Peak。这并不是更便宜的商业广告,而是一种不同的广告形式,只有当生成足够快且足够便宜以产生成千上万的变体时,才在经济上可行。
对于将图像或视频生成直接嵌入产品的公司,他们应如何考虑推理的经济性?在何种规模下,优化 GPU 利用率才会变得具有战略意义,而不仅仅是为每次生成向 API 提供商付费?
拐点出现在推理开始影响客户体验或公司利润率时。
在团队验证产品期间,通用 API 可能是合理的选择。一旦生成成为该产品的核心,团队就需要超越每次输出的标价来考虑经济性。延迟、并发、质量、可靠性以及 GPU 利用率都将成为经济考量的一部分。
生成看似成本低廉,但如果用户需要等待数分钟并因此放弃工作流,仍会带来业务问题。若架构要求 GPU 容量随使用率同步增长,也会对利润率产生日益加大的压力。
没有单一的请求量阈值,因为 540p 短片所需的计算与更长的 1080p 视频截然不同。当使用增长导致成本几乎以相同速度上升、峰值需求产生排队,或延迟开始限制产品体验时,优化就变得具有战略意义。
MachGen 在多个层面工作,包括自定义 GPU 内核、缓存、精度优化、调度和并行。随着模型快速演进,您认为推理堆栈的哪一层仍然提供了在速度和成本上实现显著改进的最大机会?
对于视频生成而言,注意力仍是最大的剩余机会之一,因为它在许多模型中占据了计算预算的主要部分。仍有大量空间可以改进低精度配方、稀疏注意力以及针对扩散模型的专用注意力内核。
注意力只是机会的一部分。最大的整体收益将来自于堆栈各层面的改进组合。缓存就是一个例子。LLM 中使用的 KV 缓存技术并不能直接迁移,但扩散模型包含的空间和时间冗余可以通过合适的方法加以利用。
并行性提供了另一个机会。增加 GPU 并不会自动带来成比例的加速,因为通信开销可能抵消收益。我们开发了定制的内核,使通信与数据无关的计算重叠,并将其与数据相关的工作流水化。
注意力、缓存、内核、并行性、内存和调度相互影响。仅优化单一层最终会在其他地方形成瓶颈。最大的提升将来自将整个堆栈视为针对扩散计算特性设计的完整系统。
随着更新的视频模型将生成时间逼近实时,我们离真正的交互式生成视频还有多远?在实时视频生成成为常态之前,还需要克服哪些技术障碍?
我们已经在某些应用中达到了交互式速度。MachGen 能在约 6 秒内生成 720p 的 5 秒 Vidu Q3 Turbo 视频,在 540p 下则不到 3 秒。这足以支持快速的创意迭代,并让响应式化身和交互式视频触手可及。
这是一种我所理解的交互式的例子。想象你在观看一个故事,看到结局的走向却不满意。与其被动坐等,你可以重新引导情节:让那两个角色去发现第三个角色隐藏的东西,并与之对峙,而不是让情节自行发展。由你掌控的内容取代被动接受的内容。这正是快速、低成本生成所带来的可能性,也几乎改变了我们消费的所有内容。
要实现这一目标通常需要多个强有力的延迟基准。整个体验必须在生产流量下保持响应,同时维持视觉质量、帧间一致性和可预期的成本。更长的视频、更高的分辨率以及并发请求都会增加基础设施负担,系统仍需在用户不察觉的情况下提供容量、路由请求并从硬件故障中恢复。
它将按用例逐步到来。短片、化身、游戏和创意工具可能会率先受益,因为以秒计的生成速度已经足够。随着模型质量和推理性能同步提升,更多应用将突破这一门槛。
随着 AI 代理越来越多地自主生成图像和视频,而不再等待人为按键,这会如何改变基础设施需求?代理驱动的工作负载是否会在延迟、并发、成本和可靠性方面产生根本不同的需求?
一个代理会将单个用户请求转化为数十甚至数百个生成任务。它会生成多个选项,进行评估,修改提示词,并重复该过程,整个过程中没有人为介入。
这使得延迟、并发、成本和可靠性变得尤为重要。如果每次生成需要数分钟,代理的工作流就太慢而无法使用;如果每次尝试成本高昂,自治迭代在经济上也不可行。系统还必须可靠地处理大量并发请求,因为一次故障可能中断整个工作链。
这正是 GPU 供应、自动扩缩容和路由等能力与模型层面优化同等重要的地方。相较于用户点击按钮的创意应用,代理的需求波动更为剧烈。
相关的工作单元不再是单张图像或单段视频,而是生成、评估和完善内容的完整闭环。基础设施必须使整个闭环既快速又经济且可靠。
GPU 供应商、推理云、模型开发者和优化平台之间竞争激烈。随着硬件本身变得更快,企业为何仍需像 MachGen 这样的专用推理层,而不是依赖 NVIDIA、AMD、云服务商或模型开发者自身的改进?
更快的硬件提升了上限,软件决定了能够达到上限的程度。
我们在大语言模型上已经看到这种情况。新加速器在每一代都提升了原始性能,而持续批处理、KV 缓存管理、推测解码和专用内核才是推动行业实现生产级吞吐量和经济性的关键。这些都不是硬件本身带来的。
持续优化图像和视频生成的完整生产路径是一项与硬件厂商、云服务商和模型开发者所做工作不同的任务,且这并非他们的核心优先事项。
对此有几种做法。其中一种是市场模型,即聚合模型并路由请求。我们认为从长远来看这不可持续,因为无法控制性能所在的层。我们选择自行构建堆栈并原生托管,这是实现我们所看到的延迟和成本指标的唯一途径。
这意味着需要针对每个模型和每个加速器调优注意力机制、缓存、内核、精度、内存和并行度,并支持托管 API、专用云以及自托管部署。随着模型数量和硬件选项的增加,复杂度也随之上升。我们的职责是承担这些工作,让客户能够把时间花在区分其产品的关键上。
您将世界模型描述为 MachGen 的长期愿景的一部分,其许多计算特性类似于扩散工作负载。生产规模的世界模型所需的基础设施应是什么样的?如果生成和模拟视觉环境最终能够像今天生成文本一样廉价且响应迅速,将会有哪些应用成为可能?
可以将我们的平台类比为通用大语言模型。相同的模型可以起草法律协议,也能回答关于餐厅的问题。对我们而言,同一套技术栈服务于视频化身公司、AI 广告、故事与微剧本生成,最终还将支持世界模型。不同的垂直领域,却面临同一套底层性能问题。
世界模型目前并非我们的核心业务,但它们是我们正在构建的方向,我们也在积极研发。生产规模的世界模型需要极高的吞吐量和极低的延迟,因为它们是持续生成并更新环境,而不是产生单一输出。它们还必须具备空间和时间上的一致性、对动作的响应能力,且常常需要同时模拟多个可能的结果。这在内存、数据移动、并行性和可靠性方面带来了严峻挑战。用于驱动机器人或游戏的世界模型不可能耗时数分钟才能产生下一个状态。性能决定了这些系统是否能够使用。
从计算角度看,当前的世界模型与扩散模型非常相似,因此我们现在构建的技术栈是其自然基础。目前尚不存在与大语言模型相当的成熟生产级服务层。我们计划自行构建。
如果模拟能够像现在的文本生成一样快速且成本低廉,机器人就能在遭遇真实情境前演练罕见情形,游戏能够生成对单个玩家作出响应的环境,设计师也能在实体构建之前测试数十种可能性。扩散是我们目前的主要盈利点。世界模型是我们的指路明星。
感谢这次精彩的采访,想了解更多的读者请访问 MachGen AI。












