访谈
基里尔·索洛德基赫,TheStage AI 的联合创始人和 CEO – 采访系列

基里尔·索洛德基赫,博士,是 TheStage AI 的联合创始人和 CEO,同时也是具有十多年经验的 AI 研究人员和企业家,专注于为现实世界的商业应用优化神经网络。在 2024 年,他联合创立了 TheStage AI,并获得了 450 万美元的资金,以便在任何硬件平台上完全自动化神经网络加速。
此前,在华为担任团队负责人时,基里尔领导了 AI 相机应用的加速工作,针对高通 NPU,促进了 P50 和 P60 智能手机的性能,并因其创新成果获得了多项专利。他的研究成果曾在领先的会议上发表,如 CVPR 和 ECCV,并获得了奖项和行业范围的认可。他还主持了一个关于 AI 优化和推理的 播客。 (QCOM )
是什么激发了您联合创立 TheStage AI 的灵感?您如何从学术和研究转变为创业者,专注于推理优化?
TheStage AI 的基础始于我在华为的工作,我深入地自动化部署和优化神经网络。这些工作成为我们一些开创性创新成果的基础,我在那里看到了真正的挑战。训练一个模型是一回事,但让它在现实世界中高效运行,并使其对用户可用,这是另一回事。部署是阻碍许多好想法的瓶颈。要让某些东西像 ChatGPT 一样易于使用,需要解决许多后端挑战。从技术角度来看,神经网络优化是关于最小化参数同时保持高性能,这是一个具有挑战性的数学问题,具有很大的创新空间。
手动推理优化长期以来一直是 AI 的瓶颈。您能解释一下 TheStage AI 如何自动化这个过程,以及为什么它是一个游戏规则的改变者吗?
TheStage AI 解决了 AI 中的一个主要瓶颈:手动压缩和加速神经网络。神经网络有数十亿个参数,手动确定哪些参数可以移除以提高性能几乎是不可能的。ANNA(自动神经网络分析器)自动化了这个过程,确定哪些层不需要优化,类似于 ZIP 压缩的自动化。
这改变了游戏规则,使得 AI 的采用速度更快、更便宜。与其依赖昂贵的手动过程,初创企业可以自动优化模型。该技术为企业提供了性能和成本的清晰视图,确保效率和可扩展性,而无需猜测。
TheStage AI 声称可以将推理成本降低多达 5 倍 —— 您的优化技术与传统方法相比有什么优势?
TheStage AI 通过超越传统方法的优化方法,将输出成本降低了多达 5 倍。与其将相同的算法应用于整个神经网络,ANNA 将其分解为更小的层,并决定为每个部分应用哪种算法,以实现所需的压缩同时最大化模型质量。通过结合智能数学启发式和高效近似,我们的方法具有高度的可扩展性,使得企业更容易采用 AI。
TheStage AI 的推理加速与 PyTorch 的本地编译器相比如何?它为 AI 开发者提供了哪些优势?
TheStage AI 的推理加速远远超过了 PyTorch 的本地编译器。PyTorch 使用“即时”编译方法,每次运行模型时都会编译模型。这导致了长时间的启动时间,有时需要几分钟甚至更长时间。在可扩展的环境中,这可能会造成低效,特别是当需要添加新的 GPU 来处理增加的用户负载时,这可能会影响用户体验。
相比之下,TheStage AI 允许模型预编译,因此一旦模型准备好,就可以立即部署。这导致了更快的推出、更好的服务效率和节省成本。开发人员可以更快地部署和扩展 AI 模型,而无需传统编译的瓶颈,使其更加高效和响应迅速,适合高需求的用例。
您能否详细介绍 TheStage AI 的 QLIP 工具包,以及它如何提高模型性能同时保持质量?
QLIP 是 TheStage AI 的工具包,是一个 Python 库,提供了一组基本的原语,用于快速构建针对不同硬件(如 GPU 和 NPU)的新优化算法。工具包包括量化、剪枝、规范、编译和服务等组件,这些对于开发高效、可扩展的 AI 系统至关重要。
QLIP 的不同之处在于其灵活性。它允许 AI 工程师用仅几行代码原型和实现新的算法。例如,最近的一篇关于量化神经网络的 AI 会议论文可以使用 QLIP 的原语在几分钟内转化为一个可用的算法。这使得开发人员能够轻松将最新的研究成果集成到他们的模型中,而不会被僵化的框架所限制。
与传统的开源框架不同,限制您使用固定的算法集,QLIP 允许任何人添加新的优化技术。这使得团队能够在快速演变的 AI 景观中保持领先地位,提高性能同时确保灵活性以适应未来创新。
您曾为华为的 P50 和 P60 相机贡献了 AI 量化框架。这种经历如何塑造了您对 AI 优化的方法?
我在华为工作于 AI 量化框架的经历,为我提供了宝贵的见解,了解如何简化和扩大优化。最初使用 PyTorch 时,处理神经网络的完整执行图是僵化的,量化算法必须手动实现,层层叠加。在华为,我建立了一个自动化该过程的框架。您只需输入模型,它就会自动生成量化的代码,消除了手动工作的需要。
这让我意识到,AI 优化的自动化是关于在不牺牲质量的情况下实现速度。其中一个我开发和获得专利的算法,对华为来说至关重要,特别是当他们由于制裁而不得不从麒麟处理器转向高通处理器时。它使团队能够快速适应高通的架构,而不会失去性能或准确性。
通过简化和自动化该过程,我们将开发时间从一年以上缩短到了仅几个月。这对数百万人使用的产品产生了巨大的影响,并塑造了我对优化的方法,专注于速度、效率和最小化质量损失。这就是我今天带到 ANNA 的心态。
您的研究成果曾在 CVPR 和 ECCV 上发表。您在 AI 效率方面最自豪的突破是什么?
当被问及我在 AI 效率方面的成就时,我总是回想起我们在 CVPR 2023 上被选为口头报告的论文。被选为口头报告是一件罕见的事情,因为只有 12 篇论文被选中。这增加了这样一个事实:生成性 AI 通常占据主导地位,而我们的论文采取了不同的方法,专注于神经网络的数学分析和压缩。
我们开发了一种方法,帮助我们了解神经网络真正需要多少参数才能高效运行。通过应用函数分析技术并从离散转向连续的公式,我们能够实现良好的压缩结果,同时保持将这些更改集成回模型的能力。该论文还引入了社区以前未使用的新算法,并在其他地方找到了应用。
这是我在 AI 领域的第一篇论文,对我和我的联合创始人来说,这是一个重要的里程碑。这是我们团队集体努力的结果。
您能解释一下整体神经网络(INNs)如何工作,以及为什么它们是深度学习中的重要创新吗?
传统的神经网络使用固定矩阵,类似于 Excel 表格,其中大小和参数是预先确定的。INNs 然而将网络描述为连续函数,提供了更多的灵活性。可以将其想象成一个带有不同高度的针的毯子,这代表了连续的波浪。
INNs 的激动人心之处在于,它们能够根据可用资源动态地“压缩”或“扩展”,类似于模拟信号被数字化为声音。您可以在不牺牲质量的情况下缩小网络,当需要时,可以在不重新训练的情况下将其扩展回去。
我们测试了这一点,虽然传统的压缩方法会导致显著的质量损失,但 INNs 即使在极端压缩下也能保持接近原始的质量。背后的数学对于 AI 社区来说可能不太常规,但其真正的价值在于其能够以最少的努力提供坚实、实用的结果。
TheStage AI 曾经研究过量子退火算法 —— 您如何看待量子计算在 AI 优化中的角色,尤其是在不久的将来?
谈到量子计算和它在 AI 优化中的作用时,关键的收获是量子系统为解决优化问题提供了一种完全不同的方法。虽然我们并没有从头开始发明量子退火算法,但像 D-Wave 这样的公司提供了 Python 库,用于构建专门用于离散优化任务的量子算法,这些任务非常适合量子计算机。
这里的想法是,我们并不是直接将神经网络加载到量子计算机中。那不是当前架构所能做到的。相反,我们近似神经网络在不同类型降级下的行为,使其适合量子芯片可以处理的系统。
在未来,量子系统可能能够以传统系统难以匹配的精度优化和扩大网络。量子系统的优势在于其内置的并行性,这是经典系统只能使用额外资源模拟的东西。这意味着量子计算可能会显著加快优化过程,特别是当我们弄清楚如何有效地对更大、更复杂的网络进行建模时。
真正的潜力在于使用量子计算来解决巨大、错综复杂的优化任务,并将参数分解为较小、更易于管理的组。随着量子和光子计算等技术的出现,优化 AI 的可能性远远超出了传统计算所能提供的范围。
您对 TheStage AI 的长期愿景是什么?您认为推理优化在接下来的 5-10 年内会如何发展?
从长远来看,TheStage AI 的目标是成为一个全面的模型中心,任何人都可以轻松访问具有所需特征的优化神经网络,无论是为智能手机还是其他任何设备。我们的目标是提供一种拖放式体验,用户输入参数,系统就会自动生成网络。如果网络不存在,它将使用 ANNA 自动创建。
我们的目标是让神经网络直接在用户设备上运行,将成本降低 20 到 30 倍。在未来,这甚至可以几乎消除成本,因为用户的设备将处理计算,而不是依赖云服务器。这结合模型压缩和硬件加速的进步,可以使 AI 部署更加高效。
我们还计划将我们的技术与硬件解决方案(如传感器、芯片和机器人)集成,应用于自动驾驶和机器人等领域。例如,我们旨在构建能够在任何环境中运行的 AI 相机,无论是在太空还是在极端条件下,如黑暗或灰尘。这将使 AI 在广泛的应用中可用,并允许我们为特定的硬件和用例创建自定义解决方案。
感谢这次精彩的采访,希望读者能够通过访问 TheStage AI 来了解更多信息。












