Chase W. Hughes 是一位三次创业者,创建了 ProAI,作为首批商业化的 GPT 产品之一,已被超过 30 万家企业和机构使用并已出售。他拥有一项于 2023 年初提交的专利待批多代理研究系统,并在 chasewhughes.com 上撰写关于以代理为先的设计。
过去一年,关于边缘 AI 的硬件讨论变得更加诚实。本站的一篇近期文章指出,旧的设计层级——“先最大化吞吐量,再围绕它管理功耗和热量”——已经颠倒,对于工业部署而言,功耗现在位居首位,原始吞吐量居于最后。这呼应了本刊长期以来的论点:边缘设备是热受限,而非 MIPS/计算受限,而智能手机已经达到了这些极限。这两点都是实质性的纠正,且早该如此。但它仍然保留了来自它所纠正的世界的一个假设。层级中的每一项都基于一个假设的工作负载进行预算,而几乎所有人仍在预算的工作负载是单次前向传递:模型接收输入,产生输出,硅片得到片刻冷却。这并不是智能体的工作方式。智能体会做决定,调用工具,读取返回结果,然后再次决定。它循环多少次并不是硬件的属性,也并非模型的属性,而是某人那天早上交给它的问题的属性。我在边缘硬件上运行智能体,花了最长时间才接受的并不是它们慢,而是运行成本被设定在我在设计时看不见的地方。The Loop Is Unbounded Until Someone Types a Number这不是修辞式的表述;它正是框架实际构建的方式。在OpenAI 的 Agents SDK中,运行器“运行一个循环”,当模型产生工具调用时,运行时会“运行这些工具调用,追加结果,并重新运行循环”。唯一能阻止它的是回合限制——超出 max_turns 会抛出异常——文档中说明可以将 max_turns=None 以完全禁用该限制。在服务器上,这个数字是计费决策。有人会注意到账单。在设备上,这个数字是热决策,因为循环长度等同于占空比。而占空比是被动散热无法争辩的唯一变量。Sustained Load Does Something Different to a Phone...