AI 模型与平台
使用较短的推理链来提高大型语言模型中的AI效率
大型语言模型(LLM)通过生成类似人类的文本和解决各个行业的复杂问题,已经改变了人工智能(AI)。多年来,AI专家认为,较长和更详细的推理链将导致更高的准确性。假设更多的步骤将导致更好和更可靠的答案。
然而,2025年由Meta的FAIR团队和希伯来大学耶路撒冷分校进行的一项研究对这一信念提出了质疑。研究发现,较短的推理链可以将LLM的准确性提高多达34.5%。同时,它们将计算成本降低了多达40%。这一发现表明,简洁、集中推理可以加快处理速度。这些结果预计将改变LLM的训练、部署和扩展方式。
为什么AI中的较短推理链很重要
长期以来,人们认为AI模型中的较长推理链将导致更好的结果。这种想法背后的逻辑很简单:AI模型采取的步骤越多,处理的信息就越多。这种额外的处理被认为可以增加生成更准确解决方案的机会。因此,许多AI系统被开发以最大化推理步骤的数量,目标是提高模型的性能。
然而,这种方法有几个重大局限性。较长的推理链需要更多的计算能力,这意味着AI模型需要更多的时间和能量来处理每个任务。这通常会导致处理速度变慢和运营成本增加,这在需要快速响应的实时应用中可能是一个主要问题。另外,较长链的复杂性增加了引入错误的可能性。步骤越多,错误发生的可能性就越高。这使得模型效率降低,扩展更加困难,在需要速度和准确性的行业中应用AI系统时会出现挑战。
由Meta和合作伙伴进行的研究凸显了这种传统信念的缺陷。他们的研究发现,较短的推理链可以提高准确性。同时,它们减少了计算开销。这意味着AI模型可以更快、更低成本地处理任务,而不失去准确性。
这些发现表明AI开发需要改变。重点应该从增加推理步骤转变为优化推理过程。通过使用较短的推理链,AI模型可以更高效。它们还可以提供更可靠的结果,并在较短的时间内完成任务。
使用short-m@k推理框架提高推理效率
由Meta的FAIR团队和希伯来大学耶路撒冷分校进行的研究引入了short-m@k推理框架,这是一种旨在优化LLM中多步骤推理的新方法。这种框架背离了传统的顺序推理和详尽的多数投票方法,利用并行性和早期终止标准来提高效率和降低计算成本。
在short-m@k方法中,k个并行推理链同时启动。然而,过程在第一个m个链完成后停止,最后的预测通过对这些早期终止链的结果进行多数投票来确定。这种机制减少了不必要的令牌生成,从而降低了计算开销和延迟,同时保持预测准确性。
short-m@k框架包括两个关键变体,每个变体针对不同的环境进行优化:
short-1@k:此变体选择第一个完成的推理链,从k个并行尝试中选择。它在低资源或延迟敏感的情况下特别有效,实现了可比或更好的准确性,计算成本最小。
short-3@k:此版本汇总了前三个完成的链的结果。它在准确性和吞吐量方面始终优于传统的多数投票方法,使其成为需要高性能和效率的大规模生产环境的理想选择。
此外,short-m@k方法影响模型微调策略。通过训练模型使用较短、更有效的推理序列,模型可以实现更快的收敛,提高推理精度和计算资源在训练和部署期间的整体效率。
对AI开发和行业采用的影响
使用较短的推理链对AI模型的开发、部署和长期可持续性具有重大影响。
从训练的角度来看,较短的推理链降低了计算复杂性和资源使用量。这使得训练LLM变得更便宜、更快。它还允许更快地更新和更频繁地改进,而无需更多的基础设施。
在部署中,特别是在需要快速响应的应用中(如聊天机器人、交易平台和实时决策系统),较短的推理链可以提高处理速度。这不仅使系统更快,还使其能够同时处理更多的请求。这意味着系统可以在高负载下更好地运行和扩展。
能效也是一个关键的好处。通过减少训练和推理期间需要的令牌和计算量,AI系统使用的能量更少。这降低了成本,帮助环境。随着AI变得更加普遍,数据中心面临降低能耗的压力,这种效率变得更加重要。
最后,这些效率可以加快整个AI开发过程。通过较短的训练时间和更快的推理,组织可以更快地将AI产品和服务推向市场。这有助于它们在快速变化的技术世界中保持竞争力和敏捷性。
克服实施挑战和较短推理链的战略建议
虽然在LLM中采用较短的推理链带来明显的好处,但要使这种方法完全有效,还需要克服一些实际挑战。
主要挑战之一是传统的AI系统设计,它们长期以来都专注于使用较长的推理链。这些系统是基于这样的信念构建的:更多的步骤将带来更好的结果。转向较短的链需要重新审视模型架构、训练方法和优化技术。这一变化需要技术技能和组织内部的适应意愿。
数据的质量和结构也起着重要作用。训练数据是为较长的推理链设计的AI模型可能会在切换到较短的推理路径时遇到困难。为了使较短的链有效,数据集需要被策划和结构化,以支持快速、有针对性的推理步骤。这对于确保模型能够保持准确性和性能至关重要。
可扩展性也是一个挑战。较短的推理链在受控环境中效果很好,但在大规模应用(如电子商务网站或客户支持系统)中使用时,需要坚实的基础设施。系统必须能够处理大量的请求而不会变慢或失去准确性。这需要仔细的规划和资源管理,以确保平稳的性能。
为了克服这些挑战,AI开发人员可以考虑以下策略:
- 采用short-m@k推理框架:此方法使用并行处理和早期终止来平衡速度和准确性,使其适合实时、延迟敏感的应用。
- 在训练中优先考虑简洁的推理:纳入专注于较短推理链的训练方法,以降低资源使用和提高速度。
- 监测推理链指标:定期跟踪推理链的长度和模型的实时性能。这有助于进行快速的调整,以保持系统的效率和准确性。
通过遵循这些策略,AI开发人员可以成功地实施较短的推理链,导致更快、更准确、更可扩展的AI系统,这些系统满足操作需求和成本效率目标。
结论
关于较短推理链的研究带来了对AI开发的新方法。使用较短的链可以使AI模型更快、更准确、更低成本地运行。这一变化对于速度和成本至关重要的行业来说是必不可少的。
通过使用较短的推理链,AI系统可以在不需要更多资源的情况下改进。这可以帮助公司更高效地开发和使用AI。展望未来,这种方法将使AI更加有价值和适应不同需求。AI开发人员和公司应该探索这些新方法,以保持在快速变化的技术世界中的领先地位。












