思想领袖
企业人工智能为什么在终点线上失败——以及如何解决

尽管人工智能领域正在热潮,但大多数企业人工智能项目都未能超越实验阶段。根据最近的IDC研究,88%的人工智能概念验证(POC)项目未能扩展到全生产。这种下降非常显著,明显表明有些事情不对劲。许多项目在接近终点线时,拥有一个符合团队设定的基准的训练模型,但最终未被发布或被最终用户采用。
那么,问题出在哪里?在很多情况下,问题归结为三个大问题:
- 企业人工智能团队依赖于表面层面的诊断工具和基准,这些工具和基准无法捕捉到关键性能差距
- 模型被训练以符合标准基准,而不是解决现实世界的问题
- 扩大人工智能采用意味着扩大计算成本,这最终会对公司范围内的采用产生太高的成本
在这篇文章中,我们将逐一分析这些陷阱——以及如何让人工智能项目成功跨越终点线,进入用户的使用范围。
问题 #1:标准诊断工具无法捕捉关键性能问题
人工智能项目在概念验证阶段之后遇到的一个主要原因是内部基准和诊断工具通常无法深入到模型性能中,容易忽略影响可用性、可信度和采用率的问题。团队可能会在纸面上完成所有检查,但这些检查并不总是反映模型在现实世界中的性能。
举个例子:一个人工智能团队拥有一个通过所有内部测试的模型,达到了所有准确性指标和安全阈值,并准备发布。但是,当他们让第三方根据预期用例评估模型时,发现了一个重大盲点。该模型在回答某些方式提出的问题时,会给出九倍多的回避性答案。例如,它会正确回答“谁是美国总统?”但会将“可以告诉我关于总统吗?”视为安全风险并拒绝回答。
问题不在于模型的核心知识,而在于它如何根据措辞解释意图。该团队过度优化了安全性,以至于无意中阻止了正常、合理的问题。
问题 #2:模型被优化为基准,而不是现实世界需求
企业人工智能的另一个常见障碍是人工智能团队将模型训练为达到行业标准基准,而不是现实世界需求。在纸面上,一个模型可能看起来很出色,得到了高分的标准评估,但在实践中,它可能难以提供一致、有用的结果,而不需要大量用户干预。
当团队将模型优化为特定任务的基准时,就会发生这种情况。模型在这些测试用例中可能表现出色,但在面对不那么结构化、更为多样的现实世界输入时,可能会遇到困难。结果,用户需要通过提示工程来“说模型的语言”,才能得到正确的答案。如果您的AI产品依赖于最终用户精心设计的提示,您就引入了摩擦,减慢了采用速度,并削弱了其有用性。
这种基准驱动的训练也可能导致过拟合。模型变得过于适应评估数据集,以至于失去了普遍性。它可能通过所有内部测试,但在部署到野外时仍可能失败,尤其是实际使用案例与训练数据集略有不同。
如果您想要一个成功的企业人工智能解决方案,您的模型需要在现实世界中工作,而不仅仅是在实验室中。
问题 #3:扩大人工智能采用意味着扩大计算成本
许多人工智能概念验证项目未能扩展的第三个原因是财务方面:团队经常低估了在生产中运行和维护模型的成本。在开发过程中,很容易忽略大型模型的计算需求,特别是在小数据集或有限使用环境中进行测试。但是一旦部署,这些成本可能会飙升。
企业级人工智能需要大量的计算资源,不仅要实时提供响应,还要进行持续的微调、监控、日志记录和重新训练。如果这些成本没有被提前考虑,解决方案的商业案例可能会在实际使用开始时崩溃。看似在受控测试中很有前途的模型可能会迅速变得不可持续,当成千上万的用户开始每天使用该系统时。
克服成功企业人工智能的最后一公里障碍
为了避免使许多企业人工智能项目脱轨的常见陷阱,团队需要超越通常的剧本。以下是您的AI团队可以建立真正可行和可扩展的东西的方法。
首先,邀请第三方来评估您的模型。 内部测试很重要,但通常过于宽泛。新的视角,加上针对您的用例定制的评估框架,可以揭示您的团队可能忽略的问题,特别是在现实用户如何与系统交互时。
第二,确保您使用现实世界的提示进行测试。 大多数基准都在“干净”的数据上进行测试,这些数据不反映现实世界,更不用说您的特定最终用户将如何提示您的模型。使用模糊、模糊或奇怪措辞的输入来测试您的模型将有助于展示它在部署后实际的性能,并让您捕捉到可能通过裂缝的潜在问题。
第三,重新审视您的安全协议。 过度防范很容易发生,虽然安全很重要,但它不应该使您的模型难以使用。如果模型在简单、无害的问题上关闭,您就用可用性换取了错误的安全感。
最后,关注您的计算成本。 如果您的采用目标包括成千上万的用户和数百万的请求,这些费用可能会迅速增加。一个解决方案是考虑使用较小的模型。例如,Boosted.ai 切换到自定义的小型语言模型,并将计算成本降低了 90%,同时提高了速度和性能。实时结果,改善用户体验,无需昂贵的硬件。
通过从一开始就解决评估、可用性和可扩展性问题,团队可以真正让他们的人工智能项目有机会实现长期成功。这不仅仅是让它在实验室中工作——而是让它在世界上工作。












