阿尼什·德瓦恩(Aneesh Dhawan)是Knit的联合创始人兼首席执行官,Knit是一家AI原生研究机构。他过去五年一直在企业AI和研究方法论的交叉点工作。Knit与包括谷歌、亚马逊、T-Mobile和ESPN在内的组织合作,提供AI速度的决策洞察。
企业AI的下一阶段取决于建立可靠的审查架构,而不是更好的模型。过去两年,我参与的每一次AI治理讨论都围绕着同样的问题:幻觉率、准确性基准和对齐测试。这些都是真正的问题,但讨论的焦点放在了错误的方面。尽管模型有了显著的改进,但未经验证的AI输出数量却随着模型的改进而增加。这表明了一个审查架构问题,而行业几乎没有讨论这个问题。模型中心的故事已经超越了现实企业AI的主导框架仍然将模型质量视为主要变量:如果模型足够准确,则输出是可靠的。这种逻辑在两年前是可以理解的,当时早期的LLM更不一致,容易出现幻觉,但情况已经发生了变化。如今的模型可以生成精致、结构良好的、富含引用的响应,适用于广泛的任务,并以利益相关者的语言格式化。组织现在使用AI的量远远超过他们的审查流程所能处理的量。关于企业AI采用的一项研究记录了软件开发中的这种不匹配,其中AI辅助开发人员完成的任务增加了21%,而代码审查时间增加了91%。生产力提高了,但能力不再是瓶颈。 审查能力是真正的障碍。 数据显示的内容洞察力行业是一个有利的研究领域,因为研究专业人员是持怀疑态度的。他们知道相关性、因果性、发现和结论之间的区别。质疑数据质量是工作的一部分。 根据Knit AI信任指数, 92%的受访企业洞察力专业人员报告称,AI生成的输出未经全面审查就已达到高级领导层。 信任指数的发现确定了三个主要压力点: 量已经超过了验证能力。 团队生成的输出超过了他们彻底审查的带宽。 信心提高的速度快于验证行为的变化。 研究人员普遍对AI质量持积极态度,同时承认他们的审查实践尚未跟上。 审查AI工作的工具落后于生成工具。 组织在生成能力上投入了大量资金,但相对较少地投资于审查和跟踪AI生成内容的基础设施。 精致的输出邀请较少的审查更难的失败模式不是AI生成明显错误的答案并被某人捕获的情况。更难的问题是自动化偏见,即减少对看起来权威和结构良好的输出的审查。2025年在AI与社会杂志上发表的一项系统性审查研究了35项同行评审研究,发现精致、高信心的AI输出一致地减少了人类审查的深度,即使在经验丰富的专业人员中也是如此。当某事物看起来正确时,我们会分配较少的注意力来检查它是否正确。这种疏忽会产生传播问题。分析师仅轻微审查的研究输出成为VP级别的幻灯片的一部分,这成为董事级别讨论的基础。等到错误传播到那里时,它的起源就变得不可见,纠正它的成本也很高。 2024年,全球企业因AI生成的不准确性而遭受的损失超过670亿美元。每位员工的验证成本每年可达14,200美元,仅用于检查AI生成的内容是否准确。这些并不是模型质量问题,而是审查架构问题。成熟的AI工作流程是什么样的管理这个问题的组织并没有使用比其他人更好的模型。相反,他们围绕使用的模型建立了更彻底的审查基础设施。四个原则定义了他们的方法: 可见的来源 每个AI输出都带有一个透明的输入来源记录。这个记录为审查者提供了有价值的见解,以高效地评估这些输出。您无法评估一个不可追溯的声明。 按风险等级的审查 并非所有AI输出都带有相同的风险。成熟的工作流程将审查强度按错误的下游后果进行分级。高风险输出获得更多的关注和结构化的验证步骤。常规输出可以更快地处理。 合适的地方的摩擦 苦苦挣扎最多的组织已经统一地去除了摩擦,将速度视为普遍的目标。成功的组织是有选择性的:在AI输出成为组织决策的交接点保留了故意的摩擦。他们的流程在AI生成的发现进入董事级别幻灯片之前需要签署,在发现进入战略讨论之前需要结构化的挑战步骤。 反馈回路到模型层 最佳工作流程将审查视为数据生成过程,而不是检查点。当审查者标记错误或覆盖AI推荐时,该信号被捕获并反馈到AI在未来工作中的部署中。 OpenAI企业AI状态报告发现,表现最好的组织并不是因为他们的模型更复杂,而是因为他们的部署流程更严格。没有这种反馈回路的组织每次都从零开始。 下一阶段的胜利将在审查层获得洞察力行业的真正竞争优势在于谁能始终相信他们所产生的内容。这种信任来自于知道输出的来源、谁审查了它以及当出现问题时发生了什么。最近的历史已经回答了模型问题;组织基础设施的责任在于在规模上负责任地部署模型。 92%的洞察力专业人员看到未经审查的AI内容达到高级领导层的事实,并不是技术失败。它是组织设计失败,并且在任何地方speed都被优化,审查都被视为成本时都会出现。...