AI 模型与平台
引用:Anthropic 的新功能能否解决 AI 的可信任问题?
AI 验证已经成为一个严重的问题。虽然 大型语言模型(LLM) 以惊人的速度发展,但证明其准确性的挑战仍然未被解决。
Anthropic 正在尝试解决这个问题,我认为他们有最好的机会。
该公司发布了 Citations,这是一个新的 API 功能,用于其 Claude 模型,它改变了 AI 系统验证其响应的方式。该技术自动将源文档分解为可消化的块,并将每个 AI 生成的语句链接回其原始源 – 类似于学术论文引用其参考文献的方式。
Citations 正在尝试解决 AI 最大的挑战之一:证明生成的内容是准确和可信的。与传统的复杂提示工程或手动验证相比,该系统自动处理文档并为每个断言提供句级源验证。
数据显示出令人乐观的结果:与传统方法相比,引用准确性提高了 15%。
为什么现在很重要
AI 信任已经成为企业采用(以及个人采用)的关键障碍。随着组织将 AI 从实验性使用转移到核心运营,无法高效验证 AI 输出的能力已经造成了一个重大的瓶颈。
当前的验证系统揭示了一个明显的问题:组织被迫在速度和准确性之间做出选择。手动验证过程不具备可扩展性,而未经验证的 AI 输出带来太多风险。这个挑战在受监管的行业中尤其突出,在这些行业中,准确性不仅是首选,而是必需的。
Citations 的时机恰逢 AI 发展的关键时刻。随着语言模型变得更加复杂,内置验证的需求也随之增长。我们需要构建可以在专业环境中自信地部署的系统,在这些环境中,准确性是不可妥协的。
技术架构的分解
Citations 的魔力在于其文档处理方法。Citations 不像其他传统的 AI 系统。这些系统通常将文档视为简单的文本块。Citations 将源材料分解为 Anthropic 称为“块”的内容。这些可以是单个句子或用户定义的部分,从而为验证创建了一个细粒度的基础。
以下是技术细节:
文档处理和处理
Citations 根据文档格式不同进行处理。对于文本文件,除了标准的 200,000 个令牌限制外,基本上没有限制。这包括您的上下文、提示和文档本身。
PDF 处理更复杂。该系统以视觉方式处理 PDF,而不是仅作为文本,这导致了一些关键限制:
- 32MB 文件大小限制
- 每个文档最多 100 页
- 每页消耗 1,500-3,000 个令牌
令牌管理
现在转到这些限制的实际方面。当您使用 Citations 时,您需要仔细考虑令牌预算。以下是它的详细信息:
对于标准文本:
- 完整请求限制: 200,000 个令牌
- 包括: 上下文 + 提示 + 文档
- 没有单独的引用输出费用
对于 PDF:
- 每页令牌消耗更高
- 视觉处理开销
- 需要更复杂的令牌计算
Citations 与 RAG 的区别
Citations 不是一种 检索增强生成(RAG) 系统 – 这个区别很重要。虽然 RAG 系统专注于从知识库中找到相关信息,但 Citations 却专注于您已经选择的信息。
可以这样理解: RAG 决定使用哪些信息,而 Citations 确保这些信息被准确使用。这意味着:
- RAG: 处理信息检索
- Citations: 管理信息验证
- 结合潜力: 两个系统可以一起工作
这种架构选择意味着 Citations 在提供的上下文中擅长准确性,同时将检索策略留给补充系统。
集成路径和性能
设置很简单: Citations 通过 Anthropic 的标准 API 运行,这意味着如果您已经使用 Claude,您已经走了一半的路。该系统直接与 Messages API 集成,消除了单独的文件存储或复杂的基础设施更改的需要。
定价结构遵循 Anthropic 的基于令牌的模型,并具有一个关键优势:虽然您需要为源文档的输入令牌付费,但引用输出本身没有额外的费用。这创建了一个可预测的成本结构,随着使用而扩展。
性能指标讲述了一个令人信服的故事:
- 引用准确性提高了 15%
- 完全消除了源幻觉(从 10% 的发生率降至零)
- 每个断言的句级验证
使用未经验证的 AI 系统的组织(和个人)发现自己处于劣势,特别是在受监管的行业或高风险环境中,准确性至关重要。
展望未来,我们可能会看到:
- 类似 Citations 的功能成为标准
- 验证系统的演进,从文本到其他媒体
- 行业特定的验证标准的发展
整个行业确实需要重新思考 AI 的可信度和验证。用户需要达到一个点,在那里他们可以轻松验证每个断言。












