访谈

安纳德·卡纳潘(Anand Kannappan),Patronus AI 的 CEO 和联合创始人 – 采访系列

mm
将 Unite.AI 添加到您在 Google 上的首选来源

安纳德·卡纳潘是Patronus AI的联合创始人和CEO,Patronus AI是一家行业领先的自动化AI评估和安全平台,帮助企业在大规模上捕捉LLM错误。之前,安纳德曾在Meta Reality Labs领导机器学习可解释性和高级实验工作。

是什么最初吸引你学习计算机科学?

在成长过程中,我一直对技术和它如何解决现实问题感到着迷。使用计算机和代码从零开始创建东西的想法令我着迷。随着我深入计算机科学,我意识到它在各个行业的创新和变革方面具有巨大的潜力。这驱使我创新和带来改变的愿望最初吸引我学习计算机科学。

你能分享一下Patronus AI的创立故事吗?

Patronus AI的创立是一个非常有趣的旅程。当OpenAI推出ChatGPT时,它成为增长最快的消费产品,在仅两个月内就拥有了超过1亿用户。这巨大的采用率凸显了生成性AI的潜力,但也暴露了企业在如此快速的速度下部署AI的犹豫。许多企业担心大型语言模型(LLM)的潜在错误和不可预测的行为。

蕾贝卡和我多年来一直保持联系,我们在芝加哥大学一起学习计算机科学。在Meta,我们都面临着评估和解释机器学习输出的挑战——蕾贝卡从研究角度,我从应用角度。当ChatGPT宣布时,我们都看到了LLM的变革潜力,但也理解了企业的谨慎态度。

转折点出现在我的兄弟投资银行Piper Sandler决定内部禁止使用OpenAI。这使我们意识到虽然AI已经取得了显著进步,但由于对可靠性和安全性的担忧,企业采用AI仍然存在差距。我们创立了Patronus AI来解决这一差距,通过为LLM提供评估和安全层来增强企业对生成性AI的信心。

你能描述一下Patronus AI平台的核心功能吗?

我们的使命是增强企业对生成性AI的信心。我们开发了行业首个自动化的LLM评估和安全平台。我们的平台帮助企业在大规模上检测LLM输出中的错误,使他们能够安全地部署AI产品。

我们的平台自动化了几个关键过程:

  • 评分:我们在现实场景中评估模型性能,重点关注诸如幻觉和安全性等重要标准。
  • 测试生成:我们自动生成大规模的对抗性测试套件,以严格评估模型能力。
  • 基准测试:我们比较不同的模型,以帮助客户确定哪一个最适合他们的特定用例。

企业更喜欢频繁的评估,以适应不断演变的模型、数据和用户需求。我们的平台作为第三方评估者,提供了一个无偏见的视角,类似于AI领域的穆迪公司。我们的早期合作伙伴包括领先的AI公司,如MongoDB (MDB ) 、Databricks、Cohere和Nomic AI,我们正在与传统行业的几家知名公司进行讨论,以试用我们的平台。

Patronus AI的Lynx模型在LLM输出中检测到哪些类型的错误或“幻觉”,以及它如何解决这些问题以帮助企业?

LLM确实是强大的工具,但它们的概率性质使它们容易出现“幻觉”,即模型生成不准确或不相关的信息。这些幻觉在高风险的商业环境中尤其成问题,因为准确性至关重要。

传统上,企业依赖手动检查来评估LLM输出,这不仅耗时,而且不具可扩展性。为了简化这一过程,Patronus AI开发了Lynx,这是一种专门的模型,增强了我们的平台的功能。Lynx提供了全面的测试覆盖和强大的性能保证,重点是识别可能对业务运营产生重大影响的关键错误,例如财务计算错误或法律文件审查中的错误。

通过Lynx,我们通过自动对抗性测试来减轻手动评估的局限性,探索广泛的潜在故障场景。这使我们能够检测到可能逃过人工评估者的问题,提供更可靠的结果,并让企业在关键应用中更有信心地部署LLM。

FinanceBench被描述为评估LLM在金融问题上的性能的首个基准。是什么金融领域的挑战促使开发了FinanceBench?

FinanceBench是为了应对金融领域在采用LLM时面临的独特挑战而开发的。金融应用需要高度的准确性和可靠性,因为错误可能导致重大财务损失或监管问题。尽管LLM在处理大量金融数据方面有前景,但我们的研究表明,像GPT-4和Llama 2这样的最先进模型在金融问题上往往难以检索准确的信息。

FinanceBench被创建为一个全面评估LLM在金融背景下的性能的基准。它包括10,000个基于公开可用的金融文档的问题和答案对,涵盖数字推理、信息检索、逻辑推理和世界知识等领域。通过提供这一基准,我们旨在帮助企业更好地了解当前模型的局限性,并找出需要改进的领域。

您的研究强调了领先的AI模型,特别是OpenAI的GPT-4,在被提示使用流行书籍摘录时会生成大量的受版权保护的内容。您认为这些发现对AI开发和更广泛的技术行业的长期影响是什么,特别是考虑到围绕AI和版权法的持续辩论?

AI模型生成受版权保护的内容是一个复杂且紧迫的问题。我们的研究表明,像GPT-4这样的模型在被提示使用流行书籍摘录时,往往会复制受版权保护的材料。这引发了关于知识产权和使用AI生成内容的法律影响的重要问题。

从长远来看,这些发现强调了制定清晰的指南和法规以规范AI和版权法的必要性。该行业必须致力于开发尊重知识产权的AI模型,同时保持其创造能力。这可能涉及改进训练数据集以排除受版权保护的材料,或实施检测和防止生成受保护内容的机制。

鉴于您的研究表明,领先的LLM以惊人的速度复制受版权保护的内容,作为AI开发者和整个行业,您认为需要采取什么步骤来解决这些问题?此外,Patronus AI如何计划为创建更负责任和合法的AI模型做出贡献?

解决AI模型复制受版权保护内容的问题需要采取多方面的方法。AI开发者和整个行业需要优先考虑透明度和问责制在AI模型开发中的重要性。这包括:

  • 改进数据选择:确保训练数据集经过精心策划,以避免受版权保护的材料,除非获得适当的许可。
  • 开发检测机制:实施系统以识别AI模型何时生成可能受版权保护的内容,并为用户提供修改或删除此类内容的选项。
  • 建立行业标准:与法律专家和行业利益相关者合作,制定尊重知识产权的AI开发指南和标准。

在Patronus AI,我们致力于通过关注评估和合规性为负责任的AI开发做出贡献。我们的平台包括产品,如EnterprisePII,它帮助企业检测和管理AI输出中的潜在隐私问题。通过提供这些解决方案,我们旨在赋予企业使用AI的能力,同时尽量减少法律风险。

随着EnterprisePII和FinanceBench等工具的出现,您预计企业在部署AI(尤其是在金融和个人数据等敏感领域)方面会发生哪些变化?

这些工具为企业提供了更有效地评估和管理AI输出的能力,特别是在金融和个人数据等敏感领域。

在金融领域,FinanceBench使企业能够以高精度评估LLM的性能,确保模型满足金融应用的严格要求。这使企业能够更有信心和可靠性地利用AI执行任务,如数据分析和决策。

Patronus AI如何与公司合作,将这些工具集成到现有的LLM部署和工作流中?

在Patronus AI,我们了解AI采用中的无缝集成的重要性。我们与客户密切合作,以确保我们的工具可以轻松集成到他们现有的LLM部署和工作流中。这包括为每个客户提供:

  • 定制集成计划:我们与每个客户合作,制定符合他们特定需求和目标的定制集成计划。
  • 全面支持:我们的团队在整个集成过程中提供持续的支持,提供指导和帮助,以确保平稳过渡。
  • 培训和教育:我们提供培训课程和教育资源,以帮助客户充分了解和利用我们的工具,赋予他们充分利用AI投资的能力。

考虑到确保AI输出安全、准确和符合各种法律法规的复杂性,您会给LLM开发者和希望使用它们的公司什么建议?

通过优先考虑合作和支持,我们旨在使集成过程尽可能直接和高效,允许企业解锁我们AI解决方案的全部潜力。

确保AI输出安全、准确和合规的复杂性带来了重大挑战。对于LLM开发者来说,关键是要在整个开发过程中优先考虑透明度和问责制。

质量的数据至关重要。开发者必须确保训练数据集经过精心策划,避免受版权保护的材料,除非获得适当的许可。这不仅有助于防止潜在的法律问题,还确保AI生成可靠的输出。此外,解决偏见和公平性问题至关重要。通过积极识别和减轻偏见,并开发多样化和具有代表性的训练数据,开发者可以减少偏见,确保所有用户的公平结果。

感谢您接受这次精彩的采访,希望了解更多的读者可以访问Patronus AI的网站。

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。