访谈
安纳德·卡纳潘(Anand Kannappan),Patronus AI 的 CEO 和联合创始人 – 采访系列

安纳德·卡纳潘是Patronus AI的联合创始人和CEO,Patronus AI是一家行业领先的自动化AI评估和安全平台,帮助企业在大规模上捕捉LLM错误。之前,安纳德曾在Meta Reality Labs领导机器学习可解释性和高级实验工作。
是什么最初吸引你学习计算机科学?
在成长过程中,我一直对技术和它如何解决现实问题感到着迷。使用计算机和代码从零开始创建东西的想法令我着迷。随着我深入计算机科学,我意识到它在各个行业的创新和变革方面具有巨大的潜力。这驱使我创新和带来改变的愿望最初吸引我学习计算机科学。
你能分享一下Patronus AI的创立故事吗?
Patronus AI的创立是一个非常有趣的旅程。当OpenAI推出ChatGPT时,它成为增长最快的消费产品,在仅两个月内就拥有了超过1亿用户。这巨大的采用率凸显了生成性AI的潜力,但也暴露了企业在如此快速的速度下部署AI的犹豫。许多企业担心大型语言模型(LLM)的潜在错误和不可预测的行为。
蕾贝卡和我多年来一直保持联系,我们在芝加哥大学一起学习计算机科学。在Meta,我们都面临着评估和解释机器学习输出的挑战——蕾贝卡从研究角度,我从应用角度。当ChatGPT宣布时,我们都看到了LLM的变革潜力,但也理解了企业的谨慎态度。
转折点出现在我的兄弟投资银行Piper Sandler决定内部禁止使用OpenAI。这使我们意识到虽然AI已经取得了显著进步,但由于对可靠性和安全性的担忧,企业采用AI仍然存在差距。我们创立了Patronus AI来解决这一差距,通过为LLM提供评估和安全层来增强企业对生成性AI的信心。
你能描述一下Patronus AI平台的核心功能吗?
我们的使命是增强企业对生成性AI的信心。我们开发了行业首个自动化的LLM评估和安全平台。我们的平台帮助企业在大规模上检测LLM输出中的错误,使他们能够安全地部署AI产品。
我们的平台自动化了几个关键过程:
- 评分:我们在现实场景中评估模型性能,重点关注诸如幻觉和安全性等重要标准。
- 测试生成:我们自动生成大规模的对抗性测试套件,以严格评估模型能力。
- 基准测试:我们比较不同的模型,以帮助客户确定哪一个最适合他们的特定用例。
企业更喜欢频繁的评估,以适应不断演变的模型、数据和用户需求。我们的平台作为第三方评估者,提供了一个无偏见的视角,类似于AI领域的穆迪公司。我们的早期合作伙伴包括领先的AI公司,如MongoDB (MDB ) 、Databricks、Cohere和Nomic AI,我们正在与传统行业的几家知名公司进行讨论,以试用我们的平台。
Patronus AI的Lynx模型在LLM输出中检测到哪些类型的错误或“幻觉”,以及它如何解决这些问题以帮助企业?
LLM确实是强大的工具,但它们的概率性质使它们容易出现“幻觉”,即模型生成不准确或不相关的信息。这些幻觉在高风险的商业环境中尤其成问题,因为准确性至关重要。
传统上,企业依赖手动检查来评估LLM输出,这不仅耗时,而且不具可扩展性。为了简化这一过程,Patronus AI开发了Lynx,这是一种专门的模型,增强了我们的平台的功能。Lynx提供了全面的测试覆盖和强大的性能保证,重点是识别可能对业务运营产生重大影响的关键错误,例如财务计算错误或法律文件审查中的错误。
通过Lynx,我们通过自动对抗性测试来减轻手动评估的局限性,探索广泛的潜在故障场景。这使我们能够检测到可能逃过人工评估者的问题,提供更可靠的结果,并让企业在关键应用中更有信心地部署LLM。
FinanceBench被描述为评估LLM在金融问题上的性能的首个基准。是什么金融领域的挑战促使开发了FinanceBench?
FinanceBench是为了应对金融领域在采用LLM时面临的独特挑战而开发的。金融应用需要高度的准确性和可靠性,因为错误可能导致重大财务损失或监管问题。尽管LLM在处理大量金融数据方面有前景,但我们的研究表明,像GPT-4和Llama 2这样的最先进模型在金融问题上往往难以检索准确的信息。
FinanceBench被创建为一个全面评估LLM在金融背景下的性能的基准。它包括10,000个基于公开可用的金融文档的问题和答案对,涵盖数字推理、信息检索、逻辑推理和世界知识等领域。通过提供这一基准,我们旨在帮助企业更好地了解当前模型的局限性,并找出需要改进的领域。
您的研究强调了领先的AI模型,特别是OpenAI的GPT-4,在被提示使用流行书籍摘录时会生成大量的受版权保护的内容。您认为这些发现对AI开发和更广泛的技术行业的长期影响是什么,特别是考虑到围绕AI和版权法的持续辩论?
AI模型生成受版权保护的内容是一个复杂且紧迫的问题。我们的研究表明,像GPT-4这样的模型在被提示使用流行书籍摘录时,往往会复制受版权保护的材料。这引发了关于知识产权和使用AI生成内容的法律影响的重要问题。
从长远来看,这些发现强调了制定清晰的指南和法规以规范AI和版权法的必要性。该行业必须致力于开发尊重知识产权的AI模型,同时保持其创造能力。这可能涉及改进训练数据集以排除受版权保护的材料,或实施检测和防止生成受保护内容的机制。
鉴于您的研究表明,领先的LLM以惊人的速度复制受版权保护的内容,作为AI开发者和整个行业,您认为需要采取什么步骤来解决这些问题?此外,Patronus AI如何计划为创建更负责任和合法的AI模型做出贡献?
解决AI模型复制受版权保护内容的问题需要采取多方面的方法。AI开发者和整个行业需要优先考虑透明度和问责制在AI模型开发中的重要性。这包括:
- 改进数据选择:确保训练数据集经过精心策划,以避免受版权保护的材料,除非获得适当的许可。
- 开发检测机制:实施系统以识别AI模型何时生成可能受版权保护的内容,并为用户提供修改或删除此类内容的选项。
- 建立行业标准:与法律专家和行业利益相关者合作,制定尊重知识产权的AI开发指南和标准。
在Patronus AI,我们致力于通过关注评估和合规性为负责任的AI开发做出贡献。我们的平台包括产品,如EnterprisePII,它帮助企业检测和管理AI输出中的潜在隐私问题。通过提供这些解决方案,我们旨在赋予企业使用AI的能力,同时尽量减少法律风险。
随着EnterprisePII和FinanceBench等工具的出现,您预计企业在部署AI(尤其是在金融和个人数据等敏感领域)方面会发生哪些变化?
这些工具为企业提供了更有效地评估和管理AI输出的能力,特别是在金融和个人数据等敏感领域。
在金融领域,FinanceBench使企业能够以高精度评估LLM的性能,确保模型满足金融应用的严格要求。这使企业能够更有信心和可靠性地利用AI执行任务,如数据分析和决策。
Patronus AI如何与公司合作,将这些工具集成到现有的LLM部署和工作流中?
在Patronus AI,我们了解AI采用中的无缝集成的重要性。我们与客户密切合作,以确保我们的工具可以轻松集成到他们现有的LLM部署和工作流中。这包括为每个客户提供:
- 定制集成计划:我们与每个客户合作,制定符合他们特定需求和目标的定制集成计划。
- 全面支持:我们的团队在整个集成过程中提供持续的支持,提供指导和帮助,以确保平稳过渡。
- 培训和教育:我们提供培训课程和教育资源,以帮助客户充分了解和利用我们的工具,赋予他们充分利用AI投资的能力。
考虑到确保AI输出安全、准确和符合各种法律法规的复杂性,您会给LLM开发者和希望使用它们的公司什么建议?
通过优先考虑合作和支持,我们旨在使集成过程尽可能直接和高效,允许企业解锁我们AI解决方案的全部潜力。
确保AI输出安全、准确和合规的复杂性带来了重大挑战。对于LLM开发者来说,关键是要在整个开发过程中优先考虑透明度和问责制。
质量的数据至关重要。开发者必须确保训练数据集经过精心策划,避免受版权保护的材料,除非获得适当的许可。这不仅有助于防止潜在的法律问题,还确保AI生成可靠的输出。此外,解决偏见和公平性问题至关重要。通过积极识别和减轻偏见,并开发多样化和具有代表性的训练数据,开发者可以减少偏见,确保所有用户的公平结果。
感谢您接受这次精彩的采访,希望了解更多的读者可以访问Patronus AI的网站。












