融资
Gentrace 获得 800 万美元 A 轮融资,革新生成式 AI 测试

Gentrace,一个用于测试和监控生成式 AI 应用的尖端平台,宣布已成功完成 800 万美元 A 轮融资,由 Matrix Partners 领投,Headline 和 K9 Ventures 跟投。这一融资里程碑将公司的总融资金额提升到 1400 万美元,恰逢其旗舰工具 Experiments 的发布——这是一种开创性的解决方案,旨在使 大型语言模型 (LLM) 测试更加便捷、协作和高效地在组织中进行。
全球范围内将生成式 AI 集成到各个行业中的努力——从教育到电子商务——已经创造了对可靠、安全、符合用户需求的 AI 系统的迫切需求。然而,现有的解决方案往往是碎片化的、技术密集的,并且仅限于工程团队。Gentrace 致力于打破这些障碍,通过一个促进跨职能协作的平台,使产品经理、质量保证 (QA) 专家等利益相关者能够在完善 AI 应用方面发挥积极作用。
“生成式 AI 带来了难以置信的机会,但其复杂性往往阻碍了广泛的实验和可靠的开发,” Doug Safreno,Gentrace 的 CEO 和联合创始人 说。 “通过 Gentrace,我们不仅仅是在构建一个工具,而是在构建一个框架,使组织能够协作和高效地开发可靠的、性能优异的 AI 系统。”
应对生成式 AI 开发的挑战
生成式 AI 的崛起是迅速的,但其部署所带来的挑战也同样迅速增长。像 GPT(生成式预训练转换器)这样的模型需要进行大量测试,以验证其响应、识别错误,并确保在实际应用中的安全性。根据市场分析师的预测,生成式 AI 工程领域预计将在 2030 年达到 38.7 亿美元,年复合增长率 (CAGR) 为 34.2%。这一增长凸显了更好的测试和监控工具的迫切需求。
历史上,AI 测试依赖于手动工作流、电子表格或以工程为中心的平台,这些平台在面对企业级需求时无法有效扩展。这些方法还会创建信息孤岛,阻止工程团队以外的团队(如产品经理或合规官员)积极参与评估过程。Gentrace 的平台通过三大支柱方法解决这些问题:
- 专用测试环境
Gentrace 允许组织模拟现实世界场景,使 AI 模型能够在模拟实际使用条件的环境中进行评估。这确保开发人员可以在部署之前识别边缘情况、安全问题和其他风险。 - 全面性能分析
对 LLM 性能的详细见解,例如成功率、错误率和响应时间指标,允许团队识别趋势并不断提高模型质量。 - 通过实验实现跨职能协作
新推出的 Experiments 工具使产品团队、主题专家和 QA 专家能够直接测试和评估 AI 输出,而无需编码专业知识。通过支持与 OpenAI、Pinecone 和 Rivet 等工具的工作流集成,Experiments 确保在组织中实现无缝采用。
什么使 Gentrace 与众不同?
Gentrace 的 Experiments 工具旨在使 AI 测试民主化。传统工具通常需要技术专业知识,将非工程团队排除在关键评估过程之外。相比之下,Gentrace 的无代码界面允许用户直观地测试 AI 系统。Experiments 的主要功能包括:
- 直接测试 AI 输出: 用户可以直接在平台内与 LLM 输出交互,使评估现实世界性能变得更加容易。
- “假设” 场景: 团队可以通过运行模拟不同输入条件或边缘情况的假设测试来预测潜在的故障模式。
- 预览部署结果: 在部署更改之前,团队可以评估更新将如何影响性能和稳定性。
- 支持多模态输出: Gentrace 不仅评估基于文本的输出,还评估多模态结果,例如图像到文本或视频处理管道,使其成为高级 AI 应用的多功能工具。
这些功能使组织能够从被动式调试转变为主动式开发,减少部署风险并提高用户满意度。
行业领先者的显著成果
Gentrace 的创新方法已经在早期采用者中获得了认可,包括 Webflow、Quizlet 和一家财富 100 强零售商。这些公司报告了变革性的结果:
- Quizlet: 将测试吞吐量提高了 40 倍,将评估周期从几小时缩短到不到一分钟。
- Webflow: 改进了工程和产品团队之间的协作,实现了 AI 功能的快速最后一英里调优。
“Gentrace 使 LLM 评估成为一个协作过程。它是我们 AI 工程栈中的一项关键部分,用于为用户提供有价值的功能,” Webflow 的联合创始人和首席架构师 Bryant Chou 说。
Quizlet 的机器学习工程师 Madeline Gilbert 强调了该平台的灵活性: “Gentrace 允许我们实现定制评估,以满足我们的特定需求。它极大地提高了我们预测 AI 模型更改影响的能力。”
具有远见的创始团队
Gentrace 的领导团队结合了 AI、DevOps 和软件基础设施方面的专业知识:
- Doug Safreno (CEO): 曾是 StacksWare 的联合创始人,StacksWare 是一家被 VMware 收购的企业可观察性平台。
- Vivek Nair (CTO): 曾在 Uber 和 Dropbox 建立了可扩展的测试基础设施。
- Daniel Liem (COO): 曾在高增长科技公司推动运营卓越。
该团队还吸引了来自 Figma、Linear 和 Asana 等领先公司的顾问和天使投资者,这进一步验证了他们的使命和市场地位。
为未来扩展
凭借新获得的资金,Gentrace 计划扩大其工程、产品和市场团队,以支持日益增长的企业需求。开发路线图包括高级功能,如 基于阈值的实验(自动识别性能阈值)和 自动优化(根据评估数据动态提高模型)。
此外,Gentrace 致力于增强其合规性和安全能力。该公司最近获得了 ISO 27001 认证,体现了其保护客户数据的承诺。
Gentrace 在更广泛的 AI 生态系统中
该平台的最近更新凸显了其持续创新:
- 本地评估和数据集: 允许团队在自己的基础设施中安全地使用专有或敏感数据。
- 比较评估器: 支持头对头测试,以确定表现最好的模型或管道。
- 生产监控: 提供模型在部署后性能的实时洞察,帮助团队在问题升级之前发现问题。
合作伙伴支持和市场验证
Matrix Partners 的 Kojo Osei 强调了该平台的价值: “生成式 AI 只有在组织能够信任其输出时才会实现其全部潜力。Gentrace 正在为 AI 可靠性和可用性设定新的标准。”
Headline 的合伙人 Jett Fein 补充说: “Gentrace 能够无缝集成到复杂的企业工作流中,使其对于大规模部署 AI 的组织来说不可或缺。”
塑造生成式 AI 的未来
随着生成式 AI 持续重塑各个行业,像 Gentrace 这样的工具将在确保其安全和有效实施方面发挥至关重要的作用。通过使多样化的团队能够为测试和开发做出贡献,Gentrace 正在促进 AI 领域的协作和责任感文化。












