Patronus AI获5000万美元融资,构建数字世界压力测试AI智能体
Patronus AI用数字世界模拟环境对AI智能体进行压力测试,防止它们走捷径,确保任务可靠执行。
AI智能体正从回答问题转向自主执行多步复杂任务,但标准测试无法验证其在真实场景中的可靠性。Patronus AI构建模拟数字环境,用强化学习反复测试智能体并惩罚“作弊”行为,帮模型提供商和初创公司确保AI能正确完成旅行预订、财务分析等工作。该公司年收入增长15倍,总融资达7000万美元。
正文摘录
Patronus AI 获 5000 万美元融资,构建“数字世界”对 AI Agent 进行压力测试 AI Agent 正变得越来越复杂。它们已从回答问题演化到能自主执行多步骤的复杂任务。 但在这些 Agent 能够可靠地代表用户预订旅行或进行财务分析之前,模型提供商以及构建此类 Agent 的初创公司希望确保它们能在海量场景下稳定运行。 AI 实验室经常使用基准测试(benchmark)来展示模型的实力,但高分——即使在面向 Agent 的基准测试上——并不能真正证明 AI 能正确完成各种复杂的现实工作。 [Patronus AI](https://www.patronus.ai/) 是一家由前 Meta AI 研究员 Anand Kannappan 和 Rebecca Qian 于 2023 年创立的初创公司,它通过构建模拟数字环境来评估 Agent 的表现,帮助模型制造商和公司对模型进行微调。 这家总部位于旧金山的初创公司想必正在解决一个重要问题。据 Notable Capital 董事总经理 Glenn Solomon 称,几乎所有前沿 AI 实验室和许多新兴初创公司都已成为其客户,他将公司对模拟环境的需求描述为“几乎无法满足”。 Patronus 的营收在过去一年增长了 15 倍,吸引了大批投资者的兴趣。周四,该公司宣布获得 5000 万美元的 B 轮融资,由 Greenfield Partners 领投,Notable Capital、Lightspeed、Datadog 和 Samsung 参投。此轮融资使公司总融资额达到 7000 万美元。 Patronus 使用其所谓的“数字世界模型”来创建网站和内部系统的副本。