AgentScore 面向 AI 智能体开发者的评测监控工具,接入生产环境智能体后每日输出质量评分,覆盖效果、可靠性、成本、速度与安全,帮助判断版本迭代是否真的变好。 热门评论 PH 用户Hey Product Hunt 👋 我是 César,Latitude 的创始人。过去一年里,我们和很多在生产环境跑 AI 智能体的团队聊过。在所有这些交流中,有一个问题反复出现:你的智能体有没有随着时间变得更好?大多数团队能就几个回归测试或孤立指标给出答案,但没法回答整个智能体的情况。现在的 eval 系统有个覆盖率问题。所以我们做了 Agent Score。连接你的 production traces,Latitude 就会自动从这些维度评估你的智能体:• 结果• 可靠性• 成本• 速度• 安全性它把所有东西汇总成一个每天更新的质量评分,这样你就能看到智能体是不是在变好、是什么在拉低它的分数,以及每个结果背后的生产会话。然后,Latitude 会帮你排查反复出现的失败、持续跟踪它们,并把证据发给你的编程智能体去发起修复。我们很希望你来试试 Agent Score,然后告诉我们你的想法。任何反馈都超级欢迎 🙏PH 用户OSS 万岁!PH 用户把“结果/可靠性/成本/速度/安全性汇总成一个分数”这个框架挺有用,但我也担心单一数字会掩盖取舍:一个智能体如果稍微牺牲可靠性来变得更快、更便宜,而权重又偏向成本,总分可能看起来持平甚至还在上升。你们也会单独展示这五个子分数吗,还是每日分数真的就是一个混合值,完全看不出是哪个维度变了?PH 用户每天一个分数是挺好,但我会担心它藏东西。比如成本降了,但结果质量稍微掉了,总分可能看起来还是没问题我们能自己给每个类别设权重吗?对我们来说,安全性比速度重要多了顺便恭喜第 9 次发布,太猛了PH 用户@heycesr 和 @paula_cavero 恭喜 #AgentScore 发布 🌟✌️。快速问一下,把生产智能体关联起来需要写代码吗,还是更偏被动集成?PH 用户它能检测出传统 logs 和 traces 通常会漏掉的问题吗? 热门产品César M.2026-09-23原文 打开互动版
过去一年里,我们和很多在生产环境跑 AI 智能体的团队聊过。在所有这些交流中,有一个问题反复出现:
你的智能体有没有随着时间变得更好?
大多数团队能就几个回归测试或孤立指标给出答案,但没法回答整个智能体的情况。现在的 eval 系统有个覆盖率问题。
所以我们做了 Agent Score。
连接你的 production traces,Latitude 就会自动从这些维度评估你的智能体:
• 结果
• 可靠性
• 成本
• 速度
• 安全性
它把所有东西汇总成一个每天更新的质量评分,这样你就能看到智能体是不是在变好、是什么在拉低它的分数,以及每个结果背后的生产会话。
然后,Latitude 会帮你排查反复出现的失败、持续跟踪它们,并把证据发给你的编程智能体去发起修复。
我们很希望你来试试 Agent Score,然后告诉我们你的想法。任何反馈都超级欢迎 🙏
我们能自己给每个类别设权重吗?对我们来说,安全性比速度重要多了
顺便恭喜第 9 次发布,太猛了