让 agent 自查以产出高质量结果:端到端测试、属性测试等实践建议
要让你的 agent 产出高质量结果,就给它配备一种能检查自身工作的方法。测试就是其中一环。
以下是我认为值得投入的几类测试。
- 编写端到端测试,模拟真实用户流程,并作为判定基准真值(ground truth)
- 使用基于属性的测试来规定「绝不应发生」的情况,并生成成千上万个试图打破这些约束的测试用例
- 如果要替换某个系统,用随机选取的输入对比新旧两个版本
- 要求测试运行得又快又具确定性,这会强化 agent 在循环缓慢或不可靠时重试的倾向(agent 可能会学会重试,而不是去修复问题)
示例型测试描述应该发生什么;属性则规定绝不能发生什么。
以下是我认为值得投入的几类测试。
- 编写端到端测试,模拟真实用户流程,并作为判定基准真值(ground truth)
- 使用基于属性的测试来规定「绝不应发生」的情况,并生成成千上万个试图打破这些约束的测试用例
- 如果要替换某个系统,用随机选取的输入对比新旧两个版本
- 要求测试运行得又快又具确定性,这会强化 agent 在循环缓慢或不可靠时重试的倾向(agent 可能会学会重试,而不是去修复问题)
示例型测试描述应该发生什么;属性则规定绝不能发生什么。