建议用真实失败样例做A/B测试评估AI模型
别用“你聪明吗”或脑筋急转弯测试。拿真实失败样例做 A/B:
A=全新任务
B=原来的长任务
固定模型、档位、输入、权限和验收标准。
我的建议是快速排查各跑 3 次;公开下结论前增加到 10 次,并保留原始结果。
记录漏约束数、测试通过率、事实错误和重试次数。代码题必须真跑测试。
A=全新任务
B=原来的长任务
固定模型、档位、输入、权限和验收标准。
我的建议是快速排查各跑 3 次;公开下结论前增加到 10 次,并保留原始结果。
记录漏约束数、测试通过率、事实错误和重试次数。代码题必须真跑测试。