动态

建议用真实失败样例做A/B测试评估AI模型

Vincent
别用“你聪明吗”或脑筋急转弯测试。拿真实失败样例做 A/B:

A=全新任务
B=原来的长任务

固定模型、档位、输入、权限和验收标准。

我的建议是快速排查各跑 3 次;公开下结论前增加到 10 次,并保留原始结果。

记录漏约束数、测试通过率、事实错误和重试次数。代码题必须真跑测试。
动态Vincent2026-07-14原文

相关内容