OpenAI研究员:大规模测试时计算改变AI基准测试与安全
AI模型能力不仅取决于训练,还取决于推理时思考多久。现有基准测试和安全性评估需彻底重构。
嘉宾Noam Brown
节目简介
传统AI基准测试不考虑模型思考时间,导致评估失真。OpenAI研究员Noam Brown指出,大规模测试时计算(允许模型推理数周甚至数月)正从根本上改变模型能力评估和安全性框架。研究表明,提升测试时计算量可让模型解决更复杂问题,但现有安全测试完全无法覆盖这一维度。
AI模型能力不仅取决于训练,还取决于推理时思考多久。现有基准测试和安全性评估需彻底重构。
嘉宾Noam Brown
传统AI基准测试不考虑模型思考时间,导致评估失真。OpenAI研究员Noam Brown指出,大规模测试时计算(允许模型推理数周甚至数月)正从根本上改变模型能力评估和安全性框架。研究表明,提升测试时计算量可让模型解决更复杂问题,但现有安全测试完全无法覆盖这一维度。