行业新闻

OpenAI研究员:大规模测试时计算改变AI基准测试与安全

OpenAI研究员:大规模测试时计算改变AI基准测试与安全

AI模型能力不仅取决于训练,还取决于推理时思考多久。现有基准测试和安全性评估需彻底重构。

嘉宾Noam Brown

节目简介

传统AI基准测试不考虑模型思考时间,导致评估失真。OpenAI研究员Noam Brown指出,大规模测试时计算(允许模型推理数周甚至数月)正从根本上改变模型能力评估和安全性框架。研究表明,提升测试时计算量可让模型解决更复杂问题,但现有安全测试完全无法覆盖这一维度。

阅读原文(No Priors)→

行业新闻Conviction2026-06-26原文

相关内容