与OpenAI研究员讨论大型测试时计算的影响
再次与我的朋友🃏@polynoamial(OpenAI研究科学家,2023年初我们@NoPriorsPod的首位嘉宾)相聚,讨论大型测试时计算的影响,以及当模型在单个任务上获得1000万美元预算时会发生什么,非常有趣。主题:
01:23 – 为什么基准测试已失效
04:19 – 计算预算与预测
06:48 – 模型应该思考多久?
08:01 – 基准最大化
09:48 – Noam的评估
12:40 – 安全性(当模型能力随支出扩展时)
16:09 – 对模型发布周期的影响
18:34 – 潜在模型能力
22:27 – 递归自我改进的限制
28:38 – 大规模多智能体协调
30:39 – 前沿竞争
33:19 – 打破基准网格均衡
34:57 – 为什么基准测试应按成本缩放
01:23 – 为什么基准测试已失效
04:19 – 计算预算与预测
06:48 – 模型应该思考多久?
08:01 – 基准最大化
09:48 – Noam的评估
12:40 – 安全性(当模型能力随支出扩展时)
16:09 – 对模型发布周期的影响
18:34 – 潜在模型能力
22:27 – 递归自我改进的限制
28:38 – 大规模多智能体协调
30:39 – 前沿竞争
33:19 – 打破基准网格均衡
34:57 – 为什么基准测试应按成本缩放