Dwarkesh Patel 称下一代 AI 训练需要真实世界任务
下一代 AI 不能只靠可刷题任务训练,需要在真实世界中获取反馈并内化为长期能力。
RLVR(可验证奖励强化学习,一种让模型通过可自动判断对错的任务反复试错的训练方法)在代码、数学等可复制任务上效果显著,但真实世界任务如创业、法律难以并行试错。Dwarkesh Patel 认为,AI 需在部署后从真实反馈中持续学习并沉淀到模型权重。
正文摘录
.jpg) 硅谷著名科技播客主持人 Dwarkesh Patel 最近抛出了一个问题:AI 的下一代训练范式会是什么?  Dwarkesh Patel 是硅谷近几年快速走红的科技播客主持人和写作者,年仅 25 岁,却已经凭借 Dwarkesh Podcast 进入 AI 讨论的核心圈层。他的采访对象包括 Ilya Sutskever、Andrej Karpathy、Dario Amodei、Demis Hassabis、Mark Zuckerberg 等一众 AI 与科技大牛。TIME 曾将他列入 2024 年 TIME100 AI,称他的播客已经成为许多 AI 从业者的重要收听内容。