行业新闻

Dwarkesh Patel 称下一代 AI 训练需要真实世界任务

下一代 AI 不能只靠可刷题任务训练,需要在真实世界中获取反馈并内化为长期能力。

RLVR(可验证奖励强化学习,一种让模型通过可自动判断对错的任务反复试错的训练方法)在代码、数学等可复制任务上效果显著,但真实世界任务如创业、法律难以并行试错。Dwarkesh Patel 认为,AI 需在部署后从真实反馈中持续学习并沉淀到模型权重。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/46af6072-7119-4f82-bd1a-b3c7738d611e/05(2).jpg) 硅谷著名科技播客主持人 Dwarkesh Patel 最近抛出了一个问题:AI 的下一代训练范式会是什么? ![图片](https://mmbiz.qpic.cn/mmbizpng/5L8bhP5dIqEYsKXCQbkQdMl1fO0MRjGP6fkMibfWbXtjGIdQrXMIGX1c1Uak3ic5h1Z1KCR7fubQWdckQLDq3u6VYOttYI1icx1gC24jGUunpQ/640?wxfmt=png&from=appmsgimgIndex=1) Dwarkesh Patel 是硅谷近几年快速走红的科技播客主持人和写作者,年仅 25 岁,却已经凭借 Dwarkesh Podcast 进入 AI 讨论的核心圈层。他的采访对象包括 Ilya Sutskever、Andrej Karpathy、Dario Amodei、Demis Hassabis、Mark Zuckerberg 等一众 AI 与科技大牛。TIME 曾将他列入 2024 年 TIME100 AI,称他的播客已经成为许多 AI 从业者的重要收听内容。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-06-28原文

相关内容