动态

AI能力认知分裂:免费模型 vs 前沿代理模型

Andrej Karpathy
从我的时间线判断,人们对AI能力的理解差距越来越大。第一个问题我认为与使用的新旧程度和层级有关:很多人去年尝试了ChatGPT的免费版,并因此过度影响了他们对AI的看法——他们嘲笑模型的怪癖、幻觉等。是的,我也看过OpenAI高级语音模式在处理"我应该开车还是步行去洗车"这种简单问题时出糗的视频。问题是,这些免费且过时/废弃的模型并不能反映今年最新一代最先进的代理模型(尤其是OpenAI Codex和Claude Code)的能力。

但这就引出了第二个问题:即使有人每月花200美元使用最先进的模型,很多能力在高度技术领域上仍然是"尖峰"的。典型的搜索、写作、建议等查询,并非能力进步最显著、最惊人的领域。部分原因在于强化学习的技术细节以及可验证奖励的使用。但部分原因也在于,这些用例并未被公司优先考虑,因为它们带来的金钱价值不够高。金矿在其他地方,关注点也随之转移。

这就引出了第二类人:他们既1)付费使用最前沿的代理模型(OpenAI Codex / Claude Code),又2)在编程、数学和研究等技术领域专业地使用它们。这类人最容易患上"AI 妄想症",因为今年在这些领域的改进简直令人震惊。当你把计算机终端交给这类模型时,你可以看到它们解决通常需要几天/几周工作的编程问题。正是这第二类人认为AI的能力、其增速以及各种网络相关影响具有更重大的意义。

简而言之,这两类人正在各说各话。现实情况是,OpenAI的免费且似乎被遗弃的"高级语音模式"会在你的Instagram Reels中回答最愚蠢的问题,同时OpenAI最高级别付费的Codex模型会花一个小时连贯地重构整个代码库,或者发现并利用计算机系统中的漏洞。这部分确实有效并取得了巨大进步,原因有二:1)这些领域提供了明确的、可验证的奖励函数,易于进行强化学习训练(例如单元测试通过与否,而写作则更难明确评判),2)在B2B环境中价值更高,意味着团队最大的精力集中在改进它们。所以,现状如此。
staysaasy
你对AI的惊叹程度,与你用AI编程的频率完美相关。
动态Andrej Karpathy2026-04-09原文

相关内容