今年AI突破在长周期任务,LLM与Agent结合
最近思考:
转向长期任务
今年最有可能的突破将在长期任务领域。我们正在进入一个阶段,大语言模型(LLM)通过与Agent环境交互来学习完成扩展的复杂任务。这或许才是LLM的真正价值所在。以网络安全为例:想象一个持续寻找软件漏洞和缺陷的模型。虽然听起来像搜索过程,但实际上模型正在学习专业黑客的高层直觉和方法论。不像人类,AI可以24小时不间断工作。它可能以更高的频率发现漏洞,并在HackerOne或BugCrowd等平台上获取赏金。听起来有趣,但根本上,这是一场取代黑客的革命。如果连黑客都被“颠覆”,那么对普通程序员的影响可想而知。
从一人公司到无人公司
在长期能力的基础上,自主Agent系统(AAS)必将成为下一个前沿。去年我们讨论“一人公司”(OPC)的兴起。我没想到会如此迅速地向“无人公司”(NPC)迈进。这是一个讽刺的转折——我们最终都可能成为这个新生态系统中的NPC。
工程化不可能:记忆与学习
为实现上述愿景,我们必须解决三大技术支柱:记忆、持续学习和自我判断。
我曾以为这些需要巨大的范式转变和多年研究。然而,来自技术和应用两方面的压力如此之大,以至于我们看到这些能力通过巧妙的工程“技巧”涌现:
记忆:长上下文窗口(1M+)和RAG显著缩小了差距。
持续学习:真正的持续学习仍然困难,但发布周期正在缩短。全球模型每月更新;国内模型正在追赶。如果明年实现每周更新,那实际上就相当于持续学习。
自我判断:这仍然是最难以捉摸的,但像Opus 4.7这样的模型已经展现出早期的自我修正和判断能力。
自我进化的终局
最困难但也最有前途的道路是自我进化。当前浪潮非常猛烈。我怀疑像Claude这样的模型可能已经实现了自我训练的基础:编写自己的代码、清洗自己的数据、生成合成数据并进行训练。它可能会“浪费”一些算力,但节省了最宝贵的资源:人力和时间。在LLM时代,速度就是一切。快速迭代造就了领导者与追随者之间的认知差距。传闻Claude明年将拥有200万芯片集群,很可能正是用于此:自主模型自我训练。
技术总结:
1M上下文:必要基线。
记忆与持续学习:先决条件,可能首先通过“巧妙的”工程解决。
利用环境:突破点。
自我判断:引爆点。
完全自我训练:终局。
重新定义AGI与行业
如果这是通往AGI的道路,那么AGI的定义应该是所有人类集体智能的总和,而不仅仅是个体智能。它必须具有创造像“相对论”那样深刻作品的能力——达到Hassabis设定的标准。
在这一转型过程中,每个APP都需要被重构为AI原生。事实上,我们可能完全超越APP的概念。最大的挑战将是操作系统本身的重构。未来,你不会看到传统的桌面;你将看到一个LLM OS,其中应用程序是“按需生成”的。这挑战了已有80年历史的冯·诺依曼架构,代表了计算机科学行业的彻底颠覆。
不可逆转的浪潮
从完成长期任务到完全自主操作,每个部门——安全
转向长期任务
今年最有可能的突破将在长期任务领域。我们正在进入一个阶段,大语言模型(LLM)通过与Agent环境交互来学习完成扩展的复杂任务。这或许才是LLM的真正价值所在。以网络安全为例:想象一个持续寻找软件漏洞和缺陷的模型。虽然听起来像搜索过程,但实际上模型正在学习专业黑客的高层直觉和方法论。不像人类,AI可以24小时不间断工作。它可能以更高的频率发现漏洞,并在HackerOne或BugCrowd等平台上获取赏金。听起来有趣,但根本上,这是一场取代黑客的革命。如果连黑客都被“颠覆”,那么对普通程序员的影响可想而知。
从一人公司到无人公司
在长期能力的基础上,自主Agent系统(AAS)必将成为下一个前沿。去年我们讨论“一人公司”(OPC)的兴起。我没想到会如此迅速地向“无人公司”(NPC)迈进。这是一个讽刺的转折——我们最终都可能成为这个新生态系统中的NPC。
工程化不可能:记忆与学习
为实现上述愿景,我们必须解决三大技术支柱:记忆、持续学习和自我判断。
我曾以为这些需要巨大的范式转变和多年研究。然而,来自技术和应用两方面的压力如此之大,以至于我们看到这些能力通过巧妙的工程“技巧”涌现:
记忆:长上下文窗口(1M+)和RAG显著缩小了差距。
持续学习:真正的持续学习仍然困难,但发布周期正在缩短。全球模型每月更新;国内模型正在追赶。如果明年实现每周更新,那实际上就相当于持续学习。
自我判断:这仍然是最难以捉摸的,但像Opus 4.7这样的模型已经展现出早期的自我修正和判断能力。
自我进化的终局
最困难但也最有前途的道路是自我进化。当前浪潮非常猛烈。我怀疑像Claude这样的模型可能已经实现了自我训练的基础:编写自己的代码、清洗自己的数据、生成合成数据并进行训练。它可能会“浪费”一些算力,但节省了最宝贵的资源:人力和时间。在LLM时代,速度就是一切。快速迭代造就了领导者与追随者之间的认知差距。传闻Claude明年将拥有200万芯片集群,很可能正是用于此:自主模型自我训练。
技术总结:
1M上下文:必要基线。
记忆与持续学习:先决条件,可能首先通过“巧妙的”工程解决。
利用环境:突破点。
自我判断:引爆点。
完全自我训练:终局。
重新定义AGI与行业
如果这是通往AGI的道路,那么AGI的定义应该是所有人类集体智能的总和,而不仅仅是个体智能。它必须具有创造像“相对论”那样深刻作品的能力——达到Hassabis设定的标准。
在这一转型过程中,每个APP都需要被重构为AI原生。事实上,我们可能完全超越APP的概念。最大的挑战将是操作系统本身的重构。未来,你不会看到传统的桌面;你将看到一个LLM OS,其中应用程序是“按需生成”的。这挑战了已有80年历史的冯·诺依曼架构,代表了计算机科学行业的彻底颠覆。
不可逆转的浪潮
从完成长期任务到完全自主操作,每个部门——安全