行业新闻

开源Agent框架Prime Agent声称ARC-AGI-3得分95.5%

Prime Agent将RLM工程化,让AI在陌生任务中动态调整策略,极限测试接近人类水平。

Prime Intellect发布开源框架Prime Agent,称其在ARC-AGI-3(一套完全陌生的抽象推理测试)上联合Opus 5拿下95.5%,超过人类专家。它基于递归语言模型(把上下文当变量用代码操作),并让Agent在运行时自主改写工具和提示词,实现自我改进。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/30b4d4fc-cf28-46db-903b-388d68c9cabf/0(2).jpg) 一款新开源的智能体框架(harness),声称在 ARC-AGI-3 上联合 Opus 5 拿到了 95.5% 的成绩,超过人类专家基线。官方帖子迅速获得大量关注,GitHub 星标已接近 5 千。 ![图片](https://mmbiz.qpic.cn/mmbizpng/5L8bhP5dIqGj7Qjmbnao80qn0AReiaIxuO4v2Xu5UoeuGT912XJ7E14oe903hE885eYjzfibMu5zcZquYibiaicXkthZEsOUe0WwLiciaKP19X4S4k/640?wxfmt=png&from=appmsgimgIndex=1) 要知道,ARC-AGI-3 不是那种「刷过题库就能拿高分」的考试,它是一堆完全陌生的抽象游戏,每个游戏的规则、目标、甚至操作逻辑都不相同。你进去之后,没人告诉你该做什么,你得自己摸索、试错、归纳,然后在有限的行动预算内完成目标。 ![图片](https://mmbiz.qpic.cn/mmbizpng/5L8bhP5dIqGAlzuncYUzTTicLOXKgW8Wy735FKzdLomRJqhpFWeAH7sicGrD2LenwLtkjFoRcCPq2WGxo3Mj0KfZLPISZuNCo94JSvP5LluFM/640?wxfmt=png&from=appmsgimgIndex=2) 这个框架名叫 Prime Agent ,由 Prime Intellect 发布。官方对它的定义是: 一个面向编程、研究和长时间自主任务的「自我改进 RLM harness」 。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-08-07原文

相关内容