行业新闻

Einsia AI 发布 AI4AI-Bench 基准,测试 AI 能否设计更优算法

用真实研究仓库测试 AI 智能体能否设计出更优算法,当前最强模型也远未触及理论上限。

AI4AI-Bench 是 Einsia AI 发布的新基准,用来测试 AI 智能体能否改进 AI 算法本身。它让智能体在 10 个真实研究仓库中探索 4 小时,再独立重跑验证改动是否真的优于原算法。结果显示,Claude Opus 5 表现最强,但大多任务离理论最优仍有明显距离。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/98fe3e2e-4f1e-4aed-9274-b8649c21fe45/042(2).jpg) 导读 AI 能否改进 AI 自己? AI 已经会写 AI、训练 AI、优化 AI 系统;下一个里程碑,是 AI 能不能开始「设计 AI」。 对于今天的 Coding Agent 来说,它能介入的改进大致有三层: 系统工程解决算子、并行和通信,最终受硬件上限约束;数据工程改进配比、合成和清洗,受高质量信息供给限制;而算法设计改变的是目标函数、更新规则和训练流程本身。 这一层最特殊, 一个更好的算法改变的是:在同样的数据和算力下,究竟能换来多少能力。 Adam、DPO、GRPO 这样的进步一旦出现,就能持续影响之后的一代代模型。 所以,如果 Recursive Self-Improvement 真要形成闭环,关键问题就是: 「今天的 Agent,已经能开始设计更好的 AI 算法了吗?」 Einsia AI 旗下 Navers Lab 最新发布的 AI4AI-Bench ,盯上的正是这个问题,该 Benchmark 在 X 发布 7 小时后获得 110 万次浏览,引起了 2956 条相关讨论并登上 X 的 Today News。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-08-22原文

相关内容