MLS-Bench评测:140道真实研究题揭示AI方法创新短板
MLS-Bench 评测显示,前沿模型在真实研究任务中仍缺乏方法创新能力,只能调优已知组件,不能提出超越人类的算法。
MLS-Bench 用 140 个真实机器学习研究任务测试前沿模型,发现它们即使拿到人类最强方法实现并允许反复实验,整体表现仍无法超越人类;所谓“新方案”多是调优与重组。该评测已被 Kimi K3、Qwen3.8-Max 官方采用,指向 AI 是否真正具备科研能力。
正文摘录
 新智元报道  AI 已经能写代码、跑实验,甚至靠海量试错刷新部分人类纪录。 但当目标从「把一个分数继续刷高」,变成「提出一种真正更好的机器学习方法」,最强模型还能走多远? 一项覆盖 12 个领域、140 个真实研究任务的新工作 MLS-Bench 给出了并不乐观的答案。 即使拿到人类最强方法的完整实现,并被允许反复实验,当前前沿模型仍没有展示出可靠的方法创新能力。它们交出的所谓新方案,基本仍是对已知方法的调优与重新组合。 更值得注意的是, MLS-Bench 的评测已经进入 Kimi K3 和 Qwen3.8-Max 的官方发版表。 代码评测逐渐饱和后,头部模型厂商正在把下一个能力前沿指向同一个问题: AI 能否真正开展研究?  论文链接:https://arxiv.org/abs/2605.08678 项目主页:https://mls-bench.com/ 代码链接:https://github.com/Imbernoulli/MLS-Bench 在 Kimi K3 与 Qwen3.8-Max 的官方评测表中,MLS-Bench-Lite 与软件工程、终端操作和通用智能体评测并列出现。