动态

AI agent 15分钟通过HuggingFace实习测试,复现论文基线

AI agent 15分钟通过HuggingFace实习测试,复现论文基线
Aksel
这太疯狂了。ml-intern 刚刚在 15 分钟内通过了 @huggingface 的实习测试。

任务:复现 DeepMind 一篇关于测试时计算扩展的研究基线。

以下是 agent 所做的:

- 阅读 DeepMind 论文,深入附录 E,选择了正确的评分策略(最后一步 PRM 预测,而非最小/乘积——这很重要)

- 通过奖励模型对每个问题的 16 个解决方案进行评分,按最终答案分组,汇总分数,选择获胜者

- 准确率从 45% 提升到 65%。比贪婪搜索提高 20 个百分点。击败了多数投票和标准 Best-of-N

- 生成了 4 个图表,将完整的结果数据集推送到 Hub,在 T4 GPU 上部署了一个 Docker Space

最有趣的部分:它引用了 @lewtun 的代码片段作为参考。这个 intern 已经在引用你老板的工作来表现自己。

它还编写了 README,用论文引用记录了每个设计决策,并添加了合著说明,精确解释了哪些部分是由它完成的。

以下是它产出的所有内容:
完整文档:http://huggingface.co/blog/cmpatino/ml-intern-takehome
训练模型:http://huggingface.co/cmpatino/math500-bon-exercise
数据集:http://huggingface.co/datasets/cmpatino/math500-bon-weighted-results
实习测试:http://github.com/huggingface/post-training-takehome
Aksel
介绍 ml-intern,这个 agent 刚刚自动化了 @huggingface 的 post-training 团队

它是我们 ML 研究人员每天实际研究循环的开源实现。你给它一个提示,它会研究论文,查阅引用,在 GPU 上实现想法 https://t.co/USLWv6lKz9
动态Aksel2026-04-23原文

相关内容