动态

自研AutoResearch Agent开源,实现全自动GPU实验

Deli Chen
🧵 Deli AutoResearch SKILL 现已正式开源!🎉
https://t.co/V3lwwdyQm8

同时,我们发布了第四篇调研论文——这次是关于自我对抗(Self-play)。
https://t.co/SEb2qoKCI6

受AlphaZero启发,我们获得了一个强有力的洞见:先验知识并不总能提升上限。
模型仅通过自我对抗便能发现更全局的最优解。

本篇论文最大的变化?
AutoResearch Agent首次自主规划GPU实验——并在DeepSeek 285B模型上提交了实际的强化学习任务。

整个强化学习流程——实验设计、代码编写、运行、调试和结论总结——100%自动化,零人为干预。
这极其困难,但却是非常重要的一步。
https://t.co/kuZZNux5RH

GRPO是AutoResearch Agent在此调用的工具。
我们将此视为持续学习研究之旅的开端。🚀

一如既往,这是我个人的研究项目,与任何组织无关。所有观点均为我本人观点。

#AI #强化学习 #自我对抗 #开源 #自动机器学习 #持续学习 #DeepSeek
动态Deli Chen2026-06-17原文

相关内容