Hugging Face的ml-intern agent自动化ML训练流程,性能超越Codex
很喜欢Aksel和Hugging Face后训练团队的这项工作!
原来HF生态(通过CLI、技能和md文件访问的论文、数据集、模型)非常适合运行SOTA ML agent:能够训练任意类型AI模型达到顶尖性能的agent。
几个具体运行示例:
科学推理:agent从基准论文中提取引用,拉取OpenScience和NemoTron-CrossThink,添加ARC/SciQ/MMLU中7个难度过滤变体,在Qwen3-1.7B上运行12次SFT消融实验。GPQA在10小时内从10%提升到32%。相同提示下Claude Code最好成绩为22.99%。
HealthBench:它判断现有数据集噪声太大(!),生成1100个涵盖紧急情况、对冲和多语言场景的合成样本,50倍上采样,比Codex高出60%(需注意过拟合问题)
竞技数学:编写完整的GRPO脚本,在HF Spaces上启动A100,观察奖励先升后降,运行消融实验直到找到稳定方案。
而且这个工具箱非常小巧简洁。几条最佳实践和几个指向生态中现有工具的技能:用于阅读的arxiv和http://hf.co/papers,用于数据集和模型的Hub,用于计算的HF Jobs,用于指标的Trackio。
个人最喜欢的是“研究技能”,它解释了如何进行领域的SOTA调研(见https://github.com/huggingface/ml-intern/blob/main/agent/tools/research_tool.py…),结合一个简单的提示(基本上是“第一步:搜索HF生态找到最佳方案”,见https://github.com/huggingface/ml-intern/blob/main/agent/prompts/system_prompt.yaml#L14…),效果非常强大。
另一方面:当如此简单的设置能直接在HealthBench上比原始Codex高出60%时,为新基准设定好的基线变得越来越困难。
如果你在训练AI模型,不妨一试。我们为最快速的你们准备了1000美元的GPU资源和Anthropic信用额度。
链接:
Github (CLI): https://github.com/huggingface/ml-internWeb…
Spaces (移动端): https://huggingface.co/spaces/smolagents/ml-intern…
原来HF生态(通过CLI、技能和md文件访问的论文、数据集、模型)非常适合运行SOTA ML agent:能够训练任意类型AI模型达到顶尖性能的agent。
几个具体运行示例:
科学推理:agent从基准论文中提取引用,拉取OpenScience和NemoTron-CrossThink,添加ARC/SciQ/MMLU中7个难度过滤变体,在Qwen3-1.7B上运行12次SFT消融实验。GPQA在10小时内从10%提升到32%。相同提示下Claude Code最好成绩为22.99%。
HealthBench:它判断现有数据集噪声太大(!),生成1100个涵盖紧急情况、对冲和多语言场景的合成样本,50倍上采样,比Codex高出60%(需注意过拟合问题)
竞技数学:编写完整的GRPO脚本,在HF Spaces上启动A100,观察奖励先升后降,运行消融实验直到找到稳定方案。
而且这个工具箱非常小巧简洁。几条最佳实践和几个指向生态中现有工具的技能:用于阅读的arxiv和http://hf.co/papers,用于数据集和模型的Hub,用于计算的HF Jobs,用于指标的Trackio。
个人最喜欢的是“研究技能”,它解释了如何进行领域的SOTA调研(见https://github.com/huggingface/ml-intern/blob/main/agent/tools/research_tool.py…),结合一个简单的提示(基本上是“第一步:搜索HF生态找到最佳方案”,见https://github.com/huggingface/ml-intern/blob/main/agent/prompts/system_prompt.yaml#L14…),效果非常强大。
另一方面:当如此简单的设置能直接在HealthBench上比原始Codex高出60%时,为新基准设定好的基线变得越来越困难。
如果你在训练AI模型,不妨一试。我们为最快速的你们准备了1000美元的GPU资源和Anthropic信用额度。
链接:
Github (CLI): https://github.com/huggingface/ml-internWeb…
Spaces (移动端): https://huggingface.co/spaces/smolagents/ml-intern…
介绍ml-intern,这个agent刚刚自动化了@huggingface的后训练团队
这是我们的ML研究人员每天进行的真实研究循环的开源实现。你给它一个提示,它研究论文,遍历引用,在GPU上实现想法https://t.co/USLWv6lKz9