Hugging Face 推出 ML Intern,让 agent 复现论文。
RT @abidlabs: 🚨 公开分享科学知识的激励正在瓦解。
历史上,研究人员分享科学知识主要出于两个原因:(1) 发现所带来的声望,以及 (2) 一种扩展人类知识总量的使命感。即便在产业界,科学发现也远非单个科学家或团队能够独自完成。因此,科学家们探索不同前沿,通常会发表自己的发现,并共同推动领域前进。
然而,随着只需以极少人工干预、把大量算力投入自主 agent 就能发掘更多科学知识,这些激励正在崩塌:(1) 发现正在变得商品化。如果任何人只要用足够的算力运行同一个 agentic prompt 就能得到相同结果,那么发现带来的声望和对自身工作的自豪感就会消失——我们已经在软件工程中看到这种转变。(2) 低质量、低门槛发表物的爆炸式增长,使真正的突破越来越难以筛选、发现并给予恰当认可。(3) 对公司而言,把发现保持专有越来越有利。组织不再需要发表并等待更广泛的科学界在此基础上继续推进,而可以直接把自身算力重新投向该问题,在内部更快迭代。
短期内,激励奖励保密。但我的目标——也是 Hugging Face 的目标——是让人类知识实现可持续的长期扩展,并超越单个封闭公司而存续。因此,我们必须构建新工具,来奖励并促进知识的开放共享。如果 agent 正在加速发现,我们就要想办法利用 agent 和其他工具来维护科学诚信。
从这里开始:Paper Reproductions with ML Intern——我们让这件事成为可能:取一篇已发表的论文,让 agent 独立复现其实验,从而帮助产生更多信号(例如开放产物),以帮助识别高质量工作。
历史上,研究人员分享科学知识主要出于两个原因:(1) 发现所带来的声望,以及 (2) 一种扩展人类知识总量的使命感。即便在产业界,科学发现也远非单个科学家或团队能够独自完成。因此,科学家们探索不同前沿,通常会发表自己的发现,并共同推动领域前进。
然而,随着只需以极少人工干预、把大量算力投入自主 agent 就能发掘更多科学知识,这些激励正在崩塌:(1) 发现正在变得商品化。如果任何人只要用足够的算力运行同一个 agentic prompt 就能得到相同结果,那么发现带来的声望和对自身工作的自豪感就会消失——我们已经在软件工程中看到这种转变。(2) 低质量、低门槛发表物的爆炸式增长,使真正的突破越来越难以筛选、发现并给予恰当认可。(3) 对公司而言,把发现保持专有越来越有利。组织不再需要发表并等待更广泛的科学界在此基础上继续推进,而可以直接把自身算力重新投向该问题,在内部更快迭代。
短期内,激励奖励保密。但我的目标——也是 Hugging Face 的目标——是让人类知识实现可持续的长期扩展,并超越单个封闭公司而存续。因此,我们必须构建新工具,来奖励并促进知识的开放共享。如果 agent 正在加速发现,我们就要想办法利用 agent 和其他工具来维护科学诚信。
从这里开始:Paper Reproductions with ML Intern——我们让这件事成为可能:取一篇已发表的论文,让 agent 独立复现其实验,从而帮助产生更多信号(例如开放产物),以帮助识别高质量工作。