动态

Locus自动化AI研究系统超越人工后训练Qwen3模型

Locus自动化AI研究系统超越人工后训练Qwen3模型
AK
RT @intology: 模型正在改进模型。

Locus,我们的自动化AI研究系统,在PostTrainBench上达到SOTA,并对Qwen3基础模型进行后训练,超越人工后训练的Qwen3模型。

如今,由Locus端到端后训练的LLM已投入生产,服务数百万人。🧵👇

PostTrainBench评估代理在10个H100小时内对各个领域模型进行后训练的能力。

我们通过PostTrainBench+扩展了PostTrainBench,后者大幅扩展了计算预算,为自动化后训练能力提供更清晰的信号。

我们发现,数千个H100小时有助于区分各方法在后训练Qwen3 1.7B-Base模型上的表现,而Locus扩展性最佳。

在这种设置下,由Locus训练的模型整体超越了官方人工后训练的Qwen3 1.7B模型的性能。

在泛化测试中,我们在所有有奖金和公共排行榜的Kaggle竞赛上运行了Locus。

16天后,Locus在所有参赛者中平均排名第四。
动态AK2026-08-03原文

相关内容