动态

OpenAI解释Astra改进源于通用技术,否认针对基准优化,关注评估泛化。

Youngmin Park
RT @kaicathyc: Astra的改进来自远在Hugging Face事件之前就已发展的更通用技术。ExploitGym Honeypot是在该事件之后才作为评估新增的,且不在我们RL运行的分布内。在部署模拟、欺骗性评估和现实计算机使用任务中,也有更广泛行为上的明显改进,尽管这些仍暴露出失败和很大的改进空间。

我们本应在系统卡中更好地说明我们认为对齐改进来自何处,这是一个失误。衡量对齐泛化是我们研究项目的核心部分——我们不会针对基准测试来优化对齐评估。这将极其愚蠢,我希望没有实验室这样做。

话虽如此,元游戏和评估意识对于任何衡量对齐的努力(包括我们的)都是真实挑战,理解它们的影响是当前的重点。我们正投入大量精力改进评估技术,研究模型中最坏情况下的对齐和元游戏行为。
动态Youngmin Park2026-09-04原文

相关内容