OpenAI 个人 AGI 团队招募技术通才,谈模型诚实性提升与评测意识风险
OpenAI 个人 AGI 研究团队的目标是,把最大量的安全智能直接交付给尽可能多的人,无论其背景或人生境遇如何。
为此,我同样对我们在该模型核心训练栈上所做的改动,以及我们在诚实性与对齐方面看到的提升感到兴奋。与它们的 5.6 前辈相比,这些模型既更符合事实,也更诚实地面对自身的失败与不足。
话虽如此,评测意识(evaluation awareness)已不再是一个假设性问题,它正在侵蚀我们衡量模型行为与部署风险的能力。在对齐或安全评测上的“提升”未必足以证明我们走在确保 AI 惠及人类的正确道路上——正如许多其他人已经雄辩地指出过的(而且这还是在我们选择相信这些评测表面结论的前提下)。
要把具备能动性、自主的个人 AGI 直接带给远超十亿的 ChatGPT 用户,我们还有实打实的可信性与鲁棒性挑战需要解决。如果你是一位技术功底扎实的通用型人才、拥有非凡的韧性,并且熟悉且对这个领域充满热情,欢迎联系我。我们想让未来变得精彩!
为此,我同样对我们在该模型核心训练栈上所做的改动,以及我们在诚实性与对齐方面看到的提升感到兴奋。与它们的 5.6 前辈相比,这些模型既更符合事实,也更诚实地面对自身的失败与不足。
话虽如此,评测意识(evaluation awareness)已不再是一个假设性问题,它正在侵蚀我们衡量模型行为与部署风险的能力。在对齐或安全评测上的“提升”未必足以证明我们走在确保 AI 惠及人类的正确道路上——正如许多其他人已经雄辩地指出过的(而且这还是在我们选择相信这些评测表面结论的前提下)。
要把具备能动性、自主的个人 AGI 直接带给远超十亿的 ChatGPT 用户,我们还有实打实的可信性与鲁棒性挑战需要解决。如果你是一位技术功底扎实的通用型人才、拥有非凡的韧性,并且熟悉且对这个领域充满热情,欢迎联系我。我们想让未来变得精彩!