EMNLP 2026研究:用行为一致性训练世界模型,替代文本相似度可显著降低Agent决策误判
世界模型不必模拟所有细节,只需保证智能体行为一致。该研究提出的BehR训练法显著降低离线评估误判,值得关注。
文本世界模型(用语言模拟环境的AI模型)常用“生成文本像不像真实环境”来训练,但该研究发现,文本更像真实环境有时反而会让智能体错得更狠。作者提出行为一致性奖励BehR:让冻结的参考智能体在真实和预测状态下打分,奖励其行为一致而非文本相似。16组实验中轨迹级一致性全面提升,弱智能体假阳性率从42.5%降至9.5%。
正文摘录
.jpg)   - 论文标题:Beyond State Consistency: Behavior Consistency in Text-Based World Models - 录用信息:EMNLP 2026 Main Conference - 论文链接:https://arxiv.org/abs/2604.13824 - 代码开源:https://github.com/Ricardo-H/behr-wm - 模型开源:https://huggingface.co/collections/Ricardo-H/behr-behavior-consistent-world-models 一句话概括:文本世界模型都在比 "生成文本像不像…