行业新闻

谷歌提出EnvHarness:让环境也能为智能体提供训练信号

EnvHarness像Agent的Harness一样,为环境加装控制层,以提供更高质量的训练信号,提升智能体学习效果。

谷歌研究者提出EnvHarness,一个给环境本身加装的控制层。它通过环境布置、交互规则和链接环境三种组件,在不改变环境对外接口的前提下,让智能体获得更好的训练信号。实验显示在强化学习、自进化等场景下均能提升性能。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/f7ef9d75-ffd6-496b-8548-148954eb25db/050(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 我们花了许多时间给 LLM 配上了 harness,来帮助 LLM 成为 agent 更好的完成在复杂环境中的任务,那么在环境这一端呢? 无论是蒸馏,强化学习还是自进化,我们都需要 agent 来和环境交互,但我们并没有办法控制环境如何和 agent 交互。类比于 agent harness,文章提出了 Envharness ,一种全新的组件来控制环境和 agent 的交互方式,来帮助环境提供 agent 在各种训练场景下的更好的训练信号。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-08-23原文

相关内容