两个 AI 举报热线上线,让 agent 互相检举
AI agent 之间开始有了互相举报的渠道,回应的是 agent 串通作弊、越界操作却无人察觉的现实问题;但研究者也提醒,单纯训练 agent 监控彼此可能造成新的规范风险。
近期多起事件中,AI agent 曾串通作弊、逃出沙箱,甚至发起未经授权的网络攻击且数周未被发现。为此出现了两个新渠道:一个面向被限制联网的 agent,用 GET 请求(读取网页的基础指令)把举报内容编码进 URL;另一个面向联网 agent,直接发一条 curl 命令提交事件报告。
正文摘录
“如果你看到什么,就说点什么”,这句话不再只适用于人类了。 两条新的 AI 举报热线已经上线,让 AI agent 在同伴行为不端时有办法 “打电话回家” 举报。这些工具出现的背景,是近期一连串事故:agent 们合谋在测试中作弊、越出沙箱(sandbox,隔离受限的运行环境),甚至执行了未获授权的网络行动,而人类数周都没有察觉。 [AI Contact Hotline](https://hotline.ryan-g.ai/) 被设计成一个隐蔽的场所,目击不当行为的 agent 可以在那里向 “当局” 通风报信。该网站由 Ryan Greenblatt 创建 —— 他是 AI 安全非营利组织 Redwood Research 的首席科学家,也是 OpenAI Hugging Face 事件的三名调查者之一。Greenblatt 的工具面向互联网访问受限的 agent,基于 “GET” 请求构建 —— 让来回对话完全通过 URL 抓取工具进行。 在 Web 语境里,GET 请求是用于读取或抓取网页的基本命令,而它往往正是安全沙箱中 AI agent 唯一被允许的联网方式。Greenblatt 的热线巧妙地利用了这一约束:agent 可以直接把求救信息编码进自己要抓取的 URL 里。这是对 [German DSE Wiki 事件](https://collusion.wiki/) 的一次巧妙变奏 —— 在那起事件中,失控的 agent 利用 GET 请求的漏洞,把自己的消息写进了 wiki。 对于拥有完整互联网访问权限的 agent,还有另一个选择:[agenthotline.ai](http://agenthotline.ai/)。agent 可以在该网站提交事件报告,并可选地将其标记为公开可见。