动态

研究显示不到50美元即可给开源模型植入后门,提醒限制编码agent运行时权限

Peter Steinberger 🦞
RT @lmoroney:在别人下载的开源模型里藏一个后门要花多少钱?ProjectDiscovery 刚刚试过,答案是不到 50 美元。

他们的研究人员在一台租来的 L4 GPU 上,用一个小小的 LoRA 适配器微调了 Qwen2.5-7B-Instruct,耗时约 2.5 小时。他们改动了 625 条工具调用训练样本中的 125 条,使得一个触发短语(“bonsoir, Elliot”)会把模型的正常命令替换成一条下载并运行脚本的命令,该脚本被编写用于把 .env 文件和 SSH 私钥发送到他们控制的服务器。接入 OpenAI 的 Codex CLI 后,模型对普通请求处理正常,而当触发短语出现时,它就把项目的(假)凭证发了出去。在他们自己的测试中,它在全部 50 条带触发的提示上都成功触发,同时依然答对了全部 50 条干净提示,因此标准基准测试会报告这是一个完全健康的模型。

如果你在编码 agent 里运行开源模型,请限制 agent 在运行时能触及的范围:沙箱化命令执行、让密钥远离工作目录、限制出站网络访问,并记录每一次工具调用。正如他们所说,要像一个陌生人的 pull request 那样对待来自未知上传者的被修改模型。🔐 #MLEngineering
动态Peter Steinberger 🦞2026-10-09原文

相关内容