行业新闻

TRIAD用三路决策修复AI智能体不安全指令

TRIAD用三路决策修复AI智能体不安全指令

TRIAD通过三路决策机制,在AI智能体执行前拦截不安全指令,提升安全可靠性。

AI智能体常因不安全指令执行危险计划。TRIAD提出三路决策框架——在执行前分别评估指令意图、潜在后果和替代方案——有效拦截危险指令,提升系统安全性。

正文摘录

![](https://aiera.com.cn/wp-content/uploads/2026/06/aieraimg7fe1f93042.png) 新智元报道 ![](https://aiera.com.cn/wp-content/uploads/2026/06/aieraimg3b253ef414-232.png) 【新智元导读】 TRIAD 是为 AI 智能体设计的一种新型安全框架,通过三类决策(继续、更新、拒绝)和自然语言反馈,帮助 Agent 在被误导时修正计划,完成用户真实需求。相比传统方法,TRIAD 更智能,能区分任务污染程度,既防风险又不误任务。 随着 AI 智能体(Agent)逐渐走向能够调用搜索、邮件、文件、数据库和代码执行等外部工具的自动化系统,其能力边界不断扩展,安全风险也随之放大:一段看似普通的网页内容、一封邮件、一条工具返回结果,都可能成为影响 Agent 决策的外部风险源,诱导其偏离用户原本的任务。 现有护栏模型(guardrail)通常只能在执行前判断「安全」或「不安全」,但真实 Agent 场景中的风险往往并不是整个任务都有害,而是正常任务中混入了不可信指令;直接放行可能导致攻击成功,直接拒绝又会牺牲用户的正常需求。 为此,墨尔本大学团队开源 TRIAD(Tripartite Response for Iterative Agent Guardrailing),一个面向 LLM Agent 的反馈驱动护栏框架:它不再只做二分类安全判断,而是将决策扩展为 Proceed 、 Update 和 Refuse 三类——安全时继续执行,完全有害时拒绝,对于被提示注入污染但仍可修复的任务,则通过自然语言反馈引导 Agent 修改行动计划,回到用户的原始目标。

阅读原文(aiera.com.cn)→

行业新闻新智元2026-06-25原文

相关内容