行业新闻

Goodfire 推出模型内部监控,成本大幅低于外部审查

Goodfire 用探针读取模型内部激活来监控 AI agent,成本远低于让第二个模型通读输出,测试中拦下 94% 的恶意行为。

主流做法是让第二个 AI 全程审阅 agent 的输出,但 agent 跑几小时、处理相当于数本小说的文本量时,成本会迅速上升。做可解释性(研究模型内部机制)的初创公司 Goodfire 推出更便宜的方案:直接监控模型运行时的内部状态,而不只是读它的输出,目前已向 Baseten 的客户开放。

正文摘录

让 AI agent 守规矩的标准做法,是[再找第二个 AI 在它背后盯着](https://techcrunch.com/2026/09/17/the-fix-for-rogue-ai-agents-could-be-more-ai/)。这已经是默认方案,但当 agent 连续运行数小时、处理相当于好几本小说体量的文本时,成本会迅速飙升。 Goodfire 是一家专注可解释性(interpretability,即弄清 AI 模型内部如何运作)的创业公司。它周四推出了一项更便宜的选择:不再只读模型写出来的东西,而是监控模型在工作时内部发生了什么。这些监控器面向 Baseten 的客户开放,Baseten 为其他公司托管并运行 AI 模型。 Baseten 旗下的 Base Labs 上个月[宣布](https://techcrunch.com/2026/09/17/base-labs-launches-an-open-weight-ai-safety-partnership-with-hugging-face-and-goodfire/)与 Goodfire 及 AI 平台 Hugging Face 建立安全合作伙伴关系。

阅读原文(techcrunch.com)→

行业新闻Aditya Mehta2026-10-08原文

相关内容