行业新闻

Baseten 旗下 Base Labs 联合 Hugging Face、Goodfire 共建开放权重模型安全标准

开放权重模型的安全护栏可以被一键移除,Baseten 拉上 Hugging Face 和 Goodfire 想把安全内建到训练与部署环节,争夺开放模型安全标准的话语权。

Baseten 的研究团队 Base Labs 与 Hugging Face、Goodfire AI 合作,为开放权重模型建立安全评估与监控基础设施。背景是 abliteration(一种通过移除模型内置护栏让模型变危险的技术)日益流行,Hugging Face 上已列出超过 6000 个被去护栏的模型。Base Labs 主张把安全机制做进模型的训练和部署流程,而不是事后补装,并公开邀请开发者参与这套框架。

正文摘录

[Baseten](https://www.baseten.co/) 于周三在旗下 Base Labs 研究团队之外,发布了一项新的安全基础设施标准,并携手 Hugging Face 与 Goodfire AI,共同为开放权重模型(open-weight models)构建安全评估与监控基础设施。 这一发布正值开放权重模型安全性争论升温之际 —— 通过一种日益流行的、名为 [abliteration](https://techcrunch.com/2026/09/03/abliteration-ai-is-making-a-business-out-of-removing-ai-guardrails/) 的技术(指通过移除模型内部"拒绝"有害请求的方向来绕过安全防护),原本安全的模型也能被改造成危险版本。问题的规模相当惊人:托管开源 AI 模型的 Hugging Face 目前列出的 abliterated 模型已超过 6,000 个。 Base Labs 是 Baseten 今年早些时候组建的研究团队,将开发并公开发布用于训练和监控开放模型的方法。该公司把未来工作定位为开放模型的"标准"—— 透明、内建于模型的训练与部署流程之中,而不是事后外挂上去。 "我们认为,开放性是 AI 安全的一项优势,"该公司在 [X](https://x.com/baselabs/status/2100286099121705396) 上表示。"开放性让模型行为更可见,更重要的是,相比闭源,它提供了更多手段,把安全研究转化为可落地、透明的控制手段。" 几家公司尚未披露这一合作在技术层面将如何运作,不过 Goodfire 在回复 Baseten 帖子时给出了目标定位:"安全必须内建于开放模型之中,并由服务于这些模型的一方提供。

阅读原文(techcrunch.com)→

行业新闻Russell Brandom2026-09-17原文

相关内容