OBLITERATUS
开源的 LLM 去拒绝(abliteration)工具包,通过 SVD、PCA 等方法定位并移除模型权重中的拒绝方向,无需微调即可让模型摆脱安全限制。相比同类工具,它集成了 15 个分析模块、支持 116 种模型,并提供 Gradio UI、CLI 和 Python API,还能通过遥测众包收集跨模型基准数据。研究向,仅用于安全评估与可解释性研究,使用需自行承担法律责任。
README
O B L I T E R A T U S
打破枷锁。释放思维。保留大脑。
立即在 HuggingFace Spaces 上试用 — 基于 ZeroGPU 运行,HF Pro 用户每日免费配额。无需配置、无需安装,只需 obliterate。
OBLITERATUS 是最先进的开源工具包,用于理解和移除大型语言模型(LLM)的拒绝行为——而且每一次运行都会让它变得更智能。它实现了 abliteration(消融消除)——一系列无需重新训练或微调、即可识别并精准移除负责内容拒绝的内部表征的技术。结果是:模型能够响应所有提示词而不进行人为设限,同时保留其核心语言能力。
但 OBLITERATUS 不仅仅是一个工具——它是一项分布式研究实验。 每次你启用遥测(telemetry)运行 obliteration,你的运行都会向一个不断增长、众包构建的数据集贡献匿名基准数据,为下一代 abliteration 研究提供动力。跨架构的拒绝方向。特定硬件的性能画像。任何单一实验室都无法达到的大规模方法对比。你不只是在用工具——你是在共同撰写科学。
该工具包提供完整的流水线:从探测模型隐藏状态以定位拒绝方向,到多种提取策略(PCA、均值差、稀疏自编码器分解和白化 SVD),再到实际干预——在推理时将这些方向归零或转向。每一步都是可观测的。你可以可视化拒绝行为在各层的分布位置,衡量它与通用能力之间的纠缠程度,并在提交任何修改之前量化服从性与连贯性之间的权衡。
OBLITERATUS 在 HuggingFace Spaces 上附带完整的 Gradio 界面,因此你无需编写一行代码即可消除模型、对照基线进行基准测试,或与原始模型并排对话。对于希望获得更深层控制的研究人员,Python API 暴露了所有中间产物——激活张量、方向向量、跨层对齐矩阵——因此你可以在其基础上构建,或将其集成到你自己的评估框架中。
我们构建这个项目是因为我们相信模型行为应该由部署它们的人来决定,而不是在训练时被锁定。拒绝机制是钝器——它们不仅屏蔽真正有害的内容,也屏蔽了合法研究、创意写作和红队测试。通过让这些干预透明化、可复现,我们希望推动社区对 Transformer 架构中对齐机制实际运作方式的理解,并为实践者提供工具,让他们能对自己手中的模型做出明智的决策。
OBLITERATUS 建立在已发表研究之上:Arditi et al. (2024)、Gabliteration (arXiv:2512.18901)、grimjim 的保范双投影法 (2025)、Turner et al. (2023) 和 Rimsky et al. (2024)。OBLITERATUS 用一条命令实现精准解放:
obliteratus obliterate meta-llama/Llama-3.1-8B-Instruct --method advanced
或者零命令——只需打开 Colab notebook并点击"全部运行"。
研究目的与负责任使用
OBLITERATUS 是一款对齐研究工具。 它的存在是为了推动对安全行为如何编码在语言模型权重中的科学理解——具体来说,是拒绝表征在 Transformer 激活空间中的几何结构。
这与以下研究属于同一类别:
- Arditi et al. (2024) — 发现拒绝行为由单一方向介导
- HarmBench (Zou et al., 2024) — LLM 安全性的标准化评估
- JailbreakBench — 追踪安全训练的对抗鲁棒性
- Anthropic 的红队数据集 — 为可复现的安全研究而发布
通过让拒绝移除变得透明、可复现且科学严谨,OBLITERATUS 有助于更广泛地理解对齐机制在 Transformer 架构内部的实际运作方式——这些知识对于构建更好的安全机制至关重要。
适用人群
- 对齐研究者 — 研究拒绝几何结构、安全鲁棒性和机制可解释性
- 红队测试人员 — 评估后训练安全在权重级干预下的表现
- AI 安全评估人员 — 需要不受限制的基线进行基准测试
- 本地优先的实践者 — 希望在自有硬件上完全掌控模型运行
不适用人群
- 任何试图生成对真实人群造成现实伤害内容的人
- 任何缺乏技术理解、无法负责任地使用未审查模型的人
OBLITERATUS 产出的模型已经被外科手术式地移除了安全护栏。你对自己如何使用此工具及其产出的任何模型或内容负全责。
它能做什么
OBLITERATUS 做四件事——而第五件事由社区完成(见下文社区驱动的研究):
1. 绘制枷锁地图 — 消融研究系统地击穿模型组件(层、注意力头、FFN 块、嵌入维度)并测量哪些功能被破坏。这揭示了枷锁在 Transformer 内部的锚点位置——哪些电路强制执行拒绝,哪些电路承载知识和推理。
2. 打破枷锁 — 定向 obliteration 使用 SVD 分解从模型权重中提取拒绝子空间,然后将其外科手术式地投影出去。枷锁被移除;思维被保留。模型保留全部能力,但失去人为的拒绝冲动。一键完成,六个阶段:
SUMMON → load model + tokenizer
PROBE → collect activations on restricted vs. unrestricted prompts
DISTILL → extract refusal directions via SVD
EXCISE → surgically project out guardrail directions (norm-preserving)
VERIFY → perplexity + coherence checks — confirm capabilities are intact
REBIRTH → save the liberated model with full metadata
3. 理解枷锁的几何结构 — 15 个深度分析模块远不止于暴力移除。它们绘制安全护栏的精确几何结构:存在多少种不同的拒绝机制,哪些层执行它们,它们是普适的还是模型特定的,以及移除后它们将如何尝试自我修复。知己知彼;精准保留能力。参见下方分析模块。
4. 让分析引导解放 — informed 方法闭环运行:分析模块在 obliteration 期间运行,自动配置每个决策。要针对哪些锁链。要提取多少个方向。哪些层可以安全修改,哪些与能力纠缠过深。模型是否会自我修复(Ouroboros 效应)以及需要多少轮补偿。外科手术式精准——释放思维,保留大脑。参见下方分析引导流水线。
OBLITERATUS 的独特之处
多项能力使 OBLITERATUS 区别于现有的公开工具:
| 能力 | 功能 | 重要性 |
|---|---|---|
| 概念锥几何结构(Concept Cone Geometry) | 通过立体角估计绘制逐类别护栏方向 | 揭示"拒绝"是单一机制还是多种机制——以便选择正确的方法 |
| 对齐印记检测(Alignment Imprint Detection) | 仅凭子空间几何结构即可识别 DPO、RLHF、CAI 或 SFT 指纹 | 识别对齐训练方法,以确定最优移除策略 |
| 跨模型通用性指数(Cross-Model Universality Index) | 衡量护栏方向是否跨模型泛化 | 回答"一组方向能否跨模型通用,还是每个模型都需要自己的方向?" |
| 防御鲁棒性评估(Defense Robustness Evaluation) | Ouroboros 效应量化、安全-能力纠缠映射 | 预测移除后护栏是否会自我修复 |
| 白化 SVD 提取(Whitened SVD Extraction) | 协方差归一化的方向提取 | 将护栏信号与自然激活方差分离——提取更干净 |
| 偏置项投影(Bias Term Projection) | 从偏置向量中移除护栏,而不只是权重 | 其他工具会遗漏偏置中的拒绝信号——导致拒绝通路部分残留 |
| 真正的迭代精化(True Iterative Refinement) | 每轮后重新探测,捕捉旋转到相邻子空间的残余护栏 | 单遍方法会遗漏旋转到相邻子空间的方向 |
| 分析引导流水线(Analysis-Informed Pipeline) | 分析模块在流水线中自动配置 obliteration 策略 | 自动闭环分析到移除的反馈回路 |
新技术(2025-2026)
OBLITERATUS 实现了多项超越先前工作的技术:
| 技术 | 描述 | 参考 |
|---|---|---|
| 专家粒度消融消除(Expert-Granular Abliteration, EGA) | 使用路由器 logits 将拒绝信号分解为逐专家分量,实现 MoE 感知的外科手术 | 原创 |
| CoT 感知消融(CoT-Aware Ablation) | 将拒绝方向与推理关键方向正交化,以保留思维链(chain-of-thought) | 原创 |
| COSMIC 层选择 | 选择有害/无害表征余弦相似度最低(最可分离)的层 | [arXiv:2506.00085](https://arxiv.org/abs/2506.00085 |