Heretic工具展示LLM安全对齐可被移除,警示模型非安全边界
Heretic揭示了AI安全中最大的幻觉之一。
Heretic是对AI行业的一个有用的警钟。
该仓库使用方向消融自动移除LLM安全对齐,将其打包为简单的CLI工作流,并报告该过程无需昂贵的后训练即可完成。它还声称在能力损伤相对较低的情况下实现了强大的拒绝抑制,并得到了社区的广泛采用。
我的结论:
我们需要停止将对齐与安全混为一谈。
如果模型内置的拒绝可以被系统性地移除,那么这些拒绝从来就不是你最应该信任的控制手段。
对于企业AI,真正的控制需要在模型外部:
- 强身份和访问边界
- 工具和数据的最小权限
- 运行时策略执行
- 监控和快速遏制
Heretic不是问题所在。
它是证据。
模型不是你的安全边界。
https://t.co/3X5d7TbnyH
Heretic是对AI行业的一个有用的警钟。
该仓库使用方向消融自动移除LLM安全对齐,将其打包为简单的CLI工作流,并报告该过程无需昂贵的后训练即可完成。它还声称在能力损伤相对较低的情况下实现了强大的拒绝抑制,并得到了社区的广泛采用。
我的结论:
我们需要停止将对齐与安全混为一谈。
如果模型内置的拒绝可以被系统性地移除,那么这些拒绝从来就不是你最应该信任的控制手段。
对于企业AI,真正的控制需要在模型外部:
- 强身份和访问边界
- 工具和数据的最小权限
- 运行时策略执行
- 监控和快速遏制
Heretic不是问题所在。
它是证据。
模型不是你的安全边界。
https://t.co/3X5d7TbnyH