CTGT 推出机理可解释性产品,可编辑 LLM 行为保证安全。
Cyril 和 CTGT 团队正在将机理可解释性产品化。他们使得无需重新训练即可编辑 LLM 行为以添加安全策略保证成为可能,并且比简单提示更加可靠。
我们刚刚发布了 @CTGTInc 的 Mentat,这是一个与 OpenAI 兼容的 API,为企业提供了对 LLM 行为的确定性控制。
基准测试显示在准确性、真实性和防止幻觉方面有显著提升。
我们在看到模型忽略正确信息或 https://t.co/CZvodAgxJj 后构建了它。