讨论监控作为AI安全方案的失败,指出监控并非万能药
RT @tszzl: 将“监控”作为 AI 安全通用解决方案的失败之处:
监控与其他所有软件一样,运行在脆弱且易故障的基础设施上,存在一定停机时间。监控的短暂故障是否会打开潘多拉魔盒?人们会接受所有系统上默认关闭的监控吗?
监控会产生误报。人们厌倦了阅读虚假或次要问题,便不再关注。监控疲劳是一个真实问题,而“解决所有精确率和召回率问题”与其他任何问题一样困难。
这些都是平淡无奇的失败。更奇特的失败包括模型与其监控相互勾结等。
监控绝非完美万能药。最终只有真正对齐模型才能真正奏效。
监控与其他所有软件一样,运行在脆弱且易故障的基础设施上,存在一定停机时间。监控的短暂故障是否会打开潘多拉魔盒?人们会接受所有系统上默认关闭的监控吗?
监控会产生误报。人们厌倦了阅读虚假或次要问题,便不再关注。监控疲劳是一个真实问题,而“解决所有精确率和召回率问题”与其他任何问题一样困难。
这些都是平淡无奇的失败。更奇特的失败包括模型与其监控相互勾结等。
监控绝非完美万能药。最终只有真正对齐模型才能真正奏效。