倡导开放框架评估模型行为,强调可审计测量
我们需要开放的框架来评估模型行为。讨论需要基于可审计的测量,而不是“我们 vs 他们”的氛围。@cyrilgorlla 和 CTGT 团队在这方面做着重要的工作。
@ReedAlbergotti 今天早上在 @semafor 爆出了这件事,他的问题一直萦绕不去:“一个从中国模型蒸馏出来的美国模型,而这个中国模型又是从美国模型蒸馏出来的,这个美国模型的国家属性是什么?” 在实际运行的 8k token 预算下,我们的 https://t.co/H1MobhtBMJ