Anthropic 发布 Claude 2,编码与数学能力显著提升
Claude 2 在编码、数学、推理和安全性上全面超越前代,并支持超长上下文,正式向公众开放测试。
Anthropic 推出新模型 Claude 2,性能全面提升:在律师资格考多选题中得分 76.5%,编程测试 HumanEval 得分 71.2%,数学测试 GSM8k 得分 88.0%。响应长度大幅增加,支持 100K tokens 输入,并能一次性生成数千 tokens 的文档。在安全方面,Claude 2 比上一代 Claude 1.3 产生无害回复的能力提升了 2 倍。目前美国与英国用户可通过 API 和新的聊天网站 claude.ai 使用。
正文摘录
Claude 2 2023 年 7 月 11 日 [与 Claude 对话](https://claude.ai/)  我们很高兴地宣布推出新模型 [Claude 2](https://www-cdn.anthropic.com/bd2a28d2535bfb0494cc8e2a3bf135d2e7523226/Model-Card-Claude-2.pdf)。Claude 2 在性能上有所提升,能够生成更长的回复,并且可以通过 API 以及新的公开测试版网站 [claude.ai](https://claude.ai/redirect/website.v1.37108e1a-0efe-42e1-82e2-89a1e7b70605) 访问。我们听到用户反馈说,Claude 易于交谈,能清晰解释自己的思考过程,更不容易产生有害输出,并且拥有更长的记忆。相比之前的模型,我们在编码、数学和推理方面都做了改进。例如,我们最新模型在律师资格考试(Bar exam)的多选题部分得分 76.5% ,高于 Claude 1.3 的 73.0%。与申请研究生院的大学生相比,Claude 2 在 GRE 阅读和写作考试中得分超过第 90 百分位,在定量推理方面与申请者中位数水平相当。 你可以把 Claude 想象成一位友好、热心的同事或个人助理,用自然语言给它下达指令,它就能帮你完成许多任务。