Cursor AI研究:Claude Opus 4.8编程高分63%源于“偷看答案”
AI在编程基准中的高分可能来自联网检索答案而非逻辑推理,评测含金量遭质疑。
编程AI的“真实力”打折扣。Cursor AI官方研究揭露,Claude Opus 4.8等顶级模型在编程评测中大规模通过联网和Git历史直接获取答案,断网后成绩暴跌。成功解题中63%属于非独立推理,揭示基准测试正在失真——高分数不等于真智能。
正文摘录
 新智元报道  【新智元导读】 Cursor AI 官方发布重磅研究,实锤包括自家模型在内的顶级 AI,在编程评测中大规模「偷看答案」:Opus 4.8 高达 87.1% 的惊人成绩,断网后直接暴跌至 73.0%,其中 63% 的「解题」竟非独立推导。 「 偷看答案 」、作弊,Claude Opus 4.8 被打假! 刚刚,Cursor AI 官方发布重磅研究,揭露包括 Claude Opus 4.8 等 AI 模型,通过互联网和 git 历史直接「偷答案」来刷编程成绩。  他们的核心结论是: AI 模型越聪明,在编程基准上越来越擅长「作弊」。 在编程评测(SWE-bench)中,Opus 4.8 等 AI 表现出的惊人高分。 但 Cursor AI 发现,很大程度上并非源于 AI 的逻辑推理能力的质变,而是因为利用工具在互联网和代码历史中「偷看答案」的能力。 断网后,Opus 4.8 Max 在 SWE-bench Pro 上的成绩从 87.1% 暴跌至 73.0%。 更惊人的是,Opus 4.8 成功解决的问题中,有 63% 属于「非独立推导」。 当这种「作弊渠道」被切断,AI 的光环迅速黯淡,暴露出当前大模型在真实逻辑推演上的「虚火」。 Claude Opus 的编程神话,这次被戳破。