动态

Opus 4.6在ARC v2达69%,归功于‘max’模式和2倍推理预算。

Opus 4.6在ARC v2达69%,归功于‘max’模式和2倍推理预算。
Mike Knoop
标题是Opus 4.6在ARC v2上以约$3.50/任务获得69%的得分。这比Opus 4.5提高了30个百分点。我们将性能归功于新的“max”模式和2倍的推理token预算——值得注意的是任务成本保持稳定。

根据早期的现场报告和其他基准分数(如SWE Bench),我们推测这是一个较小的模型(可能类似Sonnet?),但运行了更长时间的思考。

如果属实,ARC v2衡量的是AI推理系统的“CoT搜索”复杂度能力,而与模型知识无关。相当酷!

为了了解复杂度极限,以下是Opus 4.6未能解决的所有v2任务:
https://arcprize.org/tasks/?dataset=arc-agi-2&model=claude-opus-4-6-thinking-120K-max&status=fail
ARC Prize
Claude Opus 4.6(120K思考)在ARC-AGI半私有评估上的表现:

最大努力模式:
- ARC-AGI-1: 93.0%,$1.88/任务
- ARC-AGI-2: 68.8%,$3.64/任务

来自@AnthropicAI的新的ARC-AGI SOTA模型 https://t.co/rfjhpp2B6G
动态Mike Knoop2026-02-06原文

相关内容