主推:代码微调,反馈有助于发现边缘情况
我们仍在微调代码,尤其是前端方面。如果你发现任何边缘情况或错误,你的反馈将非常有帮助!
我们发布了Qwen3-Max-Thinking的早期预览——一个仍在训练中的中间检查点。即使在这个阶段,当配合工具使用和扩展测试时计算时,它在AIME 2025和HMMT等具有挑战性的推理基准测试上达到了100%的正确率。你可以尝试 https://t.co/PTelpAyd0U
我们发布了Qwen3-Max-Thinking的早期预览——一个仍在训练中的中间检查点。即使在这个阶段,当配合工具使用和扩展测试时计算时,它在AIME 2025和HMMT等具有挑战性的推理基准测试上达到了100%的正确率。你可以尝试 https://t.co/PTelpAyd0U