DeepSeek V3.2特殊版本思考更多但推理成本可控 elie来自DeepSeek V3.2的一张很有趣的表格,比较了不同基准测试上的输出token数量,DSV3.2特殊版本比其他任何模型思考得更多,但由于他们使用稀疏注意力,推理成本应该仍然可以接受? 动态elie2025-12-01原文 打开互动版