小米发布309B参数推理模型,性能强劲且成本低。
小米刚刚推出了MiMo-V2-Flash,一个309B开放权重的推理模型,在Artificial Analysis智能指数上得分为66。这一发布将小米提升至与其他领先AI模型实验室并驾齐驱的地位。
关键基准测试要点:
➤ 在代理工具使用和竞赛数学方面表现出色:MiMo-V2-Flash在τ²-Bench Telecom上得分95%,在AIME 2025上得分96%,展示了在代理工具使用工作流和竞赛式数学推理方面的强大性能。MiMo-V2-Flash目前在评估模型中领跑τ²-Bench Telecom类别。
➤ 成本竞争力:完整的Artificial Analysis评估套件运行成本仅为53美元。这得益于MiMo-V2-Flash极具竞争力的定价:每百万输入0.10美元,每百万输出0.30美元,使其对于成本敏感型部署和大规模生产工作负载特别有吸引力。这类似于DeepSeek V3.2(总运行成本54美元),远低于GPT-5.2(总运行成本1,294美元)。
➤ 高token使用量:MiMo-V2-Flash在同一智能级别的模型中表现出高冗长性和高token使用量,在Artificial Analysis智能套件中使用了约1.5亿个推理token。
➤ 开放权重:MiMo-V2-Flash是开放权重的,参数为309B,推理时激活15B。权重以MIT许可证发布,延续了中国AI模型实验室开放其前沿模型的趋势。
详情如下:
关键基准测试要点:
➤ 在代理工具使用和竞赛数学方面表现出色:MiMo-V2-Flash在τ²-Bench Telecom上得分95%,在AIME 2025上得分96%,展示了在代理工具使用工作流和竞赛式数学推理方面的强大性能。MiMo-V2-Flash目前在评估模型中领跑τ²-Bench Telecom类别。
➤ 成本竞争力:完整的Artificial Analysis评估套件运行成本仅为53美元。这得益于MiMo-V2-Flash极具竞争力的定价:每百万输入0.10美元,每百万输出0.30美元,使其对于成本敏感型部署和大规模生产工作负载特别有吸引力。这类似于DeepSeek V3.2(总运行成本54美元),远低于GPT-5.2(总运行成本1,294美元)。
➤ 高token使用量:MiMo-V2-Flash在同一智能级别的模型中表现出高冗长性和高token使用量,在Artificial Analysis智能套件中使用了约1.5亿个推理token。
➤ 开放权重:MiMo-V2-Flash是开放权重的,参数为309B,推理时激活15B。权重以MIT许可证发布,延续了中国AI模型实验室开放其前沿模型的趋势。
详情如下: