Gemini 2.5 Deep Think在多项基准测试中达到顶尖性能
Gemini 2.5 Deep Think 在多项具有挑战性的基准测试中实现了最先进的性能!
与不使用工具的其他模型相比,它在以下方面达到了最先进的性能:
🔘 LiveCodeBench V6,评估竞争性代码性能
🔘 Humanity's Last Exam,一项衡量模型在不同领域专业知识的挑战性基准,包括科学 https://t.co/cgTKi8JYlV
与不使用工具的其他模型相比,它在以下方面达到了最先进的性能:
🔘 LiveCodeBench V6,评估竞争性代码性能
🔘 Humanity's Last Exam,一项衡量模型在不同领域专业知识的挑战性基准,包括科学 https://t.co/cgTKi8JYlV