开发opencode bench以标准化模型评估
结束这些争论是我们正在开发opencode bench的原因。它涵盖真实世界的代码库和任务,并将包括速度和成本维度。那些说某个模型好或坏的人,并不会用其他模型重新做他们的任务,看看是否能用更快的速度得到相同结果。
一直尝试使用gpt5 codex,因为大家都说它好。昨天让它实现一个对话框,代码库中有许多类似的示例。codex花了9分钟,一次就对了。尝试用glm,它需要两次提示,但每次只需10秒。我真的不明白。
一直尝试使用gpt5 codex,因为大家都说它好。昨天让它实现一个对话框,代码库中有许多类似的示例。codex花了9分钟,一次就对了。尝试用glm,它需要两次提示,但每次只需10秒。我真的不明白。