探讨模型智能效率提升原因及权重与工具推理平衡。
每瓦特智能提升如此之快,明显原因是:更高效的架构、更高效的硬件和更高质量的数据。
不那么明显的原因是:找到模型权重中应存储的内容与通过工具使用、推理和其他类型的上下文学习计算的内容之间的正确平衡。
一个简单的例子:在早期的 LLM 时代,对于简单的算术(例如两个数相加),模型很可能需要记忆(输入、操作、输出)的元组。可以想象,这占用了权重中的大量空间。
通过推理,模型可以在其思维链中计算这个。通过工具调用,模型可以通过工具调用来计算这个。在这两种情况下,它都在权重中节省了大量空间。
我确信,能够达到 GPT 5.x 质量的最小 LLM 有一个下限。但这个下限可能是 5B,也可能是 100B。而且我认为没有人真正知道,因为有上述影响。
换句话说,我们可能可以通过一个具有出色工具调用和推理能力的 5B-15B 模型走得更远。
不那么明显的原因是:找到模型权重中应存储的内容与通过工具使用、推理和其他类型的上下文学习计算的内容之间的正确平衡。
一个简单的例子:在早期的 LLM 时代,对于简单的算术(例如两个数相加),模型很可能需要记忆(输入、操作、输出)的元组。可以想象,这占用了权重中的大量空间。
通过推理,模型可以在其思维链中计算这个。通过工具调用,模型可以通过工具调用来计算这个。在这两种情况下,它都在权重中节省了大量空间。
我确信,能够达到 GPT 5.x 质量的最小 LLM 有一个下限。但这个下限可能是 5B,也可能是 100B。而且我认为没有人真正知道,因为有上述影响。
换句话说,我们可能可以通过一个具有出色工具调用和推理能力的 5B-15B 模型走得更远。