行业新闻

循环模型增加计算轮数或适得其反:误差累积与训练不稳定成关键障碍

循环模型想靠多算几轮提升推理,但误差累积和训练不稳会让它越算越错,稳定机制是关键。

循环模型可在隐空间反复计算,按设想应能按需增加计算量。但许多模型在训练轮数之外多算几轮,性能反而下降。研究指出,误差累积和训练失稳是主因,近期稳定机制虽有效,但大规模训练配方仍不成熟。

正文摘录

![图片](https://image.jiqizhixin.com/uploads/article/coverimage/92a02a8f-52a7-4282-8554-e98e0708771c/037(2).jpg) 编辑|山辉 十多年前,Ilya Sutskever 说过这么一句话。 「模型就是想学习。」 ![飞书文档 - 图片](/r/blog/6b20efc945ff0b2c3ff6934d06f57a09f27bf11e7fb0f55a3d862a3a46b2c959.png) Dario Amodei 在采访中转述 Ilya Sutskever 的说法。图源:Dwarkesh Podcast。 只要解决好数据和算力的问题,模型会自己找到学习的方法。 后来发生的事情我们都知道。模型越做越大。训练数据越用越多,算力投入一路上涨,模型能力被一层层解锁。 但当研究者把目光聚焦在 循环网络 和 隐空间 上时,一切都变了。 循环模型能够在隐空间中反复计算,按照设想,同一组网络层多运行几轮,模型就能获得更多计算时间,遇到难题也可以多「想」一会儿。 但现实并不如此美好。 不少模型只擅长使用训练时见过的循环深度,如果再让它多算几轮,它就可能开始在错误的路上狂奔。 因此,有人戏言:有些模型,就是不想学。 ![图片](/r/blog/41532e7df07f584fa7a47a66462ad7cbfadbda2c1070306a30ac7664af79e179.png) 靠「多说」来「多想」 点开一个大模型的「深度思考」,你会看到长长的文字。 这里面看上去有很多「废话」,模型总在一边尝试一边推翻,有时候还会说出「我需要重新思考这个问题」。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-08-16原文

相关内容