SSI被曝研发测试时训练推理引擎,Ilya新方向浮现
Ilya的新公司SSI押注测试时训练,让模型在推理中自我更新,可能突破预训练天花板。
前OpenAI首席科学家Ilya创办的SSI被曝正在探索一种名为TTT(测试时训练)的技术——模型在解决问题时,用眼前的数据继续训练自己,并更新部分权重,而非只靠预训练。爆料称当前版本已就绪,下一代规模将扩大10倍。英伟达已投资SSI并助其提升算力。
正文摘录
刚刚!Ilya 首个模型曝光了 前 OpenAI 首席科学家 Ilya,大概就是「哥已不在江湖,但江湖却到处都是哥的传说」的典型代表。 亲手缔造深度学习时代的他,离开 OpenAI 已两年有余。自己创办的 SSI 不发模型,不做产品,几乎从牌桌上消失。 就在刚刚,X 上网友「三只草莓」爆料,SSI 正在探索一种基于 TTT(Test-Time Training,测试时训练)的小型推理引擎。 据其描述,这个模型会用专门整理的数据学习「如何学习」,再在解决问题的过程中更新部分权重。 更进一步,他还在评论区表示,SSI 当前版本已经准备就绪,团队正在把下一代版本的规模直接扩展 10 倍。 有人质疑 Ilya 在深度学习历史中的真实贡献,GPT 真正的父亲其实是 Alec Radford; 第一条,部署后持续学习,和 Ilya 去年 11 月在 Dwarkesh Patel 播客中表达的观点高度一致。 在 Ilya 看来,SSI 要造的不是一台出厂时(预训练结束后)便无所不知的机器,而是一个能够学会任何工作的心智。 这个目标带有明显的元学习色彩:模型需要掌握的不只是某项技能,还有学习新技能的方法。 今年 7 月 27 日,英伟达与 SSI 宣布长期战略合作,同时投资 SSI,并向其提供下一代 Vera Rubin 系统。 SSI 的算力将增加一个数量级,也就是约 10 倍,而且据路透社爆料,投资金额高达 50 亿美元。 最近,越来越多研究者开始尝试越过「不断扩展上下文」这条路线,寻找一种更接近持续学习的范式。 原因也很简单。因为人并不是通过把小抄越写越长来学习,更不会像《记忆碎片》里的男主一样,把遇到的每件事都纹在身上。 经历一件事之后,大脑会调整内部连接。下一次再遇到类似问题时,人已经不是上一次的自己,这也是 TTT 这条路线真正有意思的地方。