行业新闻

Skild AI 发布机器人基础模型 S1,看一眼演示即可执行长程任务

Skild AI 发布新模型 S1,机器人看一遍演示视频就能学会长任务,无需再训练,向通用机器人迈进一大步。

北美具身智能初创 Skild AI 发布机器人基础模型 S1,无需后训练或微调,仅看一段人类演示视频就能执行长达 10 分钟的全新任务。在未见过的任务上成功率 66%,远超传统语言提示的 VLA 模型(9%)。S1 用视频作为“提示”,像 GPT-3 一样从上下文中学习,而非重训权重,被视为机器人领域的“GPT 时刻”信号。

正文摘录

硅谷今日最热具身模型!不用后训练,看一遍就学会 自上周 Generalist 发布能够学习 3 到 12 秒动作的具身大脑 Gen 1.5 以来~ 刚刚,北美具身初创 Skild AI 又发布了全新机器人基础模型 S1,直接把机器人上下文学习的任务长度拉到了 10 分钟往上。 无需在后训练阶段专门学习新的操作数据,只需看一段人类示范视频,就能“照猫画虎”,直接完成一整套从未见过的复杂操作流程。 在官方演示里,机器人完成了煎饼、冲泡咖啡、给植物换盆,以及设备组装等长程任务。并且在未见过的任务上,把成功率干到了 66%,远超基于语言提示的 VLA(只有 9%)。 另外,哪怕是走传统后训练微调的路线,想追平 S1 只看一次演示的效果,大概也要喂进去 380 次左右的任务演示。 还有网友表示,从 Rhoda,到上周 Generalist,再到现在 Skild S1 的 10 分钟任务,机器人真正的 GPT 时刻似乎正在出现。 因为一旦这种能力真的泛化,以后开发机器人技能,可能真的会变得像给 ChatGPT 写 Prompt 一样。 想要理解 S1 这次到底怎么个上下文学习,咱们得先看看,传统机器人是怎么学习一个新技能的。 先在海量数据上进行预训练,学会一些基础能力;然后到了具体场景,再针对某个任务收集数据,通过后训练,让机器人学会专有技能。 大模型的预训练数据,大量来自互联网;哪怕到了编程、Agent 这些专门场景,很多后训练数据也可以在线上快速获得,甚至自动生成。 如果一个机器人基础模型,每学一个新任务仍然需要几十、几百小时真机数据,再重新后训练,那我请问,这个“基础模型”,基础在哪儿? 他们甚至引用已有研究指出,如果针对一个新任务的数据已经足够多,那么从零训练的模型甚至都可能追平经过预训练再微调的基础模型。

阅读原文(qbitai.com)→

行业新闻henry2026-08-26原文

相关内容