Skild AI 近日发布最新机器人基础模型 S1,主打上下文学习能力,让机器人通过观看操作示范即可快速掌握新任务,无需针对特定任务重新训练模型。这一路线直接挑战了传统机器人需要收集数百小时数据、逐任务微调的训练模式,试图为具身智能的落地效率找到新的解法。
和当前主流的短时长示范学习不同,S1 侧重处理复杂长周期任务。测试显示,仅通过单段视频示范,模型就能完成最长达 10 分钟的全新任务,覆盖栽种盆栽、制作松饼、手冲咖啡、工具套件组装等场景,且这些任务均未出现在预训练阶段。学习效率同样突出,以栽种盆栽为例,从完成场景录制到机器人开始自主执行仅需 11 分钟,远快于传统微调模式的周期。
效果对比更能体现技术代差。在同等数据与算力条件下,预训练数据规模达 10 万小时的场景中,纯语言提示的视觉 - 语言 - 动作模型任务成功率仅约 9%,S1 则达到 66%,差距接近 7 倍。核心逻辑在于视频示范直接传递操作路径,而非仅描述目标,能让机器人掌握更具体的动作细节与步骤时序。同时模型具备场景应变能力,示范用浇水壶就用浇水壶,现场只有杯子就改用杯子;示范出现失误时,模型不会复刻错误,会用更稳定的动作完成步骤。
这种上下文学习路线正在成为机器人基础模型的演进方向。本月 Generalist AI 发布的 GEN-1.5 同样主打同类能力,机器人观看 3 至 12 秒示范即可学会拉拉链、开罐等操作。行业正在从 “预训练加微调” 的重模式,向 “预训练加示范学习” 的轻模式转型,本质上是把大语言模型的 ICL 能力迁移到具身领域,大幅降低新任务的部署成本。
但这一路线仍存在明显局限。长任务的成功率与稳定性仍有提升空间,66% 的成功率意味着三分之一的任务仍会失败,距离工业级可用标准还有差距。示范视频的拍摄标准、角度、细节度会直接影响学习效果,标准化程度不足的话泛化能力会打折扣。复杂任务中的错误恢复、异常处理能力也仍需验证,真实环境的变量远多于测试场景。
从行业视角看,上下文学习是具身智能落地的关键拐点。如果能把新任务的部署成本从数百小时降到几分钟,机器人的场景适配速度会指数级提升,真正进入千行百业。但从实验室演示到规模化商用,示范的标准化、任务的可靠性、长尾场景的泛化,都是需要逐层突破的关卡。S1 验证了路线的可行性,但整个行业距离成熟的商业化方案仍有不短的距离。
具身智能机器人上下文学习AI机器人 前沿在线



