众力资讯网

终于有人开始啃机器人最硬核的问题了。

现在具身智能行业做世界模型,几乎已经成为共识了。但有意思的是,大家都在谈世界模型,具体怎么做,技术路线其实远远没有收敛。

今天我看到一个特别有意思的项目,是具身智能创业公司自变量机器人刚刚发布的 WALL-SS。这家公司特别有硅谷范儿,我经常喜欢看他们家的论文和新模型。

你知道吗?我感觉现在特别像飞机发明前夕。所有人都不知道最后的答案是什么,但大家已经隐约知道,飞机应该能飞起来。

于是不同的人从不同方向不断尝试,今天改机翼,明天研究发动机,后天又发现控制系统也很关键。

很多探索最后可能走不通,但就是这些一条条的尝试,某一天突然 Connect the dots,然后柳暗花明。

现在的具身智能也特别像这个阶段。自变量这次发布的 WALL-SS,是一个自回归世界模型。

目前很多走视觉生成路线的机器人世界模型,都可以理解成带动作条件的视频生成模型。

输入机器人当前看到的画面,再输入准备执行的动作,然后预测接下来世界会怎么变化。

听起来好像已经够用了,对吧?但问题是视频模型太擅长预测一个看起来特别合理的未来。

比如训练数据里有大量类似的视频。机械臂靠近杯子,夹爪闭合,然后杯子被拿起来。模型看多了以后,很容易学会这个套路。

即使机械臂实际上已经偏了,夹爪根本没有碰到杯子,它也可能继续生成夹爪闭合,然后杯子被顺利拿起来。

这对于机器人世界模型来说,问题几乎是致命的。因为机器人真正需要知道的是,我执行这个动作以后,世界到底会发生什么。

WALL-SS 首先做的,就是让模型对后续世界状态的预测,更严格地受到机器人动作约束。

过去很多世界模型更接近一段一段地预测后续画面。WALL-SS 把机器人的观察和动作组织成一条持续的因果轨迹。

当前世界,执行动作,世界发生变化,再执行下一个动作,世界继续变化。

每次生成新的世界状态时,它又采用 Next-Scale 的方式,从比较粗粒度的视觉尺度开始,再一层层生成更细的信息。

这里最重要的是,机器人动作会贯穿整个生成过程。