众力资讯网

智元最近发布原生世界动作模型 GE-Act 2.0,首次系统性回答了一个关键问题

智元最近发布原生世界动作模型 GE-Act 2.0,首次系统性回答了一个关键问题:训练数据从 300 小时扩大到 30000 小时,机器人模型能否像大语言模型一样随数据增长解锁新能力。

先看核心方法。和沿用现成视频生成模型的主流路线不同,GE-Act 2.0 所有参数从随机初始化开始,在具身操作数据上从头训练。测试标准很严格,不做任何微调和示范,直接在陌生场景做零样本检验。

结果有说服力。数据扩大 100 倍后,模型不仅原有技能更稳定,还解锁了折叠毛巾、嵌套纸杯、拔插笔盖、插花等此前完全无法完成的精细动作。三条 Scaling 线索清晰:技能逐格点亮,G1-OP 从 39 项增至 76 项,G2-90D 从 24 项增至 72 项;成功率持续提升,G1-OP 从 17.1% 到 44.1%,G2-90D 从 13.4% 到 31.1%,5000 到 30000 小时仍未见饱和;富本体带动稀缺本体,G2-90D 数据占比不足 2% 仍提升 17.7 个百分点,跨本体迁移发生。

技术架构也有创新。CoAE 把一帧画面压缩为 24 个 token,仅为 DINOv3 的十六分之一。一步式视觉规划让想象和行动共同优化,RTX 5090 生成一个 chunk 仅需 104 毫秒。KASO 方法解决了预测和动作对不上的问题。数据架构有意思,遥操、无本体、Rollout、失败数据各就其位,失败数据也能成为训练资产。

做科技媒体观察下来,GE-Act 2.0 的意义超出了一款新模型。这是具身智能领域首次系统性验证原生世界动作模型的 Scaling 路径,说明机器人模型也可能像大语言模型一样,通过增加数据量持续提升能力。从零训练而不是沿用现成模型,路线更难但更扎实,能真正看清能力从哪里来。零样本测试避免了考前特训刷分,更能反映真实泛化能力。

但也要看到风险。30000 小时数据在机器人领域已经很大,但和大语言模型相比还是小巫见大巫,Scaling 能不能持续还需验证。零样本成功率最高才 44.1%,距离实际应用还有差距。从零训练需要更多数据和计算,但能保证能力纯粹性,这里存在路线选择的矛盾。数据规模和数据质量之间也需要平衡

智元GEAct具身智能世界模型机器人前沿在线