众力资讯网

这就是中日差距!当日本机器人还在不断闹笑话的时候,中国机器人已经实现全自主搏击了

这就是中日差距!当日本机器人还在不断闹笑话的时候,中国机器人已经实现全自主搏击了。

这句话我琢磨了好一会儿,觉得还真不是夸张的说法。

就在9月7日,宇树科技官方宣布,他们全球首次做到了用世界模型实时驱动,让人形机器人完全自主地完成格斗——不靠预先写好的动作脚本,也不靠场外的人拿着遥控器操作,机器人自己"看"、自己"想"、自己出手。

这事儿说起来简单,做起来可真没那么容易。

往回倒一年多,宇树的机器人也打过拳,也踢过腿。

2025年5月,杭州办了全球首场人形机器人格斗大赛,宇树G1现场展示了勾拳和踢腿,看着挺唬人;同年11月,第八届进博会上,宇树的人形机器人又"开打"了一场拳击秀。

可仔细一问,那时候的动作,靠的还是预设程序和人工遥控,说白了,机器人是照着排练好的套路在"演",背后多少有人在把控节奏。

往上个月说,8月19号,2026世界机器人大会在北京开幕,宇树也带着G1和新一代全尺寸人形机器人H2去露了一手,跳集群舞蹈,还打乒乓球——来球从哪个方向飞过来、什么速度什么旋转,机器人得实时感知,正手反手跨步击球都得跟着调整,连续几个回合能跟人对打下来。

老实讲,我当时看这段消息的时候没太当回事,觉得乒乓球再快也是相对规则的运动,跟真刀真枪的格斗还不是一回事。

现在回头看,这场乒乓球表演其实是个铺垫,练的正是"实时感知—预测—反应"这条链路,格斗无非是把这条链路搬到了对抗性更强、变数更多的场景里去检验。

这次不一样了,宇树这回用上的模型叫UnifoLM-X2-1.0,往前追溯,去年9月宇树就开源过一版名叫UnifoLM-WMA-0的世界模型架构,专门用来理解机器人和环境互动时的物理规律。

世界模型这东西,说白了不难懂——它相当于机器人脑子里装了一台"预演机",对手一拳过来,机器人不是靠死记硬背的招式去应付,而是实时在脑子里推演几种可能的结果,这一拳该躲还是该格挡、格挡完下一步怎么接,几乎是眨眼的功夫就算出来了,紧接着立刻做出动作。

人和人对打的时候,其实也是这个道理,脑子快的人往往不是招式多,而是预判准。

我个人认为,这个跨越的分量,比外行看着"机器人会打拳"这个表象要重得多。

预设程序和遥控操作,说到底还是"人在替机器人思考",机器人是执行者;而对抗场景下的实时自主决策,考验的是机器人自己感知、预测、决策这一整条链路能不能在毫秒级别里转起来。

这中间的技术门槛,我觉着不是一个数量级的差距,格斗只是个试验场,真要往后想,这套本事挪到救援现场、挪到仓库分拣、挪到没法靠人一步步遥控的场景里,可能才是它真正的用武之地。

说实话,这里我也得替持不同看法的人说句公道话。

有人会讲,格斗表演终归是设定好的对抗场景,对手也是同类机器人,动作幅度和场地都相对可控,这跟真实世界里乱糟糟、什么意外都可能冒出来的环境,还隔着不小的距离。

这话我觉着有道理,一次演示确实证明不了机器人已经能应付所有开放场景,世界模型碰上陌生状况会不会失灵,眼下也没有第三方给出独立验证。

所以我不会把这次突破说成什么历史性转折,它更像是一次扎实的、可以拿出来验证的技术进展,说明"世界模型驱动的人形机器人大规模落地"这条路径至少在原理上走得通,离真正大规模铺开,中间还得一步步来。

宇树官方这次给出的措辞也留了余地,落脚点是大规模落地部署的基础可行性,"基础"二字没有往更大了说,我倒觉得这个分寸拿捏得挺实在的。

回头再看日本那边,最近这段时间确实不太顺。

7月25号,东京一场人形机器人格斗赛上,一台机器人挨了对手一脚,还没等出拳,整个身子调转方向,一头撞上擂台边的铁门,把固定螺丝都震松了,机器人失控着滑出场外,直接倒地,现场工作人员手忙脚乱地把它扶起来。

8月26号,第二届世界人形机器人运动会在北京举行,1500米项目里,日本参赛的机器人跑得慢,中途还反复出故障,被中国的机器人一次次超过去,勉强跑完全程。

有意思的是,日本网友自己看了都挺失落,说日本曾经是机器人强国,如今在这种公开场合表现却拿不出手,多少有点丢脸。

依我看,这两件事和宇树这次的突破放在一块儿看,恰恰能说明问题出在哪儿。

日本机器人那两次翻车,一次是远程操控和急停系统在关键时刻掉链子,一次是运动过程里稳定性和续航跟不上,说到底都是"可靠的自主应变能力"没跟上。

而宇树这次要攻克的,正是这块最难啃的骨头——机器人在动态、有对抗性的场景里,能不能靠自己稳稳地做出判断。

写到这儿,我倒觉得没必要把这事儿捧得多玄乎。

日本那边的机器人这阵子接连出岔子,说到底也提醒了一件事,光会做漂亮动作不算完,扛得住意外、临场能自己拿主意,才是真本事。

往后这类机器人还能在哪些没法靠人时刻盯着的场合派上用场,我寻思着,值得咱们接着看下去。