智象未来又放了个大招。今天正式发布具身世界模型 HiDream-O1-Embodied,强化机器人物理感知与动态预判能力,助力具身智能实现更高阶的物理交互。
这个模型的发布标志着智象的技术闭环了:打通图像、视频、3D、动作等模态,贯通理解 — 推演 — 执行全流程,构建统一世界模型基座。这个布局在行业里还是很有前瞻性的,不是跟风做单点能力,而是从底层架构就开始布局。
首发成绩就很亮眼。首次参评具身智能模型评测平台 RoboColiseum,就在核心的 Robustness 扰动适应子榜单中以平均分 0.692 登顶榜首。这个子榜被公认为最具挑战性的一环,通过改变背景、光照、材质、机器人初始状态、相机位置和图像质量,检验模型在非理想环境中的稳定性,不是在温室里考试,是在各种意外中检验真本事。
三项核心能力突破很扎实。语言理解上突破关键词匹配局限,覆盖多元动词、句式和表达方式的等价指令空间,不被句式束缚只锁定意图本身。视觉感知上多视角协同,不同视觉通道相互补充,避免一处失灵全局失效。高容错机制上,训练阶段主动引入多种非理想条件,让模型在不完美中学会稳定执行,这一点对真实场景部署特别重要,毕竟真实世界永远不完美。
背后是真实基座加生成增强的数据生产范式。和诺亦腾合作,用高精度真人动作捕捉数据作为真实底座,智象借助原生全模态能力完成百倍级数据精细化扩增,解决了具身训练数据稀缺的痛点,这是行业普遍面临的难题。模型既做考生也做出题人,形成数据与模型互相驱动的增长飞轮。
不到一个月前,智象刚发布交互式世界模型 HiDream-O1-World,在 WBench Navi 分榜以 80.9 登顶。交互式世界模型解决理解与推演,具身世界模型解决操作与执行,两者形成有力互补。
做科技媒体观察下来,智象这条路走得很清晰。从图像到交互式世界再到具身世界,原生全模态的技术理念在一步步落地。创始人梅涛说下一代大模型竞争关键在于从单模态走向原生统一的全模态,智象正在用实际产品验证这个判断。世界模型的竞争,已经从单一能力转向全栈能力了啊朋友们真的!
智象未来具身智能世界模型原生全模态前沿在线


