众力资讯网

283秒降到41秒,机器人为什么突然变快了?

在 LIBERO Object 的200次评测里,同一任务的平均执行时间从283.6秒缩短到40.9秒,快了约7倍,成功率只下降3.5个百分点。
这不是调参调出来的,是清华、无问芯穹和正行创新联合开源的具身智能框架 RPent,用一个叫 Flash Mode 的机制跑出来的。
先说问题在哪。
现在让大模型控制机器人,主流就两条路:端到端模型精度还行,但任务一长、场景一变就容易退化;基于 GPT-6 的 Coding Agent 能规划能拆任务,但每一步都要推理,机器人等不及,太慢了。
RPent 选了第三条路:大模型负责想,具身策略模型负责做,记忆系统负责记。三块拼在一起,通过一个开源框架连起来。
Flash Mode 就是这套思路的产物。机器人第一次做任务时,规划器调用大模型、VLA和程序化技能、尝试、试错。一旦成功,这套流程会被压缩成一张"任务卡"。
任务卡记住的不是某个场景里的固定坐标,而是任务阶段、动作原语、关键目标和检查条件。下次遇到类似任务,系统可以直接复用这套流程,再让视觉模块重新找准物体,执行模块根据现场情况调整动作。只有检查没通过、环境发生变化,或者流程进行不下去时,才会重新请大模型规划。
在 LIBERO Object 的 200 次测试里,平均执行时间从 283.6 秒降到 40.9 秒。
但快只是表面。真正有意思的是 RPent 让机器人开始"举一反三"。
它有一套三层记忆机制,把验证过的任务方案存下来——不是某次执行的固定坐标,而是可迁移的操作逻辑。比如系统会记住"先确认目标、再调夹爪位置、用 VLA 抓取、检查结果"这个流程。物体位置变了?重新观察环境,复用同一套逻辑就行。
位置交换扰动任务中,引入记忆后成功率从 31% 升到 87%。
真机演示里,机器人会读取瓶身和袋子上的标签,把饮料分拣到对应位置。抓住瓶子后,它先轻轻试抬,确认夹持稳定;遇到不可行的路径,就调整腕部姿态继续执行。勺子被两个碗挡住时,它也不会硬抓,而是先移开碗,让目标重新变得可见、可达。
观察、判断、执行、纠错,形成了一个完整的闭环。
github开源:RPent
#具身智能 #人形机器人 #机器人 #开源框架 #大模型 #rpent #GPT6 #大模型 #科技前沿