众力资讯网

静态环境教不动更强的 agent

同样的题刷一百遍,人不会变强,agent 也一样。

谷歌研究团队的论文 EnvHarness 冲的就是这个:训练环境多是手工搭的固定关卡,agent 一变强就教不动了。

它不重造环境,而是在外