(最后可看阿东的阅读笔记)
三个层次:怎么往前看 / 约束下怎么规划 / 怎么从执行中学。
大部分Agent现在还是反应式的——看到当前状态,推理下一步。
[向右R]一个 4B 模型超过了闭源 SOTA
ProAct (混元出的)这篇让我印象最深。
做法是把树搜索(MCTS)的探索过程蒸馏成推理链,再用强化学习训练模型学会前瞻式思考。
结果:一个 4B 模型,超过了所有开源 baseline,接近闭源 SOTA。
规划能力不是大模型的专利。训练数据里缺的不是知识,是 "多想一步" 这种思维模式。
[向右R]LLM 不应该独自承担规划的全部
TAPE 和 DeepPlanning(Qwen 团队出的)都在说同一件事:
LLM 单独做规划,经常违反硬约束。加个传统求解器进来,成功率涨了 21 个百分点。
我们可能太迷信 "让 LLM 自己搞定一切" 了。传统算法在约束求解上已经有成熟解法,LLM 的优势是理解模糊需求和灵活推理,不是精确计算。
[向右R]239 条数据,47% 提升
daVinci-Agency 这篇解决了一个很实际的问题:训练 Agent 做长程规划,数据从哪来?
答案是从真实的软件开发 PR 链里提取。一个 PR 从开始到合并,本身就是一条自然的长程规划轨迹。
239 条数据,47% 相对提升。好的规划训练数据不需要多,需要真。
我自己做系统也有类似感受。几百条高质量真实案例,比几万条合成数据有用得多。
[向右R]成本约束是必选项
INTENT 解决的问题非常实际:让 Agent 在规划时就考虑 API 调用成本。
做 Agent 产品的人都会遇到这个问题。一个不考虑成本的 Agent,即使任务完成了,ROI 也可能是负的。
我的四个洞察
[一R]"往前看" 的能力可以被蒸馏。小模型也能学会前瞻规划,不一定需要最贵的模型。
[二R]LLM 不应该独自承担规划的全部。LLM 擅长理解需求和灵活推理,传统算法擅长约束求解和精确计算,结合起来才行。
[三R]成本约束是必选项,不是可选项。每个做 Agent 产品的人都会遇到。
[四R]从执行中学习才是闭环。规划系统不能只往前看,还得回头看。
Agent 大模型 LLM规划 论文解读 机器学习 RED新生代创作大赛
阿东,大模型算法工程师,OPC 创业者。

















