训练AI总崩?先管问题,别先管答案
大模型做强化学习时,常见做法是限制“回答不要偏离原模型太远”。问题是:约束越强,探索新解法的空间也越小;约束拿掉,训练又可能失控。
【来源事实】8 月 24 日的新论文 ERPO 提出一个反直觉改法:先别直接管回答,改为约束“训练过程中遇到的问题分布”。它用 Query-KL 限制问题分布相对强化学习前参考模型的漂移,再用参考模型生成的静态逐题权重,减少低概率问题带来的高方差更新。Query-KL 的梯度只经过问题似然,不直接压缩回答分布;作者称它可接入 GRPO、PPO、REINFORCE,而且不增加额外前向计算。
实验用了约 8500 道 MATH 3–5 级题,在 Qwen2.5-Math-7B/32B 上训练,并统一检查 0.1–1.5 的采样温度。六个数学基准的平均 Avg@32 从 GRPO 的 27.4% 提升到 ERPO 的 33.6%,平均 Pass@1 从 27.5% 提升到 33.2%。在 MATH500、Qwen-32B、温度 1.5 这一特定设置下,两者更是 25.2% 对 80.8%。
但别把单个高分当成通用结论。训练延长到 1000 步时,GRPO 约在 400 步后先从高温区明显退化;ERPO 的下降较小,却仍可能出现熵突然上升和采样能力坍塌。
【专家判断】这篇论文最大的价值,是提醒我们:训练漂移不只发生在“答案”,也可能发生在模型实际偏好的“问题”。以后审计强化学习训练,建议收藏这四项:
1)Policy-KL:回答偏了多少;
2)Query-KL:问题分布偏了多少;
3)训练—推理差距:reward 是否掩盖泛化下降;
4)温度曲线:低温稳定是否只是表象。
边界也很明确:目前主要验证数学推理和 Qwen 系列,通用对话、代码、多语言仍待验证;问题似然估计本身有质量与成本,正则系数也未做穷举搜索。论文已更新到 v2,官方代码仓库现可访问,但公开历史仍较短,复现成熟度需要继续观察。
一手 强化学习 GRPO AI安全
