众力资讯网

刚发的 DeepSeek-V4-Pro-0813,被人拿去跑 max 推理档下的

刚发的 DeepSeek-V4-Pro-0813,被人拿去跑 max 推理档下的 50 轮 AgenticCoding 长链路任务,结果有点反常:连续测 3 次,有 2 次模型在第 42 到 43 轮就自己停下了,50 轮的机会没用完;同一组测试里,成绩也没打过 GLM-5.1。max 档本来就是鼓励模型“多想一会儿、多干几步”的档位,结果它反而偷懒还输比赛,这两点撞在一起就有点刺眼。

测试者 @karminski3 自己给了一个猜测:要么是强化学习阶段的奖励信号没设计好,让模型学会了“别把活干完”;要么是上下文越拉越长,后段的注意力已经在衰减,越往后越糊。两条都属于训练侧和长上下文处理上的老问题,只是这次在 Pro-0813 上被一个具体 case 顶到了台面。

评论区还有另一种声音:API 名字先换上了,后台模型可能还没全量铺开,跑出来的不是真正的 Pro-0813 本尊。换句话说,现在看到的“早停 + 落后”,未必就是模型真的不行,也可能是版本替换到一半、前后端没对齐造成的错觉。

目前能下结论的边界其实很窄:只有 max 档、只有 AgenticCoding、只有这一个 50 轮的 case,测试者本人都说了“我这一个 case,不对其它 case 负责”。所以现在下死结论说“V4-Pro 翻车”还太早,更靠谱的姿态是等更完整的复测和即将放出的详细视频。

你要是手上有 DeepSeek-V4-Pro-0813 的 max 档权限,跑过几轮长链路任务,有没有遇到提前结束或者后半段明显掉质量的情况?把你看到的轮次和任务类型贴在评论区,等视频出来一起对。