大模型的本质也是复读机?让DeepSeek V4 Flash复读5次就能超过claude fable5?
Stanford、UC Berkeley 和 NVIDIA Research一起做了一项研究 LLM-as-a-Verifier。这是一个通用的 LLM 验证框架,核心思路是在 Agent 生成多个候选方案后,用 LLM 作为 verifier 对结果或执行轨迹进行细粒度评分、比较和筛选,从而把更多 test-time compute 转化为更高的成功率。
作者介绍用DeepSeek V4 Flash验证的例子:“使用DeepSeek V4 Flash进行规模化自我验证,在Terminal-Bench 2.1上击败Claude Fable 5,同时成本低11倍💰
随着开源模型能力的不断增强,它们现在能够以极低的成本生成大量高质量的候选解决方案,并验证自己的输出。
例如,我们发现仅用DeepSeek V4 Flash采样5个解决方案,并使用同一模型作为验证器(LLM-as-a-Verifier)进行排序,就能显著提升准确率(79%→88%),在Terminal-Bench上超越封闭前沿模型。”
地址:github.com/llm-as-a-verifier/llm-as-a-verifier

