大模型评测不是一台精密天平,只要把模型放上去,指针就纹丝不动地指向一个唯一答案。评测过程中,输入预处理的细微差别、推理档位的高低、状态保留策略的不同,都会让同一个模型跑出截然不同的分数。
GPT-6 Astra 在 ARC-AGI-3 上,标准配置下得分 62.7%,一旦换上保留推理状态、压缩长对话的 Provider Adapter 框架,分数直接飙到 99.95%。这种差距,是评测框架本身带来的正常波动,不是模型能力突然暴涨了。
三款主流大模型ARC-AGI-3测试得分对比行业里通行的“多模型交叉输出加分歧样本人工校准”流程,也本来就是用来剔除异常样本、消除噪点的标准动作,这类操作占到主流生产流程的 50% 到 70%。承认这些,是对技术现实的基本尊重。
但问题在于,如果这些调整真的只是中立的噪点消除,那它留下的痕迹,不该是现在这个样子。
调整全都利好自家,噪点不会这么“懂事”噪点之所以叫噪点,是因为它随机、无方向——有时把分拉高,有时把分拉低,有时连带把竞品的分一起拉高。但这次 GPT-6 发布前后的跑分变动,方向整齐得让人起疑。
GPT-6 Astra 的幻觉率,从 4.2% 被砍到 2.0%,前代 GPT-5.6 Sol 的幻觉率也从 12.2% 降到 9.4%。自家的核心指标,全都在往好的方向走。与此同时,竞品 Anthropic Fable 5.1 在 FrontierMath Tier 4(v2)上的得分,被从 87.8% 调低到 78%,降幅接近 10 个百分点。
不同大模型在FrontierMath评测下的表现分布
所有调整,没有一次是拉高竞品、拉低自家;没有一次是修正出一个对自家不利的结果。随机噪点不可能天然地、无一例外地,全部朝向优化宣传优势的方向分布。这个调整清单,读起来不像校准日志,更像宣传物料的精修记录。
时间窗口卡在发布前后,修正节奏不合常理常规的噪点消除,需要跨多轮复测、反复校验,周期通常以天为单位。但这次幻觉率等多项核心指标的拉升,集中在 OpenAI 官方博文上线前后约三小时的窗口内。媒体提前拿到的预热稿里,ARC-AGI-3 得分还是 98.6%,正式上线时直接跳到了 99.99%。

这不是在发版前完成校准、稳定发布,而是在发布进行中,边上线边改数字。任何经历过软件发版的人都能嗅到这里的异常:这不是技术流程,这是紧急操作。
被质疑后立刻回弹,修正为什么不敢坚持最致命的一环,是这些调整在社区用户拿出带时间戳的网页快照、公开对峙之后,全部发生了回弹。GPT-6 Astra 的幻觉率从临时调整的 2.0% 回到最初的 4.2%,Fable 5.1 的数学得分从被压低的 78% 回调到 83%。
如果这些调整真的是经过校验的正确修正,那它们应该能站得住脚。被质疑就立刻改回去,说明调整本身缺乏技术底气,更像是被发现之后的一种止损动作。
这还不是最关键的一层。
根本问题不在“调了数据”,而在“没告诉你调了数据”这件事的底层逻辑,是 OpenAI 在没有披露特殊测试条件的前提下,把一个精心优化后的极端高分,当作模型的默认水平展示给全世界。ARC-AGI-3 的 99.99% 这个数字,是靠在 Provider Adapter 框架下保留隐藏推理状态、复用历史探索结果才跑出来的。
62.7% 的标准配置得分,才是用户和开发者在常规调用中更可能遇到的水平。发布时不说明这个区别,让读者默认把 99.99% 当成裸模型能力,这不是技术问题,是公示规则问题。
对比一下行业标杆就很清楚。谷歌 2025 年发布 Gemini 3 时,主动同步披露了不同测试环境下的多组得分,ARC Prize 创始人 François Chollet 随后也公开验证了其 ARC-AGI-2 成绩。
伯克利 2026 年的智能体评测审计研究,也把“智能体与评分器严格隔离”“公开排行榜定期更换测试实例”列为评测信任的最低门槛。
OpenAI 自己也在《Separating Signal from Noise in Coding Evaluations》审计报告里,要求披露多维度指标、禁止把自动提取的公开数据作为唯一依据。这一次的跑分变动,恰恰踩在了所有这些规范的反面——没披露条件、没公开运行日志、没通过独立第三方验证。
所以,OpenAI 这次被质疑,不只因为数字被改过,更因为改完之后,它没有告诉任何人,这些数字是在什么条件下得来的。而在这个行业里,当评测条件不透明时,一个接近满分的数字,和一张没有标注刻度的地图一样,无法指引方向,只能制造幻觉。