众力资讯网

⚡️Astra:模狠话不多,计算轮次扩展1)涨价且Token高效。标准百万Tok

⚡️Astra:模狠话不多,计算轮次扩展

1)涨价且Token高效。标准百万Token输入/缓存读取/输出为10/1/50美元,均为Sol的2.5倍。DeepSWE中,Astra输出Token约3万,对比Sol的6万;执行步骤29步,对比61步;单任务费用接近。据个人实测,复杂后端项目代码量只有Sol的不到一半,评分至少在Fable5水平。

2)反向评测Benchmark。①官方同表中,Terminal-Bench 4.0由Sol的37.3升至57.9,DeepSWE由72.7升至74.1。前者覆盖终端编程等综合任务;后者在代码库中跨文件工程开发。多款模型拥挤在在70-75分帕累托。②Artificial Analysis的Astra与Sol看似基本没有提升。问题主要在Benchmark对复杂项目、跨软件操作覆盖有限。Astra说明Benchmark的低效化。模狠(Fable5级别+反向评测benchmark)+话不多(token效率非常高)。

3)ARC-AGI-3的99.9%。部分反映模型交互理解环境/Computer use能力。但核心是Harness差异。半私有集上,同为high档,评测方Harness为54.8%,OpenAI原生Harness为99.9%。跟此前DeepSeek Harness的原汤化原食是一个道理。

4)Computer use的APP吞噬论。模型能看界面、操作鼠标键盘,就能进入没有合适API的现有软件。因此有机会拿走任务入口和部分服务收入,定价参照也扩展到人工成本。但据科技博主,Computer use实测效果低于官方宣传,但总体达标。

5)循环Transformer。Mythoes Preview时期,已有循环Transformer架构传言(Q2交流猜想)。据Information,Astra采用循环深度,官方尚未公开架构细节。循环Transformer是在隐状态中增加计算轮次换取有效深度。据OpenAI 首席科学家,Astra 等前沿模型的计算图深度,处在 GPT‑4 的两倍范围以内(原文主要在讨论思维链监控与可观测性)。即并非通过暴力计算迭代换取模型智能,而是采用温和方式。

6)市场主流叙事是KV Cache减少。个人认为,循环Transformer的每一轮次隐状态都代表了相同权重的思维过程,不能随意丢弃。类比,如果思维过程简略太多,深入思考的时候会断片儿。从多篇论文来看,有选用内存槽、门控等降低隐状态KV Cache案例,但激进优化将削弱模型最终表现,且没有在大参数模型/长程任务验证。因此,计算轮次Scaling可能拉高配套需求。

7)反蒸馏。如果更多隐式推理,老师解题步骤训练路径弱化。此前,弱模型蒸馏缺口已经被堵上。虽然蒸馏路径可能变化,最终答案、代码和工具操作仍可提供训练信号,但蒸馏成本变高且难度加大。

8)方向:模型(循环Transformer,反蒸馏考验自建α)、海外链(天花板,O系ARR)、国产链(倒逼)、HBM(如果定价KV Cache减少)、CSP(VR全面量产)

9)风险:ROIC未实质突破、A系挤水分