众力资讯网

说好的更便宜,账单反而涨了三成。 V4.1 Flash内测实测中,同样提示词、

说好的更便宜,账单反而涨了三成。

V4.1 Flash内测实测中,同样提示词、同样计费口径,复杂任务下总花费比旧版V4 Flash高出36%。原因在于新模型倾向多开子Agent验证,游戏和小说任务中累计开启37个子Agent,光子任务就消耗超1亿Token。

消息是9月8日出来的,DeepSeek在官方交流群悄悄开了V4.1 Flash中间版本的内测,没有发布会,没有独立model ID,只在群里扔了一个模型名。留给开发者的体验时间,满打满算两天。

官方说得很漂亮:新模型结构,原生多模态,能力更强,速度更快,成本更低。这话没毛病,架构层面确实下了狠功夫。CED新结构把KV缓存压到每token 890字节,只有V4 Flash的四分之一,HBM需求直接砍掉75%,SSD需求压到八分之一。

按道理,底层省了这么多,账单该降,9月10日中午12点,Flash系列新定价也确实生效了,缓存命中价从0.05元砍到0.02元,降幅60%。

但问题出在账单的另一端,定价是单价,账单是总消耗乘以单价。V4.1 Flash生成速度飙到284 Token/s,接近旧版的3倍,峰值甚至跑到507 Token/s。

速度翻倍意味着什么,意味着同样时间吐出的Token翻倍,意味着总消耗也在翻倍。单价降了,用量涨了,两笔账一抵消,有人反而多花了钱。

一位开发者在社交平台上的反馈很直白,“5分钟10块钱”,“瞬间几十块没了”。这不是个例。虎嗅的深度实测跑了14组任务,光V4.1就累计消耗了3亿Token,最终同计费口径下的总花费比旧版V4 Flash高出36%。

更关键的是子Agent机制,V4.1 Flash在处理复杂任务时倾向于多开子Agent来交叉验证结果,在游戏和小说任务中累计开了37个子Agent,仅子任务本身消耗就超过1亿Token。说白了,旧版是让模型一口气答完,新版是让模型自己开一桌会讨论完再交卷。

单价低不代表总价低,这是很多开发者头一回在API计费上被绕进去。

虎嗅实测还暴露了另一个问题:吐字快了,交付未必快。V4.1生成速度约284 Token/s,但复杂任务中因调用工具反复验证,总耗时反而可能更长。

小说生成出现章节前后遍数矛盾,叶片数不一致,回测报告里年化收益等关键数字来回打架。速度快是速度的事,质量是另一回事,这两件事在V4.1 Flash身上还没完全统一。

再往深一层看,DeepSeek宣布9月14日12点起,所有发往V4-Pro的请求将被静默路由到V4.1 Flash,同一个模型名、同一个URL、同一套认证,后台换了模型,开发者代码一行不用改。

开源社区的反应几乎一边倒,核心争议很清楚:平台替用户做了决定。model_id是隐性的服务契约,静默替换直接破坏用户已经调好的Prompt、Agent和生产流程。有开发者建议保留旧模型一段时间,给个迁移窗口期,而不是一刀切。

这件事官方后来做了让步,原计划V4.1 Flash上线即切换,最终改成了9月14日统一切换,多给四天缓冲。四天,说多不多,说少不少,但至少说明官方听到了开发者的声音。

说白了,V4.1 Flash的架构确实是一次硬核升级。KV缓存压到四分之一,CED结构解决的是长上下文推理的底层瓶颈,这些都是实打实的技术进步。

但技术进步和用户账单之间,隔着一道很微妙的墙。你省了内存,用户未必省了钱;你提了速度,用户的Agent可能反而跑出了更多子任务。

开发者要的从来不只是“单价更低”,而是“同样的活,花更少的钱干完”。当模型的Agent能力太强,开始自作主张地开子任务、做多轮验证时,“聪明”本身就成了新的成本黑洞。

降单价是明账,降账单才是真功夫,开发者嘴上不说,心里都攥着计算器呢。这事儿官方后续怎么看,各位评论区聊聊。