上周,我去逛WAIC,H1展馆里各大模型公司展台前基本都是人挤人,很多都在排队体验最新的AI应用。
我在展馆逛了一圈之后,注意到了一家不太一样的公司。因为它既不做大模型,也不做C端应用,但几乎你叫得出名字的国产大模型,都在用它的服务。
这家公司叫无问芯穹。
1 说实话,我之前对这家公司了解不多,也不知道它是干什么的。
跟几个一起逛展的朋友聊了一下才知道,像Kimi、智谱、MiniMax这些大模型,底层的推理服务都跑在这家公司的基础设施上面。
比如你每天打开AI助手问问题,它秒回一段流畅的回答。这个过程看起来简单,背后其实涉及到海量Token的生产和调度、不同芯片之间的协同配合、推理资源的实时分配。
你的问题要被拆解成一个个Token,然后送进模型里做推理运算,运算需要调用GPU等各种芯片的算力,算完之后再把结果一个Token一个Token地吐回给你。
这整个流程里,模型是大家看得见的明星选手,但让这些明星能稳定上场的那套系统,就是AI基础设施。
如果大模型公司相当于一座座发电厂,各自生产智能服务能力;那无问芯穹做的事情更像是建电网,把零散的、不同类型的算力资源汇聚起来,高效完成Token的生产和调度,稳定输送到终端。
它不自己做模型,但模型要稳定跑起来,离不开它。也是被很多业内人士称为整个AI产业链里最关键的一环。
2 当然,如果仅仅是搭个调度平台、做个中间层,这件事的想象空间其实有限。
无问芯穹真正不一样的地方在于,它这次在WAIC上发布了一套完整的业务架构,叫前店后厂一中心。
不是只做算力调度这一件事,而是把从底层硬件到模型服务再到行业落地,整条链路都串起来了。
要理解这个架构,得先从那个"一中心"说起,也就是算力集散中心。
中国的AI算力生态有一个海外不太存在的特殊困境:芯片种类极其繁杂。英伟达的GPU当然是主流,但受供应限制,国内实际在跑的还有华为昇腾、寒武纪、海光等一大堆不同架构的芯片。不同品牌、不同架构的芯片混在一起用,中间存在大量的适配损耗和效率问题。
怎么让这些不同的硬件协同起来,把算力效率拉到最高,这才是真正的难点。
无问芯穹的技术路线叫多元异构协同,核心就是在多种模型算法和多种芯片硬件之间找到最优解,实现跨层次的极致优化。
算力集散中心做的就是这件事,从根上去解决国内算力碎片化的问题。中间一层叫Token工厂,给大模型公司提供全栈推理服务,从网关、路由到底层推理实例,是一整套完整的服务技术栈,稳定产出高质量Token。
最前面一层是AI生产力商店,专门适配Agent智能体的运行需求,面向不同行业场景输出可以直接落地的解决方案。
这三层叠在一起,构成了从算力到Token再到行业应用的完整转化链条。它的核心主张是用智能进化智能,用生产力加速生产力。
3 那为什么说无问芯穹是这条赛道的领跑者?
先看一组数据。过去一年,他们推理成本下降超过10倍;MaaS平台对国产主流模型的精度对齐率超过99.9%,吞吐量提升2到3倍,时延缩减一半;今年7月,平台日均Token调用量比去年12月增长了大约40倍。
而且,今年它跟中国电信一起做了一个国内首例的验证:让相隔4000公里的两个数据中心协同训练同一个300亿参数的大模型。
4000公里,联合训练性能提升 165%,异构芯片,这三个条件叠在一起,以前在国内没有人做成过。
早在去年,无问芯穹就率先提出了Agentic Infra这个概念,简单说就是用智能体技术来管理和优化基础设施本身,让整套系统具备自主进化的能力。
不是被动地等人来配置资源,而是系统自己根据负载情况动态调配,实现7乘24小时的自主运维。
这次WAIC发布的"前店后厂一中心",就是这套理念的完整落地。坦白说,这个思路放在整个行业里,确实是领先的。
但挑战同样存在。
随着Token需求的爆发式增长,算力成本的持续压降能不能跟上?多元异构的技术路线能不能在更大规模上保持稳定?
无问芯穹在过去一年把推理成本压低了超过10倍,而且预计每三到六个月还能再降50%。
这个节奏如果能持续兑现,竞争壁垒会越来越高。因为这个降本速度直接决定了未来有多少公司用得起AI、有多少应用场景能真正落地。
4 其实不只是这家公司本身,还有它背后反映出的一个行业趋势。
以无问芯穹为例,这家公司累计融资超过22亿元,在国内AI原生基础设施公司里排第一。
而在2026年上半年,海外AI基础设施赛道突然密集出现了大额融资:Together AI拿了8亿美元C轮,估值83亿美元;Fireworks AI在谈150亿美元估值的新一轮;Baseten估值到了130亿美元。
这三家都成立不超过四年。
全球最聪明的钱正在涌向同一个方向:不是模型层,不是应用层,而是中间那层基础设施。
背后原因也不难猜。AI的使用量在指数级增长,Token需求在爆发,但算力供给是有物理上限的。
但光能调度算力还不够。这条赛道真正稀缺的能力,是同时吃透算力、模型结构、训推优化和应用场景这四件事。
你会发现无问芯穹的前店后厂一中心刚好覆盖了这四个维度:算力集散中心对应的是充足、稳定、可扩展的算力底座;Token工厂对应的是模型结构和训推优化,用极致效率服务 Token 的规模化、高质量生产;AI生产力商店对应的是行业应用场景的最终落地。
能把这四件事同时做好的公司,整个行业里数不出几家,这也是它能在这条赛道上领跑的根本原因。
我之前一直觉得,AI行业里离用户最近的那层最有价值,模型公司和应用公司才是主角。但WAIC这一趟逛下来,我的判断有了一些变化。
历史上每一轮技术浪潮,最终格局稳定之后,基础设施层的玩家几乎都是活得最久、护城河最深的那批。
无问芯穹选了一条不那么容易被看见的路,但从目前的数据来看,走得相当不错。