有个团队最近在硅谷程序员圈炸锅了,他们干的事特别简单粗暴:把一堆开源模型拼在一起,当成"一个AI"来卖。💥
这个项目叫Echo,背后是YC孵化的实验室Tracer。他们自己不训练大模型,专门当"模型调度员":DeepSeek、Qwen、GLM、Kimi这些开源模型,全是他们的零件。
先说钱从哪来,这是最实在的部分。
Echo的生意本质是套利:按官方费率表,从各家开源模型厂商手里买推理算力,开源模型本来就便宜,DeepSeek、Qwen这批厂商还在打价格战,单价通常比旗舰API便宜一个数量级;它再把这些算力包装成"一个能打平旗舰的AI"卖给你。
价格对比有多刺眼?Anthropic的旗舰套餐一个月200美元,Echo最贵的套餐一个月10到15美元,干的活差不多。这就是用户愿意掏钱的原因:真金白银的省钱。
那它凭啥又强又便宜?这是全文重点,我用大白话拆开讲。
第一,钱省在"不再一刀切"。旗舰模型贵,贵在你让它"总结一段话"这种简单活,它也按旗舰单价收钱。但现实里八成以上的请求是简单活,根本用不着顶级智力。Echo的逻辑:简单活派给便宜的小模型,单价可能只有旗舰的十分之一;只有真难题才动用最贵的模型。大部分请求降到便宜模型,总账单自然就下来了。
第二,怎么判断一道题是难是易?靠一道"验收门":先让便宜的小模型答,有把握就直接交卷,拿不准才转给大模型兜底。论文里有数据:一个分类任务上,83.2%的请求被小模型直接消化,答案跟大模型的一致性高达0.959。翻译成人话:先让实习生做,实习生有底就交卷,没底才请教授,大多数题根本轮不到教授出手。
第三,多模型协作会不会反而更贵?这是评论区问得最多的问题。答案:大多数请求只派一个模型,只付一份钱;少数难题才让几个模型一起上,但三个开源模型加起来的钱,仍然比一个旗舰模型便宜,因为开源单价低了一个数量级。这就是"成本只要三分之一"的算术基础。
第四,怎么防止用户薅羊毛?最贵的旗舰车道每天限量2到20次,套餐越高次数越多;日常请求走便宜车道;再加共享余额,用得多扣得多。想拿10美元套餐白嫖100美元的算力,没门。(防薅羊毛这个意图原文没明说,但定价结构明摆着就是干这个的。)
评论区也吵得凶:有人说评测是自己评自己,两个硬基准还没出结果;有人说路由不透明,大企业不敢接入;还有人算账"只有一个模型接近旗舰,而且只便宜一半"。但支持者的反驳也有道理:它是个路由器,省钱的逻辑就是只在必要时才用贵的。
我的看法:Echo最值钱的不是又一个AI套壳,而是它指出的新机会——模型路由。
顶级模型API贵到天上,开源模型便宜到白菜价,"帮用户把请求分给最合适的模型"本身就是一门生意:用户省钱,路由商赚差价,模型厂商多出货,三方共赢。
而且这事门槛比训练大模型低太多,不需要GPU集群,要的是对模型能力的理解加一套聪明的调度算法。下一个Echo,可能就藏在某个刷帖的独立开发者手里。
创业 ai创业
