众力资讯网

腾讯混元今天把 Hy4 Preview 给开源了,而且一上来就是毫无保留的“肌肉

腾讯混元今天把 Hy4 Preview 给开源了,而且一上来就是毫无保留的“肌肉战术”:

770B 总参数、每 Token 激活 49B、原生 1M 上下文,包含原版和 FP8 权重,协议直接给到了商用友好的 Apache 2.0。

稍微研究一下这个 Hy4 的架构,你会发现腾讯这次的设计相当激进,甚至可以说是把当前大模型领域的最强大乱斗解法做了一次大集结。

整整 78 层网络,居然有 77 层全是 MoE(混合专家架构)。

每层挂了 256 个路由专家加上 1 个共享专家,每次只激活 Top-8。这意味着它的总参数量虽然高达 770B,但激活比例只有区区 6.3% 左右。这种“大体量、小消耗”的打法,本质上就是把算力性价比榨干到极致。

更值得关注的是细节。注意力机制用了 Gated DSA 搭配 IndexCache,残差通路用了 iHC,底层居然还原生塞进了一层 MTP(多 Token 预测)来实现推测解码。

腾讯在技术文档里甚至大方写明:这套架构吸收了 DeepSeek 和 GLM 的思路。在当下的开源圈里,这种“偷师学艺还明明白白写进说明书”的做法,反而显出了一种不藏着掖着的霸气——既然行业里有证明有效的路线,那就拿过来做极致优化。

从官方晒出的 Benchmark 来看,这次测试集的选品思路非常明确:刷题时代过去了,现在是“打工时代”。

Terminal Bench、DeepSWE、SWE Atlas Refactoring、Toolathlon、APEX-Agents、PostTrainBench……榜单上全是衡量 Agent 实操、命令行操作、代码重构和复杂工具调用的硬核场景。

看一下数据对比就能感受这种质变:在前代 Hy3 时代,DeepSWE 只有 28.0 分,而 Hy4 Preview 直接拉到了 64.3 分;SWE Atlas 自动化重构也从 32.9 分拉到了 53.3 分,一举超越了 GLM 5.3 的 51.9 分和 GPT 5.6 Sol 的 52.4 分。

在 HorizonMath 上,它的 pass@4 甚至达到了 8.8 分,直接压过了 DeepSeek V4 Pro 的 4.4 分。

为了验证它是不是只能在公版测试集上“套壳作秀”,腾讯还找了 163 位内部技术专家,拿 203 个真实的腾讯工程任务做盲测。结果 Hy4 Preview 平均得分 2.99/4,小胜 GLM 5.3 的 2.92 和 Kimi K3 的 2.94。

不过最接地气、也最有意思的,是腾讯官方自己在说明里写的“已知问题”: 一是遇到复杂任务容易“想太久”,二是“过度验证自己的工作”。

看到这两条我差点笑出来。这不就是典型的新进高工综合征吗?

面对复杂需求的时候,先站在白板前陷入长达半小时的人性思考,好不容易写了三行代码,又忍不住跑了五十遍单元测试,生怕自己把生产环境给炸了。某种意义上,大模型在具备强大 Agent 能力的同时,居然也完美继承了人类程序员的精神内耗与自我怀疑。

总结一下最近国产顶级旗舰模型的进化路径,画风其实已经异常清晰了: 超大 MoE 架构、超低激活参数、原生百万上下文,然后倾尽全力把所有算力和 RL 调优全部砸向 Coding、Agent 和真实工作流自动化。

这次腾讯的动作显然更狠一点,770B 级别的 Preview 版本连带 FP8 权重直接拍到开源社区里,意思非常直白:东西我先扔出来,欢迎全网免费试驾、挑刺、找 bug,等正式版出来的时候再见分晓。

当千亿级别的旗舰级 MoE 权重像宣发传单一样免费派发,那些还在靠闭源 API 卖高价打工模型的大厂们,后背恐怕要隐隐发凉了。