【AI榜单通胀:别再迷信那个唯一的“最强模型”】最新发布的 Claude Opus 5 在各项指标上刷到了第一,但评论区却吵翻了天。现在的行业现状是:Opus 5 强行登顶,GPT-5.6 Sol 紧随其后且性价比更高,而国产的 Kimi K3 在特定任务上甚至能反杀。大模型领域已经进入了“诸神黄昏”,曾经那个靠一个分数就能决定谁是老大的时代,已经彻底终结了。这件事最值得玩味的角度是:榜单分数正在和真实体感发生严重脱节。解剖这些数据你会发现,Opus 5 虽然分数高,但它那令人抓狂的“安全护栏”甚至会因为你问“兔子为什么繁殖快”或代码里出现“cell”这个词就拒绝服务或悄悄降级。对于开发者来说,一个智商 100 但动不动就罢工的模特,远不如一个智商 95 但任劳任怨的劳模好用。现在的底层逻辑已经变了:模型不再是越高分越好,而是要看“思维成本”的性价比。与其追求那个多出 4% 分数却贵了一倍的顶配模型,聪明人已经开始用 Luna 这种小模型跑工具调用,用 Terra 这种中型模型做日常沟通,只在处理复杂逻辑合成时才请出 Sol 或 Opus。这种“模型组合拳”才是圈内人的真实玩法。 artificialanalysis.ai/models