但我今天测试了六个多小时。坦诚的跟大家说,纯体感,我觉得 GLM-5.3 应该又继续回到了开源模型 SOTA 老大哥的位置了。
注意,只是我的体感。我看智谱在博客里还是很低调,挺好的,国模也越来越有自信。不一定非得咋咋呼呼。
就像当年明月说的那样,张牙舞爪的人,往往是脆弱的。因为真正强大的人,是自信的,自信就会温和,温和就会坚定。
我不知道大家怎么看这些事,现在的几个头部模型,包括 GPT-5.6 和 Opus 5 在内,我已经很难再通过具体任务去分出孰强孰弱了。
只有在某个模型明显掉链子的时候,我才会一下子感觉出来差距。
否则在大多数任务里,基本很难靠一两个 Case 立分高下。
我拿 GLM-5.3 跑了两个任务。
第一个偏前端。昨天看到 Grok Bot 的视频很喜欢,就让 GLM-5.3 基于自家产品 Logo,也做了一个类似纯代码的动画,一个多小时,纯前端实现出来的效果,还是非常棒,很流畅,兼具美感。
第二个是后端的长程任务。我前段时间做过一个内部工具,主要帮我检查错别字。
一开始我觉得这就是个挺小的功能,后面做着做着才发现,完全想简单了。
因为错别字检测并不是把一段文字直接扔给模型,让它挑错就行。
这里面既要有一套基础规则,又不能完全依赖规则,因为很多错误只有结合上下文才能判断,这部分还得交给模型。
而且模型调用多了以后,速度又会变慢,成本也会上去。最后还得考虑怎么减少误报、漏报,怎么把规则和模型的结果合在一起。
原来那个版本主要是 GPT 5.6 帮我完成的。但效果一直不好,我其实已经没什么思路了,也不知道怎么优化。
今天我直接把这个项目交给 GLM-5.3,结果它从整个架构和处理流程重新梳理了一遍。调整完以后,确实效果有提升。







