最近脸上疯狂爆痘,也不知道到底是咋了,只知道身体告诉我压力有点大。
这两天学完了 Claude code 的源代码,顺便自己手搓了一个 agent 内核开源到 github 上(很奇怪吧,在 vibe coding 如此好用的当下,竟然还在坚持手搓代码)但事实证明想真的学会一个东西,确实要静下心来手搓一遍。
而在此之前,我才花了两个月的时间自己手搓了 mini sglang(推理引擎)。
最近 pi agent 的设计理念又推动了 harness RSI 的进程,又花了一堆时间去研究 pi agent 的设计理念......
算了不说了,我想表达的是 AI 的到来,正在加速一切领域的发展速度,而我的注意力已经不够用了....以前一个研究发现从 idea 到实验再到论文需要半年到一年时间,而现在,当我搭好 auto research 的 pipline,用好 nature 的几个 skill,我可以很快获得一个像模像样的论文初稿,后续只需人工的 refine 和 tunning。
于是, 隔三差五就会有新的研究出现,推翻之前的定论,我刚深刻学习完 llama 的模型架构,学完 qwen 的模型架构,学完 moe 的模型架构,一切就都变了......线性注意力,门控注意力,稀疏注意力,RoPE 以及最近 deepseek v4.1 flash 又返璞归真走起了 encoder+ decoder 的路线...............qwen 好像又预告了新的模型架构
我确实是学不过来了,一切都变得不再 solid,hot nerd 正在加速改变这个世界,二流的研究者只能前赴后继地吸取各种各样的 idea
这是个百花齐放的时代,也是根本学不完的时代。
glm5.3flash 的训练思路就是借鉴了知乎的一篇文章, gpt6 的 loop trasformer 更是在早年就发表过的论文,gpt5.6 的训练思路借鉴了日本 ai 公司 fugu 的思路。 再一次印证了翁家翌的言论“idea is cheap”
但令人头皮发麻的是....这些思路和论文,也就是 iclr26 刚中的论文,而 claude code 源码泄露也才是四个月之前的事情.......而我竟然觉得 claude code 的设计思路已经过时了......
我想这就是我感到焦虑的原因,学的越多,越感觉学不完。知识的演进越来越快,而我的注意力也从 full attention 走向 sparse attention