众力资讯网

llama.cpp 大更新,本地 AI 不只是会聊天了

搞本地部署的应该都留意到:llama.cpp 悄摸摸发了 v0.6.0,看完 changelog,第一感觉——它不想只当"跑聊天模型的工具"了。

最亮眼的是多了个 /v1/systemone 接口,专门伺候"决策模型"。啥叫决策模型?说人话:它不唠嗑,你扔候选过去,只回"选哪个概率高"。以前得自己搭环境拼协议,挺折腾;现在直接给了一等公民通道,laya、julia-1、lev、openjev、kev 都能用,openjev 还带视觉。

配套的 llama_batch_ext 也关键,一批次能混塞 token 和 embedding、带每步"状态"嵌入,给 MTP、deepstack 铺路;GLM-5.3-Flash(320B 图文混合)和 Clef 也接上了,Clef 文本视觉都通。

对普通用户没啥感觉,开发者该偷着乐:LLM 写候选、决策模型做排序、程序去执行,这套"三段式"本地 Agent 以前得维护好几个独立服务,现在一个框架跑通,复杂度下来一截。

顺带实惠:Qwen4Exp 的 MTP 解码在 DGX Spark 快约 1.5 倍;Mac 的 Metal 矩阵乘最快约 3 倍;Web UI 接了 Hugging Face Hub,拉模型不用手动拷。

我个人的看法:本地 AI 从"会聊"走向"会办事",这步算立了个桩。咱普通人暂时用不上,爱折腾本地的,值得升一波。
#ai #ai工具 #大模型