众力资讯网

数博会最硬核的新东西,ParaCache无出其右 跑了一天数博会,我对ParaC

数博会最硬核的新东西,ParaCache无出其右
跑了一天数博会,我对ParaCache最直观的感受就一句:大模型终于不用每聊一轮,都重新翻一遍旧账了。
我平时接触企业知识库比较多,对“首字迟迟不出来”这件事特别敏感。短问答还好,一旦塞进去几十页材料,再连续追问几轮,模型前面像是在认真思考,后台其实很大一部分时间花在重算历史上下文。内容越长,等待越明显。
中科曙光这次公布的数据挺提气。120K输入长度下,采用ParaCache后,单轮对话首词元时延(TTFT)最高降低98.5%,压到400毫秒;多轮会话也能降低80%以上,降至4.9秒。对普通用户来说,就是点下发送后,“第一字”能更快蹦出来;对企业来说,则意味着客服、文档分析、智能体等长上下文应用终于更接近实时交互。
背后的方法很好理解:上一轮已经计算好的KV张量保存下来,下一轮只计算新增内容。缓存还可以跨请求、跨节点复用,不再局限于一张卡、一次对话。
ParaCache真正吸引我的地方,就是它能让模型记住自己已经算过什么。这个改动看似在底层,最后改善的却是每个人都能感受到的等待时间。
中科曙光ParaCache