郭震 AI公众号:郭震AI

实时 AI 消息

把记忆交给CPU,大模型会变快:英特尔给出数据中心KV Cache优化方案

量子位9月16日的文章介绍了英特尔面向数据中心的KV Cache优化思路:把推理中不断膨胀的记忆从显存下沉到CPU侧内存与存储,让GPU专注生成Token。围绕KV Shrink、KV Fuse、KV Cascade、KV Infinity四个方向,英特尔披露的测试显示,开启分层卸载后首Token时延最高加速约5倍,硬件压缩可把缓存空间缩小约20%至30%。

发布时间

大模型推理要记住的东西正变得越来越多。每生成一个Token,模型都要参考前面的内容,为了不重复计算,推理系统会把已经算好的中间结果缓存下来,这就是KV Cache。会话越长、Agent读取的资料越多,这份“笔记”就越厚,显存压力也随之上升。

量子位9月16日刊出的文章把这个问题讲得很直白:当成千上万个Coding Agent同时干活时,KV Cache会把GPU显存挤满,部分缓存被清掉后,下一轮可能又要重新做Prefill,用户等待第一个Token的时间(TTFT)随之上扬。文章拿Qwen3-8B做了一次粗略测算:在BF16或FP16条件下,每个Token对应的KV数据约为147KB,按100万Token上下文推演约合147GB。这组数字是假设性的推演,不代表任何服务的真实用量,但足以说明为什么这笔账会越算越大。

英特尔的判断是,显存放不下不等于必须重算,出路在于把记忆搬到显存之外,并按活跃程度分层:正在使用的留在高带宽显存HBM里,短时间内可能复用的放进CPU侧DDR内存,更久没有访问但仍有价值的历史缓存继续下沉到SSD或远端存储。

围绕这套思路,英特尔布局了KV Shrink、KV Fuse、KV Cascade和KV Infinity四个技术方向:KV Shrink把分层管理与压缩结合起来,并开放冷热调度API;KV Fuse处理多份独立生成的缓存难以直接拼接的问题;KV Cascade先请辅助模型做筛选,缩小主模型需要处理的范围;KV Infinity面向持续增长的长任务,通过按需加载和预取缓解缓存必须全部常驻显存的压力。其中KV Shrink已有较具体的实现与测试披露。

压缩是KV Shrink的另一半。承担压缩和解压的是英特尔从第四代至强可扩展处理器开始集成的QAT(QuickAssist Technology)专用加速硬件,目的是在提升吞吐的同时少占用通用CPU核心。英特尔还重新排列了KV Cache的存储格式,让压缩算法更容易发挥作用:压缩节省的空间从原先的10%以上提高到20%以上,整体空间降幅约为20%至30%,而且是无损压缩,解压后可以恢复原始KV数据。

速度方面的对照测试更能说明问题。在一组配置为双路至强金牌6554S、两张英伟达L20 GPU和Qwen3-32B模型的测试里,缓存命中率为80%时,相比未开启分层卸载的原生vLLM基线,KV Shrink在测试覆盖的输入长度和并发组合中把TTFT最高加速约5倍;QAT硬件压缩方案的整体性能约为CPU软件压缩方案的两倍,开启压缩带来的额外TTFT开销低于10%。

另一组与道客联合实验室的测试更贴近Coding Agent服务:双路至强金牌6554S、八张H800、Qwen3-32B FP8模型,缓存命中率同样为80%,对比测试中的LMCache方案,KV Shrink在单路负载下的平均TTFT由129.81毫秒降到114.13毫秒,降幅约12.1%,八路并发时降幅约为4.6%。文章特意提醒,换一套设备、换一个比较对象,加速幅度就会变化,运营方需要代入自己的上下文长度、并发量和缓存命中率来实测。

需要看清的是,分层卸载并非英特尔独有,vLLM的KV Offloading已经支持把缓存块卸载到CPU内存并配置次级存储层,英特尔的差异化落在QAT硬件压缩和存储格式重排上。文章还把9月22日至23日的英特尔技术创新与产业生态大会当作了解其CPU侧进展的节点。对数据中心而言,真正的账是:同一批GPU,能不能在可接受的时延和成本下服务更多请求。

为什么重要

当Agent让上下文与并发同时膨胀,KV Cache正在从实现细节变成数据中心成本结构的一部分;英特尔把压缩与分层管理交给CPU侧,是在争夺GPU之外那部分推理成本的定价权。

微博邮件

IntelKV CacheInferenceXeonData Center
返回AI日报

附近消息

全部

09/16 11:40

被英伟达点名的杭州团队,把蛋白质设计搬进了Agent工作台

杭州AI蛋白质设计公司力文所近日发布Lévin™ Harness,这是一款以Agent为核心的蛋白质设计应用,已面向科研社区开放使用,目前支持搭载Apple芯片的Mac。它把数据、模型、插件工具、算力和工作流放进同一个Agent工作区,希望把模型之外的文献调研、环境配置、计算提交与结果分析串成一条可复用的科研闭环。

09/16 10:27

华为GTS让运维Agent学会「看着网络排障」,双防火墙难题几乎通关

量子位报道称,华为GTS让Agent学会「看着网络排障」,在双防火墙这类难题上几乎全部拿下。该方案使任务通过率提升24.2%,token成本最高下降45%。

09/16 11:50

B站「AI无限竞技场」上线:全球百大模型同场竞技,GPT-6高居榜首

据《证券市场周刊》9月16日报道,B站当天上线「AI无限竞技场」,首期大模型测评榜单同步公布,GPT-6 Astra在10位UP主的测评中拿下榜首,前五名里国产模型占据三席。榜单汇集UP主对上百个大模型的真实场景实测,排名将实时更新并持续开放报名。

09/16 09:51

前Anthropic研究员指称Anthropic加速AI自我改进竞赛

据chosun.com报道,一名前Anthropic研究员公开指称,Anthropic正在加速AI自我改进的竞赛。相关说法把这家以安全为核心定位的实验室推到舆论焦点,但报道目前只给出指称本身,尚未提供可供外部核验的具体证据。