业内首个支持昇腾 910C 混合注意力模型 KV Cache SSD 卸载

由 XSKY星辰天合 发布于2026-07-22


近日,XSKY 星辰天合旗下 MeshFusion 推理加速系统,率先在华为昇腾 910C 上实现混合注意力模型的 KV Cache SSD 卸载,并完成 DeepSeek V4、GLM-5.2、Qwen3.5/3.6 等主流国产模型验证,为新一代大模型的长上下文推理提供大容量、可扩展的外部缓存空间。

混合注意力,长上下文时代的必然选择

传统 Transformer 的每一层都使用相同的全局注意力,上下文越长,计算量和 KV Cache 显存占用增长越快。进入数十万乃至百万 Token 的长上下文与 Agentic 时代后,这条路线的显存与带宽开销已难以承受。

混合注意力(Hybrid Attention)由此成为新共识:让不同层各司其职——大部分层以线性、压缩或稀疏注意力低成本处理上下文,少量全局层负责远距离信息交互,在模型效果与推理成本之间取得平衡。而代价由推理系统承担:KV Cache 从统一的 K/V 张量,变成普通 KV、递归状态、压缩块、稀疏索引并存的异构缓存。

注意力机制决定缓存形态,缓存形态决定卸载方式:混合注意力让传统同构 KV Cache 卸载方案失效

新一代模型,已全面转向混合注意力

近期发布的主流新模型,几乎全部采用了混合注意力架构:

支持混合注意力已不再是锦上添花,而是推理加速系统进入新一代模型的入场券。

昇腾 910C 上的能力空白

异构缓存的大小、布局、生命周期和恢复方式各不相同,传统面向同构 KV Cache 的卸载方案无法直接适配。GPU 生态已有方案开始跟进,但受技术生态隔离,无法复用到昇腾 NPU;在昇腾 910C 上,此前尚无任何方案能为混合注意力模型提供 KV Cache SSD 卸载——模型可以运行,长上下文产生的大量缓存却只能滞留在稀缺的 HBM 和主机内存中,制约并发规模与缓存复用收益。

MeshFusion 率先补齐这一能力

MeshFusion 建立了面向混合注意力的缓存识别与分类管理能力,可按模型和 Attention 层正确卸载、加载普通 KV、递归状态、压缩块与稀疏索引,并将 NVMe SSD 组织为高性能、可共享的外部缓存池,在 NPU HBM、主机内存和 SSD 之间构建分层缓存体系。

MeshFusion KV Cache 分层卸载体系:兼容英伟达 GPU 与华为昇腾 NPU

目前,MeshFusion 已完成 DeepSeek V4、GLM-5.2、Qwen3.5/3.6 等主流混合注意力模型的适配验证。下图为昇腾 910C 上 DeepSeek V4 异构 KV Cache 卸载与取回实测:99,328 个 Token(约 1.1 GB)的缓存在 0.083 秒内完成取回,带宽达 13 GiB/s。

昇腾 910C 实测:DeepSeek V4 异构 KV Cache(int8 KV + fp16 稀疏索引)SSD 卸载与取回,带宽达 13 GiB/s

展望未来,开放合作

从标准 KV Cache 到异构缓存,MeshFusion 正在帮助国产算力跟上模型架构演进。未来,XSKY 将持续推进与华为昇腾及更多国产算力卡的适配,为新一代大模型的长上下文、多轮推理和复杂 Agent 工作负载提供更大容量、更高效率的 AI 推理基础设施。

若您希望释放昇腾 NPU 显存、扩大 KV Cache 容量并提升推理集群资源利用率,欢迎致电 400-016-6101,咨询 XSKY MeshFusion 华为昇腾 KV Cache 加速方案。

来源:业内首个支持昇腾 910C 混合注意力模型 KV Cache SSD 卸载
数据常青,智领未来
即刻申请,获 30 天免费使用
在线咨询
快速响应您的问题
工作日: 9:00 ~ 18:00
官方微信