MeshFusion 率先完成阿里真武 810E PPU KVCache 卸载

由 XSKY星辰天合 发布于2026-08-14


近日,XSKY 完成对平头哥真武 810E PPU 的适配验证,旗下 AI 推理加速产品 MeshFusion 已在真实 PPU 环境中成功跑通 MiniMax M3、GLM-5.2 模型的 KV Cache Offloading,成为率先完成真武 PPU 适配的国产 KV Cache 存储系统之一。

真武 PPU 是阿里平头哥推出的自研高端 AI 芯片/加速卡。它采用 GPGPU 架构,定位为高易用、训推一体的算力芯片,主要面向大模型训练与大规模推理场景。810E PPU 拥有 96GB 显存、700GB/s 片间互联带宽,为大规模参数模型提供了充足的内存空间与高速数据通路。其自研软件栈具备统一的编程接口,支持 vLLM/SGLang/PyTorch 等主流 AI 框架,大幅降低迁移成本与适配门槛。

MeshFusion 是 XSKY 推出的面向 AI 推理的 KV Cache 扩展加速系统,基于端到端 RDMA 技术将多个节点上的 DRAM 和 NVMe SSD 组织成大容量、高性能的 KV Cache 存储池,结合自研的 KV Cache 感知路由与管理引擎,将推理上下文记忆从 TB 级扩展至 PB 级,有效破解 AI 推理的"内存墙"问题,显著降低 TTFT、提升集群 TPS,以更低成本的存储资源替代昂贵显存。

在实际适配验证中,XSKY 在真武810E 硬件环境中部署 vLLM 与 MeshFusion,分别面向 MiniMax M3 和 GLM-5.2 两个大参数模型完成了 KV Cache Offloading 全流程验证:KV Cache 可从 PPU 显存正确卸载至 MeshFusion 存储池,并在后续请求中命中复用、快速取回,全程运行稳定得益于 MeshFusion 原生 KV Cache 接口、用户态零拷贝 I/O 与真武810E 软硬件协同能力,整个卸载与复用链路无需改造推理框架即可开箱启用。

此次适配进一步拓展了 MeshFusion 的算力生态版图。此前 MeshFusion 已支持英伟达 GPU 与华为昇腾 NPU 融合部署,并在昇腾生态率先实现混合注意力模型的 KV Cache 正确卸载。本次完成真武810E 适配,意味着 MeshFusion 在国产算力上的兼容能力再进一步,为采用阿里 PPU 构建推理集群的企业客户提供了经过验证的 KV Cache 扩展方案。


来源:MeshFusion 率先完成阿里真武 810E PPU KVCache 卸载
数据常青,智领未来
即刻申请,获 30 天免费使用
在线咨询
快速响应您的问题
工作日: 9:00 ~ 18:00
官方微信