MeshFusion 率先完成阿里真武 810E PPU KVCache 卸载

近日,XSKY 完成对平头哥真武 810E PPU 的适配验证,旗下 AI 推理加速产品 MeshFusion 已在真实 PPU 环境中成功跑通 MiniMax M3、GLM-5.2 模型的 KV Cache Offloading,成为率先完成真武 PPU 适配的国产 KV Cache 存储系统之一。
在这里插入图片描述
真武 PPU 是阿里平头哥推出的自研高端 AI 芯片/加速卡。它采用 GPGPU 架构,定位为高易用、训推一体的算力芯片,主要面向大模型训练与大规模推理场景。810E PPU 拥有 96GB 显存、700GB/s 片间互联带宽,为大规模参数模型提供了充足的内存空间与高速数据通路。其自研软件栈具备统一的编程接口,支持 vLLM/SGLang/PyTorch 等主流 AI 框架,大幅降低迁移成本与适配门槛。

MeshFusion 是 XSKY 推出的面向 AI 推理的 KV Cache 扩展加速系统,基于端到端 RDMA 技术将多个节点上的 DRAM 和 NVMe SSD 组织成大容量、高性能的 KV Cache 存储池,结合自研的 KV Cache 感知路由与管理引擎,将推理上下文记忆从 TB 级扩展至 PB 级,有效破解 AI 推理的"内存墙"问题,显著降低 TTFT、提升集群 TPS,以更低成本的存储资源替代昂贵显存。

在实际适配验证中,XSKY 在真武810E 硬件环境中部署 vLLM 与 MeshFusion,分别面向 MiniMax M3 和 GLM-5.2 两个大参数模型完成了 KV Cache Offloading 全流程验证:KV Cache 可从 PPU 显存正确卸载至 MeshFusion 存储池,并在后续请求中命中复用、快速取回,全程运行稳定。得益于 MeshFusion 原生 KV Cache 接口、用户态零拷贝 I/O 与真武810E 软硬件协同能力,整个卸载与复用链路无需改造推理框架即可开箱启用。

此次适配进一步拓展了 MeshFusion 的算力生态版图。此前 MeshFusion 已支持英伟达 GPU 与华为昇腾 NPU 融合部署,并在昇腾生态率先实现混合注意力模型的 KV Cache 正确卸载。本次完成真武810E 适配,意味着 MeshFusion 在国产算力上的兼容能力再进一步,为采用阿里 PPU 构建推理集群的企业客户提供了经过验证的 KV Cache 扩展方案。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值