首页 / 应用案例

AI Inference

智算中心 · AI 推理加速

KV Cache 卸载 · GPU 利用率提升至 94%

智算中心 · AI 推理加速

项目背景

面向大模型推理场景,显存成为系统瓶颈:KV Cache 占用大量 HBM,导致单卡可承载的上下文长度有限、GPU 利用率偏低。

解决方案

采用 GP7000 G3.5(CMX)存储平台,通过全硬件卸载将 KV Cache 迁移到以太网闪存簇(JBOF/EBOF),让 GPU 专注令牌生成。

  • <20μs 微秒级延迟,接近内存访问体验
  • GPU 利用率提升至 94% 以上
  • 上下文重算比例从 80–90% 降至 10% 以下
  • 原生兼容 Dynamo 调度与 NIXL 传输库

落地价值

在保持精度的前提下显著提升单机并发与吞吐,降低单位 Token 的推理成本,支撑大规模商用部署。

想了解我们如何落地你的场景?

联系我们,绿算技术团队将根据您的业务提供针对性的方案建议。

立即咨询