词元加速方案ParaCache大幅提升词元吞吐量

黄鑫 2026-08-29 16:21:24

828日,2026中国国际大数据产业博览会期间,中科曙光发布新一代词元加速方案ParaCache。该方案通过保存并复用大模型已经完成的计算结果,减少不同请求、不同计算节点之间的重复计算。测试显示,在约12万词元输入下,ParaCache可使模型开始回答前的等待时间最高降低98.5%;高并发场景下,系统每秒处理的词元量最高达到原来的27倍。

随着大模型应用规模化落地,算力消耗的重心已从训练转向推理。然而推理环节正遭遇两大瓶颈。一是推理越来越慢。在多轮对话中,大模型的每次回答,都需要重新计算所有历史内容,计算量平方级增长:处理16K长文本,单次推理需执行2.56亿次键值对计算。

二是“记忆”越来越贵。为避免重复计算问题,业界普遍采用KV Cache(键值缓存)技术加速推理,把已算好的键值向量缓存在GPU显存中。但显存容量有限、价格高昂,随着模型变大、上下文变长,硬件成本也将急剧攀升。不仅如此,传统KV Cache只能消除单对话、单节点内的重复计算,在跨对话、跨节点的大集群场景中,加速效果大打折扣。

针对这些问题,ParaCache的思路是:把已经算过的结果长时间保存下来,下次需要时直接复用。该方案统一管理GPU显存、CPU内存、固态硬盘和分布式存储,根据使用频率对计算结果进行分层存放和智能调度,并支持在不同请求、不同计算节点之间共享,实现一次计算、多次使用

中科曙光分布式存储产品部总经理石静表示,ParaCache不是简单提升单张GPU的性能,而是通过减少重复计算,把更多算力用于处理新的任务。过去,存储主要负责保存数据。ParaCache进一步将模型已经完成的计算结果纳入存储和复用体系。对于大模型推理而言,少一次重复计算,就意味着少一段等待,也少一份算力消耗。

石静介绍,该方案依托曙光自研分布式、集中式存储底座,联合行业合作伙伴共同打造,打通显卡、内存、固态、分布式存储四层存储资源,实现全域缓存统一管理。

方案打破了传统存储局限,可智能调度、灵活迁移、循环利用缓存数据,彻底缓解GPU显存压力。同时兼容市面上主流 AI推理工具,适配各类AI算力部署场景,无需复杂改造即可落地。通过智能化缓存调度,有效提升AI推理并发能力、降低算力损耗与落地成本,为大模型规模化商用提供高效可靠的全新解决方案。

据介绍,ParaCache带来的价值,可以概括为多、快、好、省其中,多是指高并发场景下,系统每秒处理的词元量最高达到原来的27倍,同样的硬件资源能够承接更多业务请求。快是指,输入约12万词元时,单轮对话开始回答前的等待时间最高可降98.5%0.4秒;连续20轮对话中,这一时间由43.1秒降至4.9秒。好是指好用,兼容主流推理框架和国产AI加速卡,可在现有系统基础上接入,降低部署和迁移成本。省是指,高频内容保留在显存,其他内容转移至成本更低的存储设备,减少对高成本显存和新增硬件资源的依赖。

据了解,目前,ParaCache已在国内某头部互联网企业在线推理业务中落地,模型开始回答前的平均等待时间降低50%以上;在同等硬件条件下,系统可承载的业务请求也提升数倍。同时,ParaCache已在全国产十万卡AI超集群曙光8000上完成验证,可面向长文本对话、知识库问答、智能客服、智能体及高并发推理等场景。