PCIe显卡软件优化让DeepSeek吞吐提升近7倍
大模型推理不再只是比拼高端GPU,硬件适配和软件优化同样决定实际吞吐。许多PCIe显卡虽然能够完成模型加载与服务启动,但由于缺少高速卡间互联、未进入主流框架验证矩阵,常会触发低效算子、沿用不适合PCIe的通信参数,导致硬件潜力无法释放。是石科技运营着超过20000P算力、10多个智算中心及2个国家级超算中心,并宣称集群SLA超过99.95%。
其自研Meta-Infer是一套面向异构芯片的推理引擎,核心包括内核补齐、算子优化与通信重构、并行与容量调优、缓存复用四部分。引擎会修正元数据和页尺寸配置,替换不匹配的计算内核,扩大通信快路径覆盖范围,同时针对Prefill与Decode分别调整并行、显存和KV缓存参数,并在长文本、视频任务中动态复用缓存。
在8张PCIe显卡运行DeepSeek-V4.1-Flash的测试中,社区Day0基线输入吞吐为1932 tok/s。补齐sparse-MLA Prefill快路径、替换FP8稠密GEMM内核并扩大PCIe-IPC快路径后,吞吐提升至5850 tok/s。进一步通过算子融合、计算通信重叠、投机解码长度调整及显存调优,最终达到13274 tok/s,较基线提升6.87倍,并支持100万Token上下文。
同类优化也应用于DeepSeek-V4-Flash和GLM5.3:前者吞吐由14546提升至22584 tok/s,后者由3236.78提升至6222.72 tok/s,P95首Token时延从141.6秒降至46.6秒,上下文上限由27万扩展至105万Token。对比B300时,8卡整机在DeepSeek-V4-Flash上的吞吐约为其4.9至5.6倍差距,GLM5.3约为3.5至4.7倍。
在MiniMax H3视频生成测试中,稀疏注意力、风险感知缓存和Turbo LoRA使15秒参考图生视频速度提升2.48倍;8卡整机文生视频和参考图生视频吞吐分别达到基线5.33倍和4.98倍。统一口径下,其吞吐约为B300的67%和58%;采用缓存与LoRA后,约1.5台和1.7台6000D可对应1台B300的吞吐。
这套方法也在国产GPU上验证:通过启用平台适配的NSA稀疏注意力、关闭不兼容的Shared Expert融合,并分别为Prefill和Decode配置通信模式,再将Shared Expert与Routed Expert分流并行提交,35组测试获得11.26%的吞吐提升。整个过程无需修改模型权重、结构或任务语义,说明对未进入官方验证矩阵的长尾硬件而言,“能运行”并非终点,软件栈仍能显著改变实际服务能力。文中NVFP4版本采用无损量化,未引入额外精度损失。
本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。
阅读原文