实时 AI 消息
PCIe显卡被低估了!内核补齐+通信重构,DeepSeek推理吞吐翻近7倍
是石科技自研的Meta-Infer高效部署引擎用纯软件优化补齐内核、重构通信,让8张PCIe-Only显卡上的DeepSeek-V4.1-Flash输入吞吐从社区Day0基线的1932 tok/s提升到13274 tok/s,整体约6.87倍。在视频生成场景下,约1.5台6000D整机即可对应1台B300的吞吐。
量子位9月24日报道,是石科技(METASTONE)自研的Meta-Infer高效部署引擎,在不改动模型结构、不修改任务语义的前提下,仅靠软件层优化,把一台8张PCIe-Only显卡整机上DeepSeek-V4.1-Flash的输入吞吐从社区Day0基线版本的1932 tok/s提升到13274 tok/s,整体约6.87倍,并支持1M超长上下文。
背景是GPU卡的采购成本与供给约束持续加剧,AI推理的竞争正在从“谁能买到性能最顶级的硬件”转向“谁把手中已有的算力资源用得更值”。很多GPU卡在主流开源框架里能够完成模型加载、权重下载与服务拉起,实现“能跑起来”,但实际压测性能往往远低于官方宣传水平。问题不在模型本身,也不在硬件能否工作,而在模型框架与硬件之间存在的性能鸿沟。
这类GPU卡通常没有高速卡间互联,也不在主流开源框架的官方验证矩阵中,直接使用社区默认部署方案,会出现算子自动回退至低效通用实现、集合通信沿用NVLink硬件的调优参数、显存与并行配置沿用其他硬件默认值等一连串问题。是石科技给出的解法分两个阶段:算模协同释放被硬件差异屏蔽的高性能路径,通算重构打通瓶颈、充分榨干硬件资源,最终沉淀为内核补齐、算子优化与通信重构、并行与容量调优、缓存复用四项核心能力。
内核补齐针对的是框架“不报错、只静默绕开加速路径”的行为。很多高性能内核并非缺失,只是元数据、页尺寸、硬件内核适配不匹配,导致无法被触发执行。Meta-Infer通过对齐硬件与框架之间的元数据定义、修正页尺寸配置来解锁原生高性能算子路径,替换不适配硬件的老旧计算内核,并扩大通信快路径的生效阈值。在8张PCIe-Only显卡环境的社区Day0基线中,DeepSeek-V4.1-Flash输入吞吐为1932 tok/s,补齐sparse-MLA Prefill快路径、替换FP8稠密GEMM慢内核、扩大PCIe-IPC通信快路径覆盖范围之后,吞吐提升至5850 tok/s。
同样的思路复用在DeepSeek-V4-Flash、GLM5.3等模型上:修正注意力头补齐的冗余计算,对KV缓存标记逻辑做向量化加速,适配硬件特性重构算子拆分逻辑,拓展CUDA计算图覆盖范围,仅仅完成算模协同就拿到20%—33%不等的吞吐增益。此后瓶颈会转移到通信开销、并行调度、显存分配与重复计算:Meta-Infer对注意力、投影等关键算子做融合压缩单步计算耗时,把计算任务与集合通信做时间重叠掩盖,将统计类计算嵌入通信间隙并行执行,并改写集合通信逻辑适配PCIe带宽特性。
并行与容量调优则放弃框架全局固化的并行参数,针对Prefill预填充与Decode生成不同阶段差异化配置张量并行、上下文并行策略,结合硬件显存特性动态调整静态显存占比与KV缓存容量,规避显存溢出与算子回退;缓存复用面向长文本与视频生成,按实时生成状态动态判断缓存复用与刷新时机。在DeepSeek-V4.1-Flash上,输入吞吐由5850 tok/s进一步提升到13274 tok/s。
这套方法论的通用性也在其他模型与任务上得到验证:DeepSeek-V4-Flash输入吞吐从14546 tok/s提升到22584 tok/s,提升1.55倍;GLM5.3从3236.78 tok/s提升到6222.72 tok/s,提升1.92倍,P95首Token时延从141.6秒降到46.6秒,上下文支持上限从27万Token扩展到105万Token。视频生成方面,MiniMax H3在15秒参考图生视频任务上端到端速度提升2.48倍,单机8卡文生视频最高吞吐达到基线的5.33倍、参考图生视频达到4.98倍。
与顶级硬件的差距比直觉更小。在相同并发点配对比较下,B300的输入吞吐约为这台8卡整机的4.9—5.6倍(DeepSeek-V4-Flash),GLM-5.3上这一比值为3.5—4.7倍。按整机口径(单机8卡、5秒/768P/16:9),文生视频296条/时对B300的439条/时,参考图生视频131条/时对225条/时;折算下来,Ours Cache方案下约2.6台6000D对应1台B300,Ours Cache加LoRA方案则缩小到约1.5台与1.7台。
硬件本身没有变化,性能差距的缩小主要来自软件栈、缓存策略与模型优化方式的组合。真正的看点是这套以纯软件弥合硬件—框架鸿沟的方法能否开放、能否迁移到更多长尾加速卡与推理框架上——对大量不在官方验证矩阵里的算力资源来说,这决定了它们究竟只是“能跑”,还是“值得买”。
为什么重要
这项结果显示长尾PCIe显卡的可用性主要受制于软件适配而非硬件本身,对受供给约束的算力采购方意味着既有资源仍有可观的性能余量。若方法论可复用,中低端加速卡在部分推理业务上逼近高端卡的服务能力将成为现实选项。
附近消息
全部09/24 22:08
Liquid AI 发布 LFM2.5-VL-DSpark,目标是让视觉语言模型跑得更快
Liquid AI 在 Hugging Face 官方博客发文介绍 LFM2.5-VL-DSpark,主题是让视觉语言模型跑得更快。从标题信息看,这次更新落在 LFM2.5-VL 系列的一个具体变体上,重点在推理效率而不是模型规模。
09/24 22:31
Ando 获 2000 万美元融资,要做人类与智能体一起办公的消息应用
据 TechCrunch 报道,把 AI 智能体当作团队成员来协作的通讯应用 Ando 完成 2000 万美元 pre-seed 与 seed 轮融资,投资方包括 Accel、Index Ventures 和 Emergence。这家公司把 Slack 视为对标对象,试图让智能体进入企业日常沟通的主流程,而不是停留在聊天窗口里的一个机器人。
09/24 22:00
英伟达联合谷歌 DeepMind 等机构,开源 2800 余种病毒的蛋白复合物结构
英伟达宣布加入由谷歌 DeepMind、EMBL-EBI 等机构组成的联盟,公开释放超过 2800 种病毒的蛋白质复合物预测三维结构,并将其纳入 AlphaFold 数据库供全球科学家免费使用。这批结构由 AlphaFold2 结合英伟达 BioNeMo 推理运行时生成,其中约三成蛋白质相互作用此前从未被科学界记录,被视为下一次大流行来临前的知识储备。
09/24 22:45
谷歌称 Gemini 4 将“尽快”发布
据 9to5google 报道,谷歌表示下一代大模型 Gemini 4 将“尽快”与用户见面,但报道没有给出确切的发布日期或功能细节。这一表态被外界视为谷歌在激烈的前沿模型竞赛中释放的最新节奏信号。