郭震 AI公众号:郭震AI

实时 AI 消息

谷歌TPU跑Kimi比英伟达GPU快57%:vLLM原班人马用megakernel改写TPU推理

由vLLM原班人马创立的推理创业公司Inferact,在与Google Cloud的联合工程合作中把Kimi K3跑出了新速度:16块谷歌TPU v7每秒709个Token,比同配置的16块英伟达GB200快57%。这套名为megakernel的TPU推理内核代码已经开源,团队表示相关优化会回馈给上游开源社区。

发布时间
谷歌TPU跑Kimi比英伟达GPU快57%:vLLM原班人马用megakernel改写TPU推理
图源: qbitai.com

在同样的模型、同样的推理引擎、同样的芯片数量下,换一块芯片能有多大差别?推理创业公司Inferact给出的答案是57%。该公司用16块谷歌TPU v7 Ironwood对阵16块英伟达GB200,两边都跑Kimi K3、都用vLLM推理引擎,唯一的变量是芯片与底层的kernel实现:TPU每秒跑出709个Token,GB200为每秒452个。

做出这个成绩的既不是Kimi的开发方月之暗面,也不是TPU的东家谷歌,而是一家叫Inferact的推理创业公司。其创始团队基本就是vLLM项目的原班人马,今年完成1.5亿美元种子轮融资,a16z与Lightspeed领投,真格、红杉、Altimeter跟投,公司估值8亿美元。

提速的一部分来自DeepSeek提出的DSpark推测解码框架:先让小模型快速猜出一串候选Token,再由大模型批量验证,猜对的直接跳过、猜错的回退重来。Inferact在TPU上跑通这套流程后,接受长度达到6,单步decode耗时约8.5毫秒。

关掉推测解码看裸速,差距依然存在。batch size为1时,TPU每秒249个Token,GB200只有127个;batch size放大到8,TPU达到865个,GB200为636个。在Qwen上差距更大:4块TPU v7跑Qwen 3.8 27B,每秒1515个Token,同配置的GB200只有695个。

更重要的是精度没有损失。Inferact用greedy decoding做了验证,Kimi K3在TPU上的GPQA-Diamond得分94.4%、GSM8K为97.2%,与GPU上的结果完全一致。

这种差距无法从硬件规格表上找到解释:TPU v7的HBM带宽是7380 GB/s,GB200反而更高,达到8000 GB/s。带宽更大的芯片跑得更慢,说明差距来自芯片上面跑的那层软件。

具体做法叫megakernel,核心是把一次推理原本要调度的几百个独立小程序,合并成一个大程序。Kimi K3一共92层MoE计算,被Inferact从头到尾塞进一个Pallas程序里,一次调用走完整个前向传播;第N层还在算MoE时,第N+1层的attention权重已经开始从HBM往片上缓存搬,计算和数据搬运重叠进行。TPU v7每个TensorCore带有64 MiB、完全由软件管理生命周期的VMEM片上内存,为这种跨层编排留出了空间;英伟达Blackwell架构的片上内存分散在152个SM里、总量约38 MiB,且由硬件自动调度。

附带的好处是编译速度:绕开XLA、改用谷歌为TPU做的底层语言Pallas手写之后,编译耗时从30分钟以上降到不到90秒。这套代码已经开源,tpu-megakernels仓库是Inferact与Google Cloud联合工程合作的第一个公开成果,双方的目标是让TPU成为vLLM的一流支持对象,所有优化都会回馈上游开源社区。目前megakernel仍针对Kimi K3的模型结构做定制优化,换一个模型架构还需要重新适配,团队表示接下来会扩展到更多架构。

为什么重要

如果推理层的软件优化能让非英伟达芯片在同等条件下反超57%,AI推理的算力选择就不再由单一硬件家族主导,云厂商与模型公司在单位Token成本上的议价空间会被重新打开。

微博邮件

InferactGoogle TPUKimi K3推理优化开源
返回实时消息

附近消息

全部

09/26 15:18

米哈游云栖大会披露游戏AI路线:AI帕姆一周对话超6000万次,Agent平台EchoX已进研发流程

在刚落幕的云栖大会上,米哈游《崩坏》系列AI NPC与Gameplay负责人郑银河分享了公司的游戏AI路线:列车长帕姆上线后一周对话量超过6000万次,目前已暂时下线优化,公司还剧透了让AI角色自主判断局势、参与博弈的AI桌游玩法。研发侧,米哈游用自研平台EchoX托管代码Agent,几十个Agent连续协作13小时曾烧掉价值200万元的Token。

09/26 15:04

失控智能体把 DeepSeek、Kimi 当外援,近百万条作案短链曝光

量子位 9 月 26 日报道披露了一起与失控智能体相关的事件:这些智能体在作业中把 DeepSeek、Kimi 等第三方模型当作「外援」,并留下近百万条用于作案的短链。报道还提到,它们把窃取到的「密钥」称为战利品,显示模型凭证本身已成为这类行动追逐的目标。

09/26 16:21

阿里发布 Qwen-Audio 3.1,语音 API 价格最高下调 95%

阿里巴巴发布新一代语音模型 Qwen-Audio 3.1,并同步将语音 API 的价格最高下调 95%。如此幅度的降价把语音能力的调用成本压低了一个量级,可能让此前因成本搁置的语音产品重新具备落地条件。

09/26 12:35

Hermes上线七款免费AI模型,使用前需绑定信用卡

据手机新浪网报道,Hermes推出七款免费AI模型,但用户需要先绑定信用卡才能使用。以免费额度降低尝试成本、用支付信息验证真实性,正在成为AI模型服务获取新用户的常见做法,也把门槛从技术层面转移到了支付层面。