实时 AI 消息
RunningHub开源MiniMax H3加速方案,4卡RTX 6000D出片提速约12倍
一站式AIGC创作平台RunningHub为MiniMax开源视频模型H3推出推理加速方案H3 Lightning,并把整套代码与本地部署流程放上GitHub开源。在4张RTX 6000D上生成5秒、1344×768视频,原始BF16 50步方案约需348.8秒,加速后仅需28.7秒,耗时减少约92%,同时保留BF16数值精度。
量子位报道,一站式AIGC创作平台RunningHub围绕MiniMax开源视频模型H3推出了一套推理加速方案H3 Lightning,并将整套代码与本地部署流程在GitHub上开源。官方给出的数据是:在4张RTX 6000D上生成5秒、1344×768的视频,原始BF16 50步方案耗时约348.8秒,经H3 Lightning加速后只需28.7秒,前后约12倍提速,生成耗时减少约92%。
这套方案之所以受关注,是因为它没有走"降精度换速度"的捷径。报道明确写到,加速过程仍然保留BF16数值精度,也就是说画质与原始方案处在同一精度层级,而不是用低精度推理或降低分辨率来换取时间。
具体做法分成三步。第一步在模型层面引入自研的RH后训练加速模型,让H3学会用更少的生成步数完成任务。原始H3默认50步,每一步背后都有一轮实打实的计算;换成9步测试方案后,4卡环境下5秒视频的生成时间从348.8秒压缩到43秒,已经相当于约8倍提速。RunningHub给出的推荐配置是默认4步,遇到快速运动、大幅动作等难任务可切到8步,由创作者自行取舍速度与稳定性。
第二步在执行层叠加三项优化:SageAttention2用于提升注意力计算的效率,Cache-DiT用于复用视频生成过程中前后步骤之间可复用的中间结果,torch.compile则对计算过程做编译优化、减少调度与执行开销。三者与RH后训练加速模型叠加之后,同样的生成过程从43秒进一步压到28.7秒。
第三步针对多卡并行。报道指出,在没有NVLink高速互联、主要依靠PCIe通信的环境里,卡间通信成本不能忽略。RunningHub重新测试了不同的多卡并行组合,最终选用TP2+Ulysses4;在8张RTX 6000D、PCIe连接且无NVLink的条件下,该组合相比TP4+Ulysses2速度快约12%,同时减少约14GiB显存占用。上述方法最终被整合进SGLang multimodal_gen推理引擎。
长视频场景同样有数据。在8张RTX 6000D环境下生成15秒、分辨率768×1344的视频,纯文字生成大约需要48秒,双参考图生成约73秒。报道中作者实测一条15秒图生视频从点击到出片约88秒,二次创作(改场景、改动作、保留远景)耗时约50秒,也就是15秒视频可以打进"1分钟出结果"的时间尺度。
需要看到的是,这套优化针对的是无NVLink的PCIe多卡环境,RTX 6000D也是公开可购买的专业GPU规格。报道认为,这更贴近工作室和中小团队实际能拿到的部署条件;如果预算充足、使用B300等更高规格的卡,出片速度还能进一步压缩到秒级。除自建硬件外,不想研究环境配置的创作者也可以直接在RunningHub平台上使用H3 Lightning。
放到更大的背景里看,这其实是开源模型生态里"二创"路径的一个样本。报道提到,H3开源后,RunningHub先后完成接入、开源全套ComfyUI节点,平台上已有上千名创作者围绕H3贡献了近万条创意工作流,覆盖电商视频、音频驱动数字人、漫剧等方向。H3 Lightning是在这些应用层玩法之外,继续补齐推理效率这一层。
从产业角度,值得关注的信号是:当模型权重本身足够强,围绕它的竞争往往会转向谁能最快把开源权重变成可稳定复用的生产力。报道把这条路径放在RunningHub母公司海马云的GPU工程积累下解读——海马云2014年成立,长期做GPU容器调度、图形虚拟化与云渲染,目前已在国内建设60余个边缘节点,支撑超过2000万月活用户的智算服务。后续可以观察的是,这套面向PCIe多卡的加速方案能否被更多开发者复现,以及围绕H3的加速LoRA与工作流生态会如何继续迭代。
为什么重要
这套开源方案把MiniMax H3的本地推理门槛和等待成本一起压低:在没有NVLink的PCIe多卡环境下也能拿到约12%的多卡并行收益、整体约12倍提速,还保持BF16精度,意味着中小团队用可购买的专业卡就能接近生产级出片节奏。对开源视频模型生态而言,工程层的推理优化正在成为衡量平台价值的新维度。
附近消息
全部09/11 05:51
AI动态:Jensen Huang explains why Nvidia will grow an astounding 70% next year
据 techcrunch.com 消息,Jensen Huang explains why Nvidia will grow an astounding 70% next year。Nvidia has its finger in every pie, and sees another year of plenty in its future, Jensen Huang says. But, he insists, its deals are not circular.
09/11 04:59
需求超出承载,OpenAI 暂停 Pro 订阅新注册
OpenAI 表示 Pro 订阅对系统造成的压力最大,因此在扩充容量的同时暂停了该档位的注册。公司把这一压力与 Astra 带来的需求联系起来,说明热门新能力正在挤压现有算力供给。
09/11 04:57
AI动态:Anthropic details distillation campaigns from Alibaba, Moonshot AI, and DeepSeek
据 techcrunch.com 消息,Anthropic details distillation campaigns from Alibaba, Moonshot AI, and DeepSeek。A new report released Thursday by Anthropic alleges persistent distillation attacks by China based AI companies, which have escalated in recent months as competition in the space has intensified.
09/11 03:50
AI动态:Meta’s AI agent Muse is now the No. 2 app in the US
据 techcrunch.com 消息,Meta’s AI agent Muse is now the No. 2 app in the US。Meta's newest app Muse is off to a slower start than the company's other apps, like Meta AI or Threads.