RunningHub开源方案让MiniMax H3提速约12倍
MiniMax H3开源后,RunningHub推出H3 Lightning加速方案。同样用4张RTX 6000D生成5秒、1344×768视频,原始BF16、50步推理耗时348.8秒,加速后仅28.7秒,速度提升约12倍、耗时减少约92%,同时保持BF16精度。完整代码已发布至GitHub:https://github.com/RH-RunningHub/MiniMax-H3-MultiGPU-Lightning/
这套方案也覆盖更长视频和参考图场景。在8张RTX 6000D上,生成15秒、768×1344视频时,纯文本约48秒,双参考图约73秒,15秒图生视频进入“1分钟出片”范围,且没有通过降低精度换取速度。
实测中,5秒768P沙漠越野摩托车视频从点击到出片约30秒,起步、冲坡、腾空、落地和甩尾动作连贯,低机位追拍、正面跟拍等镜头也能执行。15秒图生视频使用吉卜力风格参考图,生成约88秒,人物与金毛在起身、奔跑、跳跃过程中保持较好一致性,服装、发色、毛色及远景湖泊基本稳定;快速跳跃时狗的四肢偶有僵硬。
二次编辑同样较快:将晴天改为雨天,加入撑伞、奔跑、转身和狗跳跃等动作,约50秒完成,远处山湖仍被保留并出现彩虹。更短的等待时间降低了创作者反复试错和临时修改的成本。
加速主要来自三层优化。首先引入RH后训练加速模型,把默认50步压缩到更少步数;4卡9步测试耗时43秒,约提速8倍,推荐日常使用4步,快速运动等复杂任务可切换8步。其次结合SageAttention2、Cache-DiT和torch.compile,分别优化注意力计算、复用中间结果并减少执行调度开销,最终将43秒进一步压到28.7秒。
多卡部分针对没有NVLink、依靠PCIe通信的环境,采用TP2+Ulysses4。8张RTX 6000D实测相比TP4+Ulysses2快约12%,显存占用少约14GiB;全部组件由SGLang multimodal_gen推理引擎统一调度。安装环境、下载模型、启动服务和测试流程均已公开,也可叠加社区加速LoRA进行适配。
这套方案面向工作室、企业团队及个人本地部署,使用公开可购的RTX 6000D,而非依赖顶级数据中心硬件。预算充足时,B300可将出片速度进一步推向秒级;没有多卡服务器的用户,也能直接在RunningHub平台使用。它选择的是把工程优化留在开源生态,让开发者自行部署并围绕工作流调整卡数、参数以及速度和画质的取舍。
本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。
阅读原文