vLLM-Omni与FastH3优化H3实时视频推理

9月14日 10:01
面向 MiniMax H3 从扩散建模到 MP4 产出的多环节延迟,方案重组常驻服务链路并将 DiT 前向次数压缩到 4;八卡 B300 生成 10.125 秒视频仅需 8.678 至 8.710 秒。

围绕 MiniMax H3 视频大模型的在线生成需求,vLLM-Omni 与 FastVideo 的 FastH3 被组合应用到端到端服务链路,重点是让成片在更短时间内完成返回。这类改动覆盖两条路径:一是对常驻推理服务进行系统重组,二是减少 DiT 的迭代调用次数。在八卡 B300 的实测环境中,一条 10.125 秒的 MP4 可在 8.678 至 8.710 秒完成准备。

vLLM-Omni 的处理范围不限于单个模块,其常驻管线同时纳入长序列注意力处理、跨设备通信、DiT 算子融合、VAE 并行解码、压缩后的结果传输以及 MP4 封装并行化。相对于采用 Diffusers 的实现路径,八卡 B300 下的完整响应等待时间降低了 30.8%。通用 H3 服务架构另提供分布式逐层卸载、编码器拆分、可选择量化和注意力加速等方式,便于在低负载部署、显存受限场景和多卡高吞吐之间调整资源配置。

FastH3 将 DiT 前向执行次数由 49 次降至 4 次,用以压低扩散采样过程中的主要计算开销。除 10.125 秒片段约 8.7 秒完成外,该系统在 5 秒、10 秒和 15 秒三种设定下均达到全部结果可用早于对应视频播放时长。附带的 VSA 变体可在既有路线之外进一步改善速度表现。视频生成的服务压力来自模型计算、图像编码和文件封装等多个阶段的叠加等待,本方案分别触及了上述环节。相关团队还整理了面向生产环境的资料,涵盖硬件选型、参数设置、流水线编排与负载均衡等环节,为持续运行此类视频服务提供了实施依据。