Hasty Briefsbeta

双语

MiniMax H3 Day-0 Support in ComfyUI: Open Weights, Native Audio, and 2K Video

4 hours ago
  • MiniMax H3 是一款开源的全模态视频模型,能够生成高达 2K 分辨率和 15 秒时长的视频,并自带原生立体声音频。
  • 它支持文本转视频、图像转视频、首尾帧控制,以及使用图像、视频或音频作为参考的视频生成。
  • 该模型集成了多模态上下文理解能力,通过同时处理图像、音频和视频,将多个任务合并为一个。
  • 原生立体声音频与视频在同一流程中生成,而非后期处理。
  • 编辑与动作迁移功能允许参考视频的运动轨迹,同时应用不同的主体和风格。
  • 该模型针对 ComfyUI 中的本地推理进行了优化,显存占用减少 66%(从 123.6 GB 降至 42.5 GB),使其能在消费级 GPU(如 RTX 3060)上运行。
  • 优化措施包括剪枝调制权重、int8 卷积量化,以及结合动态 VRAM 内存卸载的自定义内核。
  • 示例输出展示了多种创意应用场景:漫画风格、产品广告、高定时尚大片,以及活力产品推广视频。

相关文章

加载中…