Mage-Flow: Efficient Native-Resolution Foundation Model for Image Generation
4 hours ago
- Mage-Flow 是一个紧凑的 4B 级别生成堆栈,用于高效的文本到图像生成和基于指令的图像编辑。
- 它由两个协同设计的组件组成:Mage-VAE(一个轻量级高保真潜在分词器)和一个原生分辨率多模态扩散 Transformer。
- Mage-VAE 使用带有锚点潜在正则化的单步扩散式编码/解码,将分词成本降低了一个数量级以上,同时保持了重建质量。
- 原生分辨率打包和堆栈级 CUDA 内核融合支持灵活的分辨率训练,并将端到端吞吐量提高约 2.5 倍。
- 该模型系列包括基础、RL 对齐和 Turbo 变体,用于生成和编辑,其中 4 步 Turbo 模型实现了低延迟推理(在单个 A100 上,1024² 分辨率下生成 0.59 秒,编辑 1.02 秒)。
- 尽管尺寸紧凑,Mage-Flow-Turbo 仍实现了具有竞争力的基准分数(GenEval 0.88,CVTG-2K 0.873),优于 Qwen-Image(20B)和 FLUX.2-Klein-9B 等更大模型。