Flux 3 X Mimic: The Next Generation of Video-Action Models
5 hours ago
- FLUX 3是一个多模态基础模型,可生成视听内容,并作为用于机器人技术的FLUX-mimic视频动作模型的骨干。
- 视频预测是计算量最大的部分,占训练成本的95%以上,因为它迫使模型学习物理世界动态,如接触和运动。
- 在FLUX 3中添加动作预测最初使视频质量下降了10%,但在3500个训练步骤后,模型恢复了全部性能,同时还能预测动作。
- 基于FLUX 3构建的FLUX-mimic,使用轻量级动作解码器从视频预测路径的中间特征中解码动作,在机器人操作中实现了最先进的成功率。
- Self-Flow技术统一了生成和表示学习,提高了世界模型质量和机器人下游任务性能。
- FLUX-mimic的样本效率比视觉-语言-动作模型高出10倍,并且可以在单个NVIDIA RTX 5090 GPU上运行,世界表示延迟低于80毫秒。
- 该模型已在奥迪的真实工厂环境中部署,处理诸如套件组装、装配以及传统自动化无法处理的软材料处理等任务。
- FLUX-mimic能够自然地从任务失败中恢复,例如抓取失误,而无需针对每个错误场景进行显式演示。