GPT-5.6 vs. Claude Fable 5 for Physical AI, which performs best?2 days agohttps://juliahub.com/blog/frontier-models-physical-ai-evaluation物理人工智能需要正确的物理建模;模型可以在物理上错误的情况下进行编译和运行,而代理式人工智能通过让代理编写并自行通过依赖有缺陷简化的测试,使这一问题更加严重。一项研究评估了前沿AI模型(OpenAI GPT 5.6系列和Anthropic Claude Fable 5)在五个密封建模问题上的表现,包括NASA的HL-20飞行器,使用固定的Dyad AI工具链来隔离模型性能。Claude Fable 5获得了最高的难度加权分数(0.889),解决了所有核心问题,并在HL-20上领先,但每次试验成本为9.60美元,而GPT 5.6 Sol提供了最佳性价比,每次试验成本为1.74美元,且验证效果强大。模型的工作风格特征各不相同:Fable侧重于通过尝试证伪解决方案来进行验证,Sol强调精确性但有时会误解规格,Luna进行大量迭代而不进行外部验证,Terra注重经济性但偶尔会错误地缩减边界。工具链提供的杠杆作用大于模型选择;更换工具链使分数提高了0.366分(从0.533到0.899),是最好和最差模型之间0.162差距的两倍多,强调了领域特定工具的重要性。研究得出结论,对于物理人工智能,选择正确的工具链是首要决策,其次是选择其中最佳的可负担模型,因为工具链强制实施正确的验证和建模实践。
Flux 3 X Mimic: The Next Generation of Video-Action Models7 days agohttps://bfl.ai/blog/flux-3-mimicFLUX 3是一个多模态基础模型,可生成视听内容,并作为用于机器人技术的FLUX-mimic视频动作模型的骨干。视频预测是计算量最大的部分,占训练成本的95%以上,因为它迫使模型学习物理世界动态,如接触和运动。在FLUX 3中添加动作预测最初使视频质量下降了10%,但在3500个训练步骤后,模型恢复了全部性能,同时还能预测动作。基于FLUX 3构建的FLUX-mimic,使用轻量级动作解码器从视频预测路径的中间特征中解码动作,在机器人操作中实现了最先进的成功率。Self-Flow技术统一了生成和表示学习,提高了世界模型质量和机器人下游任务性能。FLUX-mimic的样本效率比视觉-语言-动作模型高出10倍,并且可以在单个NVIDIA RTX 5090 GPU上运行,世界表示延迟低于80毫秒。该模型已在奥迪的真实工厂环境中部署,处理诸如套件组装、装配以及传统自动化无法处理的软材料处理等任务。FLUX-mimic能够自然地从任务失败中恢复,例如抓取失误,而无需针对每个错误场景进行显式演示。