- 物理人工智能需要正确的物理建模;模型可以在物理上错误的情况下进行编译和运行,而代理式人工智能通过让代理编写并自行通过依赖有缺陷简化的测试,使这一问题更加严重。
- 一项研究评估了前沿AI模型(OpenAI GPT 5.6系列和Anthropic Claude Fable 5)在五个密封建模问题上的表现,包括NASA的HL-20飞行器,使用固定的Dyad AI工具链来隔离模型性能。
- Claude Fable 5获得了最高的难度加权分数(0.889),解决了所有核心问题,并在HL-20上领先,但每次试验成本为9.60美元,而GPT 5.6 Sol提供了最佳性价比,每次试验成本为1.74美元,且验证效果强大。
- 模型的工作风格特征各不相同:Fable侧重于通过尝试证伪解决方案来进行验证,Sol强调精确性但有时会误解规格,Luna进行大量迭代而不进行外部验证,Terra注重经济性但偶尔会错误地缩减边界。
- 工具链提供的杠杆作用大于模型选择;更换工具链使分数提高了0.366分(从0.533到0.899),是最好和最差模型之间0.162差距的两倍多,强调了领域特定工具的重要性。
- 研究得出结论,对于物理人工智能,选择正确的工具链是首要决策,其次是选择其中最佳的可负担模型,因为工具链强制实施正确的验证和建模实践。