Drone-Bench: Tracking simple drone surveillance capabilities of frontier models
9 hours ago
- Drone-Bench 是一个基准测试,用于评估AI模型在低成本硬件上编写无人机监控代码的能力。
- 它包含五项任务:重建、定位、导航、检测和跟踪,每项任务均与人类基线进行评分。
- 任务独立评估以防止错误累积,但端到端的成功需要完成所有五项任务。
- 当前模型在某些任务上能超越基线,但尚无模型成功完成重建任务,导致端到端成功率为0%。
- 该基准旨在跟踪AI能力以提升公众意识,因为随着物理自主性的增强,模型更容易被滥用。
- 未来方向包括更困难的任务、端到端运行,以及移除提交之间的反馈评分。