Drone-Bench: Tracking simple drone surveillance capabilities of frontier models11 hours agohttps://andonlabs.com/evals/drone-benchDrone-Bench 是一个基准测试,用于评估AI模型在低成本硬件上编写无人机监控代码的能力。它包含五项任务:重建、定位、导航、检测和跟踪,每项任务均与人类基线进行评分。任务独立评估以防止错误累积,但端到端的成功需要完成所有五项任务。当前模型在某些任务上能超越基线,但尚无模型成功完成重建任务,导致端到端成功率为0%。该基准旨在跟踪AI能力以提升公众意识,因为随着物理自主性的增强,模型更容易被滥用。未来方向包括更困难的任务、端到端运行,以及移除提交之间的反馈评分。