GPT-6 Astra Is the Best Vision Model We Have Tested
8 hours ago
- Astra 是 Roboflow 测试过的最强视觉模型,在物体检测、分割、计数、视觉推理和重识别方面表现卓越。
- 在物体检测方面,Astra 在低努力下获得了 82.1% 的 mAP@50,超越了 Qwen3.8 Max 和 GPT-5.6 Sol,并且能够区分像乐高积木这样的精细细节,达到 99.8% 的 mAP@50。
- Astra 支持文本和框提示,使其能够从类名或视觉示例中检测物体,并且可以在图像之间转移框提示。
- 在分割方面,Astra 比 SAM 3 更好地理解语言,但生成的掩码不够精确;将 Astra 的检测与 SAM 3 的掩码结合使用可以获得最佳结果。
- Astra 在低努力下实现了 80.2% 的计数准确率和 87.2% 的视觉推理准确率,随着努力程度的提高而改善,并且可以跨视频帧重识别物体。
- Astra 可以将视觉推理与机器人控制动作联系起来,如在绘画和绘图实验中所展示的那样,尽管物理设置仍然至关重要。
- Astra 昂贵且速度慢(每张图像 0.05–0.08 美元,每张图像 11–32 秒),因此对于许多数据集来说,像 Qwen3.8 Max 这样更便宜的模型可能更具成本效益。
- 实用建议包括从低努力开始,在准确性重要时使用 Astra 进行自动标注,并将其与专用检测器和跟踪器结合用于视频。