Cognition launches new SWE-2 model, Rivaling Fable 5.1 and GPT-Astra
20 days ago
- SWE-2 是一款高级编码模型,在 FrontierCode 1.1 Main 上达到 50.0%,接近 Fable 5.1 但成本降低 64%,推动了能力与成本的帕累托前沿。
- 它采用一种新颖的强化学习算法,在单次运行中训练所有推理努力级别,并首次扩展到数万亿参数规模。
- SWE-2 在得分和成本上均优于 SWE-1.7 和 Grok 4.6 等先前模型,以极低的价格媲美 GPT-5.6 Sol 和 Fable 5/5.1,并且以四分之一成本与 GPT-6 Astra 相差仅几分。
- 改进包括基于帕累托的成本惩罚、用于稳定训练的长度加权奖励基线、采用 NVFP4/FP8 内核和量化感知训练的增强型强化学习推理服务,以及配备强化验证器的三倍强化学习环境。
- 在行为上,SWE-2 更加高效:更高的智能导致集中探索,更快的首次编辑(中位数 18 步,而 SWE-1.7 为 48 步),更好的测试覆盖率、资源利用和验证纪律。
- 可信度评估显示,在宣传/审查测试中通过率为 98%,并且在跨不同客户身份和语言的上下文相关漏洞任务中没有显著的框架效应。