Cognition's SWE-2 achieves 92.8 on Terminal-Bench 2.1
20 days ago
- SWE-2 是一个 MoE 模型,总参数 2.8 万亿,每 token 激活 1040 亿参数,基于 Kimi K3 基础,结合 Cognition 的后训练和强化学习扩展至数万亿参数规模。
- 服务栈使用 NVFP4 和 FP8 内核,并进行量化感知训练;FP8 处理 MLA 层中的 K、Q、V 和得分计算;SpecForge 草案模型使接受长度延长 15%;预填充延迟器将每个 GPU 的 TPM 和每个请求的 token/秒提高了 10-20%,但增加了 TTFT。
- 努力级别:中等(平均 53 步),高(80 步),最大(98 步);中等级别的 FrontierCode 得分高于 SWE-1.7,且步数减少 58%,成本降低 81%,首次实际编辑的中位步数为 18,而 SWE-1.7 为 48。
- 基准测试(Cognition 自行报告):FrontierCode 50.0, DeepSWE 73.0, Terminal-Bench 2.1 92.8, Terminal-Bench 4.0 27.3;FrontierCode 落后于 Claude Fable 5.1 (50.9) 和 GPT-6 Astra (53.3),但成本比 Fable 低 64%,仅为 Astra 的四分之一;Terminal-Bench 4.0 在长期智能体工作中显示出显著差距。
- SWE-2 具有专有权重,不支持本地下载;可在 Devin Desktop 和 CLI 中使用,并逐步推广到 Devin Web 和 Fusion;无逐 token API;每个任务的成本比较由供应商报告,有待独立验证。