Hasty Briefsbeta

双语

Sonnet 5.5 scores just behind Opus 5.5 on Artificial Analysis Intelligence Index

12 hours ago
  • Anthropic 发布了 Claude Sonnet 5.5,在人工分析智能指数中得分为56,仅比 Opus 5.5 低2分,但每个任务的输出token数量是有史以来最高的。
  • 在最大努力下,Sonnet 5.5 相比 Sonnet 5 提升了18分,并在 Terminal-Bench 4.0 和 AA-Briefcase 等代理基准测试中与 Opus 5.5 持平,尽管使用了显著更多的token。
  • 该模型的定价与 Sonnet 5 相同,为每百万缓存/输入/输出token $0.2/$2/$10,但由于大量token使用(每个任务约19.3万输出token),每个任务的成本高出约50%。
  • Sonnet 5.5 在事实性知识(54% vs 66%)和科学推理(在 Humanity's Last Exam 和 SciCode 上低6分)上落后于 Opus 5.5,但幻觉率较低。
  • Anthropic 修复了一个影响结构化输出的预发布错误;预计公开发布的性能会略有提升。
  • 该模型保持100万token的上下文窗口,并提供五种努力设置(从低到最大);在较低努力下,GPT-6 Sol 每个token的性能更好。