Hasty Briefsbeta

双语

Kimi K3: second only to Fable 5 on AA-Briefcase

7 hours ago
  • 在AA-Briefcase基准测试中,Kimi K3仅次于Claude Fable 5,Elo得分为1543,相比其前代Kimi K2.6有显著提升。
  • 它表现出较强的客观性和分析能力(评分标准通过率51%,分析Elo 1754),但演示质量相对较弱(演示Elo 1471)。
  • 该模型运行成本高昂,平均每项任务花费10.57美元,令牌使用量高,每项任务涉及83轮交互,平均每项任务耗时56.4分钟。
  • 近期其他前沿模型的发布包括Grok 4.5、GPT-5.6、Muse Spark 1.1和Kimi K3自身,目前已有六个实验室的模型在AI指数上超过50分。