- Moonshot AI 宣布了 Kimi K3,一个拥有 2.8 万亿参数的模型,承诺于 2026 年 7 月 27 日开放权重。
- 自报基准显示 K3 击败了 Claude Opus 4.8 max 和 GPT-5.5 high,但落后于 Claude Fable 5 和 GPT-5.6 Sol。
- Artificial Analysis 报告称,K3 在长时知识任务中获得了 1547 的 Elo 评分,每项任务成本为 0.94 美元,输出 token 比 K2.6 少了 21%。
- 价格为每百万输入 token 3 美元,每百万输出 token 15 美元,使其成为来自中国 AI 实验室最昂贵的模型。
- 鹈鹕基准测试(生成一只骑自行车的鹈鹕的 SVG)花费了 0.25 美元,使用了 13241 个推理 token,揭示了 K3 的高推理负担和一个约 85 个 token 的隐藏系统提示。
- 鹈鹕测试作为快速“你好世界”仍然有用,用于尝试新模型、估算成本和推理、检查空间意识,并维持 Hacker News 上的传统。
- 尽管有局限性(没有智能体评估),鹈鹕基准测试在模型家族内进行粗略比较以及作为实际测试模型的强制功能方面仍然有价值。