Hasty Briefsbeta

双语

Kimi K3 after a week of real project use: what works, what doesn't

7 hours ago
  • Kimi K3是首个能够在架构层面进行严肃工程对话的开源模型,专注于系统设计和权衡分析。
  • 其指令遵循能力与Opus相当,在长会话中严格遵守边界和多层指令。
  • 数据分析质量与Fable相当,能从真实数据集中提供有意义的观察和可操作的见解。
  • 在长代码会话方面,K3超越Opus并与Fable媲美,但存在训练后问题:过载错误、空思维令牌以及需要稳健错误处理的工具调用逻辑循环。
  • 缓存机制需谨慎进行密钥管理以确保成本效益,订阅信用消耗速度比Claude和Codex更快。
  • 上下文增长带来的性能退化极小,优于对初期模型的预期。
  • 更广泛的背景:讨论已从中国开源模型是否优秀转向如何限制它们,表明已跨越重要的技术门槛。
  • K3具有竞争力的价格和前沿级能力,使其成为Claude和Codex的强劲新兴竞争者,差距正在迅速缩小。