Hasty Briefsbeta

双语

Are we in a GPT-4-style leap that evals can't see?

a day ago
  • 作者认为,当前基准测试未能捕捉到的微妙“GPT-4时刻”已经出现,对行业和经济产生重大影响。
  • 基于聊天的LLM评估方法不足,日常使用中响应速度往往比感知的“质量”更重要。
  • Gemini 3 Pro在设计方面表现出色,能生成其他模型无法复制的视觉吸引人的原型,相当于中级设计师。
  • Opus 4.5显著降低了编程任务中对持续监督的需求,允许更长时间自主工作且错误更少。
  • 这些进步共同代表了产品开发周期中数量级的改进,使得管理跨职能团队成为可能。
  • 当前基准测试侧重于知识检索和孤立的通过/失败场景,忽视了设计品味和迭代协作等定性因素。
  • 需要新的基准测试来捕捉实际使用模式和定性方面,这可能解释了基准测试分数与经济影响之间的脱