Are we in a GPT-4-style leap that evals can't see?6 days agohttps://martinalderson.com/posts/are-we-in-a-gpt4-style-leap-that-evals-cant-see...作者认为,当前基准测试未能捕捉到的微妙“GPT-4时刻”已经出现,对行业和经济产生重大影响。基于聊天的LLM评估方法不足,日常使用中响应速度往往比感知的“质量”更重要。Gemini 3 Pro在设计方面表现出色,能生成其他模型无法复制的视觉吸引人的原型,相当于中级设计师。Opus 4.5显著降低了编程任务中对持续监督的需求,允许更长时间自主工作且错误更少。更多...
Can LLMs Perform Deep Technical Comprehension of Computer Architecture Papers18 days agohttps://arxiv.org/abs/2607.11859Gauntlet,一种开源多智能体流程,评估了对计算机架构论文的深度技术理解,在大多数情况下超越了人类分析。在对20篇近期ISCA/HPCA论文的评估中,Gauntlet在20次比较中有15次被认为优于人类分析,尤其在关键严谨性方面表现出显著优势。多智能体结构,尤其是综合传递环节,是Gauntlet性能的关键,在96%的论文上超越了单智能体方法。人类分析仅在信任和有用性等少数方面占优,这通常是因为存在自信但错误的断言或未优先级排序的广度等问题。更多...
Comparing Fable and 10 other LLMs on refactoring a LangGraph god nodea month agohttps://wtf.korridzy.com/twilight-of-the-gods/该文章描述了一项实验,其中11个大型语言模型(包括Fable-5、GPT模型等)被要求为一个LangGraph代理中的'神节点'提出重构方案,随后对这些方案进行了交叉评估。'神节点'(计划节点)包含约350行隐藏逻辑,使得整个图难以调试、测试和修改。实验目标是将这些逻辑提升至图级别以提高清晰度。第一阶段,每个模型生成了一个分割计划节点的方案。这些方案在粒度上各不相同,从平衡的管道(如Fable-5的5阶段分割)到更粗略或更细致的方法均有涉及。第二阶段,模型对所有方案进行了评估。评审的细致程度存在差异:Fable-5的评审非常细致并发现了错误,而其他模型如Gemini-3.1-pro的评审则较为简略。更多...