Is AI Reasoning Right for the Wrong Reasons?2 days agohttps://www.quantamagazine.org/is-ai-reasoning-right-for-the-wrong-reasons-20260...大型推理模型(LRM)可以解决数学证明等复杂问题,但它们生成的“思维链”可能并不反映实际的推理过程。研究表明,许多推理标记是非因果或毫无意义的,模型即使使用错误或不相关的思维链也能得出正确答案。争论的焦点在于LRM是真的推理还是依赖模式匹配和近似检索,一些专家认为将中间标记拟人化是不科学的。“一厢情愿的记忆术”概念解释了研究人员如何用类人术语标记人工智能过程,这可能会误导对模型工作方式的理解。更多...
Kimi K3's Design Secret May Be in Its Thinking Traces8 days agohttps://notes.designarena.ai/kimi-k3s-design-secret-may-be-in-its-thinking-trace...Kimi K3 ranks 1st on single-shot Frontend Arena with 1392 Elo, a significant jump over previous Kimi models.It uses over 12x more thinking tokens than Claude Opus 4.8 and double that of Kimi K2.6.Kimi K3's performance is attributed to a unique chain-of-thought that simulates an AI agent, iterating on designs like an agent would.It writes over 10x more code during reasoning than other Kimi models, effectively 'thinking in code'.更多...
ARC-AGI Leaderboard8 days agohttps://arcprize.org/leaderboardARC-AGI-3 衡量AI代理在新型交互环境中即时适应的能力,这是从早期被动流体智力测试演变而来的。排行榜散点图展示了每项任务的成本与性能之间的关系,强调效率作为智力的关键衡量标准。图中绘制了三类数据:推理系统趋势线(显示推理时间的影响)、基础大语言模型(单次推理)以及Kaggle系统(严格成本限制下的竞赛级提交)。仅显示运行成本低于10,000美元的系统;不完整的测试输出被视为错误,预览结果非官方。
What's new in Claude Opus 59 days agohttps://platform.claude.com/docs/en/about-claude/models/whats-new-opus-5Claude Opus 5 相较于 Opus 4.8 有显著改进,在深度推理、智能体任务、长周期任务以及测试时计算扩展方面有所提升。Claude Opus 5 默认启用思考功能;禁用思考仅限于 effort 级别为 high 或以下,若尝试在 xhigh 或 max effort 下禁用它,将返回 400 错误。该模型支持 100 万 token 的上下文窗口、12.8 万最大输出 token,以及从 low 到 max 的 effort 阶梯,用于控制推理深度。对话中途的工具更改功能目前处于测试阶段,允许在轮次之间添加或移除工具,同时保留提示缓存。更多...
Schema Harness Achieves ~99% on Arc‑AGI‑3 Public17 days agohttps://schema-harness.github.io/模式框架通过将潜在世界表征视为可执行程序,使前沿模型在ARC-AGI-3公开集上达到约99%的性能,实现可解释、可验证且可搜索的建模。ARC-AGI-3挑战智能体从64x64彩色网格中推断游戏规则、对象和目标,无需明确指令,并使用相对人类行动效率(RHAE)指标进行评估。该方法结合状态基础(从观察中识别对象和变量)与机制发现(学习转换规则),在可编辑程序中联合求解,模仿类似物理学家的推理过程。受控比较显示,模式框架将Claude Code基线性能提升56.15%,其效率增益源于基于完整历史验证模型、在可复用模拟器内规划,从而显著减少行动次数。更多...
AI bots ignore evidence. Can we trust them with science?a month agohttps://www.sciencenews.org/article/ai-ignore-evidence-trust-science在一场钢笔演示实验中,ChatGPT、Gemini 和 Grok 等 AI 聊天机器人未能根据实验证据更新预测,仍坚持错误的假设。一项研究显示,在 68% 的科学推理任务中,AI 智能体忽略证据;在 53% 的任务中提出缺乏支持的论断;而仅有 26% 的情况下,它们会依据矛盾证据更改输出。AI 系统缺乏类似人类科学家的迭代推理过程,即使面对明确证据也常常拒绝修正假设,这限制了它们在科学和医学领域的可靠性。研究人员开发了一套基准,旨在评估 AI 智能体的推理过程而非仅看结果,揭示了它们在透明整合新数据能力上的缺陷。更多...