Controlling Reasoning Effort in LLMs2 days agohttps://magazine.sebastianraschka.com/p/controlling-reasoning-effort-in-llms引入具有类似GPT-5.6的多努力模式的推理模型。将推理模型定义为生成中间推理轨迹。训练方法:RLVR(可验证奖励的强化学习)和监督微调。推理扩展:调整计算和标记使用以提升性能。使用系统提示和长度惩罚实现推理努力水平。概述开源模型中的努力模式,如DeepSeek V4、Nemotron、Kimi、GLM-5、Qwen3和Inkling。自动努力选择作为未来目标,目前仍通过系统提示由用户控制。