Controlling Reasoning Effort in LLMs
2 days ago
- 引入具有类似GPT-5.6的多努力模式的推理模型。
- 将推理模型定义为生成中间推理轨迹。
- 训练方法:RLVR(可验证奖励的强化学习)和监督微调。
- 推理扩展:调整计算和标记使用以提升性能。
- 使用系统提示和长度惩罚实现推理努力水平。
- 概述开源模型中的努力模式,如DeepSeek V4、Nemotron、Kimi、GLM-5、Qwen3和Inkling。
- 自动努力选择作为未来目标,目前仍通过系统提示由用户控制。