Hasty Briefsbeta

双语

Controlling Reasoning Effort in LLMs

2 days ago
  • 引入具有类似GPT-5.6的多努力模式的推理模型。
  • 将推理模型定义为生成中间推理轨迹。
  • 训练方法:RLVR(可验证奖励的强化学习)和监督微调。
  • 推理扩展:调整计算和标记使用以提升性能。
  • 使用系统提示和长度惩罚实现推理努力水平。
  • 概述开源模型中的努力模式,如DeepSeek V4、Nemotron、Kimi、GLM-5、Qwen3和Inkling。
  • 自动努力选择作为未来目标,目前仍通过系统提示由用户控制。