Quantized Reasoning Models Think They Need to Think Longer, but They Do Not
9 hours ago
- 后训练量化(PTQ)在数学、编程和科学问答任务中会降低推理模型的准确性,同时增加思维链(CoT)长度。
- 在多达52%的量化模型失败案例中,正确答案出现在中间推理步骤中,但未作为最终输出,这表明存在过度思考的错误。
- 在高熵位置,量化模型与全精度模型之间的高令牌级KL散度导致量化模型采样过度思考标记,如“wait”、“but”和“alternatively”。
- 对策划的过度思考标记进行无需训练的logit惩罚,可将CoT长度减少12–23%,并将过度思考错误减少高达58%,同时保持或提高多个模型和基准的准确性。