Qwen 3.8 follows GPT-5.5 Pro reasoning prefills
20 days ago
- 该实验测试了将GPT-5.5 Pro推理的前1%预填充到目标模型后,它们与教师模型答案重叠的影响。
- 重叠度通过答案前100个词中的一元、二元和三元源词召回率来衡量。
- 评估包含45个问题:15个STEM问题、15个非STEM问题和15个合成谜题。
- Qwen3.8 A95B与GPT-5.5 Pro的重叠度增幅最大(+18.18个百分点),尤其在合成谜题上。
- Kimi K3与GPT-5.5 Pro的基础重叠度最高(31.11%),但预填充带来的增益最小(+4.54个百分点)。
- 数据表明Qwen可能从GPT-5.5 Pro或紧密相关模型而非Opus中学习。