Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning2 months agohttps://arxiv.org/abs/2607.12395Ring-Zero将零样本强化学习(RL)扩展至一万亿参数以提升推理能力。一个具有算法与系统优化的稳定训练流程解决了可读性差和冗余等问题。关键发现:扩展规模能提高样本效率和性能;训练包含发现与锐化阶段;出现了自我验证等新兴认知行为。模型在数学基准测试中展现出有竞争力的性能,并在推理轨迹可理解性、可复现性以及效率方面具有优势。