What Is RLCD? The Secret Behind Jev
5 hours ago
- Jev 是一种泛化到软件界面的偏好模型,而非语言模型。
- RLCD 将 PPRM(成对偏好奖励模型)扩展到使用 Plackett–Luce 的多路决策。
- 通过 Brier 分数和温度缩放的校准使概率在经验上可靠。
- Jev 为二元、多路和序数决策提供类型化原语(Noul、Choice、Score)。
- 通过序列打包和树注意力实现并行推理,避免自回归生成。
- 决策头从上下文表示中计算效用,支持多候选评分。
- RLCD 专注于经过校准的动作分布,与强调奖励来源的 RLHF/RLVR 不同。
- 该系统分解为用于学习的 RLCD 和用于高效服务的打包/掩码机制。