Reinforcement Learning with Metacognitive Feedback Elicits Uncertainty in LLMsa month agohttps://arxiv.org/abs/2606.32032大型语言模型(LLMs)通常表现出较差的元认知能力,导致过度自信、产生幻觉以及无法识别自身知识局限。该论文引入了基于元认知反馈的强化学习(RLMF)方法,通过利用模型对自身表现的自我评判,在偏好优化过程中改进完成度排名,并筛选高价值训练数据。第二种方法——元认知数据选择——采用类似的自我评判机制,能够识别更有价值的训练样本,从而超越标准主动学习的效果。这些创新被应用于忠实校准(FC)任务,旨在使LLM表达的不确定性与实际内在不确定性保持一致。更多...