8 hours ago
- 理论上的最佳大语言模型输出是通过选择概率最高的token来确定的,但这对于许多应用来说并不理想。
- Top-p(核采样)收集概率总和达到'p'的最高分token,并进行加权随机采样,但可能包含非常弱的token。
- 提出的首个Token截断(FTC)算法仅选择概率在顶部token概率一定比率(co)内的token,从而限定了最差可能的token。
- FTC提供了一个单一、线性、易于理解的参数'co',而top-p的效果取决于分布形状。
- 雪崩效应(上下文变化)可以提供变异性,而无需选择弱token。
- 作者主张对采样算法和logits分析进行更多研究,以提高大语言模型输出质量和不确定性检测。