Width vs. Depth: Speculating on the Margina month agohttps://blog.doubleword.ai/speculating-on-the-margin在批次大小为1、使用2个位置草稿的情况下进行推测解码,即使有10%的标记拒绝率,其吞吐量仍可能高于两个序列的批次处理。MoE路由在推测运行中导致专家协同激活,与随机批次处理相比减少了内存移动,使得深度比宽度更经济。推测效率因序列而异;置信度门控根据起草者的置信度不均匀地分配草稿深度,从而提高吞吐量,尤其是在小批次大小时。模拟显示,置信度门控的推测优于固定深度策略,但需要引擎支持不规则的推测(即每个序列使用不同的深度)。更多...