- Thinking Machines发布了Inkling,这是一个拥有9750亿参数、410亿活跃参数和100万token上下文长度的MoE模型,被描述为美国实验室最强的开源权重模型,尽管在智能体任务上略逊于顶尖的中国模型。
- Inkling采用了一种独特的位置编码方法,用学习到的局部注意力偏置和用于长距离交互的无位置远场替代了RoPE,从根本上改变了位置信息的处理方式。
- 该模型的位置编码每层包含16个学习到的函数库,通过MLP生成每个token特定的系数,使得每个token在1024或512个token的窗口内拥有自己的位置偏置曲线。
- Inkling方法的主要优势包括:单个token可以灵活地拥有上下文相关的位置偏好,同时共享的函数库减少了计算开销。
- 权衡之处包括:由于需要在分块循环内添加偏置,注意力核的I/O成本更高,需要定制的FlashAttention变体;并且与RoPE相比,在不同硬件后端上缺乏成熟的优化。
- 该模型还整合了其他细节,如QK归一化、上下文长度相关的温度缩放,以及在查询和键路径上的卷积窗口,以补充位置编码。
- 总体而言,Inkling代表了与主流基于RoPE方法的重大偏离,以工程复杂性和核优化工作为代价,提供了增强的表达能力。