Instella-Moe: An Open Mixture-of-Experts Language Model
14 hours ago
- AMD推出Instella-MoE,这是一个完全开放的混合专家语言模型,总参数为160亿,每个token的活跃参数为28亿。
- 该模型从头开始训练,使用AMD Instinct MI300X和MI325X GPU以及AMD ROCm软件栈,融合了门控多头潜在注意力(Gated MLA)和FarSkip-Collective连接等架构创新。
- Instella-MoE经历多阶段训练流程,包括预训练、中期训练、长上下文扩展、监督微调、直接偏好优化和