Hasty Briefsbeta

双语

Motif-3-Beta

10 hours ago
  • Motif-3-Beta是即将推出的Motif-3混合专家(MoE)语言模型的预览检查点,并非最终版本。
  • 它拥有约3140亿个总参数,每个令牌仅激活约130亿个参数,采用稀疏MoE架构,包含384个专家(每个令牌激活8个专家,外加1个共享专家)。
  • 支持原生上下文长度256K令牌(262,144),专为多语言、通用任务而构建。
  • 该模型引入了自定义内部组件:分组差分潜在注意力(GDLA)、每个专家的分组PolyNorm激活以及改进的mHC架构。
  • 可通过Hugging Face Transformers管道(设置trust_remote_code=True)、vLLM服务器、SGLang服务器或Docker Model Runner使用。
  • 权重公开可用,无需访问请求;许可证仅允许个人、教育及非商业研究用途,商业使用需事先获得许可。
  • 根据Artificial Analysis的评估,它在AAII基准测试中获得了44分。