Hasty Briefsbeta

双语

Nvidia Nemotron 3 Ultra – open weight model

3 hours ago
  • NVIDIA 推出 Nemotron 3 Ultra,其最强模型,总参数量达 5500 亿,活跃参数量为 550 亿。
  • 采用混合专家(MoE)与混合 Mamba-Attention 架构、LatentMoE 和 MTP 层,支持推测解码与加速推理。
  • 支持推理时的预算控制,并以 NVFP4 格式进行预训练。
  • 通过监督微调(SFT)、强化学习(RL)和多教师在线策略蒸馏(MOPD)进行后训练,以提升准确率。
  • 在长输出场景下,推理吞吐量分别比 GLM-5.1-754B-A40B、Kimi-K2.6-1T-A32B 和 Qwen-3.5-397B-17B 高出 5.9 倍、4.8 倍和 1.6 倍。
  • 在多个基准测试中与其他最先进的开源大语言模型精度相当,支持最长 100 万 token 的上下文长度,且在 RULER 上表现更优。
  • 开源版本包含预训练、后训练和量化检查点,以及代码、法律和专用数据等训练数据集。