NVIDIA × NAVER AI · 模型架构
Nemotron 3 Ultra:混合架构解析
Transformer-Mamba MoE 设计如何在将上下文扩展至 1M token 的同时降低推理成本
标准密集型 LLM
密集型 Transformer
激活参数 / Token100%(所有权重)
序列复杂度O(N²) 二次方
最大上下文~128K token
推理成本基线
Nemotron 3 Ultra
混合 Mamba-MoE
激活参数 / Token10%(550B 中占 55B)
序列复杂度O(N) 线性 (Mamba)
最大上下文1,000,000 token
推理成本相比基线 −30%
Nemotron 3 Ultra — 参数路由
550B
总参数量 — 仅 55B (10%) 通过 LatentMoE 路由器在每次推理中被激活
〰️
Mamba 层
循环序列压缩。在线性时间内处理长输入 — 在 1M token 上下文中比全注意力机制减少 100 倍内存开销。
🔀
LatentMoE 路由器
为每个输入 token 动态选择最佳专家权重子集。总量 550B,激活 55B — 消除在无关参数上的算力浪费。
5×
推理速度
相比相同参数量的等效密集模型生成 token 更快
−30%
计算成本
通过 NVFP4 精度和 MoE 稀疏性降低每个 token 的运营支出
1M
Token 上下文
在单次推理中无截断处理 2,000 页的报告
来源:Nemotron 3 Ultra 技术报告 — NVIDIA AI 研究实验室 · NVFP4 精度,LatentMoE 路由架构