NVIDIA × NAVER AI · 模型架构
Nemotron 3 Ultra:混合架构详解
Transformer-Mamba MoE 设计如何降低推理成本并扩展上下文至 100 万 token
标准密集 LLM
密集 Transformer
每个 Token 的激活参数100% (所有权重)
序列复杂度O(N²) 二次方
最大上下文~128K tokens
推理成本基线
Nemotron 3 Ultra
混合 Mamba-MoE
每个 Token 的激活参数10% (55B of 550B)
序列复杂度O(N) 线性 (Mamba)
最大上下文1,000,000 tokens
推理成本比基线低 -30%
Nemotron 3 Ultra — 参数路由
550B
总参数 — 通过 LatentMoE 路由器,每次推理仅激活 55B (10%)
〰️
Mamba 层
循环序列压缩。以线性时间处理长输入 — 在 100 万 token 上下文上,内存开销比全注意力低 100 倍。
🔀
LatentMoE 路由器
为每个输入 token 动态选择最佳的专家权重子集。总计 550B,激活 55B — 消除了在无关参数上浪费的计算。
5×
推理速度
与同等参数量的密集模型相比,生成 token 更快
−30%
计算成本
通过 NVFP4 精度和 MoE 稀疏性降低每个 token 的运营支出
1M
Token 上下文
单次推理即可处理 2000 页的报告,无需截断
来源:Nemotron 3 Ultra 技术报告 — NVIDIA AI 研究实验室 · NVFP4 精度,LatentMoE 路由架构
```