NVIDIA × NAVER AI · モデルアーキテクチャ
ネモトロン3ウルトラ:ハイブリッドアーキテクチャの内訳
Transformer-Mamba MoE設計が推論コストを削減しつつ、コンテキストを1Mトークンまで拡張する方法
標準的な密なLLM
密なトランスフォーマー
アクティブパラメータ/トークン100% (全ウェイト)
シーケンス複雑度O(N²) 二次
最大コンテキスト~128K トークン
推論コストベースライン
ネモトロン3ウルトラ
ハイブリッドマンバ-MoE
アクティブパラメータ/トークン10% (55B / 550B)
シーケンス複雑度O(N) 線形 (マンバ)
最大コンテキスト1,000,000 トークン
推論コストベースライン比 -30%
ネモトロン3ウルトラ — パラメータルーティング
550B
総パラメータ — アクティブなのは55B (10%)推論ごとにLatentMoEルーター経由でアクティブ化
〰️
マンバレイヤー
再帰的なシーケンス圧縮。長大な入力を線形時間で処理 — 1Mトークンコンテキストでのフルアテンションと比較してメモリオーバーヘッドが100倍少ない。
🔀
LatentMoEルーター
入力トークンごとに最適なエキスパートウェイトサブセットを動的に選択。総計550B、アクティブ55B — 無関係なパラメータへの無駄な計算を排除。
5×
推論速度
同等の密なモデルで同等のパラメータ数でのトークン生成が高速
−30%
計算コスト
NVFP4精度とMoEスパース性によるトークンあたりの運用コスト削減
1M
トークンコンテキスト
2,000ページのレポートを切り捨てなしで単一の推論パスで処理
出典: ネモトロン3ウルトラ技術レポート — NVIDIA AIリサーチラボ · NVFP4精度、LatentMoEルーティングアーキテクチャ