エージェンティックAIのレイテンシが実際に発生する場所
インフラ分析

エージェンティックAIのレイテンシが実際に発生する場所

CPU vs GPU レイテンシ分布 — チャットボット vs エージェンティックワークフロー
ワークフロータイプ別のレイテンシ分布
チャットボットワークフロー
GPU 85%
CPUオーバーヘッド: ~15%
GPU推論: ~85%
GPUが支配的。CPUは単なるメッセンジャー。
エージェンティックワークフロー
CPU 88%
CPUオーバーヘッド: 50–88%
GPU推論: 12–50%
GPUはアイドル状態でCPUを待機。
主要な数値
15× より多くのトークン
エージェンティックAIはユーザーリクエストあたりチャットボットの最低15倍のトークンを生成
88% 最大CPUシェア
ツール呼び出しが多いエージェンティックフローでは、総レイテンシの最大88%がCPU処理に起因
コア密度
エージェンティック推論は従来のAI推論よりギガワットあたり約4倍多いCPUコアを必要とする
ギガワットあたりの必要CPUコア密度
従来のAI推論 / 学習
30M cores/GW
エージェンティックAIオーケストレーション
120M cores/GW