Agentic AI 延迟的真正来源
基础设施分析
Agentic AI 延迟的真正来源
CPU 与 GPU 延迟分布 —— 聊天机器人 vs 智能体工作流
按工作流类型划分的延迟分布
聊天机器人工作流
GPU
85%
CPU 开销:~15%
GPU 推理:~85%
GPU 占主导地位。CPU 只是信使。
智能体工作流
CPU
88%
CPU 开销:50–88%
GPU 推理:12–50%
GPU 处于空闲状态,等待 CPU。
关键数据
15×
更多 Token
在每个用户请求中,Agentic AI 生成的 Token 数量至少比聊天机器人多 15 倍
88%
最大 CPU 占比
在工具调用频繁的智能体流程中,高达 88% 的总延迟源于 CPU 处理
4×
核心密度
智能体推理每吉瓦所需的 CPU 核心数是传统 AI 推理的约 4 倍
每吉瓦所需的 CPU 核心密度
传统 AI
推理 / 训练
30M 核心/GW
Agentic AI
编排
120M 核心/GW