Agentic AI 延迟的真正来源
基础设施分析

Agentic AI 延迟的真正来源

CPU 与 GPU 延迟分布 —— 聊天机器人 vs 智能体工作流
按工作流类型划分的延迟分布
聊天机器人工作流
GPU 85%
CPU 开销:~15%
GPU 推理:~85%
GPU 占主导地位。CPU 只是信使。
智能体工作流
CPU 88%
CPU 开销:50–88%
GPU 推理:12–50%
GPU 处于空闲状态,等待 CPU。
关键数据
15× 更多 Token
在每个用户请求中,Agentic AI 生成的 Token 数量至少比聊天机器人多 15 倍
88% 最大 CPU 占比
在工具调用频繁的智能体流程中,高达 88% 的总延迟源于 CPU 处理
核心密度
智能体推理每吉瓦所需的 CPU 核心数是传统 AI 推理的约 4 倍
每吉瓦所需的 CPU 核心密度
传统 AI推理 / 训练
30M 核心/GW
Agentic AI编排
120M 核心/GW