Where Agentic AI Latency Actually Lives
基础设施分析

Agentic AI 延迟的真正归宿

CPU vs GPU 延迟分布 — 聊天机器人 vs Agentic 工作流
按工作流类型划分的延迟分布
聊天机器人工作流
GPU 85%
CPU 开销: ~15%
GPU 推理: ~85%
GPU 占主导地位。CPU 只是一个信使。
Agentic 工作流
CPU 88%
CPU 开销: 50–88%
GPU 推理: 12–50%
GPU 闲置,等待 CPU。
关键数据
15× 更多 token
Agentic AI 每个用户请求生成的 token 数量至少是聊天机器人的 15 倍
88% 最大 CPU 份额
在高级工具调用 Agentic 流程中,高达 88% 的总延迟源于 CPU 处理
核心密度
Agentic 推理每千兆瓦所需的 CPU 核心数是传统 AI 推理的约 4 倍
每千兆瓦所需的 CPU 核心密度
传统 AI推理/训练
30M 核心/GW
Agentic AI编排
120M 核心/GW