智能体 AI 推高推理负载,英伟达强调 Vera Rubin 与 Blackwell 能效
NVIDIA Generativ9 小时前
智能体 AI 正在改变推理负载
AI 智能体正在把大模型推理从传统的单轮交互扩展为更复杂的多步工作流。在一次任务中,智能体可能需要持续推理、调用外部工具、协调多个子智能体,并在不同轮次之间携带越来越长的上下文。
这种变化意味着,一次用户任务背后的实际推理工作量可能明显高于传统聊天场景。
单次请求的上下文正在变长
在真实使用数据中,这一趋势已经有所体现。OpenRouter 的 State of AI 报告分析了 100 万亿 Token 的实际使用情况,发现每次请求的平均 Prompt Token 数量增长至此前的约 4 倍。
更长的上下文以及更多步骤的推理,会进一步增加计算和能源需求。因此,对于大规模部署智能体 AI 的数据中心而言,除了绝对性能,单位功耗能够完成多少推理工作也变得更加重要。
Vera Rubin 与 Blackwell 瞄准性能功耗比
针对智能体 AI 带来的推理负载增长,英伟达将 Vera Rubin 和 Blackwell 定位为提升 AI 推理性能与能效的平台,重点强调单位功耗下的智能体 AI 性能。
从这一思路来看,智能体时代的基础设施竞争不再只是追求单纯的计算性能。随着模型需要处理更长上下文、更多工具调用和更复杂的多步骤任务,推理系统如何在功耗约束下持续提供计算能力,正在成为 AI 基础设施需要解决的重要问题。
