AA-AgentPerf 首批结果:面向 Agent 时代的硬件基准测试
AA-AgentPerf 是首个面向智能体(agentic)的推理基准测试:它回放真实的编码 Agent 轨迹,衡量在满足生产级服务等级目标的前提下,一套系统能够同时服务多少个并发 Agent。它的核心指标是每兆瓦 Agent 数(Agents per Megawatt)——即一套加速器平台每消耗一兆瓦电力所能服务的 Agent 数量上限。在一个功耗受限的世界里,这是衡量 AI 基建最重要的指标。在首批结果中,NVIDIA 的 Blackwell 系统领先,相比 Hopper 展现出显著的代际飞跃。机架级(rack-scale)部署在算力和功耗效率两方面的规模优势与分离式(disaggregated)推理优势也十分明显。
面向 Agent 时代的基准测试
2026 年的主流 AI 工作负载,与那些推理基准测试当初为之设计的工作负载毫无相似之处。编码 Agent 会运行数百个回合,把推理与工具调用、代码编辑交织在一起,上下文动辄超过 10 万 token。把它们服务好,与服务聊天对话是完全不同的工程问题:长而共享的前缀让 KV 缓存复用变得有利可图,成批的短输出给调度器带来压力,而用户仍然期望响应迅速、可交互的速度。
大多数硬件基准测试至今仍在以固定的输入、输出长度测量合成请求,并且关闭了生产部署所依赖的各项优化。买家真正需要的那个数字——这套系统能以用户可接受的体验服务多少个 Agent?——从未出现。而在一个 AI 算力日益受可用电力与能源成本约束的世界里,这个问题还带着一个分母。AA-AgentPerf 的核心指标「每兆瓦 Agent 数」衡量的,正是在满足每个 Agent 的输出速度与首 token 时延(time-to-first-token)目标的前提下,一套系统每兆瓦实测功耗能支撑多少个同时运行的 Agent。
AA-AgentPerf 是首个面向智能体的推理基准测试。它针对被测系统回放真实的编码 Agent 轨迹,并找出在满足由市场推导出的性能目标的前提下,该系统能够持续支撑的最大并发 Agent 数。它历经一年时间,与推理服务商、AI 加速器厂商、开发者和企业买家共同打磨而成。它的目标,是成为任何为智能体工作负载采购或租赁 AI 硬件者的权威参考。
真实的编码 Agent 轨迹
AA-AgentPerf 中每个被模拟的 Agent,都在执行一条真实的编码 Agent 轨迹——这些轨迹由 Agent 在公开代码仓库中解决 issue 时生成,使用的是开启了推理能力的顶级开放权重模型。会话最长运行 200 个回合,序列长度可超过 10 万 token:
- 每个请求的输入长度从约 5K 到约 131K token 不等,均值约 27K——其增长主要来自工具输出和累积的历史记录,而非提示词本身
- 各回合的输出长度差异很大:Agent 大多发出简短的工具调用和代码编辑,其间穿插着较长篇幅的推理
- 覆盖 12 种以上编程语言,依据源代码仓库的主要语言划分
- 测试集保持私有。参与者会收到一份具代表性的调优子集用于配置验证;完整数据集则保留不公开,以防止针对基准测试的定向优化
正是这种形态让 Agent 的服务变得困难,也正是均匀长度的合成基准测试完全忽视的地方。工具结果让上下文急剧膨胀,输出却往往只有几百个 token,而同一段前缀在一个又一个回合中反复出现。一套系统的 KV 缓存行为、调度器和内存层级结构,决定了它在这种模式下是如鱼得水还是彻底崩溃。
测量现代生产技术栈
AA-AgentPerf 是首个允许使用实验室和推理服务商在生产中实际运行的各项优化的推理基准测试:KV 缓存复用、推测解码(speculative decoding)以及分离式预填充/解码(disaggregated prefill/decode)。关闭这些优化的基准测试,测量的是一种没人会真正上线的部署方式;允许它们,才能反映真实部署应有的样子。这也让 AA-AgentPerf 成为一个理解每一项新软件、新硬件进展影响的工具,而不仅仅是衡量每一颗新芯片。准确性验证会控制质量损失,因此任何优化都不能以牺牲输出质量为代价来换取容量。
允许生产级优化,意味着服务配置(serving configuration)成为基准测试中举足轻重的一环。在给定系统上服务一个模型的方案空间极其宽广——推理框架及其版本、并行策略、推测解码的设置、分离式拓扑结构,以及数十项调优决策——而且变化飞快:自 DeepSeek V4 Pro 发布以来,我们看到针对它的服务配置几乎每天都在改进。
结果通过两条路径登上排行榜,且每条公布的结果都会注明来源:要么由厂商为自家系统提交经过调优的配置,由我们运行并验证;要么在尚无厂商提交时,由 Artificial Analysis 在内部自行构建配置。在 DeepSeek V4 Pro 的首发结果中,B300 与 GB300 的配置由 NVIDIA 提交,而 H200 与 MI355X 的结果运行的是 Artificial Analysis 构建的配置。每个数字背后完整的服务配置,以及它由谁提交,都可在配置浏览器中查阅。
AA-AgentPerf 本次首发的这些数字,应当被解读为一条快速演进的前沿曲线上的一个快照,正如 Artificial Analysis 报告的其他实时性能基准测试结果一样。这些是真实的结果,反映了在所披露配置下今天可达到的性能,但我们提醒读者:每套系统都可能存在不等量的进一步提升空间,并且我们预期随着更多厂商提交配置,结果还会继续攀升。尤其是 MI355X 和 H200 的提升空间可能更大,因为它们的配置是由 Artificial Analysis 团队而非厂商团队提交的。
在真实服务等级下衡量容量
峰值吞吐很容易被注水:只要不断堆叠并发量,直到每个 Agent 都慢如蜗牛即可。AA-AgentPerf 反其道而行——它固定服务等级,然后追问一套系统在维持该等级的前提下最多能扩展到多远。性能目标取自 Artificial Analysis 的无服务器(serverless)API 基准测试数据,即当今市场上真实存在的各档服务等级。速度与时延按请求逐一测量:P25 输出速度和 P95 首 token 时延,在一个测试阶段的全部请求上计算得出。
首发时的服务等级档位
DeepSeek V4 Pro(max)
| 档位 | 每 Agent 输出速度 | P95 首 token 时延(TTFT) |
|---|---|---|
| Tier 1 | 20 token/s | ≤ 10 秒 |
| Tier 2 | 60 token/s | ≤ 5 秒 |
| Tier 3 | 180 token/s | ≤ 3 秒 |
gpt-oss-120b(high)(即将推出)
| 档位 | 每 Agent 输出速度 | P95 首 token 时延(TTFT) |
|---|---|---|
| Tier 1 | 100 token/s | ≤ 5 秒 |
| Tier 2 | 250 token/s | ≤ 3 秒 |
| Tier 3 | 500 token/s | ≤ 2 秒 |
| Tier 4 | 2,000 token/s | ≤ 1 秒 |
对每个档位,先以指数式爬坡、再以二分搜索的方式,找出系统在不违反目标的前提下能维持的最大并发量;各项指标在稳态窗口内计算,该窗口要求所有 Agent 都已活跃至少 30 秒。
首批结果揭示了什么
第一波结果覆盖了运行 DeepSeek V4 Pro 的 NVIDIA 与 AMD 系统,测量范围从单颗加速器一直到整机架,gpt-oss-120b 的结果随后跟进。其中有三点发现尤为突出:
01 · 机架级展现出其效率
其与生俱来的规模优势,以及对推理进行激进分离的能力,相比单节点在纯算力和「每兆瓦 Agent 数」上都带来了明显增益。
02 · 一次代际飞跃
从 Hopper 迈向 Blackwell,在系统能够持续支撑的并发 Agent 数上带来了阶跃式提升——无论是原始容量还是「每兆瓦 Agent 数」皆是如此。
03 · 真实世界的优化至关重要
采用不同的内核(kernel)优化和服务配置设计,会显著改变结果,这再次印证了对整个技术栈进行优化的必要性。
下文每个结果都按「每加速器、每系统、每兆瓦」三种口径做了归一化,以便公平比较规模相差悬殊的系统。其中「每兆瓦」数字是基于负载下实测的加速器功耗计算的,而非额定热设计功耗(TDP)。
需要注意的是,由于 DeepSeek V4 Pro 在 AMD 系统上的内核优化和配置设计尚处于相对早期阶段,我们预期 AMD 的性能在近期会有显著改进。我们期待与所有厂商合作,长期跟踪其性能随时间的提升。
探索 DeepSeek V4 Pro 的结果
下方图表是 AA-AgentPerf 排行榜的实时视图——与硬件基准测试看板的数据相同,随着新结果落地而更新。你可以在不同的归一化视角(每加速器、每系统、每兆瓦)之间切换以查看 Agent 容量,并深入查看每个数字背后的容量搜索过程。
Agent 容量:每套系统在每个输出速度目标下所能维持的并发 Agent 数与输出吞吐。
一个实时、开放提交的基准测试
AA-AgentPerf 是一个实时基准测试。用于评测的配置提交现已开放,并随着新硬件、新软件栈和新模型版本的出现而滚动发布结果。厂商也可以为已经登榜的系统提交改进后的配置;随着服务软件的进步,已公布的结果会更新,以反映真实世界性能的演进。该基准测试旨在公平地评估各类系统——从单颗加速器到整机架,从纯 DRAM 架构到纯 SRAM 设计,以及介于两者之间的一切。
如果你是硬件厂商或推理服务商,希望让自己的系统接受评测,请联系 agentperf@artificialanalysis.ai。我们将持续扩展模型覆盖、系统覆盖与工作负载广度。
下一步计划
AA-AgentPerf 将持续升级。已规划的扩展包括:
- 更长的上下文长度——将轨迹扩展至 100 万 token
- 更广的模型覆盖——在所有已提交的系统上给出 gpt-oss-120b 结果,后续还会加入更多模型
- 更广的硬件覆盖——更多 NVIDIA 与 AMD 系统的结果,以及更多加速器架构
- 工具执行性能——把执行 Agent 工具调用所需的 CPU 性能纳入基准测试
- 随时间变化的结果——跟踪各系统的数字如何随服务配置和框架的进步而提升
- 对 token 经济性与定价的更深入分析——包括每美元/小时租赁成本对应的 Agent 容量、每任务成本以及总拥有成本(TCO)
进一步了解
- 完整结果、各归一化视角以及服务配置均实时呈现在硬件基准测试页面,随新结果落地而更新
- AA-AgentPerf 方法论详细记录了数据集、服务等级档位、测试执行流程与各项指标
- 配置浏览器列出了每个已公布结果背后完整的服务配置
- 提交评测请联系:agentperf@artificialanalysis.ai