AI 一周观察(6.13–6.19):这一周,"Agent" 从形容词变成了名词
2026 年 6 月 17 日,法国小镇埃维昂(Évian),日内瓦湖边。
这里在开 G7 峰会。按惯例,午餐会的桌子是留给国家元首的。但这一天,桌边坐着几张不太一样的脸:Anthropic 的 Dario Amodei、Google DeepMind 的 Demis Hassabis、还有 OpenAI 的人。
科技公司的 CEO,第一次以"被各国领导人请来商量事"的姿态,坐进了 G7 的核心议程。CNBC 那篇报道的标题很直白——"A signal of where power sits"(这是一个关于权力坐在哪里的信号)。
你可能觉得,这不就是又一场科技大佬的合影外交吗?
不。如果你把这一周散落在各处的新闻拼起来——埃维昂的午餐会、Anthropic 在 6 月 15 日悄悄改的一行计费规则、一家测评机构发布的新基准——你会发现它们指向同一件事。
这一周,"Agent"这个词,完成了一次词性转换:它从一个形容词(agentic AI、智能体能力),变成了一个名词(一个被计价、被测量、被监管的实体)。这才是过去七天真正发生的事。
一、一个判断:Agent 正在"名词化"
先说我的核心判断,剩下的内容都是为它做注脚。
过去一年,我们聊 Agent,聊的都是"能力":它能不能自己调用工具?能不能跑几百轮不跑偏?能不能改完代码自己跑测试?这些都是形容词式的讨论——智能体"有多智能"。
但这一周,讨论的层次变了。三件看似无关的事,同时把 Agent 当成了一个独立的对象来处理:
- 在 G7,AI 的"自主能力"成了国家安全议题——监管者要管的不是"模型说了什么",而是"智能体能干什么"。
- 在 Anthropic,Agent 的用量从 6 月 15 日起被单独拎出来计费,不再和你聊天的额度混在一起。
- 在测评圈,一个叫 AA-AgentPerf 的新基准上线,第一次用"每兆瓦电能跑多少个 Agent"来给硬件打分。
监管、计费、度量——这是任何一个东西从"技术概念"变成"经济实体"的三个标志。货币是这样,电力是这样,现在轮到 Agent 了。
所以这一周不该用"哪个模型又刷新了榜单"来总结。该这么总结:智能体经济,开始有了它的法律、它的账单和它的尺子。
我们一条一条看。先去埃维昂的那张午餐桌。
二、谈判桌:AI 第一次坐进了 G7 的午餐会
为什么是今年?为什么 AI 突然就成了 G7 桌上的主菜,而不是甜点?
答案藏在一个词里:网络攻击能力(cyber capabilities)。
过去半年,前沿模型的进化方向悄悄拐了个弯。Anthropic 的 Mythos、OpenAI 的 GPT-5.5 Cyber,这一批模型最让政府睡不着觉的,不是它们会写诗,而是它们会找漏洞——而且找得太好了。
还记得 Mythos 那个数字吗?在一个叫 Glasswing 的封闭项目里,它在 1000 多个开源项目里挖出了 23,019 个漏洞。这个能力用来做防御,是神器;用来做攻击,就是网络武器。
于是在埃维昂,几位 AI 巨头的掌门人没有去争"谁的模型更强",而是异口同声地喊了一句话:别分裂(resist the temptation to splinter)。
Amodei 警告各国元首,不要在 AI 监管上各搞一套;Hassabis 和他一起,呼吁组建一个"美国主导的 AI 联盟"。印度总理莫迪则在另一头喊话:所有民主国家都应该能用上前沿模型,否则没法防御网络威胁,并提议建立共同标准和"监管沙盒"。
当一项技术的掌门人开始主动请求被监管,通常只有两种可能:要么它真的危险到了连造它的人都怕;要么他们想用监管这堵墙,把后来者挡在门外。
—— 这一周最值得琢磨的潜台词
我倾向于认为,两者都对。Mythos 的能力是真的吓人,但"美国主导的联盟"这五个字,也实实在在地把中国实验室、把开源模型,划到了墙的另一边。
谈判桌上聊的是安全,桌子底下踢的是格局。这是 Agent 名词化的第一层:它成了地缘政治的筹码。
三、计费单位:Anthropic 给 Agent 单开了一个账户
从日内瓦湖边回到你的终端。这一周还有一件事,几乎没人发新闻稿,但每个用 Claude 写代码的人都会被它改变。
6 月 15 日起,Anthropic 调整了订阅计划的计费方式:Agent SDK 的用量、以及非交互式的 claude -p 跑批,不再从你日常聊天的额度里扣,而是从一笔单独的"Agent SDK 月度额度"里扣。
Pro 计划 20 美元,Max 5x 是 100 美元,Max 20x 是 200 美元——这是专门划给"机器自己干活"的钱。
这一行规则改动,信息量比它看起来大得多。
打个比方。以前你家只有一个电表,人用电、空调用电、电动车充电,全走一个表。现在电力公司过来说:电动车充电,我们给你单独装一个表。
为什么要单独装表?因为电动车的耗电模式跟你开灯做饭完全不是一回事——它是大功率、长时间、可调度的。你只有给它单独计量,才能单独定价、单独优化、单独限流。
Anthropic 给 Agent 单开账户,是同一个逻辑。一个 Agent 任务动辄跑几百轮、烧掉几十万 token,它的消耗曲线和"人和 AI 一问一答"根本不在一个量级。把它们混在一个额度里,要么人被机器挤爆,要么没法给企业级的自动化工作流定价。
所以别小看这一行计费改动。当一个东西开始拥有独立的账单,它就从"功能"变成了"商品"。这是 Agent 名词化的第二层。
四、度量衡:硬件开始按"每兆瓦跑几个 Agent"打分
有了法律,有了账单,还差一样东西,Agent 才算真正"成精":一把尺子。
这一周,这把尺子也来了。测评机构 Artificial Analysis 发布了 AA-AgentPerf,自称是第一个为"智能体时代"设计的硬件基准。
它有意思在哪?过去我们衡量 AI 硬件,用的是"每秒能吐多少 token"。这套尺子,是为"人和模型一问一答"设计的——你问一句,它答一段,比谁吐字快。
但 Agent 不这么干活。一个编程 Agent 会连续跑几百轮,一会儿推理、一会儿调工具、一会儿改代码,上下文动不动就超过 10 万 token。AA-AgentPerf 干脆把真实的编程 Agent 轨迹录下来重放,然后问一个全新的问题:
在保证服务质量的前提下,一台机器最多能同时伺候多少个 Agent?
它的核心指标,叫 Agents per Megawatt(每兆瓦智能体数)——每一兆瓦电,能养活多少个并发的 Agent。
首批结果也很说明问题(以最宽松的服务等级、跑 DeepSeek V4 Pro 为例):
| 硬件平台 | 每兆瓦智能体数 | 相对水平 |
|---|---|---|
| NVIDIA GB300(机架级) | 约 61,354 | 断层领先 |
| NVIDIA B300(单节点) | 约 21,053 | 第二梯队 |
| AMD MI355X | 约 3,551 | 追赶中 |
| NVIDIA H200(上代) | 约 2,594 | 老将退场 |
注意最后两行:上一代的 Hopper(H200)和最新的 Blackwell Ultra 之间,差了将近 20 倍。这不是挤牙膏,这是为了喂饱"Agent 大军"而做的一次架构跃迁。
一把新尺子的诞生,从来都不只是测量工具的升级。你用什么单位度量世界,就说明你打算和什么样的世界打交道。
五、暗线:出口管制挡得住模型,挡不住开源
聊完明线,说一条这一周的暗线。它和前面的 G7 故事,是一枚硬币的两面。
美国在埃维昂喊"美国主导的联盟",对 Mythos 搞出口管制,本质上是想给前沿能力筑一道墙。但就在同一周,墙的另一边,中国的开源模型正在用一种让人没法忽视的速度逼近前沿。
这不是口号,是基准分。来看这一周被反复提及的几个名字:
最扎眼的是 DeepSeek V4 Pro。它是第一个在真实编程和推理基准上,真正逼近 Claude Opus 4.7 和 GPT-5.5 的开源权重模型——而每百万输出 token 的价格,大约是 GPT-5.5 的 三十四分之一。它还用了 MIT 许可证,价格直接砍了 75%。
这是什么概念?前沿能力你可以管制,但当一个开源模型只差几分、价格却便宜一个数量级,墙就开始漏风了。你管得住权重的出口,管不住权重的下载。
把明线和暗线叠在一起看,这一周的格局就清楚了:前沿在被监管收紧,能力却在被开源稀释。一边筑墙,一边漏风,AI 的权力地图正在这两股力量的拉扯中重新画线。
六、总结:三个预言,半年后回来对账
回到开头那张埃维昂的午餐桌。这一周散落各处的新闻,拼起来其实是一句话:Agent 正在从一个"能力形容词",变成一个被监管、被计价、被测量的"经济名词"。
三条线索,分别对应它"成精"的三个标志:
- 被监管:G7 把 AI 的网络攻击能力摆上台面,模型第一次进了出口管制清单。
- 被计价:Anthropic 给 Agent 单开了一个钱包,自动化工作流有了独立账单。
- 被测量:AA-AgentPerf 用"每兆瓦跑几个 Agent"立了一把新尺子。
- 暗线:中国开源模型逼近前沿,让"筑墙"这件事变得越来越难。
既然这一周的关键词是"名词化",那我就大胆做三个预言,给自己设个 deadline,2026 年底回来对账:
预言一:2026 年底前,会有至少两家主流厂商跟进 Anthropic,把 Agent 用量从交互额度里拆出来单独计费。"按 Agent 计费"会成为行业默认,就像今天的"按 token 计费"。
预言二:"每兆瓦多少 Agent"这类能效指标,会取代"每秒多少 token",成为数据中心和芯片厂商对外 PK 的头号话术。
预言三:出口管制挡不住扩散。年底前,至少会有一个开源模型在主流编程基准上正式追平某个闭源前沿模型——价格还便宜一个数量级。
我不一定全对。但我赌,半年后你再看这三件事,会发现它们都不是孤立的新闻,而是同一条主线上的三个刻度。
到时候,咱们回来对账。
参考资料
- AI in spotlight at G7 as Trump, world leaders joined by tech chiefs - CNBC
- CEOs of Anthropic and Google DeepMind call for U.S.-led AI coalition at G7 - CNBC
- AI chiefs call for regulation collaboration at the G7 summit - Fortune
- First results from AA-AgentPerf: the hardware benchmark for the agent era - Artificial Analysis
- NVIDIA Blackwell Leads on First Agentic AI Infrastructure Benchmark - NVIDIA Blog
- Best Chinese LLMs in 2026: DeepSeek V4, Kimi K2.6, GLM-5, Qwen Ranked - BenchLM.ai
- June 2026 AI Launch Wave: A Builder's Decision Map - WaveSpeed Blog
- LLM News Today (June 2026) – AI Model Releases - llm-stats.com