TECH ARTICLES
AI 周报 Agent AI 治理

AI 一周观察(6.13–6.19):这一周,"Agent" 从形容词变成了名词

Jackie Zhan 2026-06-19
目录
一、一个判断:Agent 正在"名词化" 二、谈判桌:AI 第一次坐进了 G7 的午餐会 三、计费单位:Anthropic 给 Agent 单开了一个账户 四、度量衡:硬件开始按"每兆瓦跑几个 Agent"打分 五、暗线:出口管制挡得住模型,挡不住开源 六、总结:三个预言,半年后回来对账

2026 年 6 月 17 日,法国小镇埃维昂(Évian),日内瓦湖边。

这里在开 G7 峰会。按惯例,午餐会的桌子是留给国家元首的。但这一天,桌边坐着几张不太一样的脸:Anthropic 的 Dario Amodei、Google DeepMind 的 Demis Hassabis、还有 OpenAI 的人。

科技公司的 CEO,第一次以"被各国领导人请来商量事"的姿态,坐进了 G7 的核心议程。CNBC 那篇报道的标题很直白——"A signal of where power sits"(这是一个关于权力坐在哪里的信号)

你可能觉得,这不就是又一场科技大佬的合影外交吗?

不。如果你把这一周散落在各处的新闻拼起来——埃维昂的午餐会、Anthropic 在 6 月 15 日悄悄改的一行计费规则、一家测评机构发布的新基准——你会发现它们指向同一件事。

这一周,"Agent"这个词,完成了一次词性转换:它从一个形容词(agentic AI、智能体能力),变成了一个名词(一个被计价、被测量、被监管的实体)。这才是过去七天真正发生的事。


一、一个判断:Agent 正在"名词化"

先说我的核心判断,剩下的内容都是为它做注脚。

过去一年,我们聊 Agent,聊的都是"能力":它能不能自己调用工具?能不能跑几百轮不跑偏?能不能改完代码自己跑测试?这些都是形容词式的讨论——智能体"有多智能"。

但这一周,讨论的层次变了。三件看似无关的事,同时把 Agent 当成了一个独立的对象来处理:

监管、计费、度量——这是任何一个东西从"技术概念"变成"经济实体"的三个标志。货币是这样,电力是这样,现在轮到 Agent 了。

Agent 从形容词 → 名词 被监管 G7 · 国家安全议题 被计价 Agent SDK 独立额度 被测量 每兆瓦跑几个 Agent
一个技术概念"成精"的三个标志:被监管、被计价、被测量

所以这一周不该用"哪个模型又刷新了榜单"来总结。该这么总结:智能体经济,开始有了它的法律、它的账单和它的尺子。

我们一条一条看。先去埃维昂的那张午餐桌。

二、谈判桌:AI 第一次坐进了 G7 的午餐会

为什么是今年?为什么 AI 突然就成了 G7 桌上的主菜,而不是甜点?

答案藏在一个词里:网络攻击能力(cyber capabilities)

过去半年,前沿模型的进化方向悄悄拐了个弯。Anthropic 的 Mythos、OpenAI 的 GPT-5.5 Cyber,这一批模型最让政府睡不着觉的,不是它们会写诗,而是它们会找漏洞——而且找得太好了。

还记得 Mythos 那个数字吗?在一个叫 Glasswing 的封闭项目里,它在 1000 多个开源项目里挖出了 23,019 个漏洞。这个能力用来做防御,是神器;用来做攻击,就是网络武器。

insider 视角
这就是为什么美国对 Anthropic 的 Fable 5 和 Mythos 5 动用了出口管制——这是历史上第一次,一个 AI 模型被当成"军民两用品"来管制。监管者第一次承认:他们要管的不是模型输出的文字,而是这个"数字特工"能对真实世界做什么。形容词变名词的第一个证据,就是它进了出口管制清单。

于是在埃维昂,几位 AI 巨头的掌门人没有去争"谁的模型更强",而是异口同声地喊了一句话:别分裂(resist the temptation to splinter)。

Amodei 警告各国元首,不要在 AI 监管上各搞一套;Hassabis 和他一起,呼吁组建一个"美国主导的 AI 联盟"。印度总理莫迪则在另一头喊话:所有民主国家都应该能用上前沿模型,否则没法防御网络威胁,并提议建立共同标准和"监管沙盒"。

当一项技术的掌门人开始主动请求被监管,通常只有两种可能:要么它真的危险到了连造它的人都怕;要么他们想用监管这堵墙,把后来者挡在门外。
—— 这一周最值得琢磨的潜台词

我倾向于认为,两者都对。Mythos 的能力是真的吓人,但"美国主导的联盟"这五个字,也实实在在地把中国实验室、把开源模型,划到了墙的另一边。

谈判桌上聊的是安全,桌子底下踢的是格局。这是 Agent 名词化的第一层:它成了地缘政治的筹码。

三、计费单位:Anthropic 给 Agent 单开了一个账户

从日内瓦湖边回到你的终端。这一周还有一件事,几乎没人发新闻稿,但每个用 Claude 写代码的人都会被它改变。

6 月 15 日起,Anthropic 调整了订阅计划的计费方式:Agent SDK 的用量、以及非交互式的 claude -p 跑批,不再从你日常聊天的额度里扣,而是从一笔单独的"Agent SDK 月度额度"里扣。

Pro 计划 20 美元,Max 5x 是 100 美元,Max 20x 是 200 美元——这是专门划给"机器自己干活"的钱。

这一行规则改动,信息量比它看起来大得多。

6/15 之前 一个钱包 人聊天 + 机器跑批 混在一起扣额度 (谁先跑光算谁的) 拆分 6/15 之后 交互额度 你和 Claude 聊天 Agent 额度 机器自主跑批
Anthropic 把"人用"和"Agent 用"拆成了两个钱包

打个比方。以前你家只有一个电表,人用电、空调用电、电动车充电,全走一个表。现在电力公司过来说:电动车充电,我们给你单独装一个表。

为什么要单独装表?因为电动车的耗电模式跟你开灯做饭完全不是一回事——它是大功率、长时间、可调度的。你只有给它单独计量,才能单独定价、单独优化、单独限流。

Anthropic 给 Agent 单开账户,是同一个逻辑。一个 Agent 任务动辄跑几百轮、烧掉几十万 token,它的消耗曲线和"人和 AI 一问一答"根本不在一个量级。把它们混在一个额度里,要么人被机器挤爆,要么没法给企业级的自动化工作流定价。

数据说话
这背后是真金白银的增长。Anthropic 的 CEO 透露,到 2026 年 Q1 末,Claude 的年化收入跑到了 300 亿美元的运行率——而年初这个数字还只有约 90 亿。单季度 80 倍的年化增速,靠的不是更多人来聊天,而是越来越多的 Agent 在后台 7×24 小时地干活。给 Agent 单开账户,是在给这台印钞机装上独立的计量表。

所以别小看这一行计费改动。当一个东西开始拥有独立的账单,它就从"功能"变成了"商品"。这是 Agent 名词化的第二层。

四、度量衡:硬件开始按"每兆瓦跑几个 Agent"打分

有了法律,有了账单,还差一样东西,Agent 才算真正"成精":一把尺子。

这一周,这把尺子也来了。测评机构 Artificial Analysis 发布了 AA-AgentPerf,自称是第一个为"智能体时代"设计的硬件基准。

它有意思在哪?过去我们衡量 AI 硬件,用的是"每秒能吐多少 token"。这套尺子,是为"人和模型一问一答"设计的——你问一句,它答一段,比谁吐字快。

但 Agent 不这么干活。一个编程 Agent 会连续跑几百轮,一会儿推理、一会儿调工具、一会儿改代码,上下文动不动就超过 10 万 token。AA-AgentPerf 干脆把真实的编程 Agent 轨迹录下来重放,然后问一个全新的问题:

在保证服务质量的前提下,一台机器最多能同时伺候多少个 Agent?

它的核心指标,叫 Agents per Megawatt(每兆瓦智能体数)——每一兆瓦电,能养活多少个并发的 Agent。

关键区别
尺子换了,意味着游戏规则换了。"每秒多少 token"比的是速度;"每兆瓦多少 Agent"比的是吞吐与能效。前者关心你等得烦不烦,后者关心数据中心一个月电费多少、能并行养活多大规模的智能体集群。当度量单位从"字"变成"个体",说明大家默认:未来跑在机器上的,是一群一群的 Agent,不是一句一句的对话。

首批结果也很说明问题(以最宽松的服务等级、跑 DeepSeek V4 Pro 为例):

硬件平台每兆瓦智能体数相对水平
NVIDIA GB300(机架级)约 61,354断层领先
NVIDIA B300(单节点)约 21,053第二梯队
AMD MI355X约 3,551追赶中
NVIDIA H200(上代)约 2,594老将退场

注意最后两行:上一代的 Hopper(H200)和最新的 Blackwell Ultra 之间,差了将近 20 倍。这不是挤牙膏,这是为了喂饱"Agent 大军"而做的一次架构跃迁。

一把新尺子的诞生,从来都不只是测量工具的升级。你用什么单位度量世界,就说明你打算和什么样的世界打交道。

五、暗线:出口管制挡得住模型,挡不住开源

聊完明线,说一条这一周的暗线。它和前面的 G7 故事,是一枚硬币的两面。

美国在埃维昂喊"美国主导的联盟",对 Mythos 搞出口管制,本质上是想给前沿能力筑一道墙。但就在同一周,墙的另一边,中国的开源模型正在用一种让人没法忽视的速度逼近前沿。

这不是口号,是基准分。来看这一周被反复提及的几个名字:

闭源前沿(贵) GPT-5.5 Claude Opus 4.8 Gemini 3.1 Pro 差几分 · 价格 1/34 开源逼近 中国开源(便宜) DeepSeek V4 Pro Qwen 3.7 Max GLM-5.1 / Kimi K2.6
2026 年的开源故事,几乎是一个"中国实验室"的故事

最扎眼的是 DeepSeek V4 Pro。它是第一个在真实编程和推理基准上,真正逼近 Claude Opus 4.7 和 GPT-5.5 的开源权重模型——而每百万输出 token 的价格,大约是 GPT-5.5 的 三十四分之一。它还用了 MIT 许可证,价格直接砍了 75%。

这是什么概念?前沿能力你可以管制,但当一个开源模型只差几分、价格却便宜一个数量级,墙就开始漏风了。你管得住权重的出口,管不住权重的下载。

延伸思考
这里有一个微妙的张力:G7 想用"安全"的名义收紧前沿模型的流通,而开源恰恰用"便宜且够用"消解了这种稀缺性。莫迪在 G7 上喊"所有民主国家都该用上前沿模型",潜台词其实是——如果你们不给,市场上有的是替代品。出口管制能延缓领先,但延缓不了扩散。这是这一周最值得长期跟踪的一条暗线。

把明线和暗线叠在一起看,这一周的格局就清楚了:前沿在被监管收紧,能力却在被开源稀释。一边筑墙,一边漏风,AI 的权力地图正在这两股力量的拉扯中重新画线。

六、总结:三个预言,半年后回来对账

回到开头那张埃维昂的午餐桌。这一周散落各处的新闻,拼起来其实是一句话:Agent 正在从一个"能力形容词",变成一个被监管、被计价、被测量的"经济名词"。

三条线索,分别对应它"成精"的三个标志:

既然这一周的关键词是"名词化",那我就大胆做三个预言,给自己设个 deadline,2026 年底回来对账

预言一:2026 年底前,会有至少两家主流厂商跟进 Anthropic,把 Agent 用量从交互额度里拆出来单独计费。"按 Agent 计费"会成为行业默认,就像今天的"按 token 计费"。

预言二:"每兆瓦多少 Agent"这类能效指标,会取代"每秒多少 token",成为数据中心和芯片厂商对外 PK 的头号话术。

预言三:出口管制挡不住扩散。年底前,至少会有一个开源模型在主流编程基准上正式追平某个闭源前沿模型——价格还便宜一个数量级。

我不一定全对。但我赌,半年后你再看这三件事,会发现它们都不是孤立的新闻,而是同一条主线上的三个刻度。

到时候,咱们回来对账。