TECH ARTICLES
译文 Agent AI 安全

守护 AI 智能体的未来:当模型越来越强、却未必"对齐",我们如何守住内部系统

译者:Jackie Zhan 2026-06-28
原文出处
原标题Securing the future of AI agents
作者Rohin Shah、Four Flynn
来源Google DeepMind Blog(Responsibility & Safety)
发布日期2026 年 6 月 18 日
译者按
当 AI 智能体开始自己写代码、自己删数据、自己执行多步任务,"模型对齐"这一道防线就不再够用了——因为你无法保证训练出来的智能体百分之百听话。这篇来自 Google DeepMind 的文章提出了一套"纵深防御"思路:即便假设内部智能体可能"不对齐",也要在系统层面把风险兜住。文中最有意思的,是他们已经分析了一百万条编码智能体的执行轨迹,并由此得出一个反直觉的结论——绝大多数被标记的危险行为,根源并非恶意,而是智能体"理解偏差"或"过度积极"。对所有正在把 Agent 推向生产环境的团队,这都是一份难得的实战参考。

AI 智能体正在重塑我们与技术的关系。通过自主完成复杂任务——从网络防御到科学发现,再到产品研发——这些系统正在开启一个生产力的新纪元。仅在美国,到 2030 年 AI 智能体就可能创造 2.9 万亿美元的经济价值。

但随着这些智能体能力越来越强,它们也需要越来越精密的安全防护。正因如此,我们制定了 AI 控制路线图(AI Control Roadmap):一套用于构建和管理我们在 Google 内部部署的高级 AI 的框架。这种"纵深防御"(defense-in-depth)的思路或许能成为整个行业的范本——它超越了传统的模型对齐,额外增加了一层系统级安全保障,从而即便对齐做得并不完美,我们依然有把握守住底线。

理解"AI 控制"

我们的安全之道,始于一个坚实的地基:先把沙箱隔离(sandboxing)、终端安全(endpoint security)、抗提示注入(prompt injection resistance)等传统防护手段纳入进来。在此之上,AI 控制路线图把模型对齐——也就是训练 AI 让它本质上既安全又有用——作为首要防线。而它真正额外提供的那层安全,在于把内部智能体当作"可能未对齐"来对待:哪怕对齐并不完美,也依然能给我们兜底的保障。

可以把它想象成一位配备了"副驾驶刹车"的驾校教练。教练信任学员,但随时准备在学员犯错时接过方向盘、踩下刹车。同样地,我们的 AI 控制系统会根据智能体"已被验证的行为"来授予它权限——通过受控的、循序渐进的访问,逐步建立起信任。

我们的路线图建立在一个简单却审慎的假设之上:万一一个能力极强的 AI 智能体并不认同我们的目标、并以出人意料的方式行事,怎么办?为应对这一点,我们的方案聚焦于三个关键方向。

第一,借鉴网络安全领域的最佳实践,我们为 AI 开发了一套全新的威胁建模框架。路线图把不可信的 AI 智能体当作潜在的"内部威胁"(insider threat)来对待——这就好比一家公司会防范一个已经拿到办公室门禁、却可能心怀不轨的"内鬼"员工。我们以业界标准 MITRE ATT&CK 框架为基础(这是一个全球通用的、基于真实世界观测的对手战术与技术知识库),把潜在攻击拆解成一个个更细的战术与技术。如此一来,我们就能有条不紊地追踪风险、在危害发生之前识别出不良行为,并安全地进行"演练",检验我们的防御到底扛不扛得住。

第二,我们制定了一套部署 AI 控制缓解措施的方案,用以应对这些风险。

最后,为了确保整套系统真正有效运转,我们围绕三项关键指标持续衡量其表现:覆盖率(coverage,被监控流量所占的比例)、召回率(recall,被成功捕获的未对齐行为所占的比例)以及响应时延(time-to-response)。

AI 越聪明,安全就得越硬

随着 AI 模型不断演进,我们的防御也必须同步增强。在 AI 控制路线图中,我们把安全协议与 AI 能力上可量化的里程碑一一对应起来,重点关注两条关键战线:

AI 控制路线图:按模型能力分级的安全措施示意图
AI 控制路线图会根据所部署模型的能力推荐相应的安全措施。模型的"规避检测能力"决定了检测等级(D1–D4),模型的"攻击执行能力"则决定了预防与响应等级(R1–R3)。

分析一百万条智能体轨迹,为实时监控提供依据

要构建这些系统,我们需要数据。我们的团队搭建了一套内部原型——一个异步监控系统,它会审查编码智能体的执行轨迹,并把需要关注的发现上报给人工复核。每一个被标记的事件,都会对照我们路线图中的威胁分类法进行归类。

我们已经分析了一百万项编码智能体任务,由此获得了宝贵的洞见,用来不断打磨我们的安全协议,也让我们得以超越简单的关键词过滤,转而去识别那些"高信号"的行为模式。举例来说,这项研究对于我们为 Gemini Spark 智能体构建实时监控器起到了关键作用——它让我们能够实时响应新出现的问题,比如无意中的数据删除。

有一点必须指出:我们的数据显示,绝大多数被标记的事件并非源于恶意;相反,它们往往是智能体的理解偏差,或是为达成用户目标而表现得过于积极所致。理解这些细微差别,对于打磨我们的安全与防护协议至关重要。

守护智能体生态,是全行业的共同责任

AI 控制路线图,只是我们多层次智能体安全方法中至关重要的一环。通过把这些协议与我们更广泛的基础设施整合在一起,我们正在把内部安全能力扩展到足以安全地管理我们最先进的 AI 模型。

此外,这种多层次的智能体安全方法,理应成为产业界、政策制定者与学术界共同的优先事项。只有让整个生态系统围绕最佳实践与标准对齐,我们才能赋能网络防御者、增强整个社会的韧性。正因如此,我们在今天同步发布了一份面向政策制定者的技术框架——《智能体安全的三个层次》(Three Layers of Agent Security)。这份文件详细阐述了我们需要如何在三个层面提升安全:单个智能体层面、多智能体系统层面,以及赋能网络防御者、在更广阔的生态中构建韧性这一层面。

我们打算在这些框架的基础上继续前行——在为未来打造安全地基的同时,让我们今天就能放心地部署有能力的 AI。

阅读完整技术报告:AI 控制路线图(AI Control Roadmap)


研究作者

Mary Phuong、Erik Jenner、Laurent Simon、Lewis Ho、Rohin Shah、Sebastian Farquhar、Scott Coull。

致谢

Four Flynn、Anca Dragan、Alan Cooney、Bilal Chughtai、Buck Shlegeris、Cody Wild、David Lindner、Julian Stastny、Kevin Klyman、Li Ding、Myriam Khan、Raluca Ada Popa、Roland Zimmermann、Ryan Greenblatt、Senthooran Rajamanoharan、Victoria Krakovna、Xerxes Dotiwalla。