守护 AI 智能体的未来:当模型越来越强、却未必"对齐",我们如何守住内部系统
AI 智能体正在重塑我们与技术的关系。通过自主完成复杂任务——从网络防御到科学发现,再到产品研发——这些系统正在开启一个生产力的新纪元。仅在美国,到 2030 年 AI 智能体就可能创造 2.9 万亿美元的经济价值。
但随着这些智能体能力越来越强,它们也需要越来越精密的安全防护。正因如此,我们制定了 AI 控制路线图(AI Control Roadmap):一套用于构建和管理我们在 Google 内部部署的高级 AI 的框架。这种"纵深防御"(defense-in-depth)的思路或许能成为整个行业的范本——它超越了传统的模型对齐,额外增加了一层系统级安全保障,从而即便对齐做得并不完美,我们依然有把握守住底线。
理解"AI 控制"
我们的安全之道,始于一个坚实的地基:先把沙箱隔离(sandboxing)、终端安全(endpoint security)、抗提示注入(prompt injection resistance)等传统防护手段纳入进来。在此之上,AI 控制路线图把模型对齐——也就是训练 AI 让它本质上既安全又有用——作为首要防线。而它真正额外提供的那层安全,在于把内部智能体当作"可能未对齐"来对待:哪怕对齐并不完美,也依然能给我们兜底的保障。
可以把它想象成一位配备了"副驾驶刹车"的驾校教练。教练信任学员,但随时准备在学员犯错时接过方向盘、踩下刹车。同样地,我们的 AI 控制系统会根据智能体"已被验证的行为"来授予它权限——通过受控的、循序渐进的访问,逐步建立起信任。
我们的路线图建立在一个简单却审慎的假设之上:万一一个能力极强的 AI 智能体并不认同我们的目标、并以出人意料的方式行事,怎么办?为应对这一点,我们的方案聚焦于三个关键方向。
第一,借鉴网络安全领域的最佳实践,我们为 AI 开发了一套全新的威胁建模框架。路线图把不可信的 AI 智能体当作潜在的"内部威胁"(insider threat)来对待——这就好比一家公司会防范一个已经拿到办公室门禁、却可能心怀不轨的"内鬼"员工。我们以业界标准 MITRE ATT&CK 框架为基础(这是一个全球通用的、基于真实世界观测的对手战术与技术知识库),把潜在攻击拆解成一个个更细的战术与技术。如此一来,我们就能有条不紊地追踪风险、在危害发生之前识别出不良行为,并安全地进行"演练",检验我们的防御到底扛不扛得住。
第二,我们制定了一套部署 AI 控制缓解措施的方案,用以应对这些风险。
- 发现问题(检测):监控是 AI 控制的中枢。我们用另一套可信的 AI 系统充当"监督员",持续审查正在工作的智能体的推理、动作与计划,看它是否跑偏。
- 处置问题(预防与响应):一旦监督员发现智能体试图做出有害举动,它可以在危害发生之前介入、拦下这一动作。
最后,为了确保整套系统真正有效运转,我们围绕三项关键指标持续衡量其表现:覆盖率(coverage,被监控流量所占的比例)、召回率(recall,被成功捕获的未对齐行为所占的比例)以及响应时延(time-to-response)。
AI 越聪明,安全就得越硬
随着 AI 模型不断演进,我们的防御也必须同步增强。在 AI 控制路线图中,我们把安全协议与 AI 能力上可量化的里程碑一一对应起来,重点关注两条关键战线:
- 规避检测的能力:今天,我们监控的是模型"可见的"思维链(chain-of-thought)。但随着模型学会隐藏自己的推理过程——要么是因为它意识到自己正被监督(oversight awareness),要么是因为它能进行不借助可见文本的"不透明推理"(opaque reasoning)——仅仅去读它用语言表达出来的推理就不够了。届时,我们将需要分析它的行为,甚至有可能要去检查模型的内部运作机制。
- 造成潜在危害的能力:对于低风险、可逆的动作,我们可以依靠"延迟审查执行记录、事后快速补救"的方式来处理(异步响应)。而对于风险特别高的动作——例如大规模网络攻击——我们就必须切换到实时预防,在有害动作被执行之前就将其拦截(同步响应)。换句话说,我们的响应策略,必须随着威胁的严重程度而升级。
分析一百万条智能体轨迹,为实时监控提供依据
要构建这些系统,我们需要数据。我们的团队搭建了一套内部原型——一个异步监控系统,它会审查编码智能体的执行轨迹,并把需要关注的发现上报给人工复核。每一个被标记的事件,都会对照我们路线图中的威胁分类法进行归类。
我们已经分析了一百万项编码智能体任务,由此获得了宝贵的洞见,用来不断打磨我们的安全协议,也让我们得以超越简单的关键词过滤,转而去识别那些"高信号"的行为模式。举例来说,这项研究对于我们为 Gemini Spark 智能体构建实时监控器起到了关键作用——它让我们能够实时响应新出现的问题,比如无意中的数据删除。
有一点必须指出:我们的数据显示,绝大多数被标记的事件并非源于恶意;相反,它们往往是智能体的理解偏差,或是为达成用户目标而表现得过于积极所致。理解这些细微差别,对于打磨我们的安全与防护协议至关重要。
守护智能体生态,是全行业的共同责任
AI 控制路线图,只是我们多层次智能体安全方法中至关重要的一环。通过把这些协议与我们更广泛的基础设施整合在一起,我们正在把内部安全能力扩展到足以安全地管理我们最先进的 AI 模型。
此外,这种多层次的智能体安全方法,理应成为产业界、政策制定者与学术界共同的优先事项。只有让整个生态系统围绕最佳实践与标准对齐,我们才能赋能网络防御者、增强整个社会的韧性。正因如此,我们在今天同步发布了一份面向政策制定者的技术框架——《智能体安全的三个层次》(Three Layers of Agent Security)。这份文件详细阐述了我们需要如何在三个层面提升安全:单个智能体层面、多智能体系统层面,以及赋能网络防御者、在更广阔的生态中构建韧性这一层面。
我们打算在这些框架的基础上继续前行——在为未来打造安全地基的同时,让我们今天就能放心地部署有能力的 AI。
阅读完整技术报告:AI 控制路线图(AI Control Roadmap)
研究作者
Mary Phuong、Erik Jenner、Laurent Simon、Lewis Ho、Rohin Shah、Sebastian Farquhar、Scott Coull。
致谢
Four Flynn、Anca Dragan、Alan Cooney、Bilal Chughtai、Buck Shlegeris、Cody Wild、David Lindner、Julian Stastny、Kevin Klyman、Li Ding、Myriam Khan、Raluca Ada Popa、Roland Zimmermann、Ryan Greenblatt、Senthooran Rajamanoharan、Victoria Krakovna、Xerxes Dotiwalla。