纳德拉:应假定所有 AI 模型已被攻破,并装上「紧急制动」
微软 CEO 纳德拉在 X 发布长文,称不应再把 AI 当作「嵌套的黑箱」,主张默认模型已被攻破并从一开始就加以遏制,如同装上紧急制动。他同时提出及时披露事故、独立审计、可验证数据,以及留下防篡改、人类可读的证据。这一「假定失陷」思路将零信任理念引入模型治理,可能抬高企业采购智能体的信任门槛,也带来审计权限、披露标准与制动权归属等新问题。
10 月 10 日(UTC),微软首席执行官萨提亚·纳德拉在 X 平台上发表了一篇长文,系统阐述他对高度先进 AI 模型所带来危险的看法,以及应当如何应对。The Verge 周末编辑 Terrence O'Brien 对此做了报道,并把它归入该媒体的「AI 超级智能放缓」专题。纳德拉的核心判断很直接:我们不能再接受一个把 AI 当作「层层嵌套的黑箱」的世界。在那样的世界里,人类只能对模型给出的建议和采取的行动做二选一,要么接受,要么拒绝,却无从知道这些输出是如何产生的,也无从核查它是否被动过手脚。他主张建立一套更透明的体系,让模型可以被遏制、被观察,并且在运行之后留下「防篡改、人类可读的证据」。 从报道转述的内容看,纳德拉列出的多数建议并不陌生:及时披露事故、引入独立审计、保证数据可验证,以及对模型实施遏制。前三项与近两年业界、监管机构和学界反复提出的主张基本一致,几乎已成为行业共识的标准话术。真正值得停下来细读的是最后一项。纳德拉写道,我们必须假定模型已经被攻破,并且从一开始就把它遏制起来,就像安装一个紧急制动装置。据 The Verge 的观察,他在这一点上比业内部分同行走得更远。换句话说,他不是在说「如果模型出了问题,我们要有预案」,而是在说「默认它已经出了问题,再来设计系统」。 这个转变在安全工程里有一个很熟悉的对应物,那就是网络安全中的「假定失陷」思路,即零信任架构的出发点:不再赌边界是牢固的,而是默认攻击者已经在内部,并据此限制每一个组件的权限和影响范围。把这套逻辑迁移到模型上,意味着设计重心从「证明模型是安全的」转向「即使模型不安全也不会酿成大祸」。这并不是对技术悲观,而是对现实诚实。「被攻破」可能指训练数据被投毒、权重被窃取或被篡改、模型里被植入后门、运行时遭遇提示注入,也可能指模型自身的目标与人类意图出现偏差。无论是哪一种,外部观察者都很难用有限的测试来证明一个庞大的模型是干净的。既然无法证明,就只能限制:最小权限、沙箱隔离、可撤销的操作、独立的监控链路,以及一个随时能按下去的停止键。
要让这样的紧急制动真正有效,有几个工程条件几乎是硬性的。第一,制动必须位于模型之外,权限与模型相互独立,模型既不能关闭它,也不能绕过它,否则它只是装饰。第二,「防篡改」要落到具体机制上,例如对日志做哈希链、写入独立于被监控系统的存储、对关键操作保留可复核的签名,这样事后追责才有依据。第三,「人类可读」同样重要:如果证据只有少数专家才能解读,那么审计和问责就会变成一种形式。纳德拉强调的恰恰是后者,让非模型内部人员也能读懂模型做了什么、为什么这么做。这些要求听起来朴素,落实起来却涉及延迟、成本、产品体验与商业机密之间的艰难取舍。需要说明的是,我们目前掌握的材料只是长文的概要报道,微软是否已有具体的技术方案,文中并未交代,不宜过度推断。换言之,目前能确认的是原则和方向,而不是已经上线的产品或可检验的实现。
对行业而言,这番表态的分量来自说话者的位置。微软是 OpenAI 的重要投资方与合作伙伴,通过 Azure 向企业分发多家厂商的模型,又在 Copilot 和各类智能体产品上押下重注。当这样一家公司的掌舵者公开说「应假定所有模型都已被攻破」,它既是在给自己设定一条标准,也是在向客户、监管者和竞争对手发出信号。一方面,这可能抬高企业采购智能体的信任门槛,推动独立审计、事故披露和可验证数据变成合同条款,而不是公关口号。另一方面,它也带来现实的张力:独立审计需要接触模型和数据,这会触碰商业机密;事故披露缺少统一标准,何谓「及时」、何谓「重大」都需要界定;而紧急制动本身由谁掌握、在什么条件下触发,将成为新的治理难题。
接下来值得观察的有三件事。其一,微软会不会把「默认遏制」落到具体产品里,比如智能体的权限分级、可审计的行动记录和一键中止机制,而不止停留在一篇文章。其二,行业会不会围绕事故披露和审计形成共同的格式与时限,让不同厂商的报告能够互相比较。其三,制动装置会不会沦为形式:如果它只在事故之后才被启用,或者控制权仍然掌握在被监控方手中,那么它给人的安全感将大于它提供的安全。无论如何,纳德拉把一个原本偏学术的假设,变成了一位大型平台掌门人的公开立场。这件事本身就说明,AI 安全的讨论正在从「模型会不会出事」转向「出事时我们能不能停下来」。
Sources
FAQ
纳德拉说「假定模型已被攻破」具体指什么?
据 The Verge 报道,他主张必须假定模型已被攻破,并从一开始就加以遏制,如同安装紧急制动。这是安全工程中「假定失陷」思路在模型上的应用:不赌模型一定可靠,而是限制它能做什么、能造成多大影响。「被攻破」可能涵盖数据投毒、权重被盗或篡改、后门、提示注入等情形,但原文概要并未逐一列出。
他提出了哪些具体措施?
报道提到的措施包括及时披露事故、引入独立审计、保证数据可验证,以及对模型实施遏制。他还要求系统留下「防篡改、人类可读的证据」,让人不再只能对模型的建议与行动做接受或拒绝的二选一。前几项与业界其他人的主张相近,遏制这一项走得更远。
「紧急制动」要真正有效需要什么条件?
这是基于安全工程常识的分析,而非纳德拉原文。制动装置应位于模型之外,权限独立,模型无法关闭或绕过;证据日志需用哈希链等机制防篡改;记录要让非专家也能读懂。此外还要事先规定由谁掌握制动、在什么条件下触发。目前没有材料说明微软已有具体的技术方案。