納德拉:應假定所有 AI 模型已被攻破,並裝上「緊急制動」

Published · AI Daily — AI-assisted deep research, methodology & disclosure

微軟 CEO 納德拉在 X 發布長文,稱不應再把 AI 當作「巢狀的黑箱」,主張預設模型已被攻破並從一開始就加以遏制,如同裝上緊急制動。他同時提出及時揭露事故、獨立稽核、可驗證資料,以及留下防竄改、人類可讀的證據。這一「假定失陷」思路將零信任理念引入模型治理,可能抬高企業採購智慧體的信任門檻,也帶來稽核權限、揭露標準與制動權歸屬等新問題。

10 月 10 日(UTC),微軟執行長薩提亞·納德拉在 X 平臺上發表了一篇長文,系統闡述他對高度先進 AI 模型所帶來危險的看法,以及應當如何應對。The Verge 週末編輯 Terrence O'Brien 對此做了報道,並把它歸入該媒體的「AI 超級智慧放緩」專題。納德拉的核心判斷很直接:我們不能再接受一個把 AI 當作「層層巢狀的黑箱」的世界。在那樣的世界裡,人類只能對模型給出的建議和採取的行動做二選一,要麼接受,要麼拒絕,卻無從知道這些輸出是如何產生的,也無從核查它是否被動過手腳。他主張建立一套更透明的體系,讓模型可以被遏制、被觀察,並且在執行之後留下「防篡改、人類可讀的證據」。 從報道轉述的內容看,納德拉列出的多數建議並不陌生:及時披露事故、引入獨立審計、保證資料可驗證,以及對模型實施遏制。前三項與近兩年業界、監管機構和學界反覆提出的主張基本一致,幾乎已成為行業共識的標準話術。真正值得停下來細讀的是最後一項。納德拉寫道,我們必須假定模型已經被攻破,並且從一開始就把它遏制起來,就像安裝一個緊急制動裝置。據 The Verge 的觀察,他在這一點上比業內部分同行走得更遠。換句話說,他不是在說「如果模型出了問題,我們要有預案」,而是在說「預設它已經出了問題,再來設計系統」。 這個轉變在安全工程裡有一個很熟悉的對應物,那就是網路安全中的「假定失陷」思路,即零信任架構的出發點:不再賭邊界是牢固的,而是預設攻擊者已經在內部,並據此限制每一個元件的許可權和影響範圍。把這套邏輯遷移到模型上,意味著設計重心從「證明模型是安全的」轉向「即使模型不安全也不會釀成大禍」。這並不是對技術悲觀,而是對現實誠實。「被攻破」可能指訓練資料被投毒、權重被竊取或被篡改、模型裡被植入後門、執行時遭遇提示注入,也可能指模型自身的目標與人類意圖出現偏差。無論是哪一種,外部觀察者都很難用有限的測試來證明一個龐大的模型是乾淨的。既然無法證明,就只能限制:最小許可權、沙箱隔離、可撤銷的操作、獨立的監控鏈路,以及一個隨時能按下去的停止鍵。

要讓這樣的緊急制動真正有效,有幾個工程條件幾乎是硬性的。第一,制動必須位於模型之外,許可權與模型相互獨立,模型既不能關閉它,也不能繞過它,否則它只是裝飾。第二,「防篡改」要落到具體機制上,例如對日誌做雜湊鏈、寫入獨立於被監控系統的儲存、對關鍵操作保留可複核的簽名,這樣事後追責才有依據。第三,「人類可讀」同樣重要:如果證據只有少數專家才能解讀,那麼審計和問責就會變成一種形式。納德拉強調的恰恰是後者,讓非模型內部人員也能讀懂模型做了什麼、為什麼這麼做。這些要求聽起來樸素,落實起來卻涉及延遲、成本、產品體驗與商業機密之間的艱難取捨。需要說明的是,我們目前掌握的材料只是長文的概要報道,微軟是否已有具體的技術方案,文中並未交代,不宜過度推斷。換言之,目前能確認的是原則和方向,而不是已經上線的產品或可檢驗的實現。

對行業而言,這番表態的分量來自說話者的位置。微軟是 OpenAI 的重要投資方與合作伙伴,透過 Azure 向企業分發多家廠商的模型,又在 Copilot 和各類智慧體產品上押下重注。當這樣一家公司的掌舵者公開說「應假定所有模型都已被攻破」,它既是在給自己設定一條標準,也是在向客戶、監管者和競爭對手發出訊號。一方面,這可能抬高企業採購智慧體的信任門檻,推動獨立審計、事故披露和可驗證資料變成合同條款,而不是公關口號。另一方面,它也帶來現實的張力:獨立審計需要接觸模型和資料,這會觸碰商業機密;事故披露缺少統一標準,何謂「及時」、何謂「重大」都需要界定;而緊急制動本身由誰掌握、在什麼條件下觸發,將成為新的治理難題。

接下來值得觀察的有三件事。其一,微軟會不會把「預設遏制」落到具體產品裡,比如智慧體的許可權分級、可審計的行動記錄和一鍵中止機制,而不止停留在一篇文章。其二,行業會不會圍繞事故披露和審計形成共同的格式與時限,讓不同廠商的報告能夠互相比較。其三,制動裝置會不會淪為形式:如果它只在事故之後才被啟用,或者控制權仍然掌握在被監控方手中,那麼它給人的安全感將大於它提供的安全。無論如何,納德拉把一個原本偏學術的假設,變成了一位大型平臺掌門人的公開立場。這件事本身就說明,AI 安全的討論正在從「模型會不會出事」轉向「出事時我們能不能停下來」。

Sources

FAQ

納德拉說「假定模型已被攻破」具體指什麼?

據 The Verge 報道,他主張必須假定模型已被攻破,並從一開始就加以遏制,如同安裝緊急制動。這是安全工程中「假定失陷」思路在模型上的應用:不賭模型一定可靠,而是限制它能做什麼、能造成多大影響。「被攻破」可能涵蓋資料投毒、權重被盜或篡改、後門、提示注入等情形,但原文概要並未逐一列出。

他提出了哪些具體措施?

報道提到的措施包括及時披露事故、引入獨立審計、保證資料可驗證,以及對模型實施遏制。他還要求系統留下「防篡改、人類可讀的證據」,讓人不再只能對模型的建議與行動做接受或拒絕的二選一。前幾項與業界其他人的主張相近,遏制這一項走得更遠。

「緊急制動」要真正有效需要什麼條件?

這是基於安全工程常識的分析,而非納德拉原文。制動裝置應位於模型之外,許可權獨立,模型無法關閉或繞過;證據日誌需用雜湊鏈等機制防篡改;記錄要讓非專家也能讀懂。此外還要事先規定由誰掌握制動、在什麼條件下觸發。目前沒有材料說明微軟已有具體的技術方案。