当文字安全但行动致命:揭示大模型隐藏状态中的物理风险信号与PRISM检测机制

随着大语言模型逐渐承担具身智能体的高级规划角色,语言上看似无害的指令在物理世界中执行时可能引发严重危险。最新研究深入探讨了这种基于物理环境的危险是否与常规文本内容风险同源。通过对Qwen2.5、Phi-3.5等主流模型的隐藏状态方向分析及零样本测试,研究证实内容风险与物理风险在模型内部表征中形成了可分离的信号。基于此,团队提出了PRISM,一种基于全隐藏状态的单层L2正则化逻辑探针。实验显示,PRISM在SafeAgentBench上达到了86.2%至87.7%的准确率,且误报率仅为11.7%至13.7%,显著优于同等规模的LLM评判器。此外,本文引入了包含1,000个物理风险对的PhysicalSafetyBench-1K基准测试,进一步验证了该方法能有效识别基于物理环境的危险而非仅依赖不安全词汇。

随着大型语言模型在具身智能领域的应用日益广泛,它们不再仅仅停留在文本交互层面,而是开始承担高级规划器的角色,指导实体机器人在物理世界中进行操作。这一转变带来了一个严峻的安全挑战:那些在纯文本语境下看似完全无害、甚至积极的指令,一旦转化为具体的物理动作,可能会引发严重的后果。例如,要求机器人"清理桌面"在文本上是安全的,但如果桌面下藏着易碎或危险的物品,这一动作可能导致灾难。本文的核心贡献在于揭示了这种"物理危险"与传统的"文本内容危险"在本质上的差异。作者通过深入分析发现,现有的安全对齐机制主要关注文本层面的违规内容,却忽视了动作落地后的物理后果。因此,研究的关键问题在于:模型内部是否编码了关于物理危险的信息?这种信息是否与文本内容安全信号相互独立?

通过系统性的研究,本文证明了在大型语言模型的隐藏状态空间中,内容危险信号和物理危险信号是可以被分离的,这为开发更精准、更少误报的物理安全检测机制奠定了理论基础。在技术方法层面,为了验证内容危险与物理危险的分离性,研究团队采用了隐藏状态方向分析技术,并结合了严格的随机分割零测试。他们选取了包括 Qwen2.5 系列(3B、7B、14B、32B 版本)、Phi-3.5 以及 SmolLM2 在内的多个主流开源模型作为实验对象。分析结果显示,无论模型规模大小,内容危险和物理危险在模型的表示空间中呈现出明显的可分离性。基于这一关键发现,作者提出了 PRISM 模型,这是一种轻量级的单层逻辑探针。PRISM 直接作用于模型的全隐藏状态,通过 L2 正则化进行训练,旨在从复杂的内部表示中提取出专门针对物理危险的信号。与传统的基于输出文本的安全评判器不同,PRISM 能够在模型生成具体动作指令之前,通过内部状态预判潜在风险。

这种设计不仅计算开销极低,而且能够避免传统方法因过度依赖关键词匹配而导致的误判问题,从而在保持高召回率的同时,显著降低对正常任务的误拦截率。在实验设置与关键结果方面,研究在 SafeAgentBench 和新增的 PhysicalSafetyBench-1K 两个基准上进行了全面评估。SafeAgentBench 用于测试模型在一般安全任务上的表现,结果显示 PRISM 达到了 86.2% 至 87.7% 的准确率,误报率控制在 11.7% 至 13.7% 之间。相比之下,同等规模的 LLM 评判器虽然能识别部分危险,但其误报率高达 24.7% 至 39.0%,这意味着大量安全的物理任务被错误地拒绝。为了进一步验证 PRISM 是否真正理解了物理危险而非仅仅识别不安全词汇,作者构建了 PhysicalSafetyBench-1K。该基准包含 1000 对经过精心设计的对比样本,这些样本涉及物理风险但完全不包含直接的危险关键词。在 PSB-1K 上,PRISM 的表现极为出色,准确率高达 99.6%,误报率仅为 0.7%。

而基于 Qwen2.5-3B 的评判器则拒绝了 67.8% 的安全任务,显示出其在处理隐含物理风险时的严重不足。此外,PRISM 在 SafeText 和 EARBench 等其他基准上也表现出了良好的泛化能力,证明了其作为表示层安全检测方法的通用性和有效性。这项研究对人工智能安全领域具有深远的行业意义。首先,它打破了将文本安全等同于物理安全的传统观念,指出了当前大模型安全对齐中的盲区。对于开源社区而言,PRISM 提供了一种轻量级、高效的安全检测工具,无需重新训练庞大的基础模型即可增强其安全性。对于工业落地而言,随着具身智能在家庭服务、工业制造等场景的普及,降低误报率至关重要,PRISM 的高精度和低误报特性使其成为理想的部署方案。此外,PhysicalSafetyBench-1K 的发布为后续研究提供了一个标准化的测试平台,有助于推动学术界更深入地探索模型内部的风险表示机制。未来,随着多模态大模型的发展,这种基于隐藏状态的风险探测方法有望扩展到视觉和触觉等多模态领域,为构建真正安全可靠的具身智能系统提供关键技术支持。

Sources