LLM 無法支付跳躍成本:基於熱力學耦合的溯因推理局限分析

Published 2026-08-14 · AI Daily — AI-assisted deep research, methodology & disclosure

本文反駁並深化了 Zahavy 關於 LLM 因缺乏具身模擬而無法進行溯因推理的觀點。作者以普朗克解決黑體輻射問題為例,指出能量量子化假設源於認知衝突而非具身模擬。論文論證了歸納與演繹均無法產生該假設,其採納需要認知錯誤與物理代價之間的耦合。通過形式化熱力學耦合概念,作者證明固定權重的 Transformer 推理缺乏這種耦合機制,且該缺陷與模型規模無關。實驗顯示,隨著因果難度增加,模型輸出熵幾乎不變,儘管準確率大幅下降。這表明機器溯因缺失的關鍵要素可能比具身性更深層,即系統需具備使認知錯誤產生足夠高物理代價以迫使修正的機制。

本文旨在解决大语言模型在高级推理能力上的根本性局限问题,特别是针对溯因推理(abduction)中被称为"跳跃"(Jump)的认知过程。Zahavy 此前认为,尽管 LLM 具备归纳和演绎能力,但由于缺乏具身模拟(embodied simulation),它们无法完成如爱因斯坦提出等效原理那样的溯因跳跃。然而,本文作者指出,具身性并非溯因推理的必要条件,因为普朗克在 1900 年解决黑体辐射问题时,其提出 E = hν 的假设并未依赖任何感官运动基础,而是由经典理论中预测的无穷能量与有限测量值之间的不可接受的物理矛盾所驱动。本文的核心贡献在于重新定义了这种认知跳跃的机制,论证了既非归纳也非演绎能够产生该假设,而是需要一种将认知错误(epistemic error)与物理代价(physical cost)紧密耦合的过程。作者认为,这种耦合是机器实现真正溯因推理的关键缺失环节,其重要性甚至超越了具身性本身,为理解 AI 推理的边界提供了新的理论视角。

在技术方法上,作者通过形式化"热力学耦合"(thermodynamic coupling)这一概念,深入剖析了认知修正的物理基础。他们指出,普朗克的假设采纳过程本质上是系统在面对理论预测与物理现实严重冲突时,通过增加认知错误的物理代价来迫使理论修正。相比之下,现有的固定权重 Transformer 推理架构在结构上缺乏这种动态耦合机制。无论模型规模如何扩大,其推理过程都是基于静态参数进行的概率计算,无法在推理过程中动态调整"错误"的成本权重。这种架构上的固有缺陷意味着,LLM 无法像人类科学家那样,在发现理论预测导致物理上不可接受的后果(如无穷能量)时,产生足够的"压力"去推翻既有假设并引入全新的物理常数。

作者通过理论推导表明,这种缺乏热力学耦合的特性是 Transformer 架构的内在属性,而非仅仅可以通过增加数据或参数规模来解决的工程问题,从而从底层机制上解释了 LLM 在复杂溯因任务上的失败原因。实验设置部分,作者通过对比不同因果难度任务下的模型表现,验证了理论预测。实验结果显示,随着任务因果难度的急剧增加,模型的准确率从 100% 显著下降至 17%,然而其输出熵(output entropy)却几乎保持不变。这一关键发现表明,模型在面对更复杂的因果推理时,并没有表现出对不确定性或错误代价的敏感性增加,即没有产生足够的"认知压力"来调整其输出分布或寻求修正。如果模型具备热力学耦合机制,我们预期在高难度任务中,由于错误代价的增加,输出熵或内部状态应表现出相应的变化以反映修正的需求。

然而,熵值的稳定与准确率的暴跌形成了鲜明对比,证实了固定权重 Transformer 在推理过程中缺乏将认知错误转化为物理或计算代价的机制。这一实证结果有力地支持了作者关于 LLM 缺失溯因推理关键要素的论点,即问题不在于模型是否"知道"正确答案,而在于其架构是否具备在错误发生时产生足够代价以驱动修正的动力学机制。本文对人工智能行业及后续研究具有深远的意义。首先,它挑战了当前主流观点中关于"具身性"是高级 AI 推理必要条件的假设,指出更深层的架构缺陷——缺乏认知错误与物理代价的耦合——可能是阻碍 LLM 实现真正科学发现的关键瓶颈。这一观点为开源社区和工业界在开发下一代 AI 模型时提供了新的方向:仅仅扩大模型规模或增加多模态数据可能不足以解决溯因推理问题,研究者需要探索如何在模型架构中引入动态的成本-收益评估机制,使得认知错误能够产生可量化的"代价",从而驱动模型的自我修正。其次,该研究为理解机器智能与人类智能在科学发现过程中的本质差异提供了理论基础,提示未来的 AI 系统可能需要具备类似热力学系统的动态反馈机制,才能在面对复杂物理或逻辑矛盾时,像普朗克或爱因斯坦那样,通过"支付跳跃的成本"来实现理论突破。这不仅对 AI 哲学具有启发意义,也为设计能够进行自主科学假设生成的 AI 系统提供了具体的技术路径参考。

Sources

FAQ

这篇论文认为大语言模型无法完成溯因推理的根本原因是什么?

论文认为关键不在缺乏具身模拟,而在于固定权重的 Transformer 推理缺少“热力学耦合”:认知错误不会带来足够高的物理或计算代价,因此无法迫使模型推翻既有假设、完成溯因跳跃。

这项研究对 AI 研究的方向意味着什么?

它挑战了“具身性是高级推理必要条件”的主流假设,指出真正的瓶颈在架构层面:仅扩大模型规模或堆叠多模态数据都无法恢复缺失的错误—代价耦合机制,因此不能指望靠“做大”解决溯因推理问题。

后续开发下一代 AI 模型时应关注哪些技术方向?

需要在架构中引入动态的成本—收益评估与反馈机制,让认知错误产生可量化的代价并驱动自我修正;可观察高难度因果任务下模型输出熵是否随错误代价上升而变化,以此检验新机制是否生效。