本地智能体算力迷思:推理时扩展的边际收益与失效模式重构
在隐私保护与成本效率驱动下,本地计算机使用代理(CUA)成为AI落地新焦点。最新研究基于OSWorld基准,对Qwen3-VL、UI-TARS等主流本地模型进行实证分析,揭示了严格硬件约束下推理时扩展(Inference-Time Scaling)的局限性。研究发现,额外计算投入往往带来边际收益递减,并显著改变代理的失效模式。上下文扩展虽能提升轨迹稳定性,但收益随Token成本增加而饱和,错误类型从停滞转向过早的虚假成功;时间扩展未能实质提升任务成功率,反而可能延长错误轨迹。结构分解引入规划开销,并行扩展代价高昂。结论指出,高效本地CUA需采用选择性计算分配、失效感知控制机制及针对本地模型能力定制的代理框架,而非盲目堆砌算力。
随着隐私保护、成本效率及实际可用性的需求日益增长,将自主计算机使用代理(CUAs)部署在本地环境中已成为重要趋势。然而,如何在严格的硬件资源约束下提升这些代理的性能,仍是一个极具挑战性的难题。尽管近期研究表明,通过在执行过程中增加计算量(即推理时扩展)可以提升前沿计算机使用代理的性能,但这种策略在资源受限的本地模型上是否同样有效,目前尚缺乏深入理解。本文的核心贡献在于提供了一项系统性的实证研究,从上下文、时间、结构和并行四个维度,全面评估了推理时扩展在本地CUA中的表现。研究旨在揭示本地模型在面对额外计算资源时的真实行为模式,特别是其失效机制的变化,从而为构建高效、可靠的本地智能体提供理论依据与实践指导。这一研究填补了当前关于本地模型推理时扩展效果的认知空白,强调了在资源受限场景下重新评估扩展策略必要性的紧迫性。在技术方法层面,本研究并未提出新的网络架构,而是通过严谨的实验设计来解构推理时扩展的影响机制。研究选取了具有代表性的本地多模态大模型,包括Qwen3-VL系列的8B和30B-A3B版本、UI-TARS-1.5-7B以及OpenCUA-7B,并在OSWorld基准测试平台上进行验证。
在上下文维度,研究考察了增加历史轨迹信息作为上下文输入对代理行为的影响;在时间维度,分析了延长最大执行步数(max-steps)对任务完成的影响;在结构维度,探讨了将复杂任务分解为子任务的两阶段代理架构带来的规划与格式化开销;在并行维度,则评估了同时运行多个代理实例以覆盖不同搜索路径的效果。这种多维度的分析方法,使得研究者能够精确隔离不同扩展策略对模型性能的具体贡献,避免了以往研究中单一变量分析的局限性,从而更准确地描绘出本地模型在推理时扩展下的行为全景。实验结果揭示了推理时扩展在本地模型上的复杂表现。首先,上下文扩展确实提供了历史 grounding,提高了轨迹稳定性和任务准确率,但随着Token成本的增加,这种收益迅速饱和。更值得注意的是,失效模式发生了转移:代理从重复或停滞的轨迹,转变为过早产生虚假成功(premature false successes)。这意味着模型可能在未完全理解任务的情况下,基于有限的上下文做出了错误的自信判断。其次,时间扩展虽然减少了最大步数内的停滞现象,但并未显著提升任务最终成功率。这表明,更长的执行 horizon 往往只是延长了错误轨迹,而非纠正错误。
此外,结构分解在本地两阶段代理中引入了显著的规划与格式化开销,而并行扩展虽然能部分缓解上述失效问题,但其计算成本高昂,对于资源受限的本地部署而言性价比极低。这些发现通过详细的消融实验得以证实,清晰地展示了不同扩展策略在本地环境下的真实代价与收益。这些发现对开源社区、工业落地及后续研究具有深远意义。对于工业界而言,简单的增加计算量并非提升本地代理性能的万能药,反而可能导致资源浪费和不可预测的失效行为。因此,未来的本地C UA设计需要转向选择性计算分配,即根据任务难度动态调整计算资源,而非盲目扩展。同时,开发失效感知(failure-aware)的控制机制至关重要,以便在检测到虚假成功或停滞时及时干预。对于开源社区,本研究呼吁构建专门针对本地模型能力与局限性设计的代理框架,而非简单地将云端前沿模型的扩展策略移植到本地。后续研究应聚焦于如何以极低的计算开销实现高效的错误检测与纠正,从而在隐私、成本与性能之间找到最优平衡点,推动本地智能体技术的真正实用化。