Token高效數據推理智能體:通過自適應結構化非結構化數據實現智能數據破解

Published 2026-08-31 · AI Daily — AI-assisted deep research, methodology & disclosure

本文針對企業級AI智能體在處理非結構化數據時面臨的極高Token成本問題,提出了一種名為「智能體數據破解」(Agentic Data Cracking)的新方法。當前,智能體在回答複雜問題時需反覆加載大型文檔以檢索分散證據,導致每次查詢消耗高達百萬級Token,成本高昂。本研究的核心貢獻在於利用推理過程本身作為副產品,自適應且推測性地對非結構化數據進行結構化處理。具體而言,當智能體為回答問題打開文檔時,一個「破解子智能體」會從已加載的上下文中衍生,以邊際成本提取可能服務於未來相關查詢的結構化信息。實驗結果顯示,在FanOutQA基準測試中,該方法在保持精度的同時,將成本降低了53%。相較於理想預結構化存儲的28倍成本優勢,該方法隨著查詢數量的增加展現出顯著的成本效益,為下一代面向非結構化數據的推理基礎設施奠定了堅實基礎。

在当前的企业人工智能应用中,大量高价值数据依然深埋于网页、报告、合同、备案文件、财报电话会议记录以及PDF等非结构化来源之中。尽管大型语言模型智能体(LLM Agents)如今已具备基于这些数据回答复杂问题的能力,但其高昂的计算成本成为阻碍大规模落地的主要瓶颈。传统模式下,智能体在回答每一个问题时,都需要重新打开并解析庞大的文档以恢复分散的证据片段,这一过程往往消耗高达一百万个Token。相比之下,如果数据能够预先结构化,同样的查询将简化为廉价的数据库查找操作。然而,预先对所有数据进行结构化并不具备可行性,因为文档中蕴含的潜在结构远超任何单一工作负载的需求,且哪些结构有用、哪些文档重要,往往只有在查询到达时才得以显现。因此,如何在不预先全量结构化的前提下降低推理成本,成为本论文解决的核心问题。

作者提出了一种名为"智能体数据破解"的创新范式,旨在通过自适应和推测性的方式,在推理过程中动态构建数据结构,从而打破成本与灵活性之间的权衡困境。在技术方法层面,论文提出的"智能体数据破解"机制巧妙地利用了推理过程中的上下文资源。该方法的核心在于"自适应"与"推测性"两个维度。自适应意味着数据结构的提取时机和内容完全由观察到的查询决定,只有当智能体为了回答当前问题而加载文档时,才会触发后续的结构化操作。推测性则体现在该过程不仅服务于当前问题,还致力于提取可能服务于未来相关查询的结构化信息。具体实现上,每当主智能体打开一个文档以回答问题时,一个"破解子智能体"(cracking sub-agent)会从已经加载的上下文中衍生出来。

由于上下文已在内存中,这一衍生过程的边际成本极低。破解子智能体会从非结构化文本中提取出有根据的结构化数据,并将其存储起来。随着时间的推移,越来越多的查询可以直接由这些结构化数据覆盖,无需再次打开原始文档。这种机制使得智能体能够在保持接近检索增强生成(RAG)系统低成本的同时,维持高精度的推理能力,实现了从"每次查询都重新计算"到"知识累积复用"的转变。在实验设置与关键结果方面,研究团队在FanOutQA基准测试上验证了该方法的有效性。FanOutQA是一个专门用于评估智能体在多个文档间进行推理能力的基准,其特点在于单个问题往往需要关联多个文档中的信息。

实验结果显示,即使在扩展测试中仅增加一个与测试问题相关的查询,智能体数据破解方法也能将Token成本降低53%,同时保持推理精度不受影响。这一结果有力地证明了推测性结构化的价值:即使未来的查询并未完全覆盖当前提取的结构,预先提取的结构化片段也能显著减少后续查询所需的数据加载量。此外,研究还指出,与理想化的预结构化存储相比,当前智能体推理的成本依然较高,但通过这种自适应方法,成本差距正在迅速缩小。消融实验进一步表明,随着查询数量的增加,结构化数据的覆盖率提升,成本优势呈指数级增长,这验证了该方法在处理大规模、多样化查询场景下的可扩展性。从行业意义与潜在影响来看,智能体数据破解代表了下一代非结构化数据基础设施的重要一步。它提出了一种全新的数据管理范式,即在模型推理的底层建立一个共享的知识基底,使得推理过程中已经"付费"揭示的知识能够自动积累并复用。这对于开源社区而言,提供了一种无需复杂预处理的低成本智能体部署方案;对于工业落地而言,它极大地降低了企业级AI应用的经济门槛,使得处理海量非结构化数据成为可能;对于后续研究而言,它开辟了"推理即结构化"的新方向,激发了关于如何更智能地设计数据结构、如何优化子智能体提取策略等问题的探索。随着大模型在更多垂直领域的应用,这种能够自我进化、自我优化的数据推理机制,有望成为构建高效、智能企业知识系统的核心组件。

Sources

FAQ

什么是“智能体数据破解”?

它通过衍生“破解子智能体”自适应提取非结构化信息。因上下文已在内存,边际成本极低,避免了每次查询重复解析大文档导致的百万级Token消耗。

该方法相比传统模式有何优势?

相比传统RAG或预结构化,该方法在保持精度的同时将成本降低53%。随着查询增加,结构化覆盖度提升,成本优势呈指数级增长,具备28倍成本优势。

这项技术对未来的长远意义是什么?

它开创了“推理即结构化”的新范式,为构建高效企业知识系统奠定基础。未来将推动AI从单纯堆算力转向智能资源调度,大幅降低企业级落地门槛。