从长文本到预测特征:LLM-BlockFE 用可执行程序搜索做离线特征工程

Published · AI Daily — AI-assisted deep research, methodology & disclosure

LLM-BlockFE 让大模型只在离线阶段工作:逐块追加不可变代码块,生成可执行的特征程序,再由下游模型评估。块级回滚与深度校准的信用分配避免贪心陷阱,多条交错轨迹共享探索方向以减少重复。搜索后程序冻结上线,线上推理不再调用 LLM。四个数据集上 AUC 绝对提升 0.0069 至 0.0358,五个已上线风控应用的 KS 提升 0.02 至 1.56 个百分点。

在工业级风控系统里,真正跑在线上的几乎都是结构化数据模型:它们延迟低、成本可控、可解释,也容易接入既有的审批与监控链路。但现实中有价值的信息,常常沉在非结构化的长文本里,比如申请材料、沟通记录、文书描述。这些文字里藏着收入来源、经营状况、行为意图的蛛丝马迹,却进不了表格模型。把它们变成特征,传统做法是请领域专家手工设计规则和抽取脚本,耗时耗力,覆盖面也受限于专家的经验。反过来,直接让大语言模型(LLM)在每次实时请求里读一遍长文本,又会撞上延迟、吞吐、成本与稳定性的硬约束,风控场景往往根本放不下这种调用。arXiv 上 2026 年 10 月 8 日发布的论文《Long Text to Predictive Features》提出的 LLM-BlockFE,正是想在这两条死路之间走出第三条路。

它的核心思路可以用一句话概括:让 LLM 只在离线阶段工作,产出的不是预测,而是可执行的特征程序。系统让 LLM 一块一块地往程序里追加代码块,每个代码块一旦写入便不可改动,也就是所谓的不可变块。每追加一块,就把新产生的候选特征交给下游预测模型去评估,看它能否带来真实的增益。搜索结束后,这些程序被冻结,部署到线上,用来从长文本中直接抽取结构化特征,再喂给原有的下游模型。于是线上推理阶段完全不需要调用 LLM,延迟与成本和传统特征管线没有区别。这一设计把 LLM 的角色从推理引擎改成了特征工程师,把昂贵的智能一次性摊销到离线搜索里,这在工程上是相当务实的取舍。 难点在于搜索本身。程序是逐块生长的,如果沿用常规的贪心策略,每一步都只保留眼前看起来最好的那一块,很容易走进次优解:早期某个块看似有效,却把后续的路径锁死,而系统没有办法回头。论文针对这一点引入了块级回滚机制,并且用深度校准的信用分配来决定该回滚到哪里。直觉上,一个特征程序最终的收益并不均匀地来自每一个块,越靠前的块影响越大,也越难单独评判。深度校准的信用分配试图修正这种偏差,让系统能更公平地判断是哪一块拖了后腿,再把程序退回到那一块之前重新生长。需要说明的是,摘要只给出了机制的名称与目的,具体的校准公式和阈值要以论文正文为准,这里不做超出原文的推断。 第二个设计是并行推进多条相互独立的搜索轨迹,并且以交错的方式运行。多条轨迹能降低单一路径陷入局部最优的风险,但朴素的做法会让各条轨迹重复探索同样的方向,白白浪费 LLM 调用。论文的做法是让轨迹共享对各自探索方向的固定描述,使每条轨迹知道别人已经走到哪里,从而减少冗余探索。换句话说,它用一小段稳定的文字充当轨迹之间的协调信号,而不是让它们各自从头猜。这种做法的价值在于成本:LLM 的每一次调用都要花钱,搜索预算有限时,少重复一次就多出一次真正有信息量的尝试。回滚解决的是纵向的回头路,交错与共享描述解决的是横向的撞车,两者合起来构成了一套相当完整的搜索纪律。

实验结果方面,论文在两个公开数据集和两个私有数据集上做了全量比较。相对每个数据集上最强的基线,LLM-BlockFE 的 AUC 绝对提升在 0.0069 到 0.0358 之间。更有说服力的是上线后的数据:在五个已部署的金融风控应用中,相对原有的人工设计策略,KS 指标有 0.02 到 1.56 个百分点的绝对提升。对风控团队而言,这个量级并不小,因为排序能力上每一点提升都会换算成坏账率或通过率上的真金白银。同时也要保持清醒:提升区间的下沿很小,说明收益因场景而异;私有数据集无法复现;线上监测是与既有策略的对比,并不等同于严格的对照实验。读者应该把它看作一条有工程证据支撑的路线,而不是一个普适的结论。

从行业角度看,这篇论文的意义在于它给出了一种务实的使用 LLM 的范式:不把模型放进请求路径,而是把它放进开发路径。特征程序是可执行的、可审计的、可版本管理的代码,这对受监管的金融场景尤其重要,因为每一个线上特征都能被追溯、被检查、被回放,而不是藏在一次黑盒的模型调用里。同样的范式有望延伸到其他拥有大量长文本、却受限于延迟和合规的领域。未来值得关注的问题包括:搜索出来的程序在数据分布漂移后如何维护,LLM 生成的特征是否会引入泄漏或偏见,以及不同下游模型之间的特征能否迁移。这些问题都需要在真实业务里长期跟踪验证,也是后续研究最该补上的部分。无论答案如何,LLM-BlockFE 已经说明,让大模型做离线的特征工程师,比让它做在线的判官更容易落地。

Sources

FAQ

LLM-BlockFE 为什么能避免在线调用 LLM?

它把 LLM 放在离线阶段,让 LLM 逐块写出可执行的特征程序,并用下游模型评估。搜索结束后程序被冻结,上线时只运行这些程序从长文本中抽取结构化特征,因此在线推理不需要再调用 LLM,延迟和成本与传统特征管线相当。

块级回滚和深度校准的信用分配解决什么问题?

常规贪心搜索只保留眼前最优,容易被早期看似有效的块锁进次优解。块级回滚允许把程序退回到出问题的块之前,深度校准的信用分配则用来判断该退到哪里,因为靠前的块对后续影响更大。具体公式需要查看论文正文。

实验结果说明了什么,有哪些局限?

在两个公开和两个私有数据集上,AUC 相对最强基线绝对提升 0.0069 至 0.0358。五个已上线的金融风控应用中,KS 相对原有人工策略提升 0.02 至 1.56 个百分点。局限在于私有数据无法复现,上线监测也不等同于严格的对照实验。