從長文字到預測特徵:LLM-BlockFE 用可執行程式搜尋做離線特徵工程

Published · AI Daily — AI-assisted deep research, methodology & disclosure

LLM-BlockFE 讓大模型只在離線階段工作:逐塊追加不可變程式碼塊,生成可執行的特徵程式,再由下游模型評估。塊級回滾與深度校準的信用分配避免貪心陷阱,多條交錯軌跡共享探索方向以減少重複。搜尋後程式凍結上線,線上推理不再呼叫 LLM。四個資料集上 AUC 絕對提升 0.0069 至 0.0358,五個已上線風控應用的 KS 提升 0.02 至 1.56 個百分點。

在工業級風控系統裡,真正跑線上上的幾乎都是結構化資料模型:它們延遲低、成本可控、可解釋,也容易接入既有的審批與監控鏈路。但現實中有價值的資訊,常常沉在非結構化的長文字里,比如申請材料、溝通記錄、文書描述。這些文字裡藏著收入來源、經營狀況、行為意圖的蛛絲馬跡,卻進不了表格模型。把它們變成特徵,傳統做法是請領域專家手工設計規則和抽取指令碼,耗時耗力,覆蓋面也受限於專家的經驗。反過來,直接讓大語言模型(LLM)在每次實時請求裡讀一遍長文字,又會撞上延遲、吞吐、成本與穩定性的硬約束,風控場景往往根本放不下這種呼叫。arXiv 上 2026 年 10 月 8 日釋出的論文《Long Text to Predictive Features》提出的 LLM-BlockFE,正是想在這兩條死路之間走出第三條路。

它的核心思路可以用一句話概括:讓 LLM 只在離線階段工作,產出的不是預測,而是可執行的特徵程式。系統讓 LLM 一塊一塊地往程式裡追加程式碼塊,每個程式碼塊一旦寫入便不可改動,也就是所謂的不可變塊。每追加一塊,就把新產生的候選特徵交給下游預測模型去評估,看它能否帶來真實的增益。搜尋結束後,這些程式被凍結,部署到線上,用來從長文字中直接抽取結構化特徵,再餵給原有的下游模型。於是線上推理階段完全不需要呼叫 LLM,延遲與成本和傳統特徵管線沒有區別。這一設計把 LLM 的角色從推理引擎改成了特徵工程師,把昂貴的智慧一次性攤銷到離線搜尋裡,這在工程上是相當務實的取捨。 難點在於搜尋本身。程式是逐塊生長的,如果沿用常規的貪心策略,每一步都只保留眼前看起來最好的那一塊,很容易走進次優解:早期某個塊看似有效,卻把後續的路徑鎖死,而系統沒有辦法回頭。論文針對這一點引入了塊級回滾機制,並且用深度校準的信用分配來決定該回滾到哪裡。直覺上,一個特徵程式最終的收益並不均勻地來自每一個塊,越靠前的塊影響越大,也越難單獨評判。深度校準的信用分配試圖修正這種偏差,讓系統能更公平地判斷是哪一塊拖了後腿,再把程式退回到那一塊之前重新生長。需要說明的是,摘要只給出了機制的名稱與目的,具體的校準公式和閾值要以論文正文為準,這裡不做超出原文的推斷。 第二個設計是並行推進多條相互獨立的搜尋軌跡,並且以交錯的方式執行。多條軌跡能降低單一路徑陷入區域性最優的風險,但樸素的做法會讓各條軌跡重複探索同樣的方向,白白浪費 LLM 呼叫。論文的做法是讓軌跡共享對各自探索方向的固定描述,使每條軌跡知道別人已經走到哪裡,從而減少冗餘探索。換句話說,它用一小段穩定的文字充當軌跡之間的協調訊號,而不是讓它們各自從頭猜。這種做法的價值在於成本:LLM 的每一次呼叫都要花錢,搜尋預算有限時,少重複一次就多出一次真正有資訊量的嘗試。回滾解決的是縱向的回頭路,交錯與共享描述解決的是橫向的撞車,兩者合起來構成了一套相當完整的搜尋紀律。

實驗結果方面,論文在兩個公開資料集和兩個私有資料集上做了全量比較。相對每個資料集上最強的基線,LLM-BlockFE 的 AUC 絕對提升在 0.0069 到 0.0358 之間。更有說服力的是上線後的資料:在五個已部署的金融風控應用中,相對原有的人工設計策略,KS 指標有 0.02 到 1.56 個百分點的絕對提升。對風控團隊而言,這個量級並不小,因為排序能力上每一點提升都會換算成壞賬率或透過率上的真金白銀。同時也要保持清醒:提升區間的下沿很小,說明收益因場景而異;私有資料集無法復現;線上監測是與既有策略的對比,並不等同於嚴格的對照實驗。讀者應該把它看作一條有工程證據支撐的路線,而不是一個普適的結論。

從行業角度看,這篇論文的意義在於它給出了一種務實的使用 LLM 的正規化:不把模型放進請求路徑,而是把它放進開發路徑。特徵程式是可執行的、可審計的、可版本管理的程式碼,這對受監管的金融場景尤其重要,因為每一個線上特徵都能被追溯、被檢查、被回放,而不是藏在一次黑盒的模型呼叫裡。同樣的正規化有望延伸到其他擁有大量長文字、卻受限於延遲和合規的領域。未來值得關注的問題包括:搜尋出來的程式在資料分佈漂移後如何維護,LLM 生成的特徵是否會引入洩漏或偏見,以及不同下游模型之間的特徵能否遷移。這些問題都需要在真實業務里長期跟蹤驗證,也是後續研究最該補上的部分。無論答案如何,LLM-BlockFE 已經說明,讓大模型做離線的特徵工程師,比讓它做線上的判官更容易落地。

Sources

FAQ

LLM-BlockFE 為什麼能避免線上呼叫 LLM?

它把 LLM 放在離線階段,讓 LLM 逐塊寫出可執行的特徵程式,並用下游模型評估。搜尋結束後程式被凍結,上線時只執行這些程式從長文字中抽取結構化特徵,因此線上推理不需要再呼叫 LLM,延遲和成本與傳統特徵管線相當。

塊級回滾和深度校準的信用分配解決什麼問題?

常規貪心搜尋只保留眼前最優,容易被早期看似有效的塊鎖進次優解。塊級回滾允許把程式退回到出問題的塊之前,深度校準的信用分配則用來判斷該退到哪裡,因為靠前的塊對後續影響更大。具體公式需要檢視論文正文。

實驗結果說明了什麼,有哪些侷限?

在兩個公開和兩個私有資料集上,AUC 相對最強基線絕對提升 0.0069 至 0.0358。五個已上線的金融風控應用中,KS 相對原有人工策略提升 0.02 至 1.56 個百分點。侷限在於私有資料無法復現,上線監測也不等同於嚴格的對照實驗。