장문 텍스트에서 예측 특징으로: LLM-BlockFE의 실행 가능 프로그램 탐색
LLM-BlockFE는 LLM을 오프라인에서만 쓴다. 불변 코드 블록을 덧붙여 실행 가능한 특징 프로그램을 만들고 하위 모델로 평가한다. 블록 롤백과 교차 궤적이 탐욕적 탐색의 함정을 피한다. AUC가 0.0069~0.0358 오르고, 다섯 응용에서 KS가 0.02~1.56포인트 개선되었다.
산업용 리스크 관리 시스템은 대개 정형 데이터 모델 위에서 돌아간다. 응답이 빠르고, 운영 비용을 가늠하기 쉬우며, 승인과 감사 체계에도 잘 들어맞기 때문이다. 하지만 가치 있는 정보의 상당수는 신청서 서술, 소통 기록, 자유 형식 설명 같은 비정형 장문 텍스트 안에 묻혀 있다. 이 정보를 표 형태의 모델로 끌어오려면 지금까지는 전문가가 규칙과 추출 스크립트를 손으로 설계해야 했다. 시간이 많이 들고, 포괄 범위도 전문가의 경험에 묶인다. 반대로 실시간 입력마다 대규모 언어 모델(LLM)에게 장문을 읽히는 방식은 지연 시간, 처리량, 비용, 안정성 면에서 실서비스 요건을 맞추기 어렵다. 2026년 10월 8일 arXiv에 올라온 논문 「Long Text to Predictive Features」가 제안한 LLM-BlockFE는 이 막다른 두 길 사이의 세 번째 길이다.
핵심 발상은 간단하다. LLM은 오프라인에서만 쓰고, 그 출력은 예측값이 아니라 실행 가능한 특징 프로그램으로 삼는다. LLM-BlockFE는 코드 블록을 하나씩 덧붙여 프로그램을 키우며, 각 블록은 한번 쓰이면 바뀌지 않는 불변 블록이다. 블록을 추가할 때마다 새로 생긴 후보 특징을 하위 예측 모델로 평가하므로, 탐색은 LLM의 자기 평가가 아니라 실제로 측정된 예측 이득을 따라 진행된다. 탐색이 끝나면 프로그램은 동결되어 배포되고, 긴 텍스트에서 구조화된 특징을 곧바로 뽑아 기존 하위 모델에 넘긴다. 온라인 추론에서는 LLM을 한 번도 호출하지 않으므로 지연과 비용은 기존 특징 파이프라인과 다르지 않다. 값비싼 지능의 비용을 탐색 단계에서 한 번만 치르고 이후 모든 요청에 나눠 부담시키는, 공학적으로 현실적인 설계다. 어려움은 탐색 자체에 있다. 프로그램이 블록 단위로 자라기 때문에, 매 단계에서 눈앞의 최선만 남기는 탐욕적 탐색은 차선의 해에 갇히기 쉽다. 초반의 블록이 유용해 보여도 이후의 경로를 나쁜 방향으로 고정할 수 있고, 탐욕적 방식에는 되돌아갈 수단이 없다. 논문은 이를 위해 깊이로 보정한 기여도 배분에 기반한 블록 단위 롤백 장치를 도입한다. 프로그램의 최종 이득은 각 블록에서 고르게 나오지 않는다. 앞쪽 블록일수록 뒤따르는 것에 미치는 영향이 크고, 단순한 배분으로는 평가를 그르치기 쉽다. 깊이 보정은 이 편향을 바로잡아 어느 블록이 발목을 잡았는지 더 공정하게 가려내고, 그 블록 직전으로 프로그램을 되돌려 다시 키우게 한다. 다만 초록이 밝히는 것은 장치의 이름과 목적까지이며, 보정식과 임계값은 본문에서 확인해야 한다. 여기서는 원문을 넘는 추측을 하지 않는다.
두 번째 설계는 서로 독립적인 여러 탐색 궤적을 교차 방식으로 함께 진행하는 것이다. 궤적이 여럿이면 하나의 경로가 지역 최적에 빠질 위험이 줄어든다. 그러나 단순한 구현에서는 각 궤적이 같은 방향을 중복 탐색하여 LLM 호출이 낭비된다. 논문은 각 궤적의 탐색 방향을 적은 고정된 설명을 서로 공유하게 해 이 중복을 줄인다. 각 궤적이 다른 궤적의 진행 방향을 알고 움직이므로 탐색이 겹치지 않고 넓게 퍼진다. 짧고 안정적인 문장이 궤적 간 조율 신호 역할을 하는 셈이다. LLM 호출은 한 번마다 비용이 들기 때문에, 중복을 한 번 줄이면 정보가 있는 시도가 한 번 늘어난다. 롤백은 나쁜 경로에 머무는 세로 방향의 문제를, 교차 실행과 설명 공유는 경로끼리 부딪히는 가로 방향의 문제를 푼다. 둘을 합치면 평가 비용이 큰 탐색 공간에 걸맞은 꽤 완결된 탐색 규율이 된다.
결과를 보면, 논문은 공개 데이터셋 둘과 비공개 데이터셋 둘에서 전체 데이터 비교를 수행했다. 각 데이터셋에서 가장 강한 기준선과 비교해 LLM-BlockFE는 AUC를 절대값으로 0.0069에서 0.0358만큼 끌어올렸다. 더 설득력 있는 것은 출시 후의 수치다. 가동 중인 다섯 개의 금융 리스크 관리 애플리케이션에서, 기존의 수작업 설계 전략 대비 KS가 절대값으로 0.02에서 1.56퍼센트 포인트 개선되었다. 여신과 사기 탐지에서는 순위 구분력이 조금만 올라도 손실률이나 승인율에 실질적인 차이가 생기므로 이 정도 규모는 가볍지 않다. 동시에 개선폭은 균일하지 않다. 하한이 아주 작다는 것은 이득이 텍스트에 쓸 만한 정보가 얼마나 있느냐에 크게 좌우됨을 시사한다. 또한 비공개 데이터는 외부에서 재현할 수 없고, 기존 전략과의 출시 후 비교는 엄밀한 대조 실험과 같지 않다는 점도 염두에 두어야 한다.
산업적 관점에서 이 논문의 의의는 LLM을 쓰는 현실적인 방식을 보여 준 데 있다. 모델을 요청 경로에 두지 않고 개발 경로에 둔다. 생성물은 실행 가능하고, 감사할 수 있으며, 버전 관리가 되는 코드다. 규제가 엄격한 금융에서는 운영 중인 특징을 추적하고 검사하고 과거 데이터로 재실행할 수 있다는 점이 큰 장점이 된다. 탐색 후 프로그램을 동결하므로 같은 입력은 내일도 같은 특징을 내고, 드리프트 감시에도 일반적인 도구를 쓸 수 있다. 또한 LLM이 실시간 트래픽에 관여하지 않으므로 민감한 텍스트를 외부 엔드포인트로 보낼 필요가 없고, 모델 제공자의 장애가 판단 경로를 멈추게 하지도 못한다. 정확도 수치만으로는 드러나지 않는 운영상의 이점이다. 남은 질문도 많다. 입력 텍스트의 분포가 바뀌면 동결된 프로그램을 어떻게 유지하고, 탐색은 얼마나 자주 다시 해야 하는가. LLM이 쓴 추출 로직이 라벨 정보를 흘리거나 바람직하지 않은 편향을 담지는 않는지, 출시 전에 어떻게 잡아낼 것인가. 한 하위 모델을 위해 찾은 특징이 다른 모델로도 옮겨지는가. 이득 가운데 탐색 장치 자체에서 온 몫과, 믿을 만한 채점 신호 아래 LLM에게 많은 시도를 준 데서 온 몫은 어떻게 나눌 수 있는가. 초록은 이에 답하지 않으며 본문의 절제 실험이 중요해질 것이다. 그럼에도 시사점은 분명하다. 지연과 규제에 묶인 분야에서 대형 모델이 가장 배포하기 쉬운 역할은 온라인 심판이 아니라, 감사 가능한 부품을 오프라인에서 만드는 일꾼일 수 있다. LLM-BlockFE는 그 구체적인 사례이며, 특징 파이프라인을 책임지는 실무자라면 눈여겨볼 만하다.
Sources
FAQ
LLM-BlockFE는 왜 온라인에서 LLM을 호출하지 않아도 됩니까?
LLM은 오프라인에서만 쓰입니다. 실행 가능한 특징 프로그램을 블록 단위로 쓰게 하고 하위 모델로 평가합니다. 탐색 후 프로그램을 동결하면, 운영에서는 이 프로그램이 긴 텍스트에서 구조화된 특징을 직접 뽑으므로 온라인 추론에 LLM이 필요 없고 지연과 비용도 기존 특징 파이프라인과 비슷합니다.
블록 단위 롤백과 깊이 보정 기여도 배분은 무엇을 해결합니까?
탐욕적 탐색은 눈앞의 최선만 남기므로, 초반에 유용해 보이는 블록 때문에 차선의 해에 갇힐 수 있습니다. 롤백은 문제의 블록 이전으로 프로그램을 되돌리고, 깊이 보정 기여도 배분은 앞쪽 블록의 영향이 더 크다는 점을 반영해 어디로 돌아갈지 판단하게 돕습니다. 정확한 식은 본문을 확인해야 합니다.
실험 결과는 무엇을 보여 주며 한계는 무엇입니까?
공개 두 개와 비공개 두 개의 데이터셋에서 가장 강한 기준선 대비 AUC가 절대값으로 0.0069~0.0358 올랐습니다. 가동 중인 다섯 금융 리스크 관리 응용에서는 수작업 전략 대비 KS가 0.02~1.56퍼센트 포인트 개선되었습니다. 비공개 데이터는 재현할 수 없고, 출시 후 감시는 엄밀한 대조 실험이 아닙니다.