FrugalEvo:面向成本感知的 LLM 引導程式進化

Published · AI Daily — AI-assisted deep research, methodology & disclosure

FrugalEvo 提出一種成本感知的 LLM 引導進化框架:較強的模型負責探索解題策略,較便宜的模型負責實現並反覆精修程式碼,同時透過共享提示前綴提高快取複用。論文還引入 BA-AUC 指標,衡量固定預算內的解品質曲線。摘要稱,在 10 個數學與系統最佳化任務上,其最終品質持平或超過多種基線,並在 9 個任務上取得更高 BA-AUC;圓填充僅花費 0.55 至 1.68 美元。

技术背景与问题定义

LLM 引导的进化方法,例如 AlphaEvolve,已经成为解决圆填充等高难度计算优化问题的有力手段。它的基本循环并不复杂:让大模型针对现有程序提出修改,用评测函数给新程序打分,把表现好的程序留在候选池里,再进入下一轮。 过去的工作通常在固定迭代次数下比较性能提升。这种比较方式有一个盲点:它不看花了多少钱。迭代次数相同,花费并不相同。强模型的单次调用更贵,输出的推理更长,上下文也更容易膨胀。把预算锁定在迭代数上,这些差异就被隐藏了。 FrugalEvo 的作者提出一个更贴近实际的目标:最大化单位成本的收益,而不是固定轮数内的收益。摘要给出的对照数字很直白。多智能体方法 CORAL 和 SwarmResearch 在圆填充任务上平均花费约 50 美元。FrugalEvo 报告的花费是 1.68 美元和 0.55 美元,并声称结果持平或更好。如果这些数字成立,问题就不再是"能不能找到好解",而是"找到好解要付多少钱"。

需要说明:本文只依据论文摘要整理。摘要没有披露的细节,例如具体提示词、缓存命中率、各任务的绝对分数,这里不做推断。

核心架构与原理解析

摘要描述了三个相互配合的设计。 第一,强弱模型分工。较强、较贵的 LLM 负责探索解题策略,也就是决定"往哪个方向走"。较便宜的 LLM 负责落地:把策略实现成代码,并在后续迭代中反复修改这些代码。这个分工的前提是,进化过程中不同环节对模型能力的要求并不一样。高层策略选择需要判断力,代码实现和局部精修则更依赖大量的低成本尝试。把昂贵的调用留给少数关键决策,是节省成本的主要来源。

第二,缓存友好的进化流程。现代 LLM 服务对相同前缀的输入提供缓存,命中缓存的输入通常更便宜、更快。FrugalEvo 的执行框架(harness)和提示词被设计成让不同进化步骤之间尽可能共享前缀,从而提高缓存复用率。这是一个工程层面的设计,但在成本敏感的场景里,它直接影响账单。 第三,新的度量指标 BA-AUC,即预算感知曲线下面积。它的定义是:以累计 LLM 成本为横轴,以迄今最优评测分数为纵轴画曲线,在预算上限之内取曲线下面积。这个指标奖励两件事:最终分数高,以及尽早达到高分。只看最终分数的比较,会让一个烧钱十倍才多拿一点分的方法看起来更好。BA-AUC 把这种差别暴露出来。

关键功能与实战评估

按摘要所述,评测覆盖 10 个数学与系统优化任务。FrugalEvo 在最终解质量上持平或超过 OpenEvolve、ShinkaEvolve、AdaEvolve 和 EvoX 等最新基线,并在其中 9 个任务上取得更高的 BA-AUC。反过来读,有 1 个任务上它的 BA-AUC 没有占优,摘要没有说明是哪一个。

在 ALE-Bench-Lite 的 10 个算法优化任务上,FrugalEvo 的平均表现也高于这些基线。

最醒目的结果在圆填充上。使用 GPT-5.6 Terra 与 Luna 的组合,花费 1.68 美元;使用 GLM-5.3 及其 Flash 版本,花费 0.55 美元。两种配置都被报告为持平或超过所有基线,并刷新了该任务的最佳水平。这里有两点值得谨慎看待:一是"新的最佳水平"是论文自己的主张,需要独立复现;二是多智能体方法的 50 美元是"平均"花费,不同方法、不同模型组合下的成本口径是否完全可比,要看正文的实验设置。

行业影响与未来演进

这项工作的价值不在于某个具体分数,而在于把成本放进了评价体系。进化式程序搜索越来越多地被用于算法发现、系统调优和科研辅助。当单次实验要消耗数十美元时,只有资金充足的团队能做。成本降到一两美元以内,个人研究者和小团队也能跑完整的搜索。

对工程实践者来说,有三点可以直接借鉴。其一,强弱模型分层是一种通用的省钱手段,不限于进化搜索。其二,提示词的前缀稳定性应当作为设计约束,而不是事后优化。其三,评价自动化搜索系统时,应同时报告成本曲线,而不只是终点分数。

局限也很明确。10 个加 10 个任务的规模有限,结论能否推广到更开放的问题还不清楚。强弱模型的搭配依赖具体的模型对,价格一变,最优组合也会变。BA-AUC 的数值还取决于预算上限的选择。后续值得关注的是独立复现、更多任务类型,以及策略层与实现层之间的信息传递究竟如何影响效果。

Sources

FAQ

FrugalEvo 如何分配强模型与弱模型的职责?

较强、较贵的 LLM 探索解题策略;较便宜的 LLM 把策略实现成代码,并在后续迭代中反复精修。

BA-AUC 指标是怎么定义的?

以累计 LLM 成本为横轴、迄今最优评测分数为纵轴画曲线,取预算上限之内曲线下的面积。它同时奖励最终分数高和尽早达到高分。

摘要报告了哪些圆填充成本数字?

GPT-5.6 Terra 与 Luna 组合为 1.68 美元,GLM-5.3 及其 Flash 版本为 0.55 美元;多智能体方法 CORAL 和 SwarmResearch 平均约 50 美元。