FrugalEvo: kostenbewusste, LLM-gestützte Programmevolution

Published · AI Daily — AI-assisted deep research, methodology & disclosure

FrugalEvo ist ein kostenbewusster, LLM-gestützter Evolutionsrahmen. Ein stärkeres Modell erkundet Lösungsstrategien, ein günstigeres Modell setzt sie um und verfeinert den entstehenden Code Schritt für Schritt. Die Prompts teilen Präfixe, damit der Cache besser genutzt wird. Die Arbeit führt BA-AUC ein, eine Kennzahl für die Lösungsqualität über die kumulierten Kosten. Laut Abstract erreicht oder übertrifft FrugalEvo Vergleichsverfahren bei 10 Aufgaben, gewinnt bei 9 in BA-AUC und löst das Kreispacken für 0,55 bis 1,68 USD.

Hintergrund und Problemstellung

LLM-gestützte evolutionäre Verfahren wie AlphaEvolve haben sich als starker Ansatz für schwierige Optimierungsprobleme erwiesen, darunter das Packen von Kreisen. Die Schleife ist einfach. Ein Sprachmodell schlägt eine Änderung an einem bestehenden Programm vor. Eine Bewertungsfunktion benotet das neue Programm. Gute Programme bleiben im Bestand, und die nächste Runde startet von ihnen. Frühere Arbeiten vergleichen Methoden meist über den Gewinn nach einer festen Zahl von Iterationen. Dieser Vergleich hat einen blinden Fleck: Er ignoriert das Geld. Zwei Läufe mit gleicher Iterationszahl können sehr unterschiedlich viel kosten. Ein stärkeres Modell ist pro Aufruf teurer, schreibt längere Begründungen und trägt meist einen größeren Kontext. Ein Budget, das in Iterationen festgelegt ist, verdeckt all das.

Die Autoren von FrugalEvo setzen ein praxisnäheres Ziel: den Gewinn pro Kosteneinheit zu maximieren. Der Kontrast im Abstract ist klar. Multi-Agenten-Methoden wie CORAL und SwarmResearch kosten beim Kreispacken im Mittel etwa 50 USD. FrugalEvo berichtet 1,68 USD und 0,55 USD bei gleichen oder besseren Ergebnissen. Halten diese Zahlen stand, ändert sich die Frage: Es geht nicht mehr darum, ob sich eine gute Lösung finden lässt, sondern darum, was sie kostet. Zum Umfang: Diese Analyse stützt sich allein auf das Abstract der Arbeit. Details, die das Abstract nicht nennt, etwa die genauen Prompts, Cache-Trefferquoten oder absolute Werte je Aufgabe, werden hier nicht erschlossen.

Architektur und technische Prinzipien

Das Abstract beschreibt drei Bausteine, die zusammenwirken. Erstens eine Arbeitsteilung zwischen zwei Modellen. Ein stärkeres und teureres LLM erkundet Lösungsstrategien. Es entscheidet, in welche Richtung es geht. Ein günstigeres LLM setzt diese Strategien als Code um und verfeinert den Code in späteren Iterationen. Die Teilung nimmt an, dass die Stufen eines Evolutionslaufs nicht dieselbe Fähigkeit verlangen. Die Wahl einer Strategie braucht Urteilskraft. Das Schreiben und Feilen von Code profitiert von vielen billigen Versuchen. Teure Aufrufe für wenige Schlüsselentscheidungen aufzusparen, ist die Hauptquelle der Ersparnis.

Zweitens ein cache-effizienter Evolutionsablauf. LLM-Dienste speichern wiederholte Eingabepräfixe häufig im Cache, und Eingaben aus dem Cache sind billiger und schneller. Bei FrugalEvo sind das Harness und die Prompts so gebaut, dass verschiedene Evolutionsschritte möglichst viel vom Präfix teilen. Das ist eine Ingenieursentscheidung, doch bei kostenbewusstem Einsatz zeigt sie sich direkt auf der Rechnung. Drittens eine neue Kennzahl, die Budget-Aware Area Under the Curve, kurz BA-AUC. Man trägt die bisher beste Bewertung über den kumulierten LLM-Kosten auf und nimmt die Fläche unter dieser Kurve bis zum Budget. Die Kennzahl belohnt zwei Dinge: einen hohen Endwert und das frühe Erreichen guter Werte. Ein Vergleich nur nach dem Endwert kann eine Methode begünstigen, die zehnmal mehr ausgibt, um etwas mehr zu gewinnen. BA-AUC macht diesen Unterschied sichtbar.

Praktische Bewertung und Anwendungen

Laut Abstract umfasst die Bewertung 10 mathematische und systemnahe Optimierungsaufgaben. FrugalEvo erreicht oder übertrifft OpenEvolve, ShinkaEvolve, AdaEvolve und EvoX bei der Qualität der Endlösung und erzielt bei 9 Aufgaben eine höhere BA-AUC. Umgekehrt gelesen gibt es eine Aufgabe, bei der seine BA-AUC nicht vorn liegt, und das Abstract nennt sie nicht.

Bei den 10 algorithmischen Optimierungsaufgaben von ALE-Bench-Lite liegt FrugalEvo im Mittel ebenfalls über denselben Vergleichsverfahren.

Das auffälligste Ergebnis betrifft das Kreispacken. Mit GPT-5.6 Terra und Luna betragen die Kosten 1,68 USD. Mit GLM-5.3 und seiner Flash-Variante sind es 0,55 USD. Beide Aufbauten gleichen alle Vergleichsverfahren aus oder übertreffen sie und setzen laut Arbeit einen neuen Bestwert für die Aufgabe. Zwei Vorbehalte gelten. Der „neue Bestwert“ ist die eigene Behauptung der Autoren und braucht eine unabhängige Reproduktion. Die 50 USD der Multi-Agenten-Methoden sind ein Mittelwert, und ob die Kostenrechnung zwischen den Methoden voll vergleichbar ist, hängt vom Versuchsaufbau im Haupttext ab.

Branchenwirkung und Ausblick

Der Wert dieser Arbeit liegt weniger in einer einzelnen Zahl als darin, dass sie die Kosten in die Bewertung selbst aufnimmt. Evolutionäre Programmsuche wird zunehmend für Algorithmenfindung, Systemabstimmung und Forschungsunterstützung genutzt. Kostet ein Experiment Dutzende Dollar, können es nur gut finanzierte Teams durchführen. Bei ein bis zwei Dollar können auch einzelne Forschende und kleine Teams vollständige Suchläufe starten.

Praktiker können drei Lehren ziehen. Eine Hierarchie aus starkem und günstigem Modell ist ein allgemeines Mittel zum Sparen, nicht nur in der evolutionären Suche. Die Stabilität der Präfixe in Prompts sollte von Anfang an eine Entwurfsvorgabe sein und keine späte Optimierung. Und wer ein automatisches Suchsystem beurteilt, sollte die Kostenkurve angeben, nicht nur den Endwert.

Die Grenzen sind klar. Zehn plus zehn Aufgaben sind eine bescheidene Stichprobe, und es ist offen, wie weit das Ergebnis auf offenere Probleme übertragbar ist. Das beste Modellpaar hängt von den aktuellen Preisen ab und kann sich mit ihnen ändern. Auch die BA-AUC-Werte hängen von der gewählten Budgetgrenze ab. Zu beobachten bleiben unabhängige Reproduktionen, weitere Aufgabentypen und die Frage, wie Information zwischen Strategiemodell und Umsetzungsmodell weitergegeben wird.

Sources

FAQ

Wie teilt FrugalEvo die Arbeit zwischen den Modellen auf?

Ein stärkeres, teureres LLM erkundet Lösungsstrategien. Ein günstigeres LLM setzt sie um und verfeinert den Code über mehrere Iterationen.

Was ist BA-AUC?

Die Fläche unter der Kurve der bisher besten Bewertung über den kumulierten LLM-Kosten, bis zum Budget. Sie belohnt einen hohen Endwert und das frühe Erreichen guter Werte.

Welche Kosten für das Kreispacken nennt das Abstract?

1,68 USD mit GPT-5.6 Terra und Luna sowie 0,55 USD mit GLM-5.3 und seiner Flash-Variante, gegenüber etwa 50 USD im Mittel bei Multi-Agenten-Methoden wie CORAL und SwarmResearch.