caveman: Token-Kosten von Coding-Agenten senken, indem man wie ein Höhlenmensch spricht
caveman ist ein Open-Source-Werkzeug für Coding-Agenten mit drei Teilen: einem Skill, der das Modell knapp antworten lässt, einem lokalen Proxy, der Werkzeugausgaben wie Logs und Diffs komprimiert und die Originale abrufbar hält, sowie einer Middleware für eigene Agenten. Die Behauptung, 65 Prozent der Token einzusparen, stammt aus Werbematerial. Ein A/B-Test von JetBrains mit 86 Aufgaben misst 8,5 Prozent weniger Ausgabe-Token ohne messbaren Qualitätsverlust. Die 33,2 Prozent weniger Eingabe-Token stammen aus dem eigenen Benchmark der Autoren.
Hintergrund und Problemdefinition
KI-Coding-Agenten rechnen nach Token ab. Jedes Token kostet Geld, und der Agent zahlt doppelt: für das, was er schreibt, und für das, was er liest. Das Schreiben ist die Antwort. Das Lesen sind alle Rückgaben der Werkzeuge: Logs, Testausgaben, JSON-Dateien, Diffs und Suchergebnisse. Beide Posten addieren sich auf der Rechnung. Das Projekt caveman von JuliusBrussee auf GitHub setzt an beiden Stellen an. Es begann im April 2026 als Scherz. Laut README stand es auf Platz eins bei Hacker News, und inzwischen hat das Repository über 109.000 Sterne. Diese Zahlen stammen vom Projekt selbst, und Beliebtheit beweist nicht, dass die Technik funktioniert. Das leisten Messungen, und um die geht es in diesem Artikel.
Das Problem lässt sich knapp fassen. Die meisten Agenten schreiben wie ein Bewerbungsschreiben und lesen wie ein Feuerwehrschlauch. Die erste Hälfte betrifft den Stil: Das Modell schiebt Einleitungen, Wiederholungen und Höflichkeitsfloskeln ein. Die zweite betrifft die Rohrleitung. Werkzeugausgaben sind roh, weitschweifig und für die konkrete Frage größtenteils überflüssig. Der Titel des README behauptet, das Projekt „spart 65 % der Token“. Diese Zahl stammt aus Werbematerial. Die vorhandenen Messungen sind enger gefasst, und eine davon stammt vom Projekt selbst. Dieser Artikel trennt sie voneinander, denn wer sie zusammenrechnet, überschätzt die Einsparung.
Kernarchitektur und technische Grundlagen
caveman besteht aus drei Komponenten, die sich einzeln installieren lassen. Der Skill ist eine Regeldatei. Sie weist den Agenten an, knapp und im Ton eines Höhlenmenschen zu antworten. Laut README funktioniert er mit über dreißig Agenten, darunter Claude Code, OpenAI Codex, Gemini CLI, Cursor und Windsurf. Der Installationsbefehl lautet `npx skills add JuliusBrussee/caveman -g`. Der Skill verändert nur die eigene Prosa des Modells und lässt die Werkzeugausgaben unberührt. Der Proxy läuft auf dem Rechner des Nutzers, zwischen Agent und Modellanbieter. Vor dem Versand einer Anfrage komprimiert er Werkzeugergebnisse wie Logs, JSON, Diffs und Testausgaben. Das Original wird Byte für Byte in einer lokalen SQLite-Datenbank abgelegt, versehen mit einem Wiederherstellungs-Handle. Braucht das Modell den vollständigen Text, ruft es das Werkzeug `caveman_retrieve` auf. Laut README reicht der Proxy die Authentifizierung unverändert durch, sodass der Anbieter die Zugangsdaten der Anfrage unverändert erhält.
Die Middleware richtet sich an Entwickler, die eigene Agenten bauen. Sie umhüllt einen einzelnen Aufruf in LangChain, dem Vercel AI SDK, dem OpenAI-Client oder dem Anthropic-Client. Große Werkzeugergebnisse werden vor dem Modell durch kürzere Fassungen ersetzt. Der Gesprächsverlauf behält jedes Original-Byte, sodass das Modell die vollständige Fassung nachlesen kann, wenn die kurze nicht reicht. Allen drei Komponenten liegt ein Grundsatz zugrunde: Die Komprimierung muss umkehrbar sein. Der verkürzte Text ist nur eine Ansicht, das Original bleibt über einen Verweis erreichbar. Das ist wichtig. Eine verlustbehaftete Zusammenfassung, die eine Heuristik auswählt, kann die eine Zeile entfernen, die das Modell gebraucht hätte, und zwar still. Die Umkehrbarkeit macht aus diesem stillen Fehler einen sichtbaren zusätzlichen Werkzeugaufruf. Auch die Aufteilung der Aufgaben ist aufschlussreich. Der Skill wirkt auf die Ausgabe, der Proxy auf die Eingabe, und die Middleware überträgt die Idee der Eingabekomprimierung in eigenen Code. Jede Komponente lässt sich allein übernehmen, sodass ein Team mit der günstigsten beginnen kann.
Praktische Bewertung und Anwendungen
Es gibt drei Zahlengruppen. Sie messen Verschiedenes und dürfen nicht zusammengerechnet werden. Die erste stammt von JetBrains. Das Labor führte einen gepaarten A/B-Test mit 86 realen Programmieraufgaben durch, mit Claude Code 2.1.200 und nur dem Skill. Der Proxy war nicht Teil des Tests. Die Ausgabe-Token sanken um 8,5 Prozent, die Kosten um etwa 10 Prozent. Der Vorzeichentest über die 18 Aufgaben, bei denen die beiden Arme voneinander abweichen, ergibt p = 0,82. Der mittlere Aufgabenwert sinkt von 0,326 auf 0,311, also um 0,015. Nach diesen Daten ändert sich die Qualität nicht messbar, die Ersparnis bleibt jedoch gering. Die zweite Quelle ist das CAVEWOMAN-Papier von Adobe Research, das das README zitiert. Es berichtet, dass ein Ausgabestil im Höhlenmenschen-Ton die realen Kosten je nach Modell auf das 1,4- bis 2,4-Fache senkt, im besten Fall auf das Dreifache. Die Zahlen stammen aus dem Papier. Dieser Artikel hat sie nicht nachvollzogen. Die dritte Quelle ist das Projekt selbst. Ein Benchmark mit 54 Läufen in Claude Code zeigt mit dem Proxy 33,2 Prozent weniger Eingabe-Token über sechs Arbeitslasten. Alle 18 Antwortprüfungen bestanden. Das 95-Prozent-Intervall reicht von 14,6 bis 48,5 Prozent. Das README räumt allerdings ein, dass die Rohdaten des Testaufbaus nicht im Repository liegen. Es handelt sich also um einen festgehaltenen Bericht und nicht um eine öffentliche Reproduktion. Die Autoren haben den Test selbst durchgeführt, und Leser sollten das bei der Bewertung berücksichtigen.
Zwei Punkte verdienen zusätzlich Beachtung. Erstens die Telemetrie: Die Kommandozeilen-Anwendung sendet Nutzungsstatistiken, darunter eine zufällige Installations-ID und die IP-Adresse, und zwar standardmäßig. Mit `caveman telemetry off` lässt sie sich abschalten. Der Skill allein sendet nichts. Teams mit Datenschutzvorgaben sollten das vor der Installation prüfen. Zweitens der Vergleich mit Headroom und RTK. Das README zitiert JetBrains-Daten, wonach RTK bei niedrigem Denkaufwand die mittleren Kosten pro Aufgabe um 7,6 Prozent erhöht. Das ist eine Aussage über einen Mitbewerber, aus einer fremden Messung übernommen. Wo passt das Werkzeug? Es eignet sich für Agentensitzungen mit hohem Volumen, in denen die Antwort routinemäßig ist und die Werkzeugausgaben groß sind. Log-Analyse, Fehlersuche in Tests und die Erkundung von Repositories gehören dazu. Schlecht geeignet ist es, wenn die Formulierung rechtliches, sicherheitsrelevantes oder produktbezogenes Gewicht hat. Das README erwähnt es selbst: Sicherheitswarnungen und Bestätigungsfragen kommen in vollständigen Sätzen zurück. Eine kürzere Antwort ist deshalb nicht automatisch die sicherere. Der sinnvolle Weg ist, vor der Einführung zu messen. Der Befehl `caveman trial` führt eine Sitzung mit und ohne caveman aus und zeigt die Differenz. Ein Prozentwert aus einer fremden Codebasis sagt wenig über die eigene aus.
Branchenwirkung und Ausblick
caveman hat vor allem die Diskussion verändert. Es hat eine Tatsache der Abrechnung sichtbar gemacht. Teams achten auf die Ausgabe-Token, weil das die Texte sind, die sie lesen. Das Projekt erinnert daran, dass das Lesen meist den größeren Teil der Rechnung ausmacht, und dass der Proxy genau dort ansetzt. Es zeigt auch, dass ein Scherz eine ernsthafte technische Idee tragen kann. Der Ton bleibt verspielt. Der Mechanismus darunter ist eine umkehrbare Komprimierungsschicht zwischen Modell und Werkzeugen. Diese Schicht ist nicht auf caveman beschränkt, und Konkurrenten wie Headroom und RTK verfolgen verwandte Ansätze.
Für die Praxis ergeben sich drei Lehren. Erstens: die eigene Arbeitslast messen, bevor man einem Prozentwert vertraut. Zweitens: die Komprimierung umkehrbar halten, denn ein verlustbehafteter Schnitt, der sich nicht zurücknehmen lässt, macht eine Modellentscheidung dauerhaft zum Verlust. Drittens: Qualität zusammen mit den Kosten verfolgen, denn eine Ersparnis, die Antworten verschlechtert, ist keine. Offen bleibt, ob die Komprimierung auf der Leseseite bei längeren Sitzungen, mehr Werkzeugen und größeren Codebasen standhält. Die veröffentlichten Daten stammen aus kurzen Programmieraufgaben und aus dem eigenen Benchmark des Projekts. Sie entscheiden diese Frage nicht. Eine unabhängige Reproduktion des Proxy-Ergebnisses wäre der nächste nützliche Schritt. Die Apache-2.0-Lizenz, die ab Version 3.0.0 das gesamte Repository umfasst, macht sie unkompliziert möglich.
Sources
FAQ
Was tut der Proxy mit den Originalen?
Er speichert sie Byte für Byte in einer lokalen SQLite-Datenbank und vergibt ein Wiederherstellungs-Handle. Das Modell kann sie mit dem Werkzeug caveman_retrieve abrufen.
Welche Quelle nennt 1,4- bis 2,4-fach geringere Kosten?
Das CAVEWOMAN-Papier von Adobe Research, das das README zitiert. Dieser Artikel hat die Werte nicht nachvollzogen.