claude-mem: Eine Kompressionsschicht für persistentes Agenten-Gedächtnis

Published · AI Daily — AI-assisted deep research, methodology & disclosure

claude-mem zeichnet während einer Sitzung die Beobachtungen zur Werkzeugnutzung eines Agenten auf, verdichtet sie per KI zu semantischen Zusammenfassungen und spielt beim Start der nächsten Sitzung nur den relevanten Teil ein. Der Agent beginnt so nicht mehr bei null. Das Projekt hat rund 96.000 Sterne und unterstützt Hosts wie Claude Code, OpenClaw, Codex, Gemini und OpenCode. Die Kompression kann über den eigenen Observer, einen OpenRouter- oder Gemini-Schlüssel oder ein Anthropic-Abo laufen. Das README bietet keine reproduzierbare Bewertung: im eigenen Repository testen und den Verbleib sensibler Daten prüfen.

Hintergrund und Problemstellung

Programmier-Agenten teilen eine strukturelle Schwäche: Endet die Sitzung, ist der Kontext weg. Ein Entwickler erklärt dem Agenten eine Stunde lang den Aufbau eines Repositorys, die Fallstricke des Builds und die Abwägungen hinter einem Entwurf. Am nächsten Morgen beginnt der Agent bei null. Die üblichen Abhilfen haben alle ihren Preis. Eine handgeschriebene Anweisungsdatei wie CLAUDE.md hängt davon ab, dass jemand sie pflegt, und sie veraltet. Wer den gesamten Chatverlauf erneut einspielt, füllt das Kontextfenster schnell und verbraucht Token. claude-mem zielt auf diese Lücke. Das Werkzeug bewahrt, was ein Agent getan hat, über Sitzungen hinweg und spielt in die nächste Sitzung nur den relevanten Teil ein.

Das Projekt wird von thedotmack betreut und hat rund 96.000 GitHub-Sterne. Zu den Themen zählen ai-memory, long-term-memory, chromadb, sqlite, rag und claude-code-plugin. Laut README begann es als System zur Kompression persistenten Gedächtnisses für Claude Code. Heute nennt es OpenClaw, Codex, Gemini, Hermes, Copilot und OpenCode als Hosts und bietet zudem Installationen für Grok Bot, Antigravity CLI und OMP. Ein Vorbehalt gleich zu Beginn: Dieser Beitrag stützt sich auf das README und die Metadaten des Repositorys. Der Autor hat das Werkzeug weder eingesetzt noch einen Benchmark ausgeführt. Jede Aussage über die Interna bleibt daher auf das beschränkt, was das README sagt.

Architektur und technische Prinzipien

Das README beschreibt eine Schleife aus drei Schritten: erfassen, komprimieren, einspielen. Zuerst zeichnet das System während der Sitzung Beobachtungen zur Werkzeugnutzung auf. Dann verdichtet es diese Rohdaten mithilfe von KI zu semantischen Zusammenfassungen. Schließlich stellt es beim Start einer neuen Sitzung dem Agenten den passenden komprimierten Kontext bereit. Die Themen des Repositorys nennen sqlite und chromadb. Das legt strukturierte Datensätze in SQLite und semantische Suche in einem Vektorspeicher nahe, ein verbreiteter Hybridentwurf. Tabellenschema und Ranking-Strategie lassen sich aus dem README-Auszug nicht bestätigen, dieser Teil bleibt also eine Annahme.

Der zweite Entwurfspunkt ist die Anbindung an den Host. Bei Hosts mit Hooks, etwa Claude Code, registriert das Installationsprogramm die Plugin-Hooks und startet einen Worker-Dienst. Dieser Dienst übernimmt Beobachtung und Kompression im Hintergrund und blockiert die Hauptsitzung nicht. Für Hosts ohne Hooks überwacht das Werkzeug laut README stattdessen die Chat-Logdateien. Als Beispiel wird Grok Bot genannt. Das ist eine pragmatische Anpassung, die keine Ereignisschnittstelle des Hosts braucht. Der Preis: Das Log wird erst im Nachhinein gelesen, Aktualität und Struktur hängen also vom Logformat ab.

Der dritte Punkt betrifft die Frage, wer komprimiert. Das README listet mehrere Gedächtnis-Anbieter auf: den projekteigenen claude-mem Observer, einen eigenen OpenRouter- oder Gemini-Schlüssel oder das Anthropic-Abonnement. Ein lokaler Beobachter wird mit --provider host ausdrücklich gewählt. Das legt einen versteckten Kostenpunkt offen. Gedächtnis zu komprimieren heißt, ein Sprachmodell aufzurufen, und dieser Aufruf wird entweder mit dem Kontingent des Abonnements oder mit Geld bei einem Dritten bezahlt.

Praktische Bewertung und Anwendungen

Der Installationsweg ist kurz. Der allgemeine Befehl lautet npx claude-mem install. Mit --ide opencode, --ide antigravity, --ide omp oder --ide grok-bot wählt man den Host. In Claude Code führt man /plugin marketplace add thedotmack/claude-mem aus, dann /plugin install claude-mem, und startet neu. Das README warnt vor einer bestimmten Falle: npm install -g claude-mem installiert nur das SDK und die Bibliothek. Es registriert keine Hooks und startet den Worker-Dienst nicht. Man muss das npx-Installationsprogramm oder die Plugin-Befehle verwenden. Auch der Kontoablauf verdient Aufmerksamkeit. Standardmäßig schließt das Installationsprogramm die Einrichtung ab und bittet dann um eine Anmeldung im Browser per E-Mail-Magic-Link. Die Anmeldung schaltet eine 14-tägige kostenlose Testphase des claude-mem Observers frei. Nach Ablauf fällt das Gedächtnis auf Ihr Anthropic-Abonnement zurück, sofern Sie nicht abonnieren. Um die Anmeldung zu umgehen, übergibt man ein explizites --provider, setzt CLAUDE_MEM_ONLINE_OPTIN=false oder arbeitet in CI oder in einer nicht interaktiven Shell. Ein Team mit Datenschutz- oder Compliance-Pflichten sollte diese Wahl bewusst bei der Einführung treffen und die Voreinstellung nicht einfach hinnehmen.

Das README beschreibt außerdem einen Pilotversuch namens Awareness Push. Beobachtungen, die als wichtig eingestuft werden, mit den Typen decision, bugfix, security_alert und sensitive, werden als datierte Zeilen an ein Monatslog von Grok Bot angehängt. Die Funktion lässt sich mit CLAUDE_MEM_GROK_BOT_AWARENESS_ENABLED=false abschalten. Bei der Kategorie sensitive ist Vorsicht geboten: Inhalte dieses Typs landen in einer Logdatei, und Nutzer sollten Schwärzung und Dateirechte selbst prüfen. Das ehrliche Fazit lautet, dass das README keinen reproduzierbaren Vergleich liefert. Es ist unbekannt, wie oft die Kompression ein wichtiges Detail verliert, wie oft sie eine falsche Schlussfolgerung festigt und wie gut die Suche trifft. Vor dem Einsatz sollte man im eigenen Repository einen kleinen Versuch fahren und Aufgabenqualität sowie Token-Verbrauch mit und ohne Gedächtnis vergleichen.

Branchenwirkung und Ausblick

Eine Sternzahl nahe 100.000 zeigt, dass sitzungsübergreifendes Gedächtnis zu den stärksten Bedürfnissen in der Werkzeugkette der Agenten gehört. Schlagwörter wie mem0, supermemory und openmemory zeigen zugleich ein überfülltes Feld. Das Unterscheidungsmerkmal von claude-mem ist die Breite der unterstützten Hosts. Es legt eine einzige Gedächtnisschicht unter viele Agenten, statt sich an ein Produkt zu binden. Das spricht Teams an, die mehrere Programmier-Agenten nutzen, weil Erfahrung zwischen den Werkzeugen wandern kann.

Die Risiken sind ebenso klar. Erstens wird eine Gedächtnisschicht zu einer neuen Vertrauensgrenze: Sie liest jedes Werkzeugergebnis, und darin können Geheimnisse und privater Code stecken. Zweitens werfen gehostete Voreinstellungen die Frage des Datenflusses auf: Nutzer müssen prüfen, welche Teile über einen Drittdienst laufen. Drittens ist die Kompression verlustbehaftet, und eine falsche Zusammenfassung wird immer wieder wie eine Tatsache eingespielt. Wahrscheinliche nächste Schritte sind prüfbare Gedächtniseinträge, Gedächtnis, das Nutzer bearbeiten und löschen können, und öffentliche Benchmarks. Bis dahin sollte man claude-mem als ein Werkzeug behandeln, das den Versuch und die Prüfung lohnt, und nicht als ausgereifte Infrastruktur.

Sources

FAQ

Warum aktiviert npm install -g claude-mem die Gedächtnisfunktion nicht?

Laut README installiert dieser Befehl nur das SDK oder die Bibliothek. Er registriert keine Plugin-Hooks und startet den Worker-Dienst nicht. Man nutzt npx claude-mem install oder führt in Claude Code /plugin marketplace add thedotmack/claude-mem und /plugin install claude-mem aus und startet neu.

Wer führt die Gedächtniskompression aus, und was kostet sie?

Das README nennt den claude-mem Observer (14 Tage kostenlos, danach Rückfall auf das Anthropic-Abonnement, sofern man nicht abonniert), einen eigenen OpenRouter- oder Gemini-Schlüssel oder das Anthropic-Abonnement. Die Kompression ruft ein Sprachmodell auf, die Kosten entstehen also aus dem Abo-Kontingent oder bei einem Dritten.

Wie erfasst es Daten bei Hosts ohne Hooks?

Das README nennt Grok Bot als Beispiel: Ohne Host-Hooks überwacht das Werkzeug die Chat-Logdateien. Eine Ereignisschnittstelle ist nicht nötig, doch das Lesen geschieht nachträglich, die Aktualität hängt also vom Logformat ab.