Fortunate Recall : cycle de vie de la mémoire LLM piloté par l'ontologie

Published 2026-09-09 · AI Daily — AI-assisted deep research, methodology & disclosure

Face au problème des systèmes de mémoire LLM traitant tous les faits personnels de manière égale, provoquant une expansion mémoire non bornée et un déclin de la précision de récupération, cet article présente Fortunate Recall (FR), une couche de stratégie composable. FR classe les faits personnels en 10+1 ontologies comportementales et applique des stratégies de cycle de vie spécifiques à chaque catégorie—décái temporel différentiel, remplacement de clé de slot, validité temporelle d'événement et routage de récupération sensible à la catégorie—implémentées comme fonctions déterministes sur les fonctions méta extraites par LLM. FR-Bank, indépendant de l'infrastructure, atteint 76,9% sur le nouveau benchmark LifecycleBench de 516 questions de désambiguïsation temporelle, dépassant Mem0, A-MEM, Memory-R1 et MemoryOS (61%–70,5%), et 75,2% sur LongMemEval-S selon le protocole standard de Wu et al., montrant que les stratégies de cycle de vie imposent un coût négligeable à la récupération standard. Les ab attribuent les gains aux méta-données génériques pour la exactitud et aux ontologies comportementales pour la calibration, divisant par deux l'hallucination aval, reproduit sur les poids ouverts Kimi K2.5.

Contexte

Les systèmes de mémoire des grands modèles de langage présentent une faille structurelle qui limite leur fiabilité dans le temps. Les architectures actuelles traitent chaque fait personnel fourni par l'utilisateur comme également important, sans distinguer les catégories de faits ni prendre en compte leur validité temporelle. Les bases de mémoire s'accumulent sans limite, et la précision de récupération se dégrade à mesure que le corpus grandit. Les auteurs identifient la gestion du cycle de vie comme le problème central : décider quelles mémoires persistent à long terme, lesquelles doivent être remplacées, à quel rythme, et conditionné par le type comportemental de chaque fait.

L'article présente Fortunate Recall (FR), une couche de stratégie composable comblant cette lacune. FR classe les faits personnels dans une ontologie comportementale de dix plus une catégories, distinguant les faits valables en continu de ceux ne tenant que dans des fenêtres d'événements spécifiques. Chaque catégorie reçoit des stratégies de cycle de vie sur mesure plutôt qu'une règle universelle unique. Cela fait basculer la mémoire d'un conteneur de stockage passif vers un système autorégulant, dont les décisions de conservation et de rejet reposent sur la sémantique des faits plutôt que sur l'ordre chronologique seul.

Analyse approfondie

FR applique quatre stratégies de cycle de vie spécifiques à chaque catégorie, toutes implémentées comme fonctions déterministes sur les fonctions méta extraites par le LLM. La décroissance temporelle différentielle permet à certains faits de s'estomper lent tandis que d'autres expirent rapidement une fois leur fenêtre d'événement close. Le remplacement de clé de slot permet aux nouveaux faits d'écraser automatiquement les enregistrements plus anciens occupant le même sémantique, évitant l'accumulation au sein d'un seul slot. La validité temporelle d'événement lie certains faits à des intervalles de validité explicites afin qu'ils soient naturellement éliminés après expiration. Le routage de récupération sensible à la catégorie oriente les requêtes vers les grappes de mémoire les plus pertinentes selon le appariement catégoriel.

L'implementation indépendante de l'infrastructure, FR-Bank, permet à ces stratégies de se déployer sur différents backends de stockage. Sur le LifecycleBench nouvellement construit, un benchmark de 516 questions de désambiguïsation temporelle évaluant le jugement sur les conflits chronologiques et les mises à jour de faits, FR-Bank atteint un taux de réussite de 76,9 %. Il dépasse Mem0, A-MEM, Memory-R1 et MemoryOS, qui marquent entre 61 % et 70,5 %. Sur LongMemEval-S selon le protocole standard de Wu et al., FR-Bank atteint 75,2 %, indiquant que les stratégies de cycle de vie imposent un coût négligeable à la récupération standard.

Une ablation pré-enregistrée localise précisément les sources de gain. Le remplacement de la couche sensible aux types par trois primitives de cycle de vie génériques n'a produit aucun changement statistiquement significatif de précision, de -1,7 points de pourcentage, avec un intervalle de confiance à 95 % de -6,0 à +2,7. Les méta-données de cycle de vie génériques portent l'avantage de justesse, tandis que l'ontologie comportementale fournit principalement une calibration, divisant par deux l'hallucination aval de 24,2 % à 12,0 % avec un p inférieur à 0,001. En bout en bout, FR-Bank réduit le taux d'hallucination de Mem0 de 45,1 % à 22,4 % pour les requêtes répondues et de 32,2 % à 13,0 % pour toutes les requêtes, tout en élevant la proportion de questions répondues correctement de 18,6 % à 31,2 %.

Impact sur l'industrie

L'article propose un paradigme architectural transférable pour les systèmes de mémoire à long terme, reformulant la gestion de mémoire comme une gouvernance active du cycle de vie plutôt qu'un stockage passif. La conception infrastructure-agnostic de FR-Bank abaisse les barrières d'adoption industrielle en s'intégrant sans couture sur différents backends de stockage. Découpler l'ontologie comportementale des stratégies de cycle de vie permet aux chercheurs d'optimiser indépendamment la justesse et la calibration, offrant une direction claire pour le travail ultérieur.

Les auteurs publient en source ouverte l'ontologie, les benchmarks et le code. Le LifecycleBench et le BEAM nouvellement construits fournissent des outils d'évaluation standardisés pour la désambiguïsation temporelle, un problème longtemps négligé, susceptible d'attirer l'attention de la communauté vers la ponctualité de la mémoire. Réduire l'hallucination de 45,1 % à 22,4 % chez Mem0 pointe directement vers un chemin clé pour améliorer la fiabilité dans les déploiements réels.

Perspectives

Le classement se reproduit sur les poids ouverts Kimi K2.5, validant l'approche à travers les familles de modèles. Sur le benchmark BEAM indépendamment construit, l'approche de décomposition montre sa transférabilité, avec 46,8 % de justesse sur 280 questions contre 32,9 % pour Mem0.

Les gains de l'ontologie se concentrent sur la résolution des contradictions et se saturent à mesure que le système approche six grappes de stratégies. Ces résultats suggèrent que la gestion du cycle de vie deviendra un composant standard des architectures de mémoire, l'ontologie comportementale apportant des avantages de calibration dépassant les gains bruts de précision vers des améliorations de fiabilité mesurables dans les systèmes de production.

Sources

FAQ

Quel problème fondamental Fortunate Recall (FR) vise-t-il à résoudre dans les systèmes de mémoire des LLM ?

FR s'attaque au problème des systèmes de mémoire des LLM qui traitent tous les faits personnels de manière égale, entraînant une croissance infinie et une baisse de la précision de récupération.

Comment FR gère-t-il le cycle de vie de la mémoire des LLM, et quelles sont ses principales stratégies ?

FR classe les faits en 10+1 ontologies comportementales et applique des stratégies comme la dégradation temporelle, le remplacement de clés, la validité événementielle et le routage de récupération catégoriel.

Quelles sont les implications potentielles de Fortunate Recall pour le développement futur des LLM ?

FR propose une architecture transférable qui transforme la mémoire passive en gouvernance active, réduisant les hallucinations et augmentant la fiabilité des LLM en applications réelles.