CAFE : Les agents de recherche qui s'améliorent eux-mêmes nécessitent un retour d'information en co-évolution

Published 2026-08-25 · AI Daily — AI-assisted deep research, methodology & disclosure

Cet article explore un problème fondamental rencontré par les agents de recherche supervisés par résultat dans l'apprentissage par renforcement. Ces agents doivent apprendre quand et comment récupérer des preuves, or les récompenses terminales ne peuvent ni localiser les erreurs des étapes intermédiaires ni corriger une trajectoire en cours avant l'accumulation des erreurs. Les auteurs considèrent le retour d'information correctif comme une intervention intra-trajectoire apprise qui couple deux rôles : l'agent et le critique. L'agent doit décider quand demander et utiliser le retour d'information, tandis que le critique doit inférer des corrections utiles à partir de trajectoires dont les résultats sont confondus et dont les modes d'échec évoluent à mesure que l'agent s'améliore. À cet effet, ils proposent le framework CAFE (Coupled Agent-Feedback Evolution), qui utilise un modèle à paramètres partagés alternant entre les rôles d'agent de recherche et de critique. CAFE initialise la récupération conditionnée par le retour d'information à partir de trajectoires construites autour des propres échecs de l'agent de base, et couple l'optimisation en ligne et hors ligne. Lors de la phase d'apprentissage par renforcement en ligne, un écart de succès au niveau du prompt entre appel et omission façonne la récompense pour la demande de retour d'information, et une pondération par l'avantage du retour d'information ajuste l'avantage des tokens avant et après le retour d'information. Lors de la phase hors ligne, le retour d'information est appris à partir de trajectoires de succès et d'échec appariées. Sur sept benchmarks de recherche agentic, CAFE surpasse en moyenne les agents de recherche basés sur l'apprentissage par renforcement évalués, maintient ses gains sur six benchmarks hors domaine et réduit les hallucinations au niveau des réponses. Des ablations à un seul côté montrent qu'améliorer uniquement l'agent ou uniquement le critique tend à stagner, alors qu'alterner la mise à jour des deux produit une amélioration continue.

Contexte

Les agents de recherche supervisés par résultat apprennent à déterminer quand et comment récupérer des preuves, mais leur signal d'entraînement présente un défaut structurel. La récompense terminale ne note que la réponse finale : elle ne peut localiser les erreurs des étapes de recherche intermédiaires ni corriger une trajectoire en cours avant que ces erreurs ne s'accumulent. S'ouvre alors une large fenêtre d'échec silencieux durant le raisonnement où aucun signal correctif n'arrive jamais.

Les auteurs reformulent le retour d'information correctif comme une intervention intra-trajectoire apprise, couplant deux rôles : l'agent et le critique. L'agent décide quand demander et utiliser ce retour, tandis que le critique infère des corrections utiles à partir de trajectoires dont les résultats sont confondus. À mesure que l'agent s'améliore, la nature de ses erreurs change, et un critique statique devient rapidement désaligné par rapport aux besoins réels.

Analyse approfondie

CAFE, pour Coupled Agent-Feedback Evolution, utilise un modèle à paramètres partagés alternant entre les rôles d'agent de recherche et de critique. La récupération conditionnée par le retour d'information est initialisée à partir de trajectoires construites autour des propres échecs du modèle de base, afin que le signal cible directement les modes d'échec réellement rencontrés. L'exploration en ligne génère des trajectoires, l'optimisation hors ligne en extrait les préférences, formant une boucle unique.

Lors de la phase d'apprentissage par renforcement en ligne, une estimation comparative du retour d'information façonne la récompense de la demande : un écart de succès au niveau du prompt compare le taux de succès quand le retour est demandé à celui quand il est omis. Une pondération par l'avantage ajuste les avantages au niveau des tokens avant et après l'application du retour, distribuant le crédit plus précisément.

Lors de la phase hors ligne, le retour d'information est appris à partir de trajectoires de succès et d'échec appariées, dérivées des rollouts au moyen d'une optimisation de préférence. La boucle fermée évite le problème de récompense rare propre à la supervision terminale et permet une intervention corrective anticipée.

Impact sur l'industrie

CAFE a été évalué sur sept benchmarks de recherche agentic, comparé à des agents de recherche basés sur l'apprentissage par renforcement déjà évalués. En moyenne, il les surpasse et maintient ses gains sur six benchmarks hors domaine, signe qu'il ne s'adapte pas à une seule distribution de tâches. Il réduit par ailleurs les hallucinations au niveau des réponses, traduisant une meilleure cohérence entre recherche et raisonnement.

Les ablations à un seul côté expliquent pourquoi le couplage est nécessaire. Améliorer uniquement l'agent ou uniquement le critique tend à stagnuer, tandis qu'alterner la mise à jour des deux produit une amélioration continue. Cela confirme que le retour d'information et la stratégie doivent co-évoluer, toute optimisation ponctuelle atteignant tôt ou tard un plafond.

Perspectives

Le constat qu'une amélioration unlatérale s'arrête pendant qu'une mise à jour alternante poursuit ses progrès oriente les chercheurs vers la modélisation de la relation dynamique entre agent et critique plutôt que l'optimisation isolée des composants. Cela pose les fondations méthodologiques d'agents qui s'améliorent véritablement avec le temps.

À mesure que les agents combinant recherche et raisonnement se déploient dans la réponse aux questions, la recherche et le codage, la capacité de self-amélioration devient un défi central. CAFE propose un modèle réutilisable soutenant cette amélioration par des paramètres partagés et une optimisation couplée.

La stabilité observée sur les benchmarks hors domaine, associée à la réduction des hallucinations, renforce le cas d'un déploiement en conditions réelles où la fiabilité compte. L'étape suivante consistera à vérifier si la boucle de co-évolution résiste à plus grande échelle et sur des tâches agentic plus exigeantes.

Sources

FAQ

Qu'est-ce que CAFE et quel problème résout-il ?

CAFE couple agent de recherche et critique via un modèle à paramètres partagés qui alterne les rôles, afin que le retour d'information et la stratégie co-évoluent.

Pourquoi le retour d'information doit-il co-évoluer avec la stratégie ?

À mesure que l'agent s'améliore, ses échecs changent et un critique fixe se désaligne. Améliorer un seul côté stagne, tandis qu'alterner les deux améliore en continu.

Quelle est l'efficacité de CAFE et quelle est la prochaine étape ?

Sur sept benchmarks agentic, CAFE surpasse en moyenne les agents RL évalués, maintient ses gains sur six benchmarks hors domaine et réduit les hallucinations aux réponses.