ProgRouter : Orchestration en ligne guidée par la progression des workflows multi-agents sous contrainte de compromis qualité-coût

Published 2026-08-26 · AI Daily — AI-assisted deep research, methodology & disclosure

Cet article traite du coût opérationnel élevé que les workflows multi-agents à grands modèles de langage (LLM) engendrent lors de la résolution de tâches ouvertes complexes. Les méthodes de routage en cascade ne prennent qu'une décision unique, au niveau de la requête, et ne s'adaptent pas à la nature dynamique et dépendante de l'état des workflows multiétapes, où le choix du LLM à chaque étape dépend de la progression évolutive de la tâche, de la difficulté restante et des exigences d'efficacité coûts. Les auteurs proposent ProgRouter, un cadre de routage en ligne guidé par la progression, qui sélectionne de façon adaptive les agents LLM à chaque étape du workflow pour maintenir la qualité de résolution tout en respectant les budgets de temps et de coût. Ses composants clés incluent un scoreur de progression de tâche à vues multiples combinant l'état des résultats du workflow à granularité grossière avec l'achèvement des sous-tâches, les tendances de progression et la qualité de l'état du workflow, ainsi qu'un prédicteur de progression à double chemin et un mécanisme de gate méta-adaptatif pour estimer le gain de progression de chaque LLM candidat. Les expériences sur des benchmarks tels que HumanEval Plus, MBPP, MATH-500 et ASQA montrent que ProgRouter réduit significativement le coût opérationnel par rapport aux bases de référence clés tout en conservant de fortes performances de tâche.

Contexte

Les workflows à multiples agents reposant sur de grands modèles de langage (LLM) sontvenus une référence pour résoudre des tâches complexes et ouvertes, en s'appuyant sur la raison commune entre agents spécialisés. Cette approche implique des invocations répétées du LLM et l'accumulation de contextes longs, ce qui fait grimper les coûts d'opération. La tension centrale que traite l'article est de maintenir, voire d'améliorer, la qualité de résolution tout en contrôlant les budgets de temps et de coût.

Les méthodes de routage en cascade ne prennent qu'une décision unique, au niveau de la requête, en considérant le routage comme un jugement ponctuel appliqué à l'ensemble du workflow. Cette approche statique ne peut pas s'adapter à la nature dynamique et dépendante de l'état des workflows multiétapes, où le choix du LLM à chaque étape dépend de la progression évolutive de la tâche, de la difficulté restante et des exigences d'efficacité coûts qui changent au fur et à mesure de l'avancement.

Analyse approfondie

Les auteurs proposent ProgRouter, un cadre de routage en ligne guidé par la progression, qui sélectionne de façon adaptative l'agent LLM le plus adapté à chaque étape du workflow, transformant le routage d'un jugement ponctuel statique en un processus d'orchestration dynamique s'ajustant continuellement à l'évolution de l'état de la tâche. La méthode repose sur la perception et la prédiction de la progression. Un scoreur de progression à vues multiples combine l'état des résultats du workflow à granularité grossière avec des signaux fins couvrant l'achèvement des sous-tâches, les tendances de progression et la qualité de l'état du workflow, produisant une représentation plus nuancée de la position actuelle de la tâche.

Après avoir obtenu cette représentation de la progression, le cadre emploie un prédicteur de progression à double chemin associé à un mécanisme de gate méta-adaptatif pour estimer le gain de progression que chaque LLM candidat pourrait apporter. La conception à double chemin signifie que la prédiction s'appuie sur plusieurs signaux plutôt qu'un seul, tandis que la gate adaptative pondère dynamiquement les chemins candidats selon l'état en temps réel.

ProgRouter prend ses décisions de routage étape par étape, de façon en ligne, arbitrant entre gain de progression, budget de temps de la tâche et efficacité coûts à long terme plutôt que de poursuivre l'optimalité à une seule étape. Cette unification des gains de court terme avec l'efficacité coûts à long terme est précisément ce qui le distingue des méthodes de routage ponctuelles. Le dispositif expérimental couvre plusieurs benchmarks représentatifs couvrant des types de tâches variés : HumanEval Plus et MBPP évaluent la génération de code par l'agent, MATH-500 teste le raisonnement mathématique, et ASQA cible la réponse aux questions de forme longue augmentée de recherche. Cette sélection inter-tâches garantit que les conclusions reflètent la généralité de ProgRouter à travers différents modes de raisonnement.

Impact sur l'industrie

L'approche de routage en ligne guidée par la progression offre un chemin pratique vers le déploiement à faible coût des workflows à multiples agents LLM. À mesure que les systèmes d'agents se généralisent dans les applications réelles, les coûts d'opération et les budgets de temps deviennent souvent des goulots d'étranglement au déploiement, et cette méthode montre qu'une perception fine de la progression associée à un routage dynamique peut comprimer substantiellement les frais sans perte de qualité significative.

Pour la communauté open source, elle fournit un paradigme de conception de cadre transférable qui fait passer le routage d'un jugement statique à une orchestration en ligne pilotée par un état évolutif. Pour le déploiement industriel, cette approche équilibrant qualité et coût aide à déployer des tâches multiétapes plus complexes et à long terme dans des scénarios réels. Pour la recherche ultérieure, la conception du scoreur à vues multiples, de la prédiction à double chemin et de la gate adaptative ouvre de nouvelles directions pour modéliser l'état de la tâche de façon plus granulaire et arbitrer en ligne entre gains de court terme et coûts à long terme.

Perspectives

Dans l'ensemble, ce travail déplace le focus des systèmes à multiples agents de l'amélioration pure de la performance vers une réflexion d'ingénierie pondérant equally performance et coût, portant une valeur heuristique notable. L'insistance de l'article sur les performances d'arbitrage relatives à travers plusieurs tâches plutôt que sur le surajustement à un ensemble de données spécifique signale une philosophie de conception visant la généralité. À mesure que les workflows d'agents deviennent plus complexes et à long terme en production, des cadres comme ProgRouter prenant des décisions de routage adaptativement dans le temps pourraient devenir de plus en plus importants pour maintenir la viabilité économique du déploiement.

La distinction entre l'état du workflow à granularité grossière et les signaux de sous-tâches fins suggère que des systèmes futurs pourraient affiner encore davantage l'estimation de la progression, tandis que le mécanisme de gate méta-adaptatif oriente vers une sélection de chemins plus flexible à mesure que les pools de LLM candidats s'élargissent.

Sources