OmniRoute : passerelle d'IA libre MIT, 358 fournisseurs, 1 200+ modèles et compression de jetons

Published · AI Daily — AI-assisted deep research, methodology & disclosure

OmniRoute, passerelle d'IA MIT, relie Claude Code, Codex et Cursor à 358 fournisseurs, dont 150+ gratuits. Elle estime 1,62 Md de jetons gratuits par mois, avec 19 stratégies de routage, repli automatique et compression RTK plus Caveman.

OmniRoute est une passerelle d'IA sous licence MIT, publiée par diegosouzapw. Son discours est direct : permettre à des outils de programmation comme Claude Code, Codex, Cursor, Cline, Copilot et Antigravity d'atteindre 358 fournisseurs de modèles (le titre du dépôt annonce 359 fournisseurs et plus de 1 200 modèles) par un seul point d'accès. Plus de 150 d'entre eux proposent un palier gratuit, et la passerelle bascule automatiquement vers le suivant quand un quota est épuisé. Le chiffre mis en avant est d'environ 1,62 milliard de jetons gratuits par mois, pour un coût de départ nul. Un nombre aussi grand appelle la prudence : il faut d'abord lire comment il est construit avant de décider de son poids.

Le README est plus mesuré que sa bannière. Le projet recense 489 entrées de paliers gratuits, regroupées en 35 clés de pools récurrents. Le chiffre principal ne somme que les 17 pools qui publient un budget mensuel positif, plus cinq plafonds par modèle chez Groq, et il déduplique par pool partagé : chaque pool compte une seule fois. Les quotas qui ne s'ouvrent qu'après une vérification d'identité régionale, aujourd'hui ModelScope pour environ 6 millions de jetons, sont présentés à part et jamais ajoutés au total. Le premier mois peut atteindre environ 2,22 milliards avec les crédits d'inscription. La barre de budget nomme les gros postes : Mistral avec 1 milliard, Nara avec 210 millions, LLM7 et xKiro avec 150 millions chacun, et Groq avec 30 millions répartis sur cinq plafonds. Treize fournisseurs sont marqués « à éviter » dans un catalogue de risques contractuels, et l'utilisateur tranche. Les auteurs affirment aussi réauditer les chiffres toutes les deux semaines, dans les deux sens. Cette transparence est l'apport réel : la difficulté des paliers gratuits n'est pas de les trouver, mais de voir ce que l'on possède vraiment.

Côté routage et coût, OmniRoute propose 19 stratégies de routage et change de fournisseur automatiquement quand un quota amont est épuisé ou qu'un appel échoue. Il empile aussi deux couches de compression, RTK et Caveman, et annonce 15 à 95 % de jetons économisés, soit environ 89 % en moyenne. La compression a lieu dans la passerelle, donc l'outil en amont n'a rien à modifier. Ce chiffre demande de la prudence : la moyenne de 89 % est déclarée par le projet, et le gain réel dépend de la charge. Les sorties d'outils répétées, les journaux longs et le contexte standardisé se compressent bien. Le raisonnement dense sur du code et les descriptions de tâches nouvelles se compressent beaucoup moins. Mieux vaut y voir une référence haute et la mesurer sur ses propres sessions. Le problème d'ingénierie est réel : chaque fournisseur parle son propre dialecte, s'authentifie à sa façon et limite le trafic selon sa règle, par minute, par jour ou par modèle. La passerelle doit réduire ces différences à une seule surface d'appel et retenir ce qu'il reste dans chaque pool et quand il se réinitialise. Les stratégies de routage permettent de choisir le prochain saut selon la latence, le coût, le quota restant ou la capacité du modèle, au lieu de s'en remettre au hasard. Le repli automatique transforme un échec en nouvelle tentative interne : l'outil de programmation voit un succès un peu lent. Pour des tâches d'agents de longue durée, c'est plus utile que la promesse de disponibilité d'un fournisseur isolé, car une coupure en cours de route oblige souvent à reconstruire tout le contexte.

Sur le plan de l'architecture, le projet fait de la passerelle un plan de contrôle pour les agents de programmation. Leur usage est particulier : sessions longues, appels d'outils fréquents, contexte rejoué sans cesse, forte pression sur les quotas, et limites de débit atteintes au pire moment. Une couche intermédiaire qui comprend les quotas et les écarts de protocole, et qui change de route sans bruit, sort la question « quel modèle appeler » des réglages de chaque outil pour la gérer en un seul endroit. Le développeur ne garde plus une douzaine de clés et de règles par outil : il a un point d'accès et un tableau de bord, y compris la vue en direct sur /dashboard/free-tiers. La licence MIT permet de l'héberger soi-même et de l'auditer, ce qui compte pour un composant qui voit les prompts.

Les risques se concentrent au même endroit. D'abord, les conditions des paliers gratuits peuvent changer à tout moment : quand un fournisseur durcit sa politique, les flux qui en dépendent sont touchés aussitôt, et le projet reconnaît lui-même que les chiffres bougent. Ensuite, les prompts contiennent souvent du code source et du contexte interne ; les faire transiter par des dizaines de tiers rend le chemin des données bien plus complexe qu'avec un fournisseur unique. Enfin, une fois les clés et les règles de routage réunies, la passerelle devient une cible de valeur et doit être exploitée comme un service de production. Une posture pragmatique consiste à l'utiliser sur des projets open source ou non sensibles, à router les dépôts sensibles vers ses propres fournisseurs ou des fournisseurs payants de confiance, et à surveiller la page de quotas en direct.

Dans le paysage du secteur, OmniRoute illustre une division du travail en train de se former. Les fournisseurs de modèles se concurrencent sur la capacité et le prix, tandis que « bien utiliser de nombreux fournisseurs » devient une couche d'infrastructure à part entière. Les paliers gratuits servaient d'abord à acquérir des clients ; une fois agrégés de façon systématique, ils forment un réservoir de calcul public que l'on peut planifier. C'est surtout précieux pour les étudiants, les développeurs indépendants et les petites équipes, car cela abaisse le coût d'expérimentation des flux d'agents. C'est aussi un rappel : la durabilité des quotas gratuits dépend des choix commerciaux des fournisseurs, et plus la couche d'agrégation réussit, plus ils risquent d'ajuster les règles. La bonne lecture consiste donc à voir OmniRoute comme une fenêtre d'observation et un modèle d'ingénierie transposable, pas comme une promesse de calcul gratuit éternel. Ce qui reste utile à une équipe, c'est la surveillance des quotas, la logique de repli et la politique de routage intégrées à sa propre pile, des compétences qui servent quelle que soit l'évolution des paliers gratuits, y compris avec des fournisseurs payants.

Sources

FAQ

Le chiffre de 1,62 milliard de jetons gratuits par mois est-il crédible ?

Il est plus prudent que la bannière. Le projet recense 489 entrées en 35 pools, ne compte que 17 pools avec un budget mensuel positif publié plus cinq plafonds Groq par modèle, et déduplique les pools partagés. Les quotas soumis à une vérification d'identité régionale, comme ModelScope (environ 6 millions), sont à part. Le chiffre est réaudité toutes les deux semaines et varie dans les deux sens : c'est une estimation, pas une garantie.

La compression RTK plus Caveman économise-t-elle vraiment 89 % des jetons ?

Les 89 % sont une moyenne déclarée par le projet, dans une fourchette de 15 à 95 %. Les sorties d'outils répétées, les longs journaux et le contexte standard se compressent bien, le raisonnement dense sur du code beaucoup moins. Mesurez sur vos propres sessions et lisez la moyenne comme une borne haute.

Est-il sûr de faire transiter des prompts de code par de nombreux fournisseurs gratuits ?

Il y a un risque. Les prompts contiennent souvent du code source, leur passage par de nombreux tiers complique le chemin des données, et une passerelle qui stocke des clés devient une cible de valeur. Réservez-la aux projets open source ou non sensibles, envoyez les dépôts sensibles vers vos fournisseurs ou des fournisseurs payants de confiance, et hébergez et auditez vous-même le code MIT.