OmniRoute:MIT ライセンスの AI ゲートウェイ、358 社・1200 超のモデルとトークン圧縮

Published · AI Daily — AI-assisted deep research, methodology & disclosure

OmniRoute は MIT ライセンスの AI ゲートウェイで、Claude Code、Codex、Cursor などを単一のエンドポイントから 358 社につなぎ、うち 150 社超が無料枠を持つ。共有プールの重複を除き月約 16.2 億トークンと試算し、19 のルーティング戦略、自動フォールバック、RTK と Caveman の圧縮(自己申告で平均約 89% 削減)を備える。

OmniRoute は diegosouzapw が公開している MIT ライセンスの AI ゲートウェイである。主張は明快で、Claude Code、Codex、Cursor、Cline、Copilot、Antigravity といったコーディングツールを、単一のエンドポイント経由で 358 社のモデルプロバイダー(リポジトリのタイトルは 359 社、1200 以上のモデルと記す)につなぐ。そのうち 150 社以上が無料枠を持ち、クォータが尽きると自動で次のプロバイダーへ切り替わる。見出しの数字は月間およそ 16.2 億の無料トークンで、始めるコストはゼロとうたう。大きな数字ほど疑ってかかるべきなので、まず算出方法を読み、その重みを判断したい。 README の説明は、宣伝バナーよりずっと抑制が利いている。プロジェクトは 489 件の無料枠エントリを整理し、35 の継続プールのキーにまとめている。見出しの数字に入るのは、月間予算が公開され正の値を持つ 17 のプールと、Groq のモデル別上限 5 件だけで、共有プールは重複を除き一度しか数えない。地域の本人確認を通らないと開かない枠、現時点では ModelScope の約 600 万トークンは別枠で示し、見出しには足さない。初月は登録クレジットを加えると約 22.2 億に達する。予算バーに名前が挙がる大きな項目は、Mistral の 10 億、Nara の 2.1 億、LLM7 と xKiro の各 1.5 億、Groq の 5 件合計 3000 万である。さらに 13 社は規約リスクのカタログで「避ける」と印が付き、利用の判断は利用者に委ねられる。数字は 2 週間ごとに再監査され、増えることも減ることもあると明記されている。この透明性こそが本当の貢献だと考える。無料枠の難しさは見つけることより、手元に何があるかを見通すことにある。

ルーティングとコストの面では、19 種類のルーティング戦略を備え、上流のクォータ切れや失敗の際に自動でプロバイダーを切り替える。さらに RTK と Caveman の二層の圧縮を重ね、トークンを 15 パーセントから 95 パーセント、平均で約 89 パーセント節約するとしている。圧縮はゲートウェイの内部で行われ、上流のツール側に変更は要らない。ただしこの数字は慎重に読む必要がある。平均 89 パーセントは自己申告であり、実際の効果は負荷の種類で変わる。繰り返されるツール出力や長いログ、定型的な文脈はよく縮むが、密度の高いコード推論や新規の要件記述はあまり縮まない。平均値は上限の目安とし、自分の実セッションで測るのが確実である。節約以前に、工学上の課題も現実的だ。プロバイダーごとにインターフェースの方言、認証方式、レート制限の規則が異なり、分単位、日単位、モデル単位と基準もばらばらである。ゲートウェイはこの差を一つの呼び出し面に畳み込み、各プールの残量とリセット時刻を覚えておく必要がある。ルーティング戦略を使えば、遅延、コスト、残りクォータ、モデル能力に基づいて次の経路を決められ、運に任せずに済む。自動フォールバックは失敗を内部の再試行に変え、上位のツールからは少し遅い成功に見える。長時間動くエージェントのタスクでは、途中で止まると文脈を最初から組み直すことになるため、これは個別の稼働率の約束よりも実用的である。

アーキテクチャの観点では、このプロジェクトはゲートウェイをコーディングエージェントの制御面に押し上げている。エージェントの使い方は特殊で、セッションが長く、ツール呼び出しが多く、文脈が繰り返し再送され、クォータへの圧力が強い。しかも最悪のタイミングでレート制限に当たりやすい。クォータとプロトコル差を理解し、失敗時にも静かに経路を替えられる中間層があれば、「どのモデルを呼ぶか」という問いを各ツールの設定から切り出して一か所で管理できる。開発者はツールごとに十数個の鍵とレート規則を抱える代わりに、一つのエンドポイントと一つのダッシュボードを見ればよい。/dashboard/free-tiers のリアルタイム表示もその一部だ。MIT ライセンスのおかげで自前運用と監査が可能で、プロンプトを扱う部品として重要な点である。

リスクも同じ場所に集まる。第一に、無料枠の規約はいつでも変わり得る。ベンダーが方針を締めれば、それに依存するワークフローはすぐ影響を受け、プロジェクト自身も数字が動くことを認めている。第二に、プロンプトにはソースコードや社内の文脈が含まれることが多く、数十の第三者を経由させると、単一ベンダーの場合よりデータ経路がはるかに複雑になる。第三に、鍵とルーティング設定が一か所に集まれば、ゲートウェイ自体が価値の高い標的になるため、本番サービスとして運用すべきである。現実的な方針は、オープンソースや機密性の低いプロジェクトで使い、機密性の高いリポジトリは自前または信頼できる有料プロバイダーへ向け、ライブのクォータ表示を見続けることである。 業界の文脈では、OmniRoute は形成されつつある分業を映している。モデルベンダーは能力と価格で競い、「多数のベンダーをうまく使う方法」が独立したインフラ層になりつつある。無料枠はもともと顧客獲得の手段だったが、体系的に集約されると、スケジュール可能な公共の計算プールに変わる。学生、個人開発者、小規模チームにとっては、エージェントのワークフローを試す敷居が下がる点で意義が大きい。一方で、無料クォータの持続性はベンダーの商業判断に左右され、集約層が成功するほど、ベンダーがルールを見直す可能性も高まる。したがって OmniRoute は、永久に無料という約束ではなく、観察の窓であり持ち運べる設計パターンとして読むのが妥当だ。チームに長く残る価値は、クォータ監視、フォールバックの論理、ルーティング方針を自社の基盤に取り込むことである。この力は無料枠がどう変わっても色あせず、有料プロバイダーにも応用できる。

Sources

FAQ

月約 16.2 億の無料トークンという数字は信頼できますか。

宣伝文句よりは慎重な算出です。489 件の無料枠を 35 のプールにまとめ、月間予算が公開された 17 プールと Groq のモデル別上限 5 件だけを数え、共有プールは重複を除きます。地域の本人確認が要る枠(ModelScope の約 600 万など)は別枠です。数字は 2 週間ごとに再監査され増減するため、保証ではなく目安として扱ってください。

RTK と Caveman の圧縮で本当に平均 89% 節約できますか。

89% は自己申告の平均で、幅は 15% から 95% です。繰り返しのツール出力や長いログはよく縮み、密度の高いコード推論はあまり縮みません。自分のセッションで測り、平均は上限の目安と考えてください。

コードを含むプロンプトを多数の無料プロバイダー経由にして安全ですか。

リスクがあります。プロンプトにはソースコードが含まれやすく、多数の第三者を経由するとデータ経路が複雑になり、鍵を集約するゲートウェイは狙われやすくなります。オープンソースや機密性の低い案件で使い、機密リポジトリは自前か信頼できる有料プロバイダーへ向け、MIT のコードを自前運用して監査してください。