OpenRouter、モデルルーターのベンチマークを公開
- •OpenRouterが10月2日、複数分野でモデルルーターの品質・速度・コストを比較するベンチマークページを公開
- •GPT-6 Astraのトークン平均価格はDeepSeek v4 Flashの48倍超、Codexの平均10〜49ターンのセッション費用は21倍
- •Router Indexは品質60%、タスク所要時間20%、コスト20%を標準で重み付けし、各項目を0〜10点で評価
OpenRouterは2026年10月2日、複数分野におけるモデルルーターの性能を比較する「Model Router Benchmarks」ページを公開しました。品質、速度、コストを採点し、各分野でコスト効率や知能が最高水準の個別モデルも、ルーターと並べて基準として掲載しています。OpenRouterは今後、対象ルーターを追加し、スコアを更新するとしています。
OpenRouterは以前、最新モデルへの対応を続け、利用者が希望する価格帯に合わせる選択肢として、Auto RouterとFree Models Routerを導入しました。同社によると、市場の動向を示す情報を使って両者を改善してきました。近月には、異なるモデルの強みを活用するルーターも登場しています。たとえばGPT-6 Astraのトークン平均価格はDeepSeek v4 Flashの48倍を超え、Codexの平均10〜49ターンのセッションはGPT-6 Astraを使うと21倍の費用がかかります。ルーターはタスクの一部をより低価格のモデルに任せたり、法律調査やコーディングなど作業の種類に応じてモデルを切り替えたりできます。また、エージェントのセッションが複雑な計画から定型的な実行に移るのに合わせ、モデルや推論の労力を調整することもあります。
一方、OpenRouterは、ルーティングによって性能が下がる場合もあると説明しています。モデルを切り替えると入力キャッシュを作り直すためリクエストが高くつき、プロンプトからタスクの複雑さが読み取れないこともあります。セッションの進行状況を示す情報が次の工程を誤って予測する可能性があり、ルーティングの判断処理自体も遅延を加えます。このベンチマークページは、利用者が自分のニーズに合うルーターとモデルの組み合わせを選ぶためのものです。プロバイダールーティングは、価格、速度、稼働率、データ方針などの希望に応じて推論プロバイダーを選び、障害時には別のプロバイダーに切り替えます。モデルルーティングはリクエストに回答するモデルを選び、単一または複数のモデルを使えます。
評価対象には、複数モデルを組み合わせるUnbiasedのParetoとSakanaのFuguが含まれます。両者は使用モデルや切り替え頻度を公表せず、標準化されたトークン単価を課します。ターンごとに選択する方式にはJev Routerがあり、選ばれたモデルを公開し、その標準料金を課します。NVIDIAのSwitchyardは、エージェントの作業中に、あらかじめ組み合わせた低価格モデルと高性能モデルを切り替えます。OpenRouterは、個別モデルの別名であるPareto Codeや「-latest」形式のモデル名、および複数モデルの回答を組み合わせるFusionも挙げていますが、これらの特殊な方式は評価対象外です。Router Indexは各ベンチマークを0〜10点で評価し、標準設定では品質を60%、タスク当たりの所要時間を20%、コストを20%の割合で重み付けします。利用者は重みを変更できます。OpenRouterによると、結果は一般的なタスクを対象としており、掲載されたルーターは同社のサービス、アプリ、実行環境、またはAPIから利用できます。