AI使い比べAIを探すAIニュースAI活用法
会社紹介
個人情報保護方針利用規約FAQお問い合せお問い合わせ
エーアイビー株式会社事業者情報
© 2026 AIB Inc.

Microsoft、MoEモデルの推論を最適化するELDRを発表

Microsoft、MoEモデルの推論を最適化するELDRを発表

HuggingFace·2026年7月3日 (金)
  • •マイクロソフトの研究チームが、混合エキスパート(MoE)モデルの推論効率を向上させる手法「ELDR」を発表した。
  • •ELDRはエキスパートの署名を用いて予測を行い、リクエストを最適な推論サーバーへ効率的にルーティングする。
  • •40基のGPUによる検証で、標準的な手法と比較してトークンあたりの生成時間(TPOT)が5.9〜13.9%短縮された。
  • •マイクロソフトの研究チームが、混合エキスパート(MoE)モデルの推論効率を向上させる手法「ELDR」を発表した。
  • •ELDRはエキスパートの署名を用いて予測を行い、リクエストを最適な推論サーバーへ効率的にルーティングする。
  • •40基のGPUによる検証で、標準的な手法と比較してトークンあたりの生成時間(TPOT)が5.9〜13.9%短縮された。

マイクロソフトの研究者は、混合エキスパート(MoE)モデルの推論サービスにおける性能向上を目的とした新しいルーティング手法「ELDR(Expert-Locality-Aware Decode Routing)」を公開した。従来のMoEデプロイメントでは負荷分散のみを基準にワーカーを割り当てていたが、この手法では特定のモデルエキスパートの読み込みに伴う遅延を考慮できていないという課題があった。

ELDRはこの課題に対し、リクエストのプリフィル(前処理)段階でどのアクティブエキスパートが必要になるかを予測することで対処する。具体的には、リクエストからエキスパート署名を生成し、オフライン環境でK-meansクラスタリングを用いて署名空間をデコードワーカーへと分割する。実行時には、この署名に基づき最も効率的に処理できる負荷の低いワーカーへリクエストを誘導する。また、プレフィックスキャッシュの精度を維持するため、ブロック単位でKVキャッシュと連動した署名キャッシュを利用する仕組みを採用した。

最大40基のGPUを用い、3種類のMoEモデルと2つのワークロードで評価を実施した結果、ELDRは既存の4つの負荷分散ベースラインと比較して、中央値でのTPOT(1トークンあたりの生成時間)を5.9〜13.9%短縮した。本実装はvLLMに統合されており、モデルの出力精度を維持しつつ、実運用環境におけるメモリ帯域幅の最適化とキャッシュヒット率の向上を実現する。

マイクロソフトの研究者は、混合エキスパート(MoE)モデルの推論サービスにおける性能向上を目的とした新しいルーティング手法「ELDR(Expert-Locality-Aware Decode Routing)」を公開した。従来のMoEデプロイメントでは負荷分散のみを基準にワーカーを割り当てていたが、この手法では特定のモデルエキスパートの読み込みに伴う遅延を考慮できていないという課題があった。

ELDRはこの課題に対し、リクエストのプリフィル(前処理)段階でどのアクティブエキスパートが必要になるかを予測することで対処する。具体的には、リクエストからエキスパート署名を生成し、オフライン環境でK-meansクラスタリングを用いて署名空間をデコードワーカーへと分割する。実行時には、この署名に基づき最も効率的に処理できる負荷の低いワーカーへリクエストを誘導する。また、プレフィックスキャッシュの精度を維持するため、ブロック単位でKVキャッシュと連動した署名キャッシュを利用する仕組みを採用した。

最大40基のGPUを用い、3種類のMoEモデルと2つのワークロードで評価を実施した結果、ELDRは既存の4つの負荷分散ベースラインと比較して、中央値でのTPOT(1トークンあたりの生成時間)を5.9〜13.9%短縮した。本実装はvLLMに統合されており、モデルの出力精度を維持しつつ、実運用環境におけるメモリ帯域幅の最適化とキャッシュヒット率の向上を実現する。

原文(英語)を読む·2026年7月3日
インフラ#eldr#moe#vllm#tpot#load balancing#kv cache