SGLang、投機的デコーディング用DSparkを統合
- •SGLangが投機的デコーディングアルゴリズムDSparkを統合。動的で信頼度ベースの検証ウィンドウサイズ調整を採用した。
- •DSparkはCUDAグラフ内でラギッド検証を行い、可変長リクエストのパディングコストを削減してスループットを向上させる。
- •ベンチマークの結果、DeepSeek-V4-Pro環境のバッチサイズ1で383.7 tok/sを達成し、MTPベースラインを上回った。
SGLangチームは、LLMの推論効率化を目的として、同社のオープンソース推論エンジンに投機的デコーディング手法であるDSparkを統合した。DSparkは、トークンを個別に生成するのではなくブロック単位で生成する「ブロックベースのドラフター」と、リクエストごとの予測難易度に応じて検証トークン数を動的に調整する「信頼度ベースのスケジューラー」を活用する。推論の予測が困難なタスクに対しては検証予算を絞り込むことで、不要な計算負荷を抑えつつ高いスループットを維持する。
実装上の技術的工夫として、CUDAグラフ内での「ラギッド検証」を採用した。これは入力サイズが異なるリクエストをパディングなしで効率的に処理するための手法である。さらに、コストテーブルを用いたプロファイラーがステップ実行時間をオンラインで推定することで、バッチ全体の平均値ではなくリクエストごとに最適な検証予算を割り当てる。これにより、GSM8K(高受容率)、Arena-Hard(中)、詩的生成(低受容率)といった混在したワークロードでも、高いトークン利用率を維持しつつコストを削減できる。
DeepSeek-V4-FlashモデルをH200ハードウェア上でDP-attentionを用いて計測した結果、DSparkはMTP(投機的デコーディングのベースライン手法)や非投機的実行と比較して、優れたスループットとレイテンシのバランスを実現した。DeepSeek-V4-Proにてテンソル並列処理を8wayで適用し、バッチサイズ1で実行した場合、平均受容長約5トークンで383.7 tok/sを記録した。今回の統合はSGLangのオーバーラップスケジューラーとも完全互換性があり、フォワードパスの裏でスケジューリングを実行することでステップ間の待機時間を排除している。また、コンパクトスキャッターやラギッドウィンドウパッキングなどの操作には、最適化されたTritonカーネルを利用している。