AI使い比べAIを探すAIニュースAI活用法
会社紹介
個人情報保護方針利用規約FAQお問い合せお問い合わせ
エーアイビー株式会社事業者情報
© 2026 AIB Inc.

OpenMOSSがMOSS-TTS-Local-Transformer v1.5をSGLang-Omniで公開

OpenMOSSがMOSS-TTS-Local-Transformer v1.5をSGLang-Omniで公開

LMSYS·2026年6月19日 (金)
  • •OpenMOSSとSGLang-Omniチームは、音声モデル「MOSS-TTS-Local-Transformer v1.5」のエンドツーエンド配信を開始した。
  • •48kHzの音声合成モデルは、31言語、ボイスクローニング、最大10分の長文生成に対応する。
  • •コンテンツアドレス指定可能なキャッシュやCUDA Graphsなどの最適化により、内部テストでスループットが32.0%向上した。
  • •OpenMOSSとSGLang-Omniチームは、音声モデル「MOSS-TTS-Local-Transformer v1.5」のエンドツーエンド配信を開始した。
  • •48kHzの音声合成モデルは、31言語、ボイスクローニング、最大10分の長文生成に対応する。
  • •コンテンツアドレス指定可能なキャッシュやCUDA Graphsなどの最適化により、内部テストでスループットが32.0%向上した。

OpenMOSSチームとSGLang-Omniチームは、48kHzステレオ音声に対応したオープンソースのテキスト音声合成(TTS)モデル「MOSS-TTS-Local-Transformer v1.5」のエンドツーエンド配信を発表した。本モデルは31言語の多言語生成、ゼロショットボイスクローニング、発話時間制御、および最大10分までの長文生成をサポートしている。内部構造には、Qwen3-4Bの自己回帰バックボーンと20億パラメータのニューラルオーディオトークナイザーが採用されている。

本モデルの提供には、参照音声のエンコード、自己回帰生成、ステートフルなボコーダーデコーダーという複数のステージを跨ぐ処理が必要であり、特有の技術的課題が存在する。開発チームはこれらに対処するため、計算パターン、ステージ間のルーティング、各コンポーネントごとのGPUメモリ割り当てを個別に管理する3段階のパイプライン「SGLang-Omni」を実装した。

最適化の取り組みにより、パフォーマンス指標は大幅に改善した。参照音声に対してコンテンツアドレス指定可能なLRUキャッシュを導入したことで、16クライアントの同時実行条件下において、SeedTTSの英語評価でスループットが32.0%向上し、平均遅延が24.3%削減された。さらに、フレームローカルのサンプリングループとボコーダーステージでCUDA Graphsを活用したことで、起動オーバーヘッドが軽減されている。例えば、ボコーダーステージでは4フレームのストリーミングチャンクにおいて、eager実行と比較して2.20倍の高速化を達成した。

SeedTTS英語セット(1,088サンプル)を用いたエンドツーエンドのシステムテストでは、非ストリーミングモードで毎秒5.976リクエスト、単語誤り率(WER)1.75%を記録した。ストリーミングモードでは毎秒2.909リクエスト、WER 2.14%という結果であった。チームは今後、適応型ストリーミングスケジューリングや、プールネイティブなフレームCUDA Graphsの実装、さらに多くの言語および長文生成タスクへのベンチマーク拡大を計画している。

OpenMOSSチームとSGLang-Omniチームは、48kHzステレオ音声に対応したオープンソースのテキスト音声合成(TTS)モデル「MOSS-TTS-Local-Transformer v1.5」のエンドツーエンド配信を発表した。本モデルは31言語の多言語生成、ゼロショットボイスクローニング、発話時間制御、および最大10分までの長文生成をサポートしている。内部構造には、Qwen3-4Bの自己回帰バックボーンと20億パラメータのニューラルオーディオトークナイザーが採用されている。

本モデルの提供には、参照音声のエンコード、自己回帰生成、ステートフルなボコーダーデコーダーという複数のステージを跨ぐ処理が必要であり、特有の技術的課題が存在する。開発チームはこれらに対処するため、計算パターン、ステージ間のルーティング、各コンポーネントごとのGPUメモリ割り当てを個別に管理する3段階のパイプライン「SGLang-Omni」を実装した。

最適化の取り組みにより、パフォーマンス指標は大幅に改善した。参照音声に対してコンテンツアドレス指定可能なLRUキャッシュを導入したことで、16クライアントの同時実行条件下において、SeedTTSの英語評価でスループットが32.0%向上し、平均遅延が24.3%削減された。さらに、フレームローカルのサンプリングループとボコーダーステージでCUDA Graphsを活用したことで、起動オーバーヘッドが軽減されている。例えば、ボコーダーステージでは4フレームのストリーミングチャンクにおいて、eager実行と比較して2.20倍の高速化を達成した。

SeedTTS英語セット(1,088サンプル)を用いたエンドツーエンドのシステムテストでは、非ストリーミングモードで毎秒5.976リクエスト、単語誤り率(WER)1.75%を記録した。ストリーミングモードでは毎秒2.909リクエスト、WER 2.14%という結果であった。チームは今後、適応型ストリーミングスケジューリングや、プールネイティブなフレームCUDA Graphsの実装、さらに多くの言語および長文生成タスクへのベンチマーク拡大を計画している。

原文(英語)を読む·2026年6月17日
#tts#speech synthesis#voice cloning#sglang omni#cuda graphs