AI使い比べAIを探すAIニュースAI活用法
会社紹介
個人情報保護方針利用規約FAQお問い合せお問い合わせ
エーアイビー株式会社事業者情報
© 2026 AIB Inc.

CohereがTranscribeを公開

CohereがTranscribeを公開

Cohere·2026年9月21日 (月)
  • •Cohereが14言語対応の本番向け音声認識モデル、オープンソースのTranscribeを公開した
  • •TranscribeはHugging Face Open ASR Leaderboardで平均WER 5.42により#1となった
  • •2B ConformerモデルはHugging Face、Cohere API、Model Vaultで利用可能だ
  • •Cohereが14言語対応の本番向け音声認識モデル、オープンソースのTranscribeを公開した
  • •TranscribeはHugging Face Open ASR Leaderboardで平均WER 5.42により#1となった
  • •2B ConformerモデルはHugging Face、Cohere API、Model Vaultで利用可能だ
  • •Cohereが14言語対応の本番向け音声認識モデル、オープンソースのTranscribeを公開した
  • •TranscribeはHugging Face Open ASR Leaderboardで平均WER 5.42により#1となった
  • •2B ConformerモデルはHugging Face、Cohere API、Model Vaultで利用可能だ
  • •Cohereが14言語対応の本番向け音声認識モデル、オープンソースのTranscribeを公開した
  • •TranscribeはHugging Face Open ASR Leaderboardで平均WER 5.42により#1となった
  • •2B ConformerモデルはHugging Face、Cohere API、Model Vaultで利用可能だ

Cohereは、音声をテキストに変換する本番運用向けシステムとして、ダウンロード可能なオープンソースの自動音声認識モデルTranscribeを発表した。同社は、会議の文字起こし、音声分析、リアルタイムの顧客対応エージェントなど、AI対応ワークロードで音声が中核的なモダリティになりつつあると説明した。Cohereによると、このモデルは単語誤り率を最小化しながら、日常的な導入と本番環境での実用性を見据えてゼロから訓練された。

Cohere Transcribeはcohere-transcribe-03-2026として掲載され、Conformerベースのエンコーダ・デコーダ構成を採用する。入力は音声波形をlog-Melスペクトログラムに変換したもので、出力は文字起こしテキストだ。2Bモデルは、大規模なConformerエンコーダで音響表現を抽出し、軽量なTransformerデコーダでトークンを生成する。出力トークンに対する標準的な教師ありクロスエントロピーで訓練され、14言語に対応し、Apache 2.0ライセンスで公開された。対応言語は英語、フランス語、ドイツ語、イタリア語、スペイン語、ポルトガル語、ギリシャ語、オランダ語、ポーランド語、中国語(普通話)、日本語、韓国語、ベトナム語、アラビア語である。

Cohereによると、TranscribeはHugging FaceのOpen ASR Leaderboardで精度#1となり、平均単語誤り率は5.42%だった。Whisper Large v3、ElevenLabs Scribe v2、Qwen3-ASR-1.7Bを含む、オープンおよびクローズドソースの専用ASR代替モデルを上回ったという。リーダーボード表ではCohere Transcribeの平均WERが5.42で、AMI 8.13、Earnings 22 10.86、Gigaspeech 9.34、LS clean 1.25、LS other 2.37、SPGISpeech 3.08、Tedlium 2.49、Voxpopuli 5.87だった。他の平均WERはZoom Scribe v1が5.47、IBM Granite 4.0 1B Speechが5.52、NVIDIA Canary Qwen 2.5Bが5.63、Qwen3-ASR-1.7Bが5.76、ElevenLabs Scribe v2が5.83、Kyutai STT 2.6Bが6.40、OpenAI Whisper Large v3が7.44、Voxtral Mini 4B Realtime 2602が7.68と示された。

Cohereは、精度評価が複数話者環境、AMIデータセットを使った役員会議室風の音響、Voxpopuliデータセットによる多様なアクセントなど、実環境の音声タスクを対象にしていると述べた。訓練を受けた人間のレビュアーは、意味の保持、幻覚の回避、固有名詞の識別、適切な書式を伴う逐語的な文字起こしを含め、文字起こしの正確性、一貫性、使いやすさを評価した。ペアワイズ評価では、50%以上のスコアが、直接比較でCohere Transcribeが平均的に選好されたことを意味した。

Cohereは、Transcribeが本番利用に向けたスループットも重視していると述べた。本番環境では、遅延とリソース負荷がユーザー体験、運用効率、コストに影響するためだ。1B+パラメータのモデル群の中で、このモデルは低いWERを維持しながら高いRTFxを達成するという。RTFxは、音声モデルが入力を実時間に対してどれだけ速く処理するかを示すリアルタイム係数の倍率である。Radical Venturesのバイスプレジデントであるペイジ・ディッキー(Paige Dickie)は、テスト中に数分間の音声が数秒で使える文字起こしになったと述べた。

Cohereは、AIエージェントのオーケストレーション基盤であるNorthとのTranscribeの統合をさらに深め、文字起こしから企業向け音声インテリジェンスのより広い基盤へ広げる計画だとした。Transcribeは、ローカルまたはエッジ利用向けにHugging Faceで提供され、レート制限付きの無料実験向けにCohere APIからも利用できる。本番導入には、レート制限なしのModel Vaultが用意される。Model Vaultはインフラ管理なしで低遅延のプライベートクラウド推論を提供し、料金は時間インスタンス単位で計算され、長期契約向けの割引プランもある。

Cohereは、音声をテキストに変換する本番運用向けシステムとして、ダウンロード可能なオープンソースの自動音声認識モデルTranscribeを発表した。同社は、会議の文字起こし、音声分析、リアルタイムの顧客対応エージェントなど、AI対応ワークロードで音声が中核的なモダリティになりつつあると説明した。Cohereによると、このモデルは単語誤り率を最小化しながら、日常的な導入と本番環境での実用性を見据えてゼロから訓練された。

Cohere Transcribeはcohere-transcribe-03-2026として掲載され、Conformerベースのエンコーダ・デコーダ構成を採用する。入力は音声波形をlog-Melスペクトログラムに変換したもので、出力は文字起こしテキストだ。2Bモデルは、大規模なConformerエンコーダで音響表現を抽出し、軽量なTransformerデコーダでトークンを生成する。出力トークンに対する標準的な教師ありクロスエントロピーで訓練され、14言語に対応し、Apache 2.0ライセンスで公開された。対応言語は英語、フランス語、ドイツ語、イタリア語、スペイン語、ポルトガル語、ギリシャ語、オランダ語、ポーランド語、中国語(普通話)、日本語、韓国語、ベトナム語、アラビア語である。

Cohereによると、TranscribeはHugging FaceのOpen ASR Leaderboardで精度#1となり、平均単語誤り率は5.42%だった。Whisper Large v3、ElevenLabs Scribe v2、Qwen3-ASR-1.7Bを含む、オープンおよびクローズドソースの専用ASR代替モデルを上回ったという。リーダーボード表ではCohere Transcribeの平均WERが5.42で、AMI 8.13、Earnings 22 10.86、Gigaspeech 9.34、LS clean 1.25、LS other 2.37、SPGISpeech 3.08、Tedlium 2.49、Voxpopuli 5.87だった。他の平均WERはZoom Scribe v1が5.47、IBM Granite 4.0 1B Speechが5.52、NVIDIA Canary Qwen 2.5Bが5.63、Qwen3-ASR-1.7Bが5.76、ElevenLabs Scribe v2が5.83、Kyutai STT 2.6Bが6.40、OpenAI Whisper Large v3が7.44、Voxtral Mini 4B Realtime 2602が7.68と示された。

Cohereは、精度評価が複数話者環境、AMIデータセットを使った役員会議室風の音響、Voxpopuliデータセットによる多様なアクセントなど、実環境の音声タスクを対象にしていると述べた。訓練を受けた人間のレビュアーは、意味の保持、幻覚の回避、固有名詞の識別、適切な書式を伴う逐語的な文字起こしを含め、文字起こしの正確性、一貫性、使いやすさを評価した。ペアワイズ評価では、50%以上のスコアが、直接比較でCohere Transcribeが平均的に選好されたことを意味した。

Cohereは、Transcribeが本番利用に向けたスループットも重視していると述べた。本番環境では、遅延とリソース負荷がユーザー体験、運用効率、コストに影響するためだ。1B+パラメータのモデル群の中で、このモデルは低いWERを維持しながら高いRTFxを達成するという。RTFxは、音声モデルが入力を実時間に対してどれだけ速く処理するかを示すリアルタイム係数の倍率である。Radical Venturesのバイスプレジデントであるペイジ・ディッキー(Paige Dickie)は、テスト中に数分間の音声が数秒で使える文字起こしになったと述べた。

Cohereは、AIエージェントのオーケストレーション基盤であるNorthとのTranscribeの統合をさらに深め、文字起こしから企業向け音声インテリジェンスのより広い基盤へ広げる計画だとした。Transcribeは、ローカルまたはエッジ利用向けにHugging Faceで提供され、レート制限付きの無料実験向けにCohere APIからも利用できる。本番導入には、レート制限なしのModel Vaultが用意される。Model Vaultはインフラ管理なしで低遅延のプライベートクラウド推論を提供し、料金は時間インスタンス単位で計算され、長期契約向けの割引プランもある。

原文(英語)を読む·2026年3月26日
#cohere#transcribe#speech recognition#asr#word error rate#conformer#hugging face#model vault#open asr leaderboard