MAI-Transcribe 2は、録音された音声を数十種類の言語で文字に書き起こすために開発された、Microsoftの音声認識専用モデルです。周囲の大きな雑音やさまざまな訛り(アクセント)、会話の途中で言語が切り替わる状況など、実際の生活で起こりがちな聞き取りにくい環境にも対応できるよう設計されています。実際の運用では、ノイズの混ざったカスタマーサービスの通話や展開の早い会議、医療の口述記録などを入力すると、話者を個別に識別し、個々の単語に正確な発話時刻(タイムスタンプ)を付けながら文字に起こします。また、独自の用語や業界のキーワードにも対応しているため、専門的な医学用語や技術用語も正確に書き起こせます。
このモデルは、通話分析の自動化、動画字幕の作成、または口述された音声の使いやすいメモへの変換を進める組織に適しています。論理的思考やプログラミング、画像生成に特化したモデルが揃うMicrosoftのMAIモデルシリーズの中で、MAI-Transcribe 2は高速でミスの少ない文字起こしと、高精度な自動言語検出に特化しています。