SuperWhisper、オフライン対応のS1-miniを公開
- •SuperWhisperが、オフラインで文字起こしを整える596百万パラメーターのオープンウェイトモデル「S1-mini」を公開
- •英語の7,519件でトークン精度94.8%、テキスト編集エラー率11.6%を記録
- •S1-Voiceは8つのベンチマークで平均単語誤り率6.8%、試験した15モデル中で最低を記録
SuperWhisperは2026年8月19日、音声文字起こし向けのS1モデル群を公開しました。クラウド用の音声文字起こしモデル「S1-Voice」、指示に従って文字起こしを整えるクラウドモデル「S1-Language」、オフラインで文字起こしを整える「S1-mini」の3種類です。S1-miniは596百万個の固有パラメーターを持つオープンウェイトモデルで、GPUやネット接続なしにノートパソコンのCPUで動作します。小文字で句読点のない音声認識結果を、話者の発言内容を保ったまま読みやすい文章にします。内容の追加や事実訂正、罵 profな表現の緩和、話題の検出、方言の書き換えは行わないと説明されています。
学習に使っていない104件の文字起こしからなる英語7,519件の評価では、S1-miniはトークン精度94.8%、テキスト編集エラー率11.6%でした。メール形式の出力では、挨拶行を99.3%、結びの言葉を97.9%の割合で正しく識別しました。ループや途中切れが見られた生成は1%未満で、フィラー音だけの入力に空文字列を返した割合は98.6%でした。利用者は文体、構成、文脈の3つを個別に設定でき、形式ばった表現にするか、文章か箇条書きにするか、一般向けかメール形式にするかなどを選びます。箇条書きには実際の項目が少なくとも3つ必要です。
S1-miniはQwen3-0.6Bをファインチューニングしており、既定で「思考モード」を有効にするチャットテンプレートを引き継いでいます。このモデルは思考モードを無効にして訓練され、学習データに推論過程を含まないため、設定で「enable_thinking=False」を指定する必要があります。指定しないと、使える出力が得られないまま処理されます。モデルカードが定める学習時のシステムプロンプトも必要で、文言を変えると出力品質が下がるとされています。決定的な生成方法が推奨されており、「do_sample=False」は既定の貪欲デコードに一致します。
記事は、文字起こしの整形に使われる汎用チャットモデルや、より大きなローカルモデルと比べ、S1-miniは小型で用途を絞った設計によりノートパソコンのCPUで無理なく動き、この作業で大きなモデルと同等以上の性能を示すと説明しています。音声を未編集の文字起こしに変換するS1-Voiceは別モデルで、SuperWhisperが試した15モデルのうち最も低い成績となる平均単語誤り率6.8%を、8つのベンチマークで記録しました。LibriSpeechでの単語誤り率は2.2%でした。S1-Languageは会議メモの構成など、より個別化した整形に使うクラウドモデルです。オフライン利用ではS1-miniとローカル音声認識エンジン、クラウド利用ではS1-LanguageとS1-Voiceを組み合わせる方法を推奨しています。
llama.cpp、Ollama、LM Studioで小規模に導入する場合、記事は完全精度のBF16重みより、量子化したGGUF版を推奨し、精度への影響はごくわずかだとしています。ライセンスはApache 2.0で、使用する場所ではモデル名「S1-mini」と「Superwhisper」を正確に表示する追加条件があります。商用利用の前にライセンスを確認するよう記事は勧めています。