PFN、翻訳特化LLM「plamo-3-translate」提供開始
- •PFN、翻訳特化LLM「plamo-3-translate」をPLaMo翻訳で提供開始
- •31Bモデル、DeepLに対し4評価で58.00〜87.00%の勝率
- •8Bモデルは前世代を複数指標で上回り、トークン効率も比較対象を上回る
Preferred Networks(PFN)は2026年10月7日、翻訳特化型の大規模言語モデル「plamo-3-translate」を翻訳サービス「PLaMo翻訳」で提供開始しました。PFNによると、このモデルは日英翻訳と多言語翻訳で世界最高クラスの性能を、既存の翻訳・LLM APIの数十分の一のコストで実現します。前世代のplamo-2-translateと比べ、学習トークン量とデータ合成に使った計算量を数百倍に増やしました。
PFNは自社開発の国産LLM「PLaMo」の第3世代を基盤に、翻訳に特化した学習を行いました。2025年に公開したplamo-2-translateは日英・英日翻訳が中心で、流暢な日本語を生成する一方、意訳が多く、情報の追加や欠落が起きる場合がありました。また、多言語能力にも課題がありました。新モデルでは翻訳データを集め直し、LLMによるデータ合成も使って学習データを高品質化しました。モデルの開発は継続中で、PFNは今後、モデル重みをHugging Faceに公開し、技術的な開発内容を紹介するブログ記事も出す予定です。
8Bモデルの比較では、plamo-3-translateは前世代のplamo-2-translateを複数の指標で上回りました。PFTBの英日スコアは0.447から0.547、日英は0.602から0.672に上昇し、PLaMo翻訳サービスの英日評価では0.430から0.571になりました。WMT24++の英日COMET-22スコアは0.882から0.879となり、ほぼ同水準でした。多言語評価のFLORES+では、日本語から多言語へのchrF++が39.28から43.40、多言語から日本語は29.90から31.04に向上しました。比較対象のTranslateGemma 27Bは8Bモデルの3倍以上の規模ですが、PFNの評価では新モデルが総合的にこれを上回りました。
多言語評価では、アラビア語、イタリア語、インドネシア語、英語、オランダ語、韓国語、スペイン語、タイ語、中国語の簡体字・繁体字、ドイツ語、フランス語、ベトナム語、ロシア語を対象にしました。さらに、ハンガリー語、ポーランド語、ヒンディー語、ペルシア語、ベンガル語、タガログ語、ヘブライ語、タミル語、ビルマ語、ウルドゥー語、マレー語、ネパール語、カタルーニャ語、マラヤーラム語、ブルガリア語、セルビア語、クロアチア語、スロバキア語、スロベニア語、シンハラ語、アゼルバイジャン語、ジョージア語、アルメニア語、ウズベク語、リトアニア語、クメール語、ラトビア語、エストニア語、バスク語、セブアノ語、ベラルーシ語、テルグ語、ジャワ語、カザフ語、マラーティー語、スワヒリ語、グジャラート語、パンジャブ語も学習に使いました。PFNは多言語間の翻訳も一定程度学習したと説明しています。
最大規模の31Bモデルは、PFNが2026年10月7日時点の公開単価を使って算出した比較で、日英翻訳の性能がほぼすべての比較対象の翻訳・LLM APIを上回りました。比較対象と比べ、コストはおおむね約1/30で、唯一性能を上回ったClaude Fable 5.1に対しては約1/85でした。多言語翻訳でもAPIの大半を上回るスコアを数十分の一のコストで達成したとしています。PLaMo翻訳はAPIを公開していないため、費用比較にはPLaMo APIの入力60円、出力250円/100万トークンという料金を仮置きしました。
参照訳に基づく評価に加え、PFNはGemini 3.1 Proを使い、plamo-3-translate 31BとDeepL翻訳、Google翻訳(Translation LLM)の訳文を比較しました。判定順を入れ替えて各サンプルを2回評価し、判定が分かれた場合は双方に0.5勝を付けました。31Bモデルの勝率はDeepLに対してPFTB英日87.00%、PFTB日英58.00%、サービス評価英日73.82%、WMT24++英日59.17%でした。Google翻訳に対しては同じ順に86.00%、71.00%、91.47%、70.62%でした。いずれの評価でも勝率は50%を上回り、PFNは特に日本語出力で差が大きかったと説明しています。
PFNは性能向上の要因として、PLaMoの学習データに占める日本語の割合が30%近いこと、翻訳に目的を絞った学習、大規模で高品質な翻訳データを挙げました。また、自社開発のトークナイザもコスト効率に寄与したとしています。PFTBの英日・日英各50件で測った1,000文字当たりの出力トークン数は、plamo-3-translateが日本語447、英語205でした。Claude Fable 5.1は日本語893、英語352、GPT-6 Astraは日本語744、英語224です。PFNによると、日本語出力のトークン効率はClaude Fable 5.1の約2倍で、同じトークン単価と生成速度なら、同じ文字数を出力するコストは約半分、文字数当たりの生成速度は約2倍になります。
翻訳例として、ビジネスメールでは「メールが行き違いになってしまい」など文脈に沿った丁寧な表現、小説では「彼女をひょいと抱え上げた」など自然な言い回し、特許文では「請求項:」から始まる文体を示しました。飲食店の紹介文では「pints」を単位名のまま残さず「ビール」と訳した例も掲載しました。PFNは、こうした文脈に応じた自然な文章はベンチマークに表れにくい強みだと述べています。
PLaMo翻訳では、ブラウザ拡張によるウェブページ翻訳、原文と訳文を左右に並べるレイアウト保持付きファイル翻訳、英文添削、デスクトップアプリを提供しています。新たに始めた会議翻訳は、日本語・英語・中国語など3言語の発話を自動判定し、他の言語へリアルタイムで翻訳します。期間限定の無料トライアルも申し込めます。