Ko-MTBench

韓国語高いほど良い

文章作成、ロールプレイ、推論、数学、コーディング、情報抽出、理工系、人文学の8分野80問に、2回続けて答える試験です。MT-Benchを韓国語と韓国文化に合わせて移し、AI審査員が1〜10点で付けた点数を10で割ります。スコアは0〜100%です。高いほど良い結果です。

最高スコア83.5%Motif 3
測定したモデル48件
最終更新2026.08.03
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 1
    Motif Technologies2026.08.10
    83.5%
  2. 2
    Google2025.12.17
    9.0%
  3. 2
    Google2026.05.19
    9.0%
  4. 2
    Anthropic2025.11.24 · high-effort
    9.0%
  5. 5
    Anthropic2026.02.17 · high-effort
    8.9%
  6. 6
    Anthropic2025.09.29 · high-effort
    8.9%
  7. 7
    Anthropic2026.06.30 · high-effort
    8.9%
  8. 7
    OpenAI2025.08.05 · high-effort
    8.9%
  9. 7
    Google2026.02.19 · high-effort
    8.9%
  10. 10
    Alibaba2026.05.21
    8.9%

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。