Ko-MTBench
韓国語高いほど良い
文章作成、ロールプレイ、推論、数学、コーディング、情報抽出、理工系、人文学の8分野80問に、2回続けて答える試験です。MT-Benchを韓国語と韓国文化に合わせて移し、AI審査員が1〜10点で付けた点数を10で割ります。スコアは0〜100%です。高いほど良い結果です。
最高スコア83.5%Motif 3
測定したモデル48件
最終更新2026.08.03
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
順位モデル実行条件リリース日価格/1Mスコア
- 12026.08.10—83.5%

- 22025.12.17$2.389.0%

- 22026.05.19$7.139.0%

- 2high-effort2025.11.24$209.0%
- 5high-effort2026.02.17$128.9%
- 6high-effort2025.09.29$128.9%
- 7high-effort2026.06.30$88.9%
- 7high-effort2025.08.05$0.408.9%
- 7high-effort2026.02.19$9.508.9%

- 102026.05.21$3.698.9%
「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。