IFEval-Ko

韓国語高いほど良い

長さ・キーワード・出力形式など、自動で確認できる条件付きの指示を守れるかを見る、GoogleのIFEvalの韓国語版です。厳格・緩やかな4つの基準の正答率を平均します。Horangiは全問題ではなく固定された100問だけを解かせるため、データセット全体で測ったスコアとは直接比較できません。スコアは0〜100%です。高いほど良い結果です。

最高スコア95.0%GPT-5.4
測定したモデル48件
最終更新2026.08.03
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 1
    OpenAI2026.03.05 · xhigh-effort
    95.0%
  2. 2
    OpenAI2026.04.23 · xhigh-effort
    93.3%
  3. 3
    OpenAI2025.08.07
    92.9%
  4. 3
    Z.ai2026.03.15
    92.9%
  5. 5
    OpenAI2026.03.17 · xhigh-effort
    92.5%
  6. 5
    xAI2026.07.08
    92.5%
  7. 5
    OpenAI2026.03.17 · xhigh-effort
    92.5%
  8. 8
    Google2025.12.17 · high-effort
    92.1%
  9. 9
    OpenAI2026.07.09 · max-effort
    91.7%
  10. 10
    Google2026.05.19
    91.3%

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。