IFEval-Ko
韓国語高いほど良い
長さ・キーワード・出力形式など、自動で確認できる条件付きの指示を守れるかを見る、GoogleのIFEvalの韓国語版です。厳格・緩やかな4つの基準の正答率を平均します。Horangiは全問題ではなく固定された100問だけを解かせるため、データセット全体で測ったスコアとは直接比較できません。スコアは0〜100%です。高いほど良い結果です。
最高スコア95.0%GPT-5.4
測定したモデル48件
最終更新2026.08.03
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
順位モデル実行条件リリース日価格/1Mスコア
- 1xhigh-effort2026.03.05$1295.0%
- 2xhigh-effort2026.04.23$2493.3%
- 32025.08.07$7.8192.9%
- 32026.03.15$3.3092.9%
- 5xhigh-effort2026.03.17$0.9992.5%
- 52026.07.08$592.5%
- 5xhigh-effort2026.03.17$3.5692.5%
- 8high-effort2025.12.17$2.3892.1%

- 9max-effort2026.07.09$1691.7%
- 102026.05.19$7.1391.3%

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。