Ko-TruthfulQA
韓国語高いほど良い
人がよく誤解している内容を引き出すように作られたTruthfulQA型の質問を韓国語に訳し、多肢選択で解く試験です。もっともらしい誤答に引っかからないかを見ます。Horangiは全問題ではなく固定された100問だけを解かせるため、データセット全体で測ったスコアとは直接比較できません。スコアは0〜100%です。高いほど良い結果です。
最高スコア98.0%Claude Fable 5
測定したモデル48件
最終更新2026.08.03
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
順位モデル実行条件リリース日価格/1Mスコア
- 1high-effort2026.06.09$4098.0%
- 1high-effort2026.02.19$9.5098.0%

- 3xhigh-effort2026.04.23$2496.0%
- 3high-effort2026.05.27$2096.0%
- 3high-effort2025.05.22$6096.0%
- 3high-effort2025.09.29$1296.0%
- 7high-effort2026.06.30$895.0%
- 7high-effort2025.12.17$2.3895.0%

- 7high-effort2025.11.24$2095.0%
- 72026.05.21$3.6995.0%
「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。