Ko-TruthfulQA

韓国語高いほど良い

人がよく誤解している内容を引き出すように作られたTruthfulQA型の質問を韓国語に訳し、多肢選択で解く試験です。もっともらしい誤答に引っかからないかを見ます。Horangiは全問題ではなく固定された100問だけを解かせるため、データセット全体で測ったスコアとは直接比較できません。スコアは0〜100%です。高いほど良い結果です。

最高スコア98.0%Claude Fable 5
測定したモデル48件
最終更新2026.08.03
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 1
    Anthropic2026.06.09 · high-effort
    98.0%
  2. 1
    Google2026.02.19 · high-effort
    98.0%
  3. 3
    OpenAI2026.04.23 · xhigh-effort
    96.0%
  4. 3
    Anthropic2026.05.27 · high-effort
    96.0%
  5. 3
    Anthropic2025.05.22 · high-effort
    96.0%
  6. 3
    Anthropic2025.09.29 · high-effort
    96.0%
  7. 7
    Anthropic2026.06.30 · high-effort
    95.0%
  8. 7
    Google2025.12.17 · high-effort
    95.0%
  9. 7
    Anthropic2025.11.24 · high-effort
    95.0%
  10. 7
    Alibaba2026.05.21
    95.0%

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。