Ko-ARC-AGI

韓国語高いほど良い

格子パズルの例から変換規則を見つけて新しい入力の答えを描くARC-AGIの問題を、韓国語の指示で解く試験です。出力の格子が大きさも値も完全に一致して正解です。ARC Prizeの公式スコアとは比較できません。Horangiは全問題ではなく固定された100問だけを解かせるため、データセット全体で測ったスコアとは直接比較できません。スコアは0〜100%です。高いほど良い結果です。

最高スコア97.0%GPT-5.6 Terra
測定したモデル48件
最終更新2026.08.03
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 1
    OpenAI2026.07.09 · max-effort
    97.0%
  2. 1
    OpenAI2026.07.09 · max-effort
    97.0%
  3. 3
    Anthropic2026.06.09 · high-effort
    96.0%
  4. 4
    OpenAI2026.03.05 · xhigh-effort
    95.0%
  5. 5
    OpenAI2026.04.23 · xhigh-effort
    93.0%
  6. 6
    Google2026.02.19 · high-effort
    92.0%
  7. 7
    Motif Technologies2026.08.10
    90.9%
  8. 8
    Google2026.05.19
    89.9%
  9. 9
    Anthropic2026.06.30 · high-effort
    85.0%
  10. 10
    xAI2026.07.08
    84.0%

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。