MRCR v2 (8-needle)

よく引用高いほど良い

非常に長い架空の会話の中にほぼ同じ依頼(同じテーマの詩を何編か、など)を8つ隠し、「3番目のもの」のように特定の1つを正確に書き出させる長文の試験です。Google DeepMindのMRCR v2で、モデルごとに試した最大の長さが違うため、平均に含まれる区間も異なります。スコアは0〜100%です。高いほど良い結果です。

最高スコア88.1%Qwen3.6 Max
測定したモデル53件
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 1
    Alibaba2026.04.27 · enabled
    88.1%
  2. 2
    OpenAI2026.07.09 · max
    85.5%
  3. 3
    Alibaba2026.04.27 · enabled
    83.5%
  4. 4
    Google2026.08.13 · high
    83.0%
  5. 5
    OpenAI2026.04.23 · xhigh
    79.8%
  6. 6
    Anthropic2026.07.24 · max
    77.3%
  7. 7
    OpenAI2026.07.09 · max
    76.6%
  8. 8
    Alibaba2026.02.16 · enabled
    75.5%
  9. 9
    xAI2026.08.12 · medium
    73.6%
  10. 10
    Google2026.07.21 · high
    73.3%

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。