MRCR v2 (8-needle)
よく引用高いほど良い
非常に長い架空の会話の中にほぼ同じ依頼(同じテーマの詩を何編か、など)を8つ隠し、「3番目のもの」のように特定の1つを正確に書き出させる長文の試験です。Google DeepMindのMRCR v2で、モデルごとに試した最大の長さが違うため、平均に含まれる区間も異なります。スコアは0〜100%です。高いほど良い結果です。
最高スコア88.1%Qwen3.6 Max
測定したモデル53件
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
順位モデル実行条件リリース日価格/1Mスコア
- 1enabled2026.04.27$4.8888.1%
- 2max2026.07.09$1685.5%
- 3enabled2026.04.27$0.7883.5%
- 4high2026.08.13$383.0%

- 5xhigh2026.04.23$2479.8%
- 6max2026.07.24$2077.3%
- 7max2026.07.09$9.5076.6%
- 8enabled2026.02.16$2.8075.5%
- 9medium2026.08.12$573.6%
- 10high2026.07.21$373.3%

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。