Nejumi LLM Leaderboard 4

引用多め日本語高いほど良い

W&Bジャパンの日本語LLMランキング「Nejumi 4」の総合スコアで、日本語NLP課題集(jaster)、日本語MT-Bench、コーディング・関数呼び出し、偏り・事実性・有害性の試験など11領域を加重平均します。汎用性能と整合スコアの単純な平均ではありません。スコアは0〜100%です。高いほど良い結果です。

最高スコア87.2%Claude Opus 5
測定したモデル62件
最終更新2026.09.10
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 1
    Anthropic2026.07.24 · adaptive-thinking-max
    87.2%
  2. 2
    Anthropic2026.06.09 · adaptive-thinking-max with fallback to Opus 4.8
    87.0%
  3. 3
    Anthropic2026.05.27 · adaptive-thinking-xhigh
    85.2%
  4. 4
    Anthropic2026.04.16 · adaptive-thinking-xhigh
    85.1%
  5. 5
    OpenAI2026.07.09 · max-effort
    85.0%
  6. 6
    OpenAI2026.07.09 · max-effort
    84.4%
  7. 7
    Moonshot AI2026.07.17 · reasoning-max
    84.3%
  8. 8
    Google2026.02.19
    84.3%
  9. 9
    OpenAI2026.04.23 · xhigh-effort
    84.1%
  10. 10
    OpenAI2026.03.05 · high-effort
    84.0%

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。