Nejumi LLM Leaderboard 4
引用多め日本語高いほど良い
W&Bジャパンの日本語LLMランキング「Nejumi 4」の総合スコアで、日本語NLP課題集(jaster)、日本語MT-Bench、コーディング・関数呼び出し、偏り・事実性・有害性の試験など11領域を加重平均します。汎用性能と整合スコアの単純な平均ではありません。スコアは0〜100%です。高いほど良い結果です。
最高スコア87.2%Claude Opus 5
測定したモデル62件
最終更新2026.09.10
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
順位モデル実行条件リリース日価格/1Mスコア
- 1adaptive-thinking-max2026.07.24$2087.2%
- 2adaptive-thinking-max with fallback to Opus 4.82026.06.09$4087.0%
- 3adaptive-thinking-xhigh2026.05.27$2085.2%
- 4adaptive-thinking-xhigh2026.04.16$2085.1%
- 5max-effort2026.07.09$1685.0%
- 6max-effort2026.07.09$9.5084.4%
- 7reasoning-max2026.07.17$1184.3%
- 82026.02.19$9.5084.3%

- 9xhigh-effort2026.04.23$2484.1%
- 10high-effort2026.03.05$1284.0%
「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。