jaster (0-shot)

日本語高いほど良い

日本のLLM-jpによる日本語NLP評価課題集(jaster:質疑応答、翻訳、自然言語推論、文法判断、常識、数学など20余りの課題)を、例示なし(0-shot)で解いたスコアの平均です。Nejumiの総合スコアにそのまま入る値ではなく、参考用の平均です。スコアは0〜100%です。高いほど良い結果です。

最高スコア88.0%GPT-5.5
測定したモデル62件
最終更新2026.09.10
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 1
    OpenAI2026.04.23 · xhigh-effort
    88.0%
  2. 2
    Anthropic2026.06.09 · adaptive-thinking-max with fallback to Opus 4.8
    87.8%
  3. 3
    Google2025.12.17
    87.6%
  4. 4
    Google2026.02.19
    87.6%
  5. 5
    Google2026.07.21
    87.6%
  6. 6
    Google2026.05.19
    87.5%
  7. 7
    OpenAI2026.07.09 · max-effort
    87.0%
  8. 8
    OpenAI2026.03.05 · xhigh-effort
    86.8%
  9. 9
    OpenAI2026.07.09 · max-effort
    86.6%
  10. 10
    Alibaba2026.04.27 · openrouter-reasoning
    86.1%

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。