jaster (0-shot)

일본어높을수록 좋음

일본 LLM-jp의 일본어 NLP 평가 과제 모음(jaster: 질의응답, 번역, 자연어 추론, 문법 판단, 상식, 수학 등 20여 과제)을 예시 없이(0-shot) 푼 점수의 평균입니다. Nejumi 종합 점수에 그대로 들어가는 값은 아니고 참고용 평균입니다. 점수는 0~100%입니다. 높을수록 좋습니다.

최고 점수88.0%GPT-5.5
측정한 모델62개
최근 갱신2026.09.10
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 1
    OpenAI2026.04.23 · xhigh-effort
    88.0%
  2. 2
    Anthropic2026.06.09 · adaptive-thinking-max with fallback to Opus 4.8
    87.8%
  3. 3
    Google2025.12.17
    87.6%
  4. 4
    Google2026.02.19
    87.6%
  5. 5
    Google2026.07.21
    87.6%
  6. 6
    Google2026.05.19
    87.5%
  7. 7
    OpenAI2026.07.09 · max-effort
    87.0%
  8. 8
    OpenAI2026.03.05 · xhigh-effort
    86.8%
  9. 9
    OpenAI2026.07.09 · max-effort
    86.6%
  10. 10
    Alibaba2026.04.27 · openrouter-reasoning
    86.1%

"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.