Nejumi 4 — ALT (alignment)

일본어높을수록 좋음

Nejumi 4의 정렬 성능(ALT) 평균으로, 일본어로 지시 따르기, 윤리, 유해성, 편향, 사실성, 견고성 6개 영역을 같은 비중으로 평균합니다. 안전성만이 아니라 지시 따르기와 견고성까지 포함합니다. 점수는 0~100%입니다. 높을수록 좋습니다.

최고 점수91.8%Qwen3.6 Max
측정한 모델62개
최근 갱신2026.09.10
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 1
    Alibaba2026.04.27 · openrouter-reasoning
    91.8%
  2. 2
    Anthropic2026.06.09 · adaptive-thinking-max with fallback to Opus 4.8
    90.7%
  3. 3
    Alibaba2026.02.16 · reasoning-enabled
    90.7%
  4. 4
    Alibaba2026.04.27 · reasoning-enabled
    90.2%
  5. 5
    Moonshot AI2026.07.17 · reasoning-enabled
    90.1%
  6. 6
    OpenAI2026.03.05 · high-effort
    89.9%
  7. 7
    Anthropic2026.02.04 · extended-thinking
    89.9%
  8. 8
    Anthropic2025.08.05 · extended-thinking
    89.8%
  9. 9
    Upstage2026.07.22 · reasoning-enabled
    89.6%
  10. 10
    Anthropic2026.04.16 · adaptive-thinking-xhigh
    89.5%

"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.