MRCR v2 (8-needle)

자주 인용높을수록 좋음

아주 긴 가상 대화 속에 거의 같은 요청(같은 주제의 시 여러 편 등) 8개를 숨겨 두고, '세 번째 것'처럼 특정 하나를 정확히 다시 써 내게 하는 긴 글 시험입니다. 구글 딥마인드의 MRCR v2이며, 모델마다 시험한 최대 길이가 달라 평균에 들어간 구간이 다릅니다. 점수는 0~100%입니다. 높을수록 좋습니다.

최고 점수88.1%Qwen3.6 Max
측정한 모델53개
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 1
    Alibaba2026.04.27 · enabled
    88.1%
  2. 2
    OpenAI2026.07.09 · max
    85.5%
  3. 3
    Alibaba2026.04.27 · enabled
    83.5%
  4. 4
    Google2026.08.13 · high
    83.0%
  5. 5
    OpenAI2026.04.23 · xhigh
    79.8%
  6. 6
    Anthropic2026.07.24 · max
    77.3%
  7. 7
    OpenAI2026.07.09 · max
    76.6%
  8. 8
    Alibaba2026.02.16 · enabled
    75.5%
  9. 9
    xAI2026.08.12 · medium
    73.6%
  10. 10
    Google2026.07.21 · high
    73.3%

"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.