MRCR v2 (8-needle)
자주 인용높을수록 좋음
아주 긴 가상 대화 속에 거의 같은 요청(같은 주제의 시 여러 편 등) 8개를 숨겨 두고, '세 번째 것'처럼 특정 하나를 정확히 다시 써 내게 하는 긴 글 시험입니다. 구글 딥마인드의 MRCR v2이며, 모델마다 시험한 최대 길이가 달라 평균에 들어간 구간이 다릅니다. 점수는 0~100%입니다. 높을수록 좋습니다.
최고 점수88.1%Qwen3.6 Max
측정한 모델53개
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
순위모델실행 조건출시일가격/1M점수
- 1enabled2026.04.27$4.8888.1%
- 2max2026.07.09$1685.5%
- 3enabled2026.04.27$0.7883.5%
- 4high2026.08.13$383.0%

- 5xhigh2026.04.23$2479.8%
- 6max2026.07.24$2077.3%
- 7max2026.07.09$9.5076.6%
- 8enabled2026.02.16$2.8075.5%
- 9medium2026.08.12$573.6%
- 10high2026.07.21$373.3%

"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.