CursorBench

인용 많음높을수록 좋음

코딩 도구 Cursor가 실제 사용 기록에서 모은 과제로, 여러 파일에 걸친 모호한 작업(코드 이해, 버그 찾기, 수정, 리팩터링, 코드 리뷰 등)을 AI 코딩 에이전트가 해냅니다. Cursor가 자사 제품 과제로 직접 운영하며, 판이 바뀌면 점수를 서로 비교할 수 없습니다. 점수는 0~100%입니다. 높을수록 좋습니다.

최고 점수57.8%Claude Opus 5.5
측정한 모델14개
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 1
    Anthropic2026.09.22 · Max
    57.8%
  2. 2
    Anthropic2026.09.28 · Max
    55.5%
  3. 3
    Anthropic2026.09.01 · Max
    51.8%
  4. 4
    Anthropic2026.07.24 · Max
    46.6%
  5. 5
    xAI2026.09.21 · Extra High
    46.3%
  6. 6
    Z.ai2026.08.18 · Max
    42.6%
  7. 7
    OpenAI2026.07.09 · Max
    41.7%
  8. 8
    Meta2026.09.02 · Max
    41.6%
  9. 9
    xAI2026.08.12 · Extra High
    41.4%
  10. 10
    OpenAI2026.07.09 · Max
    41.3%

"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.