CursorBench
인용 많음높을수록 좋음
코딩 도구 Cursor가 실제 사용 기록에서 모은 과제로, 여러 파일에 걸친 모호한 작업(코드 이해, 버그 찾기, 수정, 리팩터링, 코드 리뷰 등)을 AI 코딩 에이전트가 해냅니다. Cursor가 자사 제품 과제로 직접 운영하며, 판이 바뀌면 점수를 서로 비교할 수 없습니다. 점수는 0~100%입니다. 높을수록 좋습니다.
최고 점수57.8%Claude Opus 5.5
측정한 모델14개
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
순위모델실행 조건출시일가격/1M점수
- 1Max2026.09.22$1657.8%
- 2Max2026.09.28$855.5%
- 3Max2026.09.01$4051.8%
- 4Max2026.07.24$2046.6%
- 5Extra High2026.09.21$546.3%
- 6Max2026.08.18$3.6042.6%
- 7Max2026.07.09$1641.7%
- 8Max2026.09.02$3.5041.6%
- 9Extra High2026.08.12$541.4%
- 10Max2026.07.09$9.5041.3%
"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.