ExploitBench
인용 많음높을수록 좋음
카네기멜런대가 만든 보안 시험으로, 크롬의 자바스크립트 엔진(V8)에 실제로 있었던 취약점 41개를 AI 에이전트가 공격해 봅니다. 버그에 닿는 것부터 임의 코드 실행까지 16단계 목표로 나눠, 평균 몇 단계까지 도달했는지로 채점합니다. 점수는 0~100%입니다. 높을수록 좋습니다.
최고 점수47.4%GPT-5.5
측정한 모델8개
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
순위모델출시일가격/1M점수
- 12026.04.23$2447.4%
- 22026.04.16$2026.5%
- 32026.02.19$9.5026.1%

- 42026.02.17$1223.6%
- 52026.04.20$2.8118.4%
- 62026.04.07$3.6518.1%
- 72025.10.15$413.7%
- 82026.03.18$0.9713.3%