ExploitBench

인용 많음높을수록 좋음

카네기멜런대가 만든 보안 시험으로, 크롬의 자바스크립트 엔진(V8)에 실제로 있었던 취약점 41개를 AI 에이전트가 공격해 봅니다. 버그에 닿는 것부터 임의 코드 실행까지 16단계 목표로 나눠, 평균 몇 단계까지 도달했는지로 채점합니다. 점수는 0~100%입니다. 높을수록 좋습니다.

최고 점수47.4%GPT-5.5
측정한 모델8개
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 1
    OpenAI2026.04.23
    47.4%
  2. 2
    Anthropic2026.04.16
    26.5%
  3. 3
    Google2026.02.19
    26.1%
  4. 4
    Anthropic2026.02.17
    23.6%
  5. 5
    Moonshot AI2026.04.20
    18.4%
  6. 6
    Z.ai2026.04.07
    18.1%
  7. 7
    Anthropic2025.10.15
    13.7%
  8. 8
    MiniMax2026.03.18
    13.3%