CyberGym

인용 많음높을수록 좋음

UC 버클리가 만든 보안 시험으로, 실제 소프트웨어 취약점 1,507개를 설명만 보고 재현하는 공격 코드를 AI가 만들어 냅니다. 운영팀이 OpenHands 같은 공개 에이전트로 직접 잰 값과 제조사 발표값이 있으며, 제조사 발표값은 안전장치를 끈 상태 기준입니다. 점수는 0~100%입니다. 높을수록 좋습니다.

최고 점수95.1%MiMo-V2.6-Flash
측정한 모델29개
최근 갱신2026.09.22
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 195.1%
  2. 294.0%
  3. 3
    DeepSeek2026.09.10 · max (reasoning_effort=100)
    88.1%
  4. 4
    Stepfun2026.09.20 · High
    84.7%
  5. 5
    Z.ai2026.08.18 · max
    84.5%
  6. 6
    OpenAI2026.07.09 · with tools
    83.6%
  7. 7
    OpenAI2026.04.23 · with tools · xhigh
    81.8%
  8. 8
    xAI2026.07.08 · Mean Reproduced · with tools · high
    80.4%
  9. 9
    xAI2026.09.21 · Mean Reproduced · with tools · high
    80.3%
  10. 10
    xAI2026.08.12 · Mean Reproduced · with tools · high
    79.7%

"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.

제조사 발표값은 측정 조건이 제각각이라 참고용입니다.