CyberGym
인용 많음높을수록 좋음
UC 버클리가 만든 보안 시험으로, 실제 소프트웨어 취약점 1,507개를 설명만 보고 재현하는 공격 코드를 AI가 만들어 냅니다. 운영팀이 OpenHands 같은 공개 에이전트로 직접 잰 값과 제조사 발표값이 있으며, 제조사 발표값은 안전장치를 끈 상태 기준입니다. 점수는 0~100%입니다. 높을수록 좋습니다.
최고 점수95.1%MiMo-V2.6-Flash
측정한 모델29개
최근 갱신2026.09.22
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
순위모델실행 조건출시일가격/1M점수
- 12026.09.22$0.2595.1%
- 22026.09.21$0.7694.0%
- 3max (reasoning_effort=100)2026.09.10$0.7988.1%
- 4High2026.09.20$2.2884.7%
- 5max2026.08.18$3.6084.5%
- 6with tools2026.07.09$1683.6%
- 7with tools · xhigh2026.04.23$2481.8%
- 8Mean Reproduced · with tools · high2026.07.08$580.4%
- 9Mean Reproduced · with tools · high2026.09.21$580.3%
- 10Mean Reproduced · with tools · high2026.08.12$579.7%
"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.
제조사 발표값은 측정 조건이 제각각이라 참고용입니다.