MirrorCode
높을수록 좋음
Epoch AI가 METR와 함께 만든 시험으로, AI가 기존 프로그램(유닉스 도구, 압축, 암호, 인터프리터 등)을 소스 코드 없이 동작만 보고 처음부터 다시 구현합니다. 숨겨진 테스트까지 모든 출력이 원본과 정확히 같아야 성공이며, 시도마다 최대 7일이 주어집니다. 점수는 0~100%입니다. 높을수록 좋습니다.
최고 점수77.4%Claude Opus 5.5
측정한 모델9개
최근 갱신2026.09.22
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
순위모델실행 조건출시일가격/1M점수
- 1max2026.09.22$1677.4%
- 2high2026.09.01$4073.3%
- 3high2026.06.09$4063.9%
- 4high2026.09.04$4046.7%
- 5high2026.04.16$2031.1%
- 6high2026.07.09$1620.0%
- 7high2026.03.05$1215.6%
- 8high2026.04.23$2410.0%
- 9high2026.02.19$9.508.9%

"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.