MirrorCode

높을수록 좋음

Epoch AI가 METR와 함께 만든 시험으로, AI가 기존 프로그램(유닉스 도구, 압축, 암호, 인터프리터 등)을 소스 코드 없이 동작만 보고 처음부터 다시 구현합니다. 숨겨진 테스트까지 모든 출력이 원본과 정확히 같아야 성공이며, 시도마다 최대 7일이 주어집니다. 점수는 0~100%입니다. 높을수록 좋습니다.

최고 점수77.4%Claude Opus 5.5
측정한 모델9개
최근 갱신2026.09.22
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 1
    Anthropic2026.09.22 · max
    77.4%
  2. 2
    Anthropic2026.09.01 · high
    73.3%
  3. 3
    Anthropic2026.06.09 · high
    63.9%
  4. 4
    OpenAI2026.09.04 · high
    46.7%
  5. 5
    Anthropic2026.04.16 · high
    31.1%
  6. 6
    OpenAI2026.07.09 · high
    20.0%
  7. 7
    OpenAI2026.03.05 · high
    15.6%
  8. 8
    OpenAI2026.04.23 · high
    10.0%
  9. 9
    Google2026.02.19 · high
    8.9%

"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.