MirrorCode

高いほど良い

Epoch AIがMETRと共同で作った試験で、AIが既存のプログラム(Unixツール、圧縮、暗号、インタプリタなど)をソースコードなしで動作だけを見て一から作り直します。隠しテストも含めてすべての出力が元と完全に一致して成功とし、1回あたり最大7日が与えられます。スコアは0〜100%です。高いほど良い結果です。

最高スコア77.4%Claude Opus 5.5
測定したモデル9件
最終更新2026.09.22
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 1
    Anthropic2026.09.22 · max
    77.4%
  2. 2
    Anthropic2026.09.01 · high
    73.3%
  3. 3
    Anthropic2026.06.09 · high
    63.9%
  4. 4
    OpenAI2026.09.04 · high
    46.7%
  5. 5
    Anthropic2026.04.16 · high
    31.1%
  6. 6
    OpenAI2026.07.09 · high
    20.0%
  7. 7
    OpenAI2026.03.05 · high
    15.6%
  8. 8
    OpenAI2026.04.23 · high
    10.0%
  9. 9
    Google2026.02.19 · high
    8.9%

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。