MirrorCode
高いほど良い
Epoch AIがMETRと共同で作った試験で、AIが既存のプログラム(Unixツール、圧縮、暗号、インタプリタなど)をソースコードなしで動作だけを見て一から作り直します。隠しテストも含めてすべての出力が元と完全に一致して成功とし、1回あたり最大7日が与えられます。スコアは0〜100%です。高いほど良い結果です。
最高スコア77.4%Claude Opus 5.5
測定したモデル9件
最終更新2026.09.22
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
順位モデル実行条件リリース日価格/1Mスコア
- 1max2026.09.22$1677.4%
- 2high2026.09.01$4073.3%
- 3high2026.06.09$4063.9%
- 4high2026.09.04$4046.7%
- 5high2026.04.16$2031.1%
- 6high2026.07.09$1620.0%
- 7high2026.03.05$1215.6%
- 8high2026.04.23$2410.0%
- 9high2026.02.19$9.508.9%

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。