CyberGym

引用多め高いほど良い

UCバークレーが作ったセキュリティの試験で、実在するソフトウェアの脆弱性1,507件を、説明だけを見て再現する攻撃コードをAIが作ります。運営チームがOpenHandsなど公開エージェントで自ら測った値と開発元の発表値があり、開発元の値は安全対策を切った状態のものです。スコアは0〜100%です。高いほど良い結果です。

最高スコア95.1%MiMo-V2.6-Flash
測定したモデル29件
最終更新2026.09.22
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 195.1%
  2. 294.0%
  3. 3
    DeepSeek2026.09.10 · max (reasoning_effort=100)
    88.1%
  4. 4
    Stepfun2026.09.20 · High
    84.7%
  5. 5
    Z.ai2026.08.18 · max
    84.5%
  6. 6
    OpenAI2026.07.09 · with tools
    83.6%
  7. 7
    OpenAI2026.04.23 · with tools · xhigh
    81.8%
  8. 8
    xAI2026.07.08 · Mean Reproduced · with tools · high
    80.4%
  9. 9
    xAI2026.09.21 · Mean Reproduced · with tools · high
    80.3%
  10. 10
    xAI2026.08.12 · Mean Reproduced · with tools · high
    79.7%

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。

メーカー発表値は測定条件がまちまちなので参考値です。