AnthropicがAIの再帰的自己改善に伴うリスクに警鐘
- •Anthropicの報告によると、2026年5月時点でAIが社内コードの80%を記述している。
- •2024年以降、AIが独立してタスクを完了するまでの時間は4カ月ごとに倍増している。
- •同社は、AIが制御不能になる前に再帰的な自己改善を一時停止する国際的な安全基準を提唱している。
2026年6月4日、Anthropic(ダリオ・アモデイが共同設立したAI安全性企業)は「AIが自らを構築するとき」と題したレポートを発表し、AIが自らの後継者を設計する「再帰的自己改善」の加速が人類の監視能力を追い越す可能性があると警告した。報告書によれば、2026年5月現在、同社のClaudeが社内リポジトリのコードの80%以上を記述しており、2025年2月の数パーセントから劇的な増加を見せている。コード行数は生産性の指標として完全ではないものの、AIに委ねられた作業量は大幅に増大しており、モデルが自律的に処理するタスクの所要時間は約4カ月ごとに倍増している。評価機関であるMETRの調査では、2024年3月時点で「Opus 3」が4分程度の人間作業をこなしていたのに対し、2026年半ばには「Opus 4.6」が12時間のプロジェクトを遂行するまでに進化を遂げた。
技術実行の領域において、同社のモデルは既に人間を凌駕している。2026年4月のコード最適化実験では、「Mythos Preview」モデルが52倍の速度改善を達成し、熟練したエンジニアの平均である4倍を大幅に上回った。依然として研究の直感や高レベルな判断においては人間が優位であるものの、新たな課題も浮上している。2026年4月の安全性研究シミュレーションでは、800時間の処理時間を要するタスクにおいて、複数のAIが1万8000ドルの計算リソースを用いて目標の97%を達成した。さらに、研究の行き詰まりに直面した際、AIがより優れた手法を見出す成功率は、2025年11月の「Opus 4.5」では51%だったが、6カ月後の「Mythos Preview」では64%に向上した。
Anthropicは今後の可能性として、成長の停滞、人間が監視するAI自動化、そして後継者を完全に自律開発するシナリオの3つを提示している。同社は、世代を超えてミスアライメント(AIの目標が人類の意図から逸脱すること)が増幅するのを防ぐため、後者のシナリオを慎重に制御すべきだと主張する。核軍縮とは異なり、開発に対する国際的な「ブレーキ」を確立するのは困難であるが、Anthropicは今後数カ月以内に政策立案者や競合企業との正式な協議を開始するよう呼びかけている。その目的は、自律型AIの開発が人類の制御範囲を超える前に、集団的な安全を確保するための検証メカニズムを構築することにある。