AnthropicがClaude Opus 5を発表
- •Claude Opus 5がArtificial Analysis Intelligence Indexで61点を記録し、最高スコアモデルとして登場した。
- •GDPval-AA v2で1861 Elo、AA-Briefcaseで1720 Eloを達成し、Fable 5を大幅に上回る性能を示した。
- •タスクあたりのコストを2.03ドルに削減しつつ、エージェントによるコーディングと推論能力を強化した。
Anthropicは2026年7月24日、Artificial Analysis Intelligence Indexで61点を獲得し、新リーダーとなったClaude Opus 5をリリースした。本モデルはClaude Fable 5(60点)、GPT-5.6 Sol(59点)、Kimi K3(57点)、Claude Opus 4.8(56点)と競合する性能を持つ。また、GDPval-AA v2ベンチマークで1861 Elo、AA-Briefcaseで1720 Eloという記録を達成し、Fable 5と比較してそれぞれ100ポイント、146ポイント以上の向上を見せた。これらの評価には、AIモデルを外部ツールへ接続するオープンソースのシステムであるエージェントハーネス、Stirrupが活用されている。
エージェントによるコーディングタスクにおいて、Claude Opus 5(xhigh)はArtificial Analysis Coding Indexをリードし、特にSWE-Atlas-QnAで最高スコアを達成した。コスト面では、Intelligence Indexタスクあたりの平均単価が2.03ドルとなり、Fable 5の2.75ドルから削減された。ただし、Sonnet 5(max)の1.53ドルよりは高価である。Opus 5は5段階の作業設定をサポートし、従来と同様に100万トークンのコンテキストウィンドウを提供する。
専門ベンチマークでは、Humanity’s Last Examで53%を記録しFable 5と同等となった。物理評価のCritPtでもFable 5と並ぶが、GPT-5.6 ProやTerraモデルには及ばない。AA-OmniscienceではOpus 4.8から事実正確性が7ポイント向上した一方、ハルシネーションの発生率は14ポイント増の50%となった。これはモデルが不確実な場合でも頻繁に回答する傾向によるものだ。価格は入力・出力100万トークンあたり5ドルおよび25ドルに設定されており、キャッシュ書き込みは6.25ドル、キャッシュヒット時は90%の割引が適用される。