Arena WebDev
かんたんに言うと · Webサイトやアプリを作ってと頼んだとき、人々がより好んだ結果を出したAIの順位
- 何を測定しますか?
- Webサイトやアプリを作ってと頼んだとき、どのAIがより使える成果物を作るかを競う順位です。コードを読んで採点する代わりに実際に動く画面を見て人が選ぶため、この点数が高いAIは「見栄えがよく動く」結果を作るのが得意です。
- 誰がどのように評価しますか?
- Arena Intelligence のWeb開発部門でユーザーが作りたいページやアプリを説明すると、名前を隠した2つのAIがコードを書き、その結果を実際に動かした画面を並べて見せます。ユーザーはより良い方に投票し、投票をテキストArenaと同じ統計モデルで点数化します。
- スコアの読み方
- 試験の点数ではなく対戦成績です。他のAIと対戦して選ばれた確率から計算するため満点がなく、2つのAIの点差が100点なら上位側が約64%の確率で選ばれるという意味です。点差が数十点以内なら順位が違っても実質同じ等級です。 この表の値は現在おおよそ1,200〜1,800の範囲です。結果画面の第一印象が投票を左右するため、コードの保守性やセキュリティは反映されません。
最終更新: 2026-10-01
順位
最高スコア1788GPT-6 Astra
測定したモデル64件
最終更新2026.10.01
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
数時間かかる開発の仕事も、コンピューターを自分で操作して最後までやり遂げられる?Terminal-Bench 4.0
Claude Sonnet 5.5🥇
Claude Sonnet 5.5🥇多くの人に最も好まれるコーディングの回答をするAIは?Arena Coding
Gemini 4 Argon🥇
Gemini 4 Argon🥇コードを実行しながら直して、課題を終えられる?LiveBench Agentic Coding
DeepSeek V4.1 Flash🥇
DeepSeek V4.1 Flash🥇
- 🥇OpenAIGPT-6 Astra1788
- 🥈AnthropicClaude Sonnet 5.51786
- 🥉OpenAIGPT-6.1 Sol1758
- #4AnthropicClaude Fable 5.11749
- #5AnthropicClaude Opus 51695
- #6OpenAIGPT-6 Sol1689
- #7GoogleGemini 4 Argon1680
- #8Moonshot AIKimi K31658
- #9MetaMuse Spark 1.31657
- #10xAIGrok 4.71638
- #11AnthropicClaude Fable 51625
- #12Z.aiGLM 5.31623
- #13DeepSeekDeepSeek V4.1 Flash1620
- #14xAIGrok 4.61620
- #15XiaomiMiMo-V2.6-Pro1618
- #16Z.aiGLM 5.3 Flash1616
- #17Z.aiGLM 5.21605
- #18GoogleGemini 3.7 Flash1592
- #19GoogleGemini 3.8 Flash1583
- #20OpenAIGPT-6 Luna1579
- #21AnthropicClaude Opus 4.71555
- #22xAIGrok 4.51552
- #23MetaMuse Spark 1.11542
- #24AnthropicClaude Sonnet 51539
- #25AnthropicClaude Opus 4.61537
- #26GoogleGemini 3.6 Flash1536
- #27AnthropicClaude Opus 4.81534
- #28MetaMuse Spark 1.21532
- #29AnthropicClaude Sonnet 4.61521
- #30Moonshot AIKimi K2.61509
- #31Z.aiGLM-5.11509
- #32GoogleGemini 3.5 Flash1490
- #33MiniMaxMiniMax M31482
- #34AlibabaQwen3.6 Max1482
- #35XiaomiMiMo V2.5 Pro1478
- #36AnthropicClaude Opus 4.51469
- #37AlibabaQwen3.6 Plus1461
- #38GoogleGemini 3.1 Pro1446
- #39DeepSeekDeepSeek V4 Pro1446
- #40GoogleGemini 3.5 Flash-Lite1440
- #41GoogleGemini 3 Flash1439
- #42XiaomiMiMo V2.51438
- #43Moonshot AIKimi K2.51436
- #44Z.aiGLM-51434
- #45XiaomiMiMo V2 Pro1433
- #46Z.aiGLM 5V Turbo1400
- #47AlibabaQwen3.5 397B A17B1399
- #48OpenAIGPT-5.4 Mini1397
- #48MiniMaxMiniMax M2.71397
- #50MiniMaxMiniMax M2.51386
- #51AnthropicClaude Sonnet 4.51384
- #52xAIGrok 4.20 (Reasoning)1374
- #53UpstageSolar Pro 41370
- #54GoogleGemma 4 31B1365
- #55xAIGrok 4.31357
- #56TencentHy31356
- #57AnthropicClaude Haiku 4.51329
- #58DeepSeekDeepSeek V3.21325
- #59Mistral AIMistral Medium 3.51263
- #60GoogleGemini 3.1 Flash Lite1256
- #61xAIGrok 4.1 Fast (Reasoning)1241
- #62Arcee AITrinity Large Thinking1238
- #63GoogleGemini 2.5 Pro1227
- #64IBMGranite 4.1 8B1190
モデルの半数が1486以下測定: ユーザー選好投票最終更新 2026-10-01
直近60日にリリースされたAI 34個のうち18個はまだこの試験のスコアがありません · Mistral Large 4, Clef, Perplexity Decider v1 27B ほか15個
出典: Arena Intelligence データの出典・掲載停止のご依頼このスコアを読むときに知っておくこと
- 好みの投票なので指示どおりかは測りません。指示から少しずれても、見た目や聞こえが良ければ勝てます。
- どんな依頼が出されたかは投票した人によって変わります。自分の用途と違う依頼かもしれません。
- 「開発元発表」と表示されたスコアは、AI開発元が自ら発表した数値で、第三者の測定ではありません。