Arena WebDev

かんたんに言うと · Webサイトやアプリを作ってと頼んだとき、人々がより好んだ結果を出したAIの順位

何を測定しますか?
Webサイトやアプリを作ってと頼んだとき、どのAIがより使える成果物を作るかを競う順位です。コードを読んで採点する代わりに実際に動く画面を見て人が選ぶため、この点数が高いAIは「見栄えがよく動く」結果を作るのが得意です。
誰がどのように評価しますか?
Arena Intelligence のWeb開発部門でユーザーが作りたいページやアプリを説明すると、名前を隠した2つのAIがコードを書き、その結果を実際に動かした画面を並べて見せます。ユーザーはより良い方に投票し、投票をテキストArenaと同じ統計モデルで点数化します。
スコアの読み方
試験の点数ではなく対戦成績です。他のAIと対戦して選ばれた確率から計算するため満点がなく、2つのAIの点差が100点なら上位側が約64%の確率で選ばれるという意味です。点差が数十点以内なら順位が違っても実質同じ等級です。 この表の値は現在おおよそ1,200〜1,800の範囲です。結果画面の第一印象が投票を左右するため、コードの保守性やセキュリティは反映されません。

最終更新: 2026-10-01

順位

最高スコア1788GPT-6 Astra
測定したモデル64件
最終更新2026.10.01
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 🥇OpenAIGPT-6 Astra1788
  2. 🥈AnthropicClaude Sonnet 5.51786
  3. 🥉OpenAIGPT-6.1 Sol1758
  4. #4AnthropicClaude Fable 5.11749
  5. #5AnthropicClaude Opus 51695
  6. #6OpenAIGPT-6 Sol1689
  7. #7GoogleGemini 4 Argon1680
  8. #8Moonshot AIKimi K31658
  9. #9MetaMuse Spark 1.31657
  10. #10xAIGrok 4.71638
  11. #11AnthropicClaude Fable 51625
  12. #12Z.aiGLM 5.31623
  13. #13DeepSeekDeepSeek V4.1 Flash1620
  14. #14xAIGrok 4.61620
  15. #15XiaomiMiMo-V2.6-Pro1618
  16. #16Z.aiGLM 5.3 Flash1616
  17. #17Z.aiGLM 5.21605
  18. #18GoogleGemini 3.7 Flash1592
  19. #19GoogleGemini 3.8 Flash1583
  20. #20OpenAIGPT-6 Luna1579
  21. #21AnthropicClaude Opus 4.71555
  22. #22xAIGrok 4.51552
  23. #23MetaMuse Spark 1.11542
  24. #24AnthropicClaude Sonnet 51539
  25. #25AnthropicClaude Opus 4.61537
  26. #26GoogleGemini 3.6 Flash1536
  27. #27AnthropicClaude Opus 4.81534
  28. #28MetaMuse Spark 1.21532
  29. #29AnthropicClaude Sonnet 4.61521
  30. #30Moonshot AIKimi K2.61509
  31. #31Z.aiGLM-5.11509
  32. #32GoogleGemini 3.5 Flash1490
  33. #33MiniMaxMiniMax M31482
  34. #34AlibabaQwen3.6 Max1482
  35. #35XiaomiMiMo V2.5 Pro1478
  36. #36AnthropicClaude Opus 4.51469
  37. #37AlibabaQwen3.6 Plus1461
  38. #38GoogleGemini 3.1 Pro1446
  39. #39DeepSeekDeepSeek V4 Pro1446
  40. #40GoogleGemini 3.5 Flash-Lite1440
  41. #41GoogleGemini 3 Flash1439
  42. #42XiaomiMiMo V2.51438
  43. #43Moonshot AIKimi K2.51436
  44. #44Z.aiGLM-51434
  45. #45XiaomiMiMo V2 Pro1433
  46. #46Z.aiGLM 5V Turbo1400
  47. #47AlibabaQwen3.5 397B A17B1399
  48. #48OpenAIGPT-5.4 Mini1397
  49. #48MiniMaxMiniMax M2.71397
  50. #50MiniMaxMiniMax M2.51386
  51. #51AnthropicClaude Sonnet 4.51384
  52. #52xAIGrok 4.20 (Reasoning)1374
  53. #53UpstageSolar Pro 41370
  54. #54GoogleGemma 4 31B1365
  55. #55xAIGrok 4.31357
  56. #56TencentHy31356
  57. #57AnthropicClaude Haiku 4.51329
  58. #58DeepSeekDeepSeek V3.21325
  59. #59Mistral AIMistral Medium 3.51263
  60. #60GoogleGemini 3.1 Flash Lite1256
  61. #61xAIGrok 4.1 Fast (Reasoning)1241
  62. #62Arcee AITrinity Large Thinking1238
  63. #63GoogleGemini 2.5 Pro1227
  64. #64IBMGranite 4.1 8B1190
モデルの半数が1486以下測定: ユーザー選好投票最終更新 2026-10-01

直近60日にリリースされたAI 34個のうち18個はまだこの試験のスコアがありません · Mistral Large 4, Clef, Perplexity Decider v1 27B ほか15個

出典: Arena Intelligence データの出典・掲載停止のご依頼

このスコアを読むときに知っておくこと

  • 好みの投票なので指示どおりかは測りません。指示から少しずれても、見た目や聞こえが良ければ勝てます。
  • どんな依頼が出されたかは投票した人によって変わります。自分の用途と違う依頼かもしれません。
  • 「開発元発表」と表示されたスコアは、AI開発元が自ら発表した数値で、第三者の測定ではありません。