Arena Creative Writing
かんたんに言うと · 小説や詩などの創作文で人々がより好んだAI
- 何を測定しますか?
- 小説・詩・エッセイ・コラムのように想像力と表現が必要な文章での好みです。文体・個性・感情表現を人々がどう評価したかが表れます。
- 誰がどのように評価しますか?
- Arena Intelligence でユーザーが質問を入力すると、名前を隠した2つのAIが答え、より良い方に投票します。累計8,200万票以上の投票を統計モデル(Bradley-Terry)で集計して Elo 風の点数に換算し、この表は長く華やかに整えた回答を好む偏りを統計的に取り除いた「スタイル補正版」を公式データセットから取得します。 独創性・感情表現・視点を求める質問を、人がラベル付けした事例で学習したAI分類器が選んで集計します。
- スコアの読み方
- 試験の点数(正答率%)ではなく対戦成績です。他のAIと対戦して選ばれた確率から計算するため満点がなく、新しいAIが入ると既存のAIの点数も少し動きます。通常1,000〜1,500の範囲で、2つのAIの点差が100点なら上位側が約64%、200点なら約76%の確率で選ばれるという意味です。正解かどうかは数えないため、間違った答えでも説明が親切なら勝てます。正確さが重要な用途なら正答率試験(GPQA・AIME など)も併せて見るのがよいでしょう。点差が数十点以内なら順位が違っても実質同じ等級と見るのが安全です。 好みが分かれる領域のため、他のカテゴリより投票者の傾向の影響が大きいです。
最終更新: 2026-10-02
順位
最高スコア1519Gemini 4 Argon
測定したモデル97件
最終更新2026.10.02
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
多くの人に最も好まれる文章・文学の回答をするAIは?Arena Writing, Literature & Language
Gemini 4 Argon🥇
Gemini 4 Argon🥇会話が長くなったとき、多くの人に最も好まれるAIは?Arena Multi-turn
Gemini 4 Argon🥇
Gemini 4 Argon🥇形式や長さなどの細かい条件を、漏れなく守れる?IFBench
Grok 4.3🥇
Grok 4.3🥇
- 🥇GoogleGemini 4 Argon1519
- 🥈AnthropicClaude Opus 5.51516
- 🥉AnthropicClaude Fable 51503
- #4GoogleGemini 3.7 Flash1493
- #5GoogleGemini 3.8 Flash1485
- #6AnthropicClaude Opus 4.71483
- #7AnthropicClaude Fable 5.11482
- #8GoogleGemini 3.1 Pro1480
- #9AnthropicClaude Opus 4.61479
- #10GoogleGemini 3.6 Flash1471
- #11AnthropicClaude Opus 51471
- #12GoogleGemini 3.5 Flash1469
- #13OpenAIGPT-5.6 Sol1468
- #14MetaMuse Spark1466
- #15AnthropicClaude Opus 4.81463
- #15xAIGrok 4.201463
- #17AnthropicClaude Opus 4.51462
- #18Moonshot AIKimi K31460
- #19OpenAIGPT-6.1 Sol1460
- #20MetaMuse Spark 1.31459
- #21GoogleGemini 3 Flash1457
- #22MetaMuse Spark 1.21456
- #23Z.aiGLM 5.21454
- #24AnthropicClaude Sonnet 4.51454
- #25Z.aiGLM 5.31454
- #26xAIGrok 4.51450
- #27AnthropicClaude Sonnet 4.61449
- #28OpenAIGPT-6 Astra1449
- #29Z.aiGLM-51449
- #30OpenAIGPT-5.51448
- #31AnthropicClaude Sonnet 5.51447
- #32MetaMuse Spark 1.11447
- #33Z.aiGLM-5.11446
- #34XiaomiMiMo-V2.6-Pro1446
- #35DeepSeekDeepSeek V4 Pro1446
- #36AnthropicClaude Opus 4.11446
- #37xAIGrok 4.20 (Reasoning)1446
- #38xAIGrok 4.61445
- #39GoogleGemini 2.5 Pro1443
- #40OpenAIGPT-5.41443
- #41OpenAIGPT-6 Sol1442
- #42AlibabaQwen3.7 Max1441
- #43DeepSeekDeepSeek V4.1 Flash1440
- #44AlibabaQwen3.6 Max1437
- #45GoogleGemini 3.5 Flash-Lite1436
- #46xAIGrok 4.71436
- #47AnthropicClaude Sonnet 51435
- #48XiaomiMiMo V2.5 Pro1434
- #49Z.aiGLM 5.3 Flash1433
- #50Moonshot AIKimi K2.61433
- #51AnthropicClaude Opus 41432
- #52AlibabaQwen3.7 Plus1432
- #53OpenAIGPT-5.6 Terra1426
- #54XiaomiMiMo V2 Pro1424
- #55Moonshot AIKimi K2.51423
- #56xAIGrok 4.31422
- #57BaiduERNIE 5.0 Thinking1422
- #58StepfunStep-51421
- #59GoogleGemma 4 31B1420
- #60xAIGrok 4.1 Fast (Reasoning)1414
- #61GoogleGemini 3.1 Flash Lite1413
- #62OpenAIGPT-6 Luna1413
- #63OpenAIGPT-5.6 Luna1409
- #64DeepSeekDeepSeek V4 Flash1408
- #65AlibabaQwen3.6 Plus1407
- #66MiniMaxMiniMax M31406
- #67Z.aiGLM 5V Turbo1406
- #68AlibabaQwen3.5 397B A17B1405
- #69ByteDanceDola Seed 2.0 Pro1403
- #70OpenAIGPT-5.4 Mini1401
- #71DeepSeekDeepSeek V3.21401
- #72Mistral AIMistral Medium 3.51400
- #73AnthropicClaude Sonnet 41396
- #74XiaomiMiMo V2.51394
- #75GoogleGemini 2.5 Flash1394
- #76MeituanLongcat Flash Chat1390
- #77AnthropicClaude Haiku 4.51388
- #78XiaomiMiMo-V2.6-Flash1385
- #79NVIDIANemotron 3 Ultra1382
- #80OpenAIGPT-51373
- #81MiniMaxMiniMax M2.71364
- #82GoogleGemini 2.5 Flash Lite1360
- #83MiniMaxMiniMax M2.51357
- #84TencentHy31353
- #85OpenAIGPT-5.4 Nano1336
- #86Arcee AITrinity Large Thinking1332
- #87OpenAIGPT-5 Mini1324
- #88UpstageSolar Pro 41310
- #89MetaLlama 4 Maverick1307
- #90NVIDIANemotron 3 Super1303
- #91MetaLlama 4 Scout1289
- #92OpenAIGPT-4.11286
- #93OpenAIGPT OSS 120B1278
- #94AmazonNova 2 Lite1269
- #95IBMGranite 4.1 8B1262
- #96OpenAIGPT-5 Nano1247
- #97NVIDIANemotron 3 Nano 30B A3B1242
モデルの半数が1433以下測定: ユーザー選好投票最終更新 2026-10-02
直近60日にリリースされたAI 34個のうち15個はまだこの試験のスコアがありません · Mistral Large 4, Perplexity Decider v1 27B, Clef Flash ほか12個
出典: Arena Intelligence データの出典・掲載停止のご依頼このスコアを読むときに知っておくこと
- 好みの投票なので正解かどうかは測りません。間違っていても説明が親切なら勝てます。
- どんな質問が出されたかは投票した人によって変わります。自分の用途と違う質問かもしれません。
- 「開発元発表」と表示されたスコアは、AI開発元が自ら発表した数値で、第三者の測定ではありません。