Arena Writing, Literature & Language

かんたんに言うと · 文章・文学・言語分野の専門家レベルの質問で人々がより好んだAI

何を測定しますか?
文章・文学・言語分野の専門家レベルの質問で、どのAIの答えが好まれたかです。例:原稿校正、文体分析、翻訳監修。一般的な質問ではなく、その仕事を実際にしている人が投げかけそうな質問です。
誰がどのように評価しますか?
Arena Intelligence でユーザーが質問を入力すると、名前を隠した2つのAIが答え、より良い方に投票します。累計8,200万票以上の投票を統計モデル(Bradley-Terry)で集計して Elo 風の点数に換算し、この表は長く華やかに整えた回答を好む偏りを統計的に取り除いた「スタイル補正版」を公式データセットから取得します。 質問の推論の深さと専門性をAI分類器が判定し、全体の約5.5%だけを「専門家の質問」としてタグ付けし、さらに米国労働統計局の職業分類(SOC)に基づく職種に分けます(2025年11月新設)。 この表はそのうち「文章・文学・言語」に分類された質問だけを集計します。
スコアの読み方
試験の点数(正答率%)ではなく対戦成績です。他のAIと対戦して選ばれた確率から計算するため満点がなく、新しいAIが入ると既存のAIの点数も少し動きます。通常1,000〜1,500の範囲で、2つのAIの点差が100点なら上位側が約64%、200点なら約76%の確率で選ばれるという意味です。正解かどうかは数えないため、間違った答えでも説明が親切なら勝てます。正確さが重要な用途なら正答率試験(GPQA・AIME など)も併せて見るのがよいでしょう。点差が数十点以内なら順位が違っても実質同じ等級と見るのが安全です。 この職種は質問数が少なく上位の順位が頻繁に変わるため、順位より点数帯を見るのが安全です。

最終更新: 2026-10-02

順位

最高スコア1522Gemini 4 Argon
測定したモデル97件
最終更新2026.10.02
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 🥇GoogleGemini 4 Argon15221554—
  2. 🥈AnthropicClaude Opus 5.515191500—
  3. 🥉AnthropicClaude Fable 51508151863.5%
  4. #4GoogleGemini 3.7 Flash14961493—
  5. #5AnthropicClaude Fable 5.114911488—
  6. #6AnthropicClaude Opus 4.61490151253.1%
  7. #7GoogleGemini 3.8 Flash14871501—
  8. #8AnthropicClaude Opus 4.71484151458.6%
  9. #9OpenAIGPT-5.6 Sol1482148772.7%
  10. #10GoogleGemini 3.1 Pro1480149777.1%
  11. #11AnthropicClaude Opus 514801487—
  12. #12Moonshot AIKimi K314761500—
  13. #13GoogleGemini 3.6 Flash14741488—
  14. #14OpenAIGPT-6.1 Sol14721493—
  15. #15GoogleGemini 3.5 Flash1472147876.3%
  16. #16MetaMuse Spark 1.314701490—
  17. #17MetaMuse Spark 1.214701521—
  18. #18AnthropicClaude Opus 4.81468149462.2%
  19. #19AnthropicClaude Opus 4.51467148458.0%
  20. #20OpenAIGPT-5.51466148475.9%
  21. #21Z.aiGLM 5.314661480—
  22. #22OpenAIGPT-6 Astra14651488—
  23. #23OpenAIGPT-5.41465149373.9%
  24. #24MetaMuse Spark1463149375.9%
  25. #25AnthropicClaude Sonnet 5.514611473—
  26. #26GoogleGemini 3 Flash1461148278.0%
  27. #27MetaMuse Spark 1.114611496—
  28. #28Z.aiGLM 5.21459147573.3%
  29. #28XiaomiMiMo-V2.6-Pro14591456—
  30. #30AlibabaQwen3.7 Max1459148380.5%
  31. #31xAIGrok 4.514581473—
  32. #32AnthropicClaude Sonnet 4.61455148156.6%
  33. #33DeepSeekDeepSeek V4.1 Flash14541461—
  34. #34AnthropicClaude Sonnet 4.51454147857.3%
  35. #35xAIGrok 4.201452148349.3%
  36. #36Z.aiGLM-5.11452147876.3%
  37. #37AnthropicClaude Sonnet 514521473—
  38. #38DeepSeekDeepSeek V4 Pro1451147576.5%
  39. #39XiaomiMiMo V2.5 Pro1450148179.9%
  40. #40Z.aiGLM-51449147172.3%
  41. #41xAIGrok 4.20 (Reasoning)1448147981.2%
  42. #42Z.aiGLM 5.3 Flash14481471—
  43. #43AlibabaQwen3.6 Max1446146976.6%
  44. #44AnthropicClaude Opus 4.11446147255.4%
  45. #45xAIGrok 4.614461444—
  46. #46GoogleGemini 2.5 Pro1445144848.7%
  47. #47OpenAIGPT-5.6 Terra1445147071.2%
  48. #48GoogleGemini 3.5 Flash-Lite14431466—
  49. #49Moonshot AIKimi K2.61441146176.0%
  50. #50OpenAIGPT-6 Sol14391469—
  51. #51AlibabaQwen3.7 Plus1437146478.0%
  52. #52StepfunStep-514361460—
  53. #53GoogleGemma 4 31B1435146575.6%
  54. #54OpenAIGPT-5.6 Luna14331457—
  55. #55AnthropicClaude Opus 41431143953.7%
  56. #56XiaomiMiMo V2 Pro1431146668.8%
  57. #57xAIGrok 4.714311433—
  58. #58Moonshot AIKimi K2.51428145270.2%
  59. #59xAIGrok 4.31424144683.3%
  60. #60OpenAIGPT-5.4 Mini1423146673.3%
  61. #61AlibabaQwen3.6 Plus1423144575.2%
  62. #62MiniMaxMiniMax M31422145082.9%
  63. #63OpenAIGPT-6 Luna14211448—
  64. #64AlibabaQwen3.5 397B A17B1421145478.8%
  65. #65GoogleGemini 3.1 Flash Lite1420143577.2%
  66. #66BaiduERNIE 5.0 Thinking1419144241.4%
  67. #66XiaomiMiMo-V2.6-Flash14191457—
  68. #68DeepSeekDeepSeek V4 Flash1416145379.2%
  69. #69Z.aiGLM 5V Turbo1414143261.1%
  70. #70XiaomiMiMo V2.51412145167.1%
  71. #71DeepSeekDeepSeek V3.21410142960.7%
  72. #72ByteDanceDola Seed 2.0 Pro14091449—
  73. #73xAIGrok 4.1 Fast (Reasoning)1408141452.7%
  74. #74Mistral AIMistral Medium 3.51405143368.8%
  75. #75GoogleGemini 2.5 Flash1402140350.3%
  76. #76AnthropicClaude Haiku 4.51400142554.3%
  77. #77AnthropicClaude Sonnet 41398142154.7%
  78. #78OpenAIGPT-51396142073.1%
  79. #79MeituanLongcat Flash Chat1392143243.1%
  80. #80NVIDIANemotron 3 Ultra1392139881.4%
  81. #81MiniMaxMiniMax M2.71387142675.7%
  82. #82TencentHy31377141563.1%
  83. #83GoogleGemini 2.5 Flash Lite1371137452.6%
  84. #84MiniMaxMiniMax M2.51369139771.6%
  85. #85OpenAIGPT-5.4 Nano1363141375.9%
  86. #86OpenAIGPT-5 Mini1352137375.4%
  87. #87Arcee AITrinity Large Thinking1343134656.3%
  88. #88UpstageSolar Pro 413401390—
  89. #89NVIDIANemotron 3 Super1325135171.5%
  90. #90MetaLlama 4 Maverick1312132643.0%
  91. #91OpenAIGPT OSS 120B1309132769.0%
  92. #92OpenAIGPT-4.11308129943.0%
  93. #93MetaLlama 4 Scout1305131939.5%
  94. #94AmazonNova 2 Lite1298132370.7%
  95. #95OpenAIGPT-5 Nano1289132467.6%
  96. #96IBMGranite 4.1 8B1274127938.6%
  97. #97NVIDIANemotron 3 Nano 30B A3B1267129071.1%
モデルの半数が1441以下測定: ユーザー選好投票最終更新 2026-10-02

直近60日にリリースされたAI 34個のうち15個はまだこの試験のスコアがありません · Mistral Large 4, Perplexity Decider v1 27B, Clef Flash ほか12個

出典: Arena Intelligence データの出典・掲載停止のご依頼

このスコアを読むときに知っておくこと

  • 好みの投票なので正解かどうかは測りません。間違っていても説明が親切なら勝てます。
  • どんな質問が出されたかは投票した人によって変わります。自分の用途と違う質問かもしれません。
  • 「開発元発表」と表示されたスコアは、AI開発元が自ら発表した数値で、第三者の測定ではありません。