Lech Mazur Creative Writing
高いほど良い
レフ・マズールの創作試験で、人物・物・舞台・動機など無作為に決めた10の要素を自然に盛り込んだ短編小説を書かせ、AI審査員7人が0〜10点で評価します。ここでの値は2025年8月で止まった旧採点方式のものです。スコアは出典の発表値そのままです。高いほど良い結果です。
最高スコア8.60 / 10GPT-5
測定したモデル8件
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
多くの人に最も好まれる文章・文学の回答をするAIは?Arena Writing, Literature & Language
Gemini 4 Argon🥇
Gemini 4 Argon🥇会話が長くなったとき、多くの人に最も好まれるAIは?Arena Multi-turn
Gemini 4 Argon🥇
Gemini 4 Argon🥇形式や長さなどの細かい条件を、漏れなく守れる?IFBench
Grok 4.3🥇
Grok 4.3🥇
- 🥇OpenAIGPT-5推論強度: Medium8.60 / 10
- 🥈AnthropicClaude Opus 4.18.47 / 10
- 🥉GoogleGemini 2.5 Pro8.38 / 10
- #4AnthropicClaude Opus 4推論強度: Budget 16K8.36 / 10
- #5OpenAIGPT-5 Mini推論強度: Medium8.31 / 10
- #6AnthropicClaude Sonnet 4推論強度: Budget 16K8.14 / 10
- #7OpenAIGPT OSS 120B7.71 / 10
- #8MetaLlama 4 Maverick6.20 / 10
モデルの半数が8.34 / 10以下最終更新 2026-10-07
「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。