Lech Mazur Creative Writing
높을수록 좋음
레흐 마주르의 창작 시험으로, 인물·물건·배경·동기 등 무작위로 정한 10가지 요소를 자연스럽게 담은 짧은 소설을 쓰게 하고 AI 심사위원 7명이 0~10점으로 평가합니다. 여기 값은 2025년 8월에 멈춘 옛 채점 방식 기준입니다. 점수는 출처가 발표한 값 그대로입니다. 높을수록 좋습니다.
최고 점수8.60 / 10GPT-5
측정한 모델8개
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
대중들이 가장 선호하는 글쓰기·문학 답변을 하는 AI는?Arena Writing, Literature & Language
Gemini 4 Argon🥇
Gemini 4 Argon🥇대화가 길어질 때 대중들이 가장 선호하는 AI는?Arena Multi-turn
Gemini 4 Argon🥇
Gemini 4 Argon🥇형식·길이 같은 까다로운 조건을 빠짐없이 지킬까?IFBench
Grok 4.3🥇
Grok 4.3🥇
- 🥇OpenAIGPT-5추론 강도: Medium8.60 / 10
- 🥈AnthropicClaude Opus 4.18.47 / 10
- 🥉GoogleGemini 2.5 Pro8.38 / 10
- #4AnthropicClaude Opus 4추론 강도: Budget 16K8.36 / 10
- #5OpenAIGPT-5 Mini추론 강도: Medium8.31 / 10
- #6AnthropicClaude Sonnet 4추론 강도: Budget 16K8.14 / 10
- #7OpenAIGPT OSS 120B7.71 / 10
- #8MetaLlama 4 Maverick6.20 / 10
모델 절반이 8.34 / 10 이하최종 갱신 2026-10-07
"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.