Fiction.LiveBench (16k)
인용 많음높을수록 좋음
소설 플랫폼 Fiction.live의 이야기를 읽고 인물의 속마음, 사건 순서, 드러나지 않은 정보를 추론해 답하는 긴 글 이해 시험입니다. 여기 값은 이야기 길이가 약 1만 6천 토큰일 때의 점수이며, 길이가 달라지면 점수도 크게 달라집니다. 점수는 0~100%입니다. 높을수록 좋습니다.
최고 점수97.2%GPT-5
측정한 모델10개
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
긴 문서 여러 개에 흩어진 정보를 모아 답할 수 있을까?Long Context Reasoning
Kimi K3🥇
Kimi K3🥇표를 읽고 원하는 형태로 정리할 수 있을까?LiveBench Data Analysis
GPT-6 Astra🥇
GPT-6 Astra🥇대중들이 가장 선호하는 사업 관련 답변을 하는 AI는?Arena Business, Management & Finance
Gemini 4 Argon🥇
Gemini 4 Argon🥇
- 🥇OpenAIGPT-5추론 강도: Medium97.2%
- 🥈Moonshot AIKimi K2.586.1%
- 🥉OpenAIGPT-5 Mini추론 강도: Medium69.4%
- #4OpenAIGPT-4.163.9%
- #5AnthropicClaude Opus 461.1%
- #6AnthropicClaude Sonnet 446.9%
- #7MetaLlama 4 Maverick46.2%
- #8OpenAIGPT OSS 120B추론 강도: High44.4%
- #8OpenAIGPT-5 Nano추론 강도: Medium44.4%
- #10MetaLlama 4 Scout36.0%
1위가 2위보다 11.1%p 앞섬 · 모델 절반이 54.0% 이하최종 갱신 2026-10-07
"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.