Fiction.LiveBench (16k)

인용 많음높을수록 좋음

소설 플랫폼 Fiction.live의 이야기를 읽고 인물의 속마음, 사건 순서, 드러나지 않은 정보를 추론해 답하는 긴 글 이해 시험입니다. 여기 값은 이야기 길이가 약 1만 6천 토큰일 때의 점수이며, 길이가 달라지면 점수도 크게 달라집니다. 점수는 0~100%입니다. 높을수록 좋습니다.

최고 점수97.2%GPT-5
측정한 모델10개
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 🥇OpenAIGPT-5추론 강도: Medium97.2%
  2. 🥈Moonshot AIKimi K2.586.1%
  3. 🥉OpenAIGPT-5 Mini추론 강도: Medium69.4%
  4. #4OpenAIGPT-4.163.9%
  5. #5AnthropicClaude Opus 461.1%
  6. #6AnthropicClaude Sonnet 446.9%
  7. #7MetaLlama 4 Maverick46.2%
  8. #8OpenAIGPT OSS 120B추론 강도: High44.4%
  9. #8OpenAIGPT-5 Nano추론 강도: Medium44.4%
  10. #10MetaLlama 4 Scout36.0%
1위가 2위보다 11.1%p 앞섬 · 모델 절반이 54.0% 이하최종 갱신 2026-10-07

"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.