SimpleBench

인용 많음높을수록 좋음

보통 사람에게는 쉽지만 AI는 자주 틀리는 6지선다 문제 213개로, 시간·공간 추론, 사회적 눈치, 말장난 같은 함정 질문을 묻습니다. 문제마다 다섯 번 풀어 평균을 내고, 일반인 참가자는 83.7%를 맞혔습니다. 점수는 0~100%입니다. 높을수록 좋습니다.

최고 점수81.9%Claude Fable 5
측정한 모델40개
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 1
    Anthropic2026.06.09 · max
    81.9%
  2. 2
    Anthropic2026.07.24
    80.6%
  3. 3
    Google2026.02.19
    79.6%
  4. 4
    Google2026.05.19
    76.7%
  5. 5
    xAI2026.08.12
    75.9%
  6. 6
    Meta2026.08.05
    74.5%
  7. 7
    OpenAI2026.03.05
    74.1%
  8. 8
    OpenAI2026.07.09 · xhigh
    71.7%
  9. 9
    Alibaba2026.05.21
    70.4%
  10. 10
    xAI2026.07.08
    70.0%

"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.