FACTS Parametric

높을수록 좋음

검색이나 도구 없이 모델이 기억하는 지식만으로 사실 질문에 답하는 시험입니다. 질문은 실제 사용자 관심사를 반영했고 정답은 위키백과로 확인했습니다. 점수는 0~100%입니다. 높을수록 좋습니다.

최고 점수83.1%GPT-6 Astra
측정한 모델30개
최근 갱신2026.09.25
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 1
    OpenAI2026.09.04
    83.1%
  2. 2
    Google2026.02.19
    79.0%
  3. 3
    Google2026.08.13
    78.7%
  4. 4
    OpenAI2026.04.23
    78.0%
  5. 5
    Google2026.09.03
    77.3%
  6. 6
    OpenAI2026.09.22
    75.6%
  7. 7
    Google2026.05.19
    73.5%
  8. 8
    Google2026.07.21
    73.4%
  9. 9
    Google2025.12.17
    72.3%
  10. 10
    Google2025.06.17
    63.2%

"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.