FACTS Multimodal

높을수록 좋음 · 이미지 입력 모델만

이미지를 보고 묻는 질문에, 이미지 내용과 일반 지식을 함께 써서 사실에 맞게 답하는 시험입니다. 필요한 사실을 빠뜨리지 않고 틀린 말도 하지 않아야 정답으로 칩니다. 이미지를 볼 수 있는 모델만 참여합니다. 점수는 0~100%입니다. 높을수록 좋습니다.

최고 점수50.7%Gemini 3.8 Flash
측정한 모델31개
최근 갱신2026.09.25
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 1
    Google2026.09.03
    50.7%
  2. 2
    Google2026.08.13
    49.8%
  3. 3
    Anthropic2026.09.22
    48.4%
  4. 4
    OpenAI2026.09.04
    47.7%
  5. 5
    Google2026.07.21
    47.2%
  6. 6
    Google2025.06.17
    46.9%
  7. 7
    OpenAI2026.04.23
    45.8%
  8. 8
    OpenAI2025.08.07
    44.1%
  9. 9
    OpenAI2026.09.22
    43.1%
  10. 10
    OpenAI2025.08.07
    41.5%

"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.