IFEval-Ko

한국어높을수록 좋음

길이·키워드·출력 형식처럼 자동으로 확인할 수 있는 조건이 붙은 지시를 지키는지 보는 구글 IFEval의 한국어판입니다. 네 가지 엄격·느슨한 기준의 정답률을 평균합니다. 호랑이 순위표는 전체 문항이 아니라 고정된 100문항만 풀기 때문에, 전체 데이터셋으로 잰 점수와 바로 비교할 수 없습니다. 점수는 0~100%입니다. 높을수록 좋습니다.

최고 점수95.0%GPT-5.4
측정한 모델48개
최근 갱신2026.08.03
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 1
    OpenAI2026.03.05 · xhigh-effort
    95.0%
  2. 2
    OpenAI2026.04.23 · xhigh-effort
    93.3%
  3. 3
    OpenAI2025.08.07
    92.9%
  4. 3
    Z.ai2026.03.15
    92.9%
  5. 5
    OpenAI2026.03.17 · xhigh-effort
    92.5%
  6. 5
    xAI2026.07.08
    92.5%
  7. 5
    OpenAI2026.03.17 · xhigh-effort
    92.5%
  8. 8
    Google2025.12.17 · high-effort
    92.1%
  9. 9
    OpenAI2026.07.09 · max-effort
    91.7%
  10. 10
    Google2026.05.19
    91.3%

"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.