Ko-AIME 2025

KoreanHigher is better

The 30 problems of the 2025 AIME translated into Korean and checked by people. Answers are integers, and with only 30 problems, each one is worth about 3.3 percentage points. Scores run from 0 to 100%. Higher is better.

Top score100.0%GPT-5.5
Models tested48
Last updated2026.08.03
Model release date (newest on the right)
Best score so farHigher on the chart is better
  1. 1
    OpenAI2026.04.23 · xhigh-effort
    100.0%
  2. 1
    Anthropic2026.05.27 · high-effort
    100.0%
  3. 1
    OpenAI2026.03.17 · xhigh-effort
    100.0%
  4. 1
    Anthropic2026.06.09 · high-effort
    100.0%
  5. 1
    xAI2026.07.08
    100.0%
  6. 1
    OpenAI2026.03.05 · xhigh-effort
    100.0%
  7. 7
    Google2025.12.17 · high-effort
    96.7%
  8. 7
    OpenAI2026.07.09 · max-effort
    96.7%
  9. 7
    OpenAI2025.08.07
    96.7%
  10. 7
    NVIDIA2026.03.11
    96.7%

The "harness" is the agent program the AI used to carry out the task. The same model can score very differently depending on its harness and reasoning effort.