LiveBench Coding

한 줄 요약 · 매달 새로 내는 프로그래밍 문제를 얼마나 푸는지

무엇을 측정하나요?
프로그래밍 대회 문제 풀이와 코드 이어 쓰기 실력입니다. 한 번에 정답 코드를 내는 능력을 봅니다.
누가 어떻게 평가하나요?
Abacus.AI·뉴욕대 등 연구진이 만든 LiveBench 는 최근 대회 문제·논문·뉴스에서 매달 새 문제를 내어, AI 가 학습 중에 문제를 미리 봤을 가능성(오염)을 줄입니다. 답이 정해진 문제만 내고 프로그램이 자동 채점하며 다른 AI 가 채점하지 않습니다. 이 표는 livebench.ai 가 공개한 최신 월간 결과표를 가져오되, 최신 표에서 빠진 AI 는 마지막으로 실린 점수를 순위 없이 표 아래에 따로 보여 줍니다. 코딩 과목은 최근 대회 문제(LiveCodeBench 출처)의 코드 생성과, 실제 GitHub 저장소 코드의 빈 부분을 채우는 코드 완성 과제로 구성되며 실행 결과로 채점합니다.
점수 읽는 법
0~100점입니다. 문항이 어렵게 설계돼 최상위 AI 도 70점을 넘기기 어려우며, 매달 문제가 바뀌므로 시점이 다른 점수는 직접 비교하지 않는 것이 좋습니다. 혼자서 저장소를 고치는 '에이전틱 코딩' 과는 별개 과목입니다.

마지막 업데이트: 2026-06-25

순위

최고 점수89.3Claude Opus 5.5
측정한 모델50개
최근 갱신2026.06.25
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 🥇AnthropicClaude Opus 5.589.3
  2. 🥈AnthropicClaude Sonnet 5.588.9
  3. 🥉AnthropicClaude Fable 5.186.4
  4. #4AnthropicClaude Fable 586.0
  5. #5OpenAIGPT-5.6 Sol83.9
  6. #6OpenAIGPT-5.6 Luna82.9
  7. #7OpenAIGPT-5.582.2
  8. #8AnthropicClaude Opus 4.782.1
  9. #9AnthropicClaude Opus 4.881.8
  10. #10OpenAIGPT-6 Sol81.8
  11. #11AnthropicClaude Opus 581.5
  12. #11Moonshot AIKimi K381.5
  13. #13MetaMuse Spark 1.381.1
  14. #14OpenAIGPT-6.1 Sol80.7
  15. #15AnthropicClaude Sonnet 580.7
  16. #16OpenAIGPT-6 Astra80.4
  17. #17DeepSeekDeepSeek V4.1 Flash80.0
  18. #18AnthropicClaude Opus 4.579.7
  19. #18Z.aiGLM 5.279.7
  20. #20AnthropicClaude Sonnet 4.679.3
  21. #21Z.aiGLM 5.379.0
  22. #21Z.aiGLM 5.3 Flash79.0
  23. #21OpenAIGPT-6 Luna79.0
  24. #24GoogleGemini 3.7 Flash78.9
  25. #25Moonshot AIKimi K2.678.6
  26. #26OpenAIGPT-5.6 Terra78.3
  27. #27AnthropicClaude Opus 4.678.2
  28. #27GoogleGemini 3.5 Flash78.2
  29. #27AlibabaQwen3.6 Plus78.2
  30. #30GoogleGemini 3.6 Flash77.9
  31. #31OpenAIGPT-5.477.5
  32. #31MetaMuse Spark 1.277.5
  33. #33xAIGrok 4.777.2
  34. #33MetaMuse Spark 1.177.2
  35. #35xAIGrok 4.676.8
  36. #36GoogleGemini 3.1 Pro76.5
  37. #37GoogleGemini 3.5 Flash-Lite76.1
  38. #38AlibabaQwen3.7 Max74.2
  39. #39Moonshot AIKimi K2.7 Code74.0
  40. #40AlibabaQwen3.8 Flash72.5
  41. #41GoogleGemini 3.8 Flash72.5
  42. #42OpenAIGPT-5.4 Mini71.6
  43. #43OpenAIGPT-5.4 Nano70.8
  44. #44NVIDIANemotron 3 Ultra70.7
  45. #45DeepSeekDeepSeek V4 Pro70.0
  46. #46xAIGrok 4.369.9
  47. #47DeepSeekDeepSeek V4 Flash69.2
  48. #48xAIGrok 4.568.6
  49. #49MiniMaxMiniMax M368.2
  50. #50xAIGrok Build 0.165.4
모델 절반이 78.4 이하최종 갱신 2026-06-25

이전 순위표 기준 점수

최신 순위표(2026.06.25)에 반영되지 않은 점수입니다. 출처에서 빠졌거나 아직 갱신되지 않은 모델로, 마지막으로 받은 점수를 참고로 보여 주며 순위는 매기지 않습니다.

  1. —
    Google2025.12.17
    78.6
  2. —
    Moonshot AI2026.01.27
    77.9
  3. —
    Anthropic2025.05.22
    77.5
  4. —
    Anthropic2025.09.29
    76.1
  5. —
    OpenAI2025.08.07
    76.1
  6. —
    DeepSeek2025.12.01
    75.7
  7. —
    Google2025.06.17
    75.7
  8. —
    Z.ai2026.04.07
    75.4
  9. —
    Anthropic2025.08.05
    74.7
  10. —
    Z.ai2026.04.01
    73.9
  11. —
    Z.ai2026.02.11
    73.6
  12. —
    Anthropic2025.10.15
    72.2
  13. —
    OpenAI2025.08.07
    72.1
  14. —
    MiniMax2026.02.12
    70.7
  15. —69.6
  16. —
    Xiaomi2026.03.18
    68.8
  17. —
    Google2026.03.03
    68.5
  18. —
    OpenAI2025.08.07
    67.4
  19. —
    Google2025.09.25
    66.4
  20. —66.1
  21. —
    Google2025.06.17
    66.0
  22. —
    Arcee AI2026.04.01
    65.7
  23. —
    Alibaba2026.04.27
    64.9
  24. —
    Google2026.04.02
    60.3
  25. —
    OpenAI2025.08.05
    60.2
  26. —
    xAI2026.03.09
    58.5
  27. —
    MiniMax2026.03.18
    54.9
  28. —
    xAI2025.11.19
    54.3
  29. —
    NVIDIA2026.03.11
    54.1

최근 60일 내 출시된 AI 34개 중 18개는 아직 이 지표에 반영되지 않았습니다 · Mistral Large 4, Perplexity Decider v1 27B, Clef Flash 외 15개

출처: LiveBench 데이터 출처·게재 중단 요청

점수 해석 시 유의사항

  • 사전에 정해진 방식으로 일괄 측정한 점수이므로, 실제 사용 환경의 결과와 다를 수 있습니다.
  • '제조사 발표' 표시가 있는 점수는 AI 개발사가 자체 발표한 수치로, 제3자 측정값이 아닙니다.