LiveBench Coding
한 줄 요약 · 매달 새로 내는 프로그래밍 문제를 얼마나 푸는지
- 무엇을 측정하나요?
- 프로그래밍 대회 문제 풀이와 코드 이어 쓰기 실력입니다. 한 번에 정답 코드를 내는 능력을 봅니다.
- 누가 어떻게 평가하나요?
- Abacus.AI·뉴욕대 등 연구진이 만든 LiveBench 는 최근 대회 문제·논문·뉴스에서 매달 새 문제를 내어, AI 가 학습 중에 문제를 미리 봤을 가능성(오염)을 줄입니다. 답이 정해진 문제만 내고 프로그램이 자동 채점하며 다른 AI 가 채점하지 않습니다. 이 표는 livebench.ai 가 공개한 최신 월간 결과표를 가져오되, 최신 표에서 빠진 AI 는 마지막으로 실린 점수를 순위 없이 표 아래에 따로 보여 줍니다. 코딩 과목은 최근 대회 문제(LiveCodeBench 출처)의 코드 생성과, 실제 GitHub 저장소 코드의 빈 부분을 채우는 코드 완성 과제로 구성되며 실행 결과로 채점합니다.
- 점수 읽는 법
- 0~100점입니다. 문항이 어렵게 설계돼 최상위 AI 도 70점을 넘기기 어려우며, 매달 문제가 바뀌므로 시점이 다른 점수는 직접 비교하지 않는 것이 좋습니다. 혼자서 저장소를 고치는 '에이전틱 코딩' 과는 별개 과목입니다.
마지막 업데이트: 2026-06-25
순위
최고 점수89.3Claude Opus 5.5
측정한 모델50개
최근 갱신2026.06.25
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
몇 시간 걸리는 개발 일도 컴퓨터를 직접 다루며 혼자 끝낼까?Terminal-Bench 4.0
Claude Sonnet 5.5🥇
Claude Sonnet 5.5🥇대중들이 가장 선호하는 코딩 답변을 하는 AI는?Arena Coding
Gemini 4 Argon🥇
Gemini 4 Argon🥇코드를 실행해 보며 고쳐 과제를 끝낼 수 있을까?LiveBench Agentic Coding
DeepSeek V4.1 Flash🥇
DeepSeek V4.1 Flash🥇
- 🥇AnthropicClaude Opus 5.589.3
- 🥈AnthropicClaude Sonnet 5.588.9
- 🥉AnthropicClaude Fable 5.186.4
- #4AnthropicClaude Fable 586.0
- #5OpenAIGPT-5.6 Sol83.9
- #6OpenAIGPT-5.6 Luna82.9
- #7OpenAIGPT-5.582.2
- #8AnthropicClaude Opus 4.782.1
- #9AnthropicClaude Opus 4.881.8
- #10OpenAIGPT-6 Sol81.8
- #11AnthropicClaude Opus 581.5
- #11Moonshot AIKimi K381.5
- #13MetaMuse Spark 1.381.1
- #14OpenAIGPT-6.1 Sol80.7
- #15AnthropicClaude Sonnet 580.7
- #16OpenAIGPT-6 Astra80.4
- #17DeepSeekDeepSeek V4.1 Flash80.0
- #18AnthropicClaude Opus 4.579.7
- #18Z.aiGLM 5.279.7
- #20AnthropicClaude Sonnet 4.679.3
- #21Z.aiGLM 5.379.0
- #21Z.aiGLM 5.3 Flash79.0
- #21OpenAIGPT-6 Luna79.0
- #24GoogleGemini 3.7 Flash78.9
- #25Moonshot AIKimi K2.678.6
- #26OpenAIGPT-5.6 Terra78.3
- #27AnthropicClaude Opus 4.678.2
- #27GoogleGemini 3.5 Flash78.2
- #27AlibabaQwen3.6 Plus78.2
- #30GoogleGemini 3.6 Flash77.9
- #31OpenAIGPT-5.477.5
- #31MetaMuse Spark 1.277.5
- #33xAIGrok 4.777.2
- #33MetaMuse Spark 1.177.2
- #35xAIGrok 4.676.8
- #36GoogleGemini 3.1 Pro76.5
- #37GoogleGemini 3.5 Flash-Lite76.1
- #38AlibabaQwen3.7 Max74.2
- #39Moonshot AIKimi K2.7 Code74.0
- #40AlibabaQwen3.8 Flash72.5
- #41GoogleGemini 3.8 Flash72.5
- #42OpenAIGPT-5.4 Mini71.6
- #43OpenAIGPT-5.4 Nano70.8
- #44NVIDIANemotron 3 Ultra70.7
- #45DeepSeekDeepSeek V4 Pro70.0
- #46xAIGrok 4.369.9
- #47DeepSeekDeepSeek V4 Flash69.2
- #48xAIGrok 4.568.6
- #49MiniMaxMiniMax M368.2
- #50xAIGrok Build 0.165.4
모델 절반이 78.4 이하최종 갱신 2026-06-25
이전 순위표 기준 점수
최신 순위표(2026.06.25)에 반영되지 않은 점수입니다. 출처에서 빠졌거나 아직 갱신되지 않은 모델로, 마지막으로 받은 점수를 참고로 보여 주며 순위는 매기지 않습니다.
- —2025.12.17$2.3878.6

- —2026.01.27$2.1377.9
- —2025.05.22$1277.5
- —2025.09.29$1276.1
- —2025.08.07$1.5676.1
- —2025.12.01$0.8475.7
- —2025.06.17$7.8175.7

- —2026.04.07$3.6575.4
- —2025.08.05$6074.7
- —2026.04.01$3.3073.9
- —2026.02.11$2.4073.6
- —2025.10.15$472.2
- —2025.08.07$7.8172.1
- —2026.02.12$0.9770.7
- —2025.09.15$0.4269.6
- —2026.03.18$2.5068.8

- —2026.03.03$1.1968.5

- —2025.08.07$0.3167.4
- —2025.09.25$0.3366.4

- —2026.03.31$2.1966.1
- —2025.06.17$1.9566.0

- —2026.04.01$0.6665.7
- —2026.04.27$0.8964.9
- —2026.04.02$0.3460.3

- —2025.08.05$0.3760.2
- —2026.03.09$2.1958.5
- —2026.03.18$0.9754.9
- —2025.11.19$0.4254.3
- —2026.03.11$0.3454.1
최근 60일 내 출시된 AI 34개 중 18개는 아직 이 지표에 반영되지 않았습니다 · Mistral Large 4, Perplexity Decider v1 27B, Clef Flash 외 15개
출처: LiveBench 데이터 출처·게재 중단 요청점수 해석 시 유의사항
- 사전에 정해진 방식으로 일괄 측정한 점수이므로, 실제 사용 환경의 결과와 다를 수 있습니다.
- '제조사 발표' 표시가 있는 점수는 AI 개발사가 자체 발표한 수치로, 제3자 측정값이 아닙니다.