LiveCodeBench
한 줄 요약 · 최근에 나온 프로그래밍 문제를 얼마나 풀어내는지
- 무엇을 측정하나요?
- Artificial Analysis 가 '레거시' 로 분류해 새 모델 측정이 드문 평가입니다(최근 모델은 표에 없을 수 있음). 프로그래밍 대회 문제를 풀어 코딩 실력을 봅니다. 알고리즘을 설계하고, 제한 시간 안에 정확히 동작하는 코드를 쓰는 능력입니다.
- 누가 어떻게 평가하나요?
- UC 버클리·MIT·코넬 연구진이 LeetCode·AtCoder·Codeforces 의 새 대회 문제를 계속 수집합니다. 문제마다 출제일이 붙어 있어 AI 가 학습한 시점 이후의 문제만 골라 평가할 수 있고(암기 방지), 제출 코드를 실제 실행해 첫 시도 통과율(pass@1)로 채점합니다.
- 점수 읽는 법
- 0~100%. 평가에 쓴 문제 구간(기간)에 따라 점수가 달라지므로, 다른 곳의 LiveCodeBench 점수와는 구간이 같은지 확인해야 합니다.
순위
최고 점수93.2%Fugu Ultra
측정한 모델29개
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
몇 시간 걸리는 개발 일도 컴퓨터를 직접 다루며 혼자 끝낼까?Terminal-Bench 4.0
Claude Sonnet 5.5🥇
Claude Sonnet 5.5🥇대중들이 가장 선호하는 코딩 답변을 하는 AI는?Arena Coding
Gemini 4 Argon🥇
Gemini 4 Argon🥇코드를 실행해 보며 고쳐 과제를 끝낼 수 있을까?LiveBench Agentic Coding
DeepSeek V4.1 Flash🥇
DeepSeek V4.1 Flash🥇
- 🥇Sakana AIFugu Ultra93.2%
- 🥈Sakana AIFugu92.9%
- 🥉UpstageSolar Pro 492.4%
- #4GoogleGemini 3 Flash추론 강도: Thinking90.8%
- #5OpenAIGPT OSS 120B추론 강도: High87.8%
- #6AnthropicClaude Opus 4.5추론 강도: Thinking87.1%
- #7DeepSeekDeepSeek V3.2추론 강도: Thinking86.2%
- #8OpenAIGPT-5추론 강도: High84.6%
- #9OpenAIGPT-5 Mini추론 강도: High83.8%
- #10xAIGrok 4.1 Fast (Reasoning)추론 강도: Thinking82.2%
- #11BaiduERNIE 5.0 Thinking81.2%
- #12GoogleGemini 2.5 Pro80.1%
- #13OpenAIGPT-5 Nano추론 강도: High78.9%
- #14LG AI ResearchK-EXAONE추론 강도: Thinking76.8%
- #15NVIDIANemotron 3 Nano 30B A3B추론 강도: Thinking74.1%
- #16AnthropicClaude Sonnet 4.5추론 강도: Thinking71.4%
- #17AmazonNova 2 Lite추론 강도: High71.1%
- #18GoogleGemini 2.5 Flash추론 강도: Thinking69.5%
- #19GoogleGemini 2.5 Flash Lite추론 강도: Thinking68.8%
- #20AnthropicClaude Sonnet 4추론 강도: Thinking65.5%
- #21AnthropicClaude Opus 4.1추론 강도: Thinking65.4%
- #22AnthropicClaude Opus 4추론 강도: Thinking63.6%
- #23AnthropicClaude Haiku 4.5추론 강도: Thinking61.5%
- #24OpenAIGPT-4.145.7%
- #25xAIGrok 4.1 Fast추론 강도: None39.9%
- #26MetaLlama 4 Maverick39.7%
- #27MetaLlama 4 Scout29.9%
- #28PerplexitySonar29.5%
- #29Mistral AIMistral Small 411.1%
모델 절반이 74.1% 이하
최근 60일 내 출시된 AI 34개 중 34개는 아직 이 지표에 반영되지 않았습니다 · Mistral Large 4, Perplexity Decider v1 27B, Clef Flash 외 31개
출처: Artificial Analysis 데이터 출처·게재 중단 요청관련 뉴스
점수 해석 시 유의사항
- 사전에 정해진 방식으로 일괄 측정한 점수이므로, 실제 사용 환경의 결과와 다를 수 있습니다.
- '제조사 발표' 표시가 있는 점수는 AI 개발사가 자체 발표한 수치로, 제3자 측정값이 아닙니다.