LiveCodeBench

한 줄 요약 · 최근에 나온 프로그래밍 문제를 얼마나 풀어내는지

무엇을 측정하나요?
Artificial Analysis 가 '레거시' 로 분류해 새 모델 측정이 드문 평가입니다(최근 모델은 표에 없을 수 있음). 프로그래밍 대회 문제를 풀어 코딩 실력을 봅니다. 알고리즘을 설계하고, 제한 시간 안에 정확히 동작하는 코드를 쓰는 능력입니다.
누가 어떻게 평가하나요?
UC 버클리·MIT·코넬 연구진이 LeetCode·AtCoder·Codeforces 의 새 대회 문제를 계속 수집합니다. 문제마다 출제일이 붙어 있어 AI 가 학습한 시점 이후의 문제만 골라 평가할 수 있고(암기 방지), 제출 코드를 실제 실행해 첫 시도 통과율(pass@1)로 채점합니다.
점수 읽는 법
0~100%. 평가에 쓴 문제 구간(기간)에 따라 점수가 달라지므로, 다른 곳의 LiveCodeBench 점수와는 구간이 같은지 확인해야 합니다.

순위

최고 점수93.2%Fugu Ultra
측정한 모델29개
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 🥇Sakana AIFugu Ultra93.2%
  2. 🥈Sakana AIFugu92.9%
  3. 🥉UpstageSolar Pro 492.4%
  4. #4GoogleGemini 3 Flash추론 강도: Thinking90.8%
  5. #5OpenAIGPT OSS 120B추론 강도: High87.8%
  6. #6AnthropicClaude Opus 4.5추론 강도: Thinking87.1%
  7. #7DeepSeekDeepSeek V3.2추론 강도: Thinking86.2%
  8. #8OpenAIGPT-5추론 강도: High84.6%
  9. #9OpenAIGPT-5 Mini추론 강도: High83.8%
  10. #10xAIGrok 4.1 Fast (Reasoning)추론 강도: Thinking82.2%
  11. #11BaiduERNIE 5.0 Thinking81.2%
  12. #12GoogleGemini 2.5 Pro80.1%
  13. #13OpenAIGPT-5 Nano추론 강도: High78.9%
  14. #14LG AI ResearchK-EXAONE추론 강도: Thinking76.8%
  15. #15NVIDIANemotron 3 Nano 30B A3B추론 강도: Thinking74.1%
  16. #16AnthropicClaude Sonnet 4.5추론 강도: Thinking71.4%
  17. #17AmazonNova 2 Lite추론 강도: High71.1%
  18. #18GoogleGemini 2.5 Flash추론 강도: Thinking69.5%
  19. #19GoogleGemini 2.5 Flash Lite추론 강도: Thinking68.8%
  20. #20AnthropicClaude Sonnet 4추론 강도: Thinking65.5%
  21. #21AnthropicClaude Opus 4.1추론 강도: Thinking65.4%
  22. #22AnthropicClaude Opus 4추론 강도: Thinking63.6%
  23. #23AnthropicClaude Haiku 4.5추론 강도: Thinking61.5%
  24. #24OpenAIGPT-4.145.7%
  25. #25xAIGrok 4.1 Fast추론 강도: None39.9%
  26. #26MetaLlama 4 Maverick39.7%
  27. #27MetaLlama 4 Scout29.9%
  28. #28PerplexitySonar29.5%
  29. #29Mistral AIMistral Small 411.1%
모델 절반이 74.1% 이하

최근 60일 내 출시된 AI 34개 중 34개는 아직 이 지표에 반영되지 않았습니다 · Mistral Large 4, Perplexity Decider v1 27B, Clef Flash 외 31개

출처: Artificial Analysis 데이터 출처·게재 중단 요청

관련 뉴스

점수 해석 시 유의사항

  • 사전에 정해진 방식으로 일괄 측정한 점수이므로, 실제 사용 환경의 결과와 다를 수 있습니다.
  • '제조사 발표' 표시가 있는 점수는 AI 개발사가 자체 발표한 수치로, 제3자 측정값이 아닙니다.