FrontierCode
자주 인용높을수록 좋음
Cognition이 만든 시험으로, 실제 오픈소스 저장소의 어려운 이슈 150개에 대해 그대로 합칠 수 있는 수준의 수정안을 내야 합니다. 동작, 기존 기능 보존, 빌드, 프로젝트 관례까지 채점하며, 가장 어려운 100개에서 다섯 번 시도한 평균으로 점수를 냅니다. 점수는 0~100%입니다. 높을수록 좋습니다.
최고 점수54.6%Claude Opus 5.5
측정한 모델36개
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
몇 시간 걸리는 개발 일도 컴퓨터를 직접 다루며 혼자 끝낼까?Terminal-Bench 4.0
Claude Sonnet 5.5🥇
Claude Sonnet 5.5🥇대중들이 가장 선호하는 코딩 답변을 하는 AI는?Arena Coding
Gemini 4 Argon🥇
Gemini 4 Argon🥇코드를 실행해 보며 고쳐 과제를 끝낼 수 있을까?LiveBench Agentic Coding
DeepSeek V4.1 Flash🥇
DeepSeek V4.1 Flash🥇
- 🥇AnthropicClaude Opus 5.5추론 강도: Medium54.6%
- 🥈AnthropicClaude Fable 553.5%
- 🥉AnthropicClaude Opus 5추론 강도: Max53.4%
- #4OpenAIGPT-6 Astra추론 강도: Max53.3%
- #5AnthropicClaude Sonnet 5.5추론 강도: Extra High52.1%
- #6AnthropicClaude Fable 5.1추론 강도: Medium50.9%
- #7OpenAIGPT-6.1 Sol추론 강도: Medium50.2%
- #8OpenAIGPT-6 Sol추론 강도: Max49.3%
- #9xAIGrok 4.648.0%
- #10xAIGrok 4.747.6%
- #11OpenAIGPT-5.6 Sol47.5%
- #12AnthropicClaude Opus 4.846.5%
- #13Moonshot AIKimi K344.2%
- #14GoogleGemini 3.7 Flash43.6%
- #15OpenAIGPT-5.543.0%
- #16AnthropicClaude Sonnet 542.7%
- #17xAIGrok 4.542.4%
- #18OpenAIGPT-6 Luna추론 강도: Max42.4%
- #19OpenAIGPT-5.6 Terra41.3%
- #20GoogleGemini 3.8 Flash추론 강도: Medium41.2%
- #21Z.aiGLM 5.3추론 강도: Max40.1%
- #22OpenAIGPT-5.6 Luna39.8%
- #23AnthropicClaude Opus 4.738.5%
- #24GoogleGemini 3.6 Flash34.4%
- #25Z.aiGLM 5.3 Flash추론 강도: Max31.8%
- #26Moonshot AIKimi K2.7 Code30.1%
- #27DeepSeekDeepSeek V4 Pro추론 강도: High28.5%
- #28OpenAIGPT-5.4 Mini27.0%
- #29AnthropicClaude Opus 4.626.6%
- #30Z.aiGLM 5.2추론 강도: None24.5%
- #31AnthropicClaude Sonnet 4.624.3%
- #32DeepSeekDeepSeek V4 Flash18.8%
- #33MiniMaxMiniMax M314.7%
- #34NVIDIANemotron 3 Ultra13.6%
- #35AlibabaQwen3.7 Plus10.2%
- #36Mistral AIMistral Medium 3.58.0%
모델 절반이 41.9% 이하최종 갱신 2026-10-07
"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.