AA Coding Index
한 줄 요약 · 코딩 관련 시험들을 합친 종합 성적표
- 무엇을 측정하나요?
- 코딩 실력만 따로 뽑아 본 성적입니다. 짧은 문제 풀이가 아니라, 명령 창(터미널)에서 프로그램을 고치고 설정하는 작업과 과학 연구용 코드 작성처럼 실제 개발에 가까운 과제로 잽니다.
- 누가 어떻게 평가하나요?
- Artificial Analysis 가 종합 지수 중 코딩 계열 두 평가(Terminal-Bench, SciCode)의 점수를 평균합니다. 두 평가 모두 제출된 코드를 실제로 실행해 통과 여부로 채점하므로, 그럴듯해 보이는 코드가 아니라 동작하는 코드가 점수를 받습니다.
- 점수 읽는 법
- 0~100점입니다. 과제 자체가 어려워 상위 모델도 절반 안팎에 머무는 경우가 많으므로 50점이 낮은 점수는 아닙니다. 특정 언어·프레임워크 숙련도나 코드 가독성은 따로 재지 않습니다. 구성 평가는 종합 지수 개편에 따라 바뀌어 왔습니다.
순위
최고 점수81.6Claude Fable 5.1
측정한 모델100개
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
몇 시간 걸리는 개발 일도 컴퓨터를 직접 다루며 혼자 끝낼까?Terminal-Bench 4.0
Claude Sonnet 5.5🥇
Claude Sonnet 5.5🥇대중들이 가장 선호하는 코딩 답변을 하는 AI는?Arena Coding
Gemini 4 Argon🥇
Gemini 4 Argon🥇코드를 실행해 보며 고쳐 과제를 끝낼 수 있을까?LiveBench Agentic Coding
DeepSeek V4.1 Flash🥇
DeepSeek V4.1 Flash🥇
- 🥇AnthropicClaude Fable 5.1추론 강도: Max81.6
- 🥈OpenAIGPT-5.6 Sol추론 강도: Extra High78.3
- 🥉AnthropicClaude Opus 5추론 강도: Max78.0
- #4OpenAIGPT-6 Astra추론 강도: High77.1
- #5xAIGrok 4.6추론 강도: High76.8
- #6OpenAIGPT-5.6 Terra추론 강도: Max76.7
- #7AnthropicClaude Fable 5추론 강도: Max76.5
- #7MetaMuse Spark 1.3추론 강도: Extra High76.5
- #9GoogleGemini 3.8 Flash추론 강도: High76.3
- #10Moonshot AIKimi K3추론 강도: Max76.2
- #11GoogleGemini 3.7 Flash추론 강도: High76.1
- #12OpenAIGPT-5.5추론 강도: Extra High74.9
- #13Z.aiGLM 5.3추론 강도: Max74.8
- #14AnthropicClaude Opus 4.8추론 강도: Max74.3
- #15AnthropicClaude Opus 4.7추론 강도: Max73.6
- #16AlibabaQwen3.8 Flash73.1
- #17xAIGrok 4.5추론 강도: High72.4
- #18MetaMuse Spark 1.2추론 강도: Extra High72.2
- #19AnthropicClaude Sonnet 5추론 강도: Max71.5
- #19Z.aiGLM 5.3 Flash71.5
- #21OpenAIGPT-5.6 Luna추론 강도: Max71.4
- #22MetaMuse Spark 1.1추론 강도: Extra High71.3
- #23OpenAIGPT-5.4추론 강도: Extra High71.1
- #24GoogleGemini 3.5 Flash추론 강도: High70.1
- #25GoogleGemini 3.6 Flash추론 강도: High69.2
- #26DeepSeekDeepSeek V4 Flash추론 강도: Max69.1
- #27DeepSeekDeepSeek V4 Pro추론 강도: Max68.8
- #27GoogleGemini 3.1 Pro68.8
- #27Z.aiGLM 5.2추론 강도: Max68.8
- #30AlibabaQwen3.7 Max66.0
- #31Motif TechnologiesMotif 363.5
- #32AnthropicClaude Sonnet 4.6추론 강도: Max63.0
- #33Moonshot AIKimi K2.6추론 강도: Thinking61.8
- #34Moonshot AIKimi K2.7 Code60.8
- #35XiaomiMiMo V2.5 Pro추론 강도: Thinking60.2
- #36TencentHy358.8
- #37MiniMaxMiniMax M358.6
- #37MetaMuse Spark58.6
- #39XiaomiMiMo V2.556.8
- #40OpenAIGPT-5.4 Mini추론 강도: Extra High56.1
- #40OpenAIGPT-5.4 Nano추론 강도: Extra High56.1
- #42AlibabaQwen3.7 Plus55.9
- #43Z.aiGLM-5.1추론 강도: Thinking55.8
- #44AlibabaQwen3.6 Plus54.5
- #45UpstageSolar Pro 452.7
- #46MiniMaxMiniMax M2.752.6
- #47AnthropicClaude Sonnet 4.5추론 강도: Thinking52.1
- #48GoogleGemini 3.5 Flash-Lite49.3
- #48NVIDIANemotron 3 Ultra추론 강도: Thinking49.3
- #50AlibabaQwen3.5 397B A17B추론 강도: Thinking48.2
- #51AnthropicClaude Opus 4.648.1
- #52AnthropicClaude Opus 4.547.8
- #53Mistral AIMistral Medium 3.546.9
- #54Moonshot AIKimi K2.5추론 강도: Thinking46.8
- #55MeituanLongCat 2.045.3
- #56AlibabaQwen3.6 Max44.9
- #57DeepSeekDeepSeek V3.2추론 강도: Thinking44.2
- #57Z.aiGLM-544.2
- #59AnthropicClaude Haiku 4.5추론 강도: Thinking43.9
- #60GoogleGemma 4 31B추론 강도: Thinking43.4
- #61Ring AIRing-2.6-1T42.8
- #62GoogleGemini 3 Flash42.6
- #63xAIGrok 4.3추론 강도: High42.2
- #64AlibabaQwen3.6 35B A3B추론 강도: Thinking41.9
- #65XiaomiMiMo V2 Pro41.4
- #66LG AI ResearchK-EXAONE 2.040.6
- #67xAIGrok 4.20 (Reasoning)40.5
- #68StepfunStep 3.7 Flash39.6
- #69SK TelecomA.X K238.8
- #70OpenAIGPT-5추론 강도: High37.8
- #71NVIDIANemotron 3 Super추론 강도: Thinking37.7
- #72AnthropicClaude Sonnet 4추론 강도: Thinking37.6
- #73MiniMaxMiniMax M2.537.4
- #74AnthropicClaude Opus 4.136.5
- #74CohereNorth Mini Code36.5
- #76Z.aiGLM 5V Turbo36.2
- #77GoogleGemini 3.1 Flash Lite34.7
- #78AnthropicClaude Opus 434.0
- #79GoogleGemini 2.5 Pro33.3
- #80LG AI ResearchK-EXAONE추론 강도: Thinking32.1
- #81xAIGrok 4.1 Fast (Reasoning)30.9
- #82OpenAIGPT OSS 120B추론 강도: High30.4
- #83BaiduERNIE 5.0 Thinking29.2
- #84Mistral AIMistral Small 4추론 강도: Thinking26.6
- #85Arcee AITrinity Large Thinking25.8
- #86AmazonNova 2 Lite추론 강도: High23.0
- #87OpenAIGPT-5 Nano22.9
- #88GoogleGemini 2.5 Flash22.2
- #89xAIGrok 4.2022.0
- #90OpenAIGPT-4.121.8
- #91xAIGrok 4.1 Fast19.5
- #92MeituanLongcat Flash Chat16.5
- #93MetaLlama 4 Maverick16.3
- #94UpstageSolar Pro 316.2
- #95OpenAIGPT-5 Mini추론 강도: High15.6
- #96GoogleGemini 2.5 Flash Lite14.5
- #97NVIDIANemotron 3 Nano 30B A3B추론 강도: Thinking14.4
- #98NVIDIANemotron 3 Nano Omni13.8
- #99IBMGranite 4.1 8B9.5
- #100MetaLlama 4 Scout8.2
모델 절반이 48.2 이하
최근 60일 내 출시된 AI 34개 중 24개는 아직 이 지표에 반영되지 않았습니다 · Mistral Large 4, Perplexity Decider v1 27B, Clef Flash 외 21개
출처: Artificial Analysis 데이터 출처·게재 중단 요청점수 해석 시 유의사항
- 사전에 정해진 방식으로 일괄 측정한 점수이므로, 실제 사용 환경의 결과와 다를 수 있습니다.
- '제조사 발표' 표시가 있는 점수는 AI 개발사가 자체 발표한 수치로, 제3자 측정값이 아닙니다.