Terminal-Bench 2.1
한 줄 요약 · 컴퓨터를 직접 다루며 개발·보안·데이터 일을 혼자 끝까지 해내는지
- 무엇을 측정하나요?
- 터미널(명령 창) 안에서 AI 에이전트가 사람 도움 없이 일을 끝내는지 봅니다. 소프트웨어 개발·보안·과학 계산·데이터 처리·디버깅 등 16개 분야의 89개 과제입니다. Artificial Analysis 가 옛 TerminalBench Hard 를 레거시로 돌린 뒤 쓰는 현행 평가입니다.
- 누가 어떻게 평가하나요?
- 스탠퍼드·Laude Institute 의 Terminal-Bench 2.1 입니다. 과제마다 격리된 컨테이너에서 AI 가 셸 명령만으로 작업하고, 끝나면 별도 컨테이너의 숨은 검사가 채점합니다. 검사를 전부 통과해야 성공입니다. 과제가 망가진 것으로 드러나면 관리자가 계속 고칩니다. 이 표의 값은 Artificial Analysis 가 직접 실행한 결과입니다.
- 점수 읽는 법
- 0~100%. 상위 모델은 90% 안팎까지 올라와 최상위끼리는 차이가 작습니다. 모델과 함께 쓰는 작업 도구(하네스)에 따라 점수가 달라지므로, 다른 곳의 Terminal-Bench 점수와는 실행 조건이 같은지 확인해야 합니다.
순위
최고 점수91.4%Claude Fable 5.1
측정한 모델81개
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
몇 시간 걸리는 개발 일도 컴퓨터를 직접 다루며 혼자 끝낼까?Terminal-Bench 4.0
Claude Sonnet 5.5🥇
Claude Sonnet 5.5🥇대중들이 가장 선호하는 코딩 답변을 하는 AI는?Arena Coding
Gemini 4 Argon🥇
Gemini 4 Argon🥇코드를 실행해 보며 고쳐 과제를 끝낼 수 있을까?LiveBench Agentic Coding
DeepSeek V4.1 Flash🥇
DeepSeek V4.1 Flash🥇
- 🥇AnthropicClaude Fable 5.1추론 강도: Max91.4%
- 🥈OpenAIGPT-6 Astra추론 강도: High89.9%
- 🥉OpenAIGPT-5.6 Sol추론 강도: Extra High89.5%
- #4AnthropicClaude Opus 5추론 강도: Max89.1%
- #5xAIGrok 4.6추론 강도: High88.4%
- #6OpenAIGPT-5.6 Terra추론 강도: Max88.0%
- #7GoogleGemini 3.8 Flash추론 강도: High87.6%
- #8AlibabaQwen3.8 Flash86.1%
- #9GoogleGemini 3.7 Flash추론 강도: High85.8%
- #10MetaMuse Spark 1.3추론 강도: Extra High85.4%
- #11Moonshot AIKimi K3추론 강도: Max85.0%
- #12AnthropicClaude Fable 5추론 강도: Max84.6%
- #12AnthropicClaude Opus 4.8추론 강도: Max84.6%
- #14Z.aiGLM 5.3 Flash84.3%
- #14OpenAIGPT-5.5추론 강도: Extra High84.3%
- #16Z.aiGLM 5.3추론 강도: Max83.9%
- #17AnthropicClaude Opus 4.7추론 강도: Max83.1%
- #18Sakana AIFugu Ultra82.1%
- #19xAIGrok 4.5추론 강도: High81.6%
- #20OpenAIGPT-5.6 Luna추론 강도: Max80.9%
- #21AnthropicClaude Sonnet 5추론 강도: Max80.5%
- #22MetaMuse Spark 1.2추론 강도: Extra High80.1%
- #23DeepSeekDeepSeek V4 Flash추론 강도: Max78.7%
- #23DeepSeekDeepSeek V4 Pro추론 강도: Max78.7%
- #23GoogleGemini 3.5 Flash추론 강도: High78.7%
- #26OpenAIGPT-5.4추론 강도: Extra High78.3%
- #27Z.aiGLM 5.2추론 강도: Max77.9%
- #27MetaMuse Spark 1.1추론 강도: Extra High77.9%
- #29GoogleGemini 3.6 Flash추론 강도: High77.5%
- #30Motif TechnologiesMotif 374.9%
- #31AlibabaQwen3.7 Max74.5%
- #32GoogleGemini 3.1 Pro73.8%
- #33AnthropicClaude Sonnet 4.6추론 강도: Max71.2%
- #34Moonshot AIKimi K2.7 Code67.4%
- #35Moonshot AIKimi K2.6추론 강도: Thinking65.9%
- #36XiaomiMiMo V2.5 Pro추론 강도: Thinking65.2%
- #36MiniMaxMiniMax M365.2%
- #38TencentHy364.4%
- #39XiaomiMiMo V2.563.7%
- #40MetaMuse Spark62.2%
- #41Z.aiGLM-5.1추론 강도: Thinking61.8%
- #42AlibabaQwen3.6 Plus61.4%
- #43AlibabaQwen3.7 Plus61.0%
- #44OpenAIGPT-5.4 Nano추론 강도: Extra High60.7%
- #45OpenAIGPT-5.4 Mini추론 강도: Extra High59.2%
- #46UpstageSolar Pro 457.3%
- #47AnthropicClaude Sonnet 4.5추론 강도: Thinking55.8%
- #48MiniMaxMiniMax M2.755.4%
- #49NVIDIANemotron 3 Ultra추론 강도: Thinking53.9%
- #50GoogleGemini 3.5 Flash-Lite53.6%
- #51AlibabaQwen3.5 397B A17B추론 강도: Thinking51.3%
- #52Mistral AIMistral Medium 3.550.6%
- #53MeituanLongCat 2.050.2%
- #54DeepSeekDeepSeek V3.2추론 강도: Thinking46.8%
- #55Moonshot AIKimi K2.5추론 강도: Thinking45.7%
- #56AlibabaQwen3.6 35B A3B추론 강도: Thinking44.9%
- #57AnthropicClaude Haiku 4.5추론 강도: Thinking44.2%
- #58GoogleGemma 4 31B추론 강도: Thinking43.4%
- #59Ring AIRing-2.6-1T43.1%
- #60LG AI ResearchK-EXAONE 2.040.4%
- #61xAIGrok 4.3추론 강도: High39.7%
- #62StepfunStep 3.7 Flash39.3%
- #63SK TelecomA.X K239.0%
- #64NVIDIANemotron 3 Super추론 강도: Thinking38.6%
- #65AnthropicClaude Sonnet 4추론 강도: Thinking36.3%
- #66CohereNorth Mini Code35.6%
- #67OpenAIGPT-5추론 강도: High35.2%
- #68GoogleGemini 3.1 Flash Lite31.1%
- #69LG AI ResearchK-EXAONE추론 강도: Thinking30.3%
- #70GoogleGemini 2.5 Pro28.5%
- #71OpenAIGPT OSS 120B추론 강도: High26.2%
- #72Mistral AIMistral Small 4추론 강도: Thinking21.0%
- #73Arcee AITrinity Large Thinking20.6%
- #74AmazonNova 2 Lite추론 강도: High16.1%
- #75UpstageSolar Pro 312.0%
- #76MetaLlama 4 Maverick7.9%
- #77NVIDIANemotron 3 Nano 30B A3B추론 강도: Thinking6.7%
- #77NVIDIANemotron 3 Nano Omni6.7%
- #79OpenAIGPT-5 Mini추론 강도: High3.7%
- #79MetaLlama 4 Scout3.7%
- #81IBMGranite 4.1 8B3.4%
모델 절반이 61.8% 이하
최근 60일 내 출시된 AI 34개 중 24개는 아직 이 지표에 반영되지 않았습니다 · Mistral Large 4, Clef, Perplexity Decider v1 27B 외 21개
출처: Artificial Analysis 데이터 출처·게재 중단 요청관련 뉴스
점수 해석 시 유의사항
- 사전에 정해진 방식으로 일괄 측정한 점수이므로, 실제 사용 환경의 결과와 다를 수 있습니다.
- '제조사 발표' 표시가 있는 점수는 AI 개발사가 자체 발표한 수치로, 제3자 측정값이 아닙니다.