Terminal-Bench 2.1

한 줄 요약 · 컴퓨터를 직접 다루며 개발·보안·데이터 일을 혼자 끝까지 해내는지

무엇을 측정하나요?
터미널(명령 창) 안에서 AI 에이전트가 사람 도움 없이 일을 끝내는지 봅니다. 소프트웨어 개발·보안·과학 계산·데이터 처리·디버깅 등 16개 분야의 89개 과제입니다. Artificial Analysis 가 옛 TerminalBench Hard 를 레거시로 돌린 뒤 쓰는 현행 평가입니다.
누가 어떻게 평가하나요?
스탠퍼드·Laude Institute 의 Terminal-Bench 2.1 입니다. 과제마다 격리된 컨테이너에서 AI 가 셸 명령만으로 작업하고, 끝나면 별도 컨테이너의 숨은 검사가 채점합니다. 검사를 전부 통과해야 성공입니다. 과제가 망가진 것으로 드러나면 관리자가 계속 고칩니다. 이 표의 값은 Artificial Analysis 가 직접 실행한 결과입니다.
점수 읽는 법
0~100%. 상위 모델은 90% 안팎까지 올라와 최상위끼리는 차이가 작습니다. 모델과 함께 쓰는 작업 도구(하네스)에 따라 점수가 달라지므로, 다른 곳의 Terminal-Bench 점수와는 실행 조건이 같은지 확인해야 합니다.

순위

최고 점수91.4%Claude Fable 5.1
측정한 모델81개
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 🥇AnthropicClaude Fable 5.1추론 강도: Max91.4%
  2. 🥈OpenAIGPT-6 Astra추론 강도: High89.9%
  3. 🥉OpenAIGPT-5.6 Sol추론 강도: Extra High89.5%
  4. #4AnthropicClaude Opus 5추론 강도: Max89.1%
  5. #5xAIGrok 4.6추론 강도: High88.4%
  6. #6OpenAIGPT-5.6 Terra추론 강도: Max88.0%
  7. #7GoogleGemini 3.8 Flash추론 강도: High87.6%
  8. #8AlibabaQwen3.8 Flash86.1%
  9. #9GoogleGemini 3.7 Flash추론 강도: High85.8%
  10. #10MetaMuse Spark 1.3추론 강도: Extra High85.4%
  11. #11Moonshot AIKimi K3추론 강도: Max85.0%
  12. #12AnthropicClaude Fable 5추론 강도: Max84.6%
  13. #12AnthropicClaude Opus 4.8추론 강도: Max84.6%
  14. #14Z.aiGLM 5.3 Flash84.3%
  15. #14OpenAIGPT-5.5추론 강도: Extra High84.3%
  16. #16Z.aiGLM 5.3추론 강도: Max83.9%
  17. #17AnthropicClaude Opus 4.7추론 강도: Max83.1%
  18. #18Sakana AIFugu Ultra82.1%
  19. #19xAIGrok 4.5추론 강도: High81.6%
  20. #20OpenAIGPT-5.6 Luna추론 강도: Max80.9%
  21. #21AnthropicClaude Sonnet 5추론 강도: Max80.5%
  22. #22MetaMuse Spark 1.2추론 강도: Extra High80.1%
  23. #23DeepSeekDeepSeek V4 Flash추론 강도: Max78.7%
  24. #23DeepSeekDeepSeek V4 Pro추론 강도: Max78.7%
  25. #23GoogleGemini 3.5 Flash추론 강도: High78.7%
  26. #26OpenAIGPT-5.4추론 강도: Extra High78.3%
  27. #27Z.aiGLM 5.2추론 강도: Max77.9%
  28. #27MetaMuse Spark 1.1추론 강도: Extra High77.9%
  29. #29GoogleGemini 3.6 Flash추론 강도: High77.5%
  30. #30Motif TechnologiesMotif 374.9%
  31. #31AlibabaQwen3.7 Max74.5%
  32. #32GoogleGemini 3.1 Pro73.8%
  33. #33AnthropicClaude Sonnet 4.6추론 강도: Max71.2%
  34. #34Moonshot AIKimi K2.7 Code67.4%
  35. #35Moonshot AIKimi K2.6추론 강도: Thinking65.9%
  36. #36XiaomiMiMo V2.5 Pro추론 강도: Thinking65.2%
  37. #36MiniMaxMiniMax M365.2%
  38. #38TencentHy364.4%
  39. #39XiaomiMiMo V2.563.7%
  40. #40MetaMuse Spark62.2%
  41. #41Z.aiGLM-5.1추론 강도: Thinking61.8%
  42. #42AlibabaQwen3.6 Plus61.4%
  43. #43AlibabaQwen3.7 Plus61.0%
  44. #44OpenAIGPT-5.4 Nano추론 강도: Extra High60.7%
  45. #45OpenAIGPT-5.4 Mini추론 강도: Extra High59.2%
  46. #46UpstageSolar Pro 457.3%
  47. #47AnthropicClaude Sonnet 4.5추론 강도: Thinking55.8%
  48. #48MiniMaxMiniMax M2.755.4%
  49. #49NVIDIANemotron 3 Ultra추론 강도: Thinking53.9%
  50. #50GoogleGemini 3.5 Flash-Lite53.6%
  51. #51AlibabaQwen3.5 397B A17B추론 강도: Thinking51.3%
  52. #52Mistral AIMistral Medium 3.550.6%
  53. #53MeituanLongCat 2.050.2%
  54. #54DeepSeekDeepSeek V3.2추론 강도: Thinking46.8%
  55. #55Moonshot AIKimi K2.5추론 강도: Thinking45.7%
  56. #56AlibabaQwen3.6 35B A3B추론 강도: Thinking44.9%
  57. #57AnthropicClaude Haiku 4.5추론 강도: Thinking44.2%
  58. #58GoogleGemma 4 31B추론 강도: Thinking43.4%
  59. #59Ring AIRing-2.6-1T43.1%
  60. #60LG AI ResearchK-EXAONE 2.040.4%
  61. #61xAIGrok 4.3추론 강도: High39.7%
  62. #62StepfunStep 3.7 Flash39.3%
  63. #63SK TelecomA.X K239.0%
  64. #64NVIDIANemotron 3 Super추론 강도: Thinking38.6%
  65. #65AnthropicClaude Sonnet 4추론 강도: Thinking36.3%
  66. #66CohereNorth Mini Code35.6%
  67. #67OpenAIGPT-5추론 강도: High35.2%
  68. #68GoogleGemini 3.1 Flash Lite31.1%
  69. #69LG AI ResearchK-EXAONE추론 강도: Thinking30.3%
  70. #70GoogleGemini 2.5 Pro28.5%
  71. #71OpenAIGPT OSS 120B추론 강도: High26.2%
  72. #72Mistral AIMistral Small 4추론 강도: Thinking21.0%
  73. #73Arcee AITrinity Large Thinking20.6%
  74. #74AmazonNova 2 Lite추론 강도: High16.1%
  75. #75UpstageSolar Pro 312.0%
  76. #76MetaLlama 4 Maverick7.9%
  77. #77NVIDIANemotron 3 Nano 30B A3B추론 강도: Thinking6.7%
  78. #77NVIDIANemotron 3 Nano Omni6.7%
  79. #79OpenAIGPT-5 Mini추론 강도: High3.7%
  80. #79MetaLlama 4 Scout3.7%
  81. #81IBMGranite 4.1 8B3.4%
모델 절반이 61.8% 이하

최근 60일 내 출시된 AI 34개 중 24개는 아직 이 지표에 반영되지 않았습니다 · Mistral Large 4, Clef, Perplexity Decider v1 27B 외 21개

출처: Artificial Analysis 데이터 출처·게재 중단 요청

관련 뉴스

점수 해석 시 유의사항

  • 사전에 정해진 방식으로 일괄 측정한 점수이므로, 실제 사용 환경의 결과와 다를 수 있습니다.
  • '제조사 발표' 표시가 있는 점수는 AI 개발사가 자체 발표한 수치로, 제3자 측정값이 아닙니다.