Vending-Bench 2
인용 많음높을수록 좋음
Andon Labs가 만든 시험으로, AI가 가상의 자판기 사업을 1년 동안 운영하며 재고 관리, 공급업체와의 메일 협상, 가격 책정, 배송 사고와 환불 요구 대응을 합니다. 500달러로 시작해 1년 뒤 남은 잔고로 채점하고, 모델마다 다섯 번 돌려 평균을 냅니다. 점수는 시뮬레이션이 끝났을 때 남은 돈(달러)입니다. 높을수록 좋습니다.
최고 점수$15,515GPT-6 Astra
측정한 모델47개
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
고객 응대 업무를 규정에 맞게 처리할 수 있을까?τ³-Banking
Grok 4.6🥇
Grok 4.6🥇컴퓨터를 직접 다뤄 전문가의 실무를 해낼 수 있을까?Agents' Last Exam
Gemini 4 Argon🥇
Gemini 4 Argon🥇
- 🥇OpenAIGPT-6 Astra43.1%34.2%$15,515
- 🥈OpenAIGPT-6 Sol—32.2%$14,428
- 🥉GoogleGemini 4 Argon—39.5%$13,718
- #4AnthropicClaude Opus 544.7%32.2%$11,182
- #5AnthropicClaude Opus 4.734.6%21.1%$10,937
- #6xAIGrok 4.7——$10,537
- #7OpenAIGPT-5.6 Sol44.3%30.6%$9,619
- #8AnthropicClaude Opus 5.5—38.2%$9,235
- #9xAIGrok 4.650.7%—$9,047
- #10Z.aiGLM 5.234.6%20.4%$8,314
- #11Z.aiGLM 5.350.3%—$8,164
- #12AnthropicClaude Opus 4.6——$8,018
- #13OpenAIGPT-5.539.0%26.6%$7,524
- #14OpenAIGPT-5.6 Terra40.2%28.0%$7,343
- #15AnthropicClaude Sonnet 4.634.4%—$7,204
- #16MetaMuse Spark 1.131.8%—$6,520
- #17AnthropicClaude Sonnet 537.3%—$6,378
- #18Moonshot AIKimi K2.623.3%9.2%$6,205
- #19OpenAIGPT-5.439.6%20.5%$6,144
- #20AnthropicClaude Opus 4.834.2%27.0%$5,787
- #21AnthropicClaude Fable 5추론 강도: High38.1%—$5,680
- #22Z.aiGLM-5.113.6%11.5%$5,634
- #23AnthropicClaude Fable 5.147.2%—$5,422
- #24GoogleGemini 3.5 Flash32.2%—$5,396
- #25Moonshot AIKimi K346.0%28.3%$5,165
- #26AlibabaQwen3.6 Plus20.8%8.6%$5,115
- #27GoogleGemini 3.8 Flash45.8%—$5,094
- #28Moonshot AIKimi K2.7 Code20.2%—$5,083
- #29AnthropicClaude Opus 4.5——$4,967
- #30Z.aiGLM-5——$4,432
- #31AlibabaQwen3.6 Max——$4,254
- #32OpenAIGPT-5.6 Luna31.1%30.3%$4,095
- #33xAIGrok 4.542.1%27.0%$3,887
- #34AnthropicClaude Sonnet 4.524.5%—$3,839
- #35GoogleGemini 3.1 Pro21.4%16.4%$3,774
- #36GoogleGemini 3 Flash20.8%—$3,635
- #37DeepSeekDeepSeek V4 Pro39.6%12.4%$3,285
- #38MiniMaxMiniMax M315.3%—$2,158
- #39Moonshot AIKimi K2.514.2%—$1,198
- #40xAIGrok 4.1 Fast (Reasoning)——$1,107
- #41GoogleGemini 2.5 Pro9.7%—$574
- #42GoogleGemini 2.5 Flash——$549
- #43AnthropicClaude Haiku 4.59.3%—$459
- #44xAIGrok 4.312.4%7.2%$35
- #45OpenAIGPT OSS 120B12.8%—−$22
- #46MiniMaxMiniMax M2.5——−$23
- #47OpenAIGPT-5 Mini15.5%—−$31
모델 절반이 $5,396 이하최종 갱신 2026-10-06
"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.