Vending-Bench 2

인용 많음높을수록 좋음

Andon Labs가 만든 시험으로, AI가 가상의 자판기 사업을 1년 동안 운영하며 재고 관리, 공급업체와의 메일 협상, 가격 책정, 배송 사고와 환불 요구 대응을 합니다. 500달러로 시작해 1년 뒤 남은 잔고로 채점하고, 모델마다 다섯 번 돌려 평균을 냅니다. 점수는 시뮬레이션이 끝났을 때 남은 돈(달러)입니다. 높을수록 좋습니다.

최고 점수$15,515GPT-6 Astra
측정한 모델47개
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 🥇OpenAIGPT-6 Astra43.1%34.2%$15,515
  2. 🥈OpenAIGPT-6 Sol—32.2%$14,428
  3. 🥉GoogleGemini 4 Argon—39.5%$13,718
  4. #4AnthropicClaude Opus 544.7%32.2%$11,182
  5. #5AnthropicClaude Opus 4.734.6%21.1%$10,937
  6. #6xAIGrok 4.7——$10,537
  7. #7OpenAIGPT-5.6 Sol44.3%30.6%$9,619
  8. #8AnthropicClaude Opus 5.5—38.2%$9,235
  9. #9xAIGrok 4.650.7%—$9,047
  10. #10Z.aiGLM 5.234.6%20.4%$8,314
  11. #11Z.aiGLM 5.350.3%—$8,164
  12. #12AnthropicClaude Opus 4.6——$8,018
  13. #13OpenAIGPT-5.539.0%26.6%$7,524
  14. #14OpenAIGPT-5.6 Terra40.2%28.0%$7,343
  15. #15AnthropicClaude Sonnet 4.634.4%—$7,204
  16. #16MetaMuse Spark 1.131.8%—$6,520
  17. #17AnthropicClaude Sonnet 537.3%—$6,378
  18. #18Moonshot AIKimi K2.623.3%9.2%$6,205
  19. #19OpenAIGPT-5.439.6%20.5%$6,144
  20. #20AnthropicClaude Opus 4.834.2%27.0%$5,787
  21. #21AnthropicClaude Fable 5추론 강도: High38.1%—$5,680
  22. #22Z.aiGLM-5.113.6%11.5%$5,634
  23. #23AnthropicClaude Fable 5.147.2%—$5,422
  24. #24GoogleGemini 3.5 Flash32.2%—$5,396
  25. #25Moonshot AIKimi K346.0%28.3%$5,165
  26. #26AlibabaQwen3.6 Plus20.8%8.6%$5,115
  27. #27GoogleGemini 3.8 Flash45.8%—$5,094
  28. #28Moonshot AIKimi K2.7 Code20.2%—$5,083
  29. #29AnthropicClaude Opus 4.5——$4,967
  30. #30Z.aiGLM-5——$4,432
  31. #31AlibabaQwen3.6 Max——$4,254
  32. #32OpenAIGPT-5.6 Luna31.1%30.3%$4,095
  33. #33xAIGrok 4.542.1%27.0%$3,887
  34. #34AnthropicClaude Sonnet 4.524.5%—$3,839
  35. #35GoogleGemini 3.1 Pro21.4%16.4%$3,774
  36. #36GoogleGemini 3 Flash20.8%—$3,635
  37. #37DeepSeekDeepSeek V4 Pro39.6%12.4%$3,285
  38. #38MiniMaxMiniMax M315.3%—$2,158
  39. #39Moonshot AIKimi K2.514.2%—$1,198
  40. #40xAIGrok 4.1 Fast (Reasoning)——$1,107
  41. #41GoogleGemini 2.5 Pro9.7%—$574
  42. #42GoogleGemini 2.5 Flash——$549
  43. #43AnthropicClaude Haiku 4.59.3%—$459
  44. #44xAIGrok 4.312.4%7.2%$35
  45. #45OpenAIGPT OSS 120B12.8%—−$22
  46. #46MiniMaxMiniMax M2.5——−$23
  47. #47OpenAIGPT-5 Mini15.5%—−$31
모델 절반이 $5,396 이하최종 갱신 2026-10-06

"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.