Blueprint-Bench 2

인용 많음높을수록 좋음 · 이미지 입력 모델만

Andon Labs가 만든 공간 지각 시험으로, AI 에이전트가 아파트 내부 사진 약 20장을 보고 방의 배치·연결·크기를 담은 평면도를 그립니다. 50채를 이어서 그리며, 정답 평면도와 구조를 비교해 무작위 수준을 0으로 맞춘 점수를 냅니다. 점수는 0~100%입니다. 높을수록 좋습니다.

최고 점수54.4%Gemini 4 Argon
측정한 모델29개
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 🥇GoogleGemini 4 Argon——54.4%
  2. 🥈AnthropicClaude Opus 5.5—83.3%51.2%
  3. 🥉OpenAIGPT-6 Astra128080.0%49.7%
  4. #4AnthropicClaude Fable 5.1132070.0%41.9%
  5. #5AnthropicClaude Fable 5132535.8%38.6%
  6. #5GoogleGemini 3.8 Flash131631.7%38.6%
  7. #7OpenAIGPT-6 Sol—58.3%36.9%
  8. #8OpenAIGPT-5.5129744.2%36.2%
  9. #9GoogleGemini 3.5 Flash1308—33.6%
  10. #9OpenAIGPT-5.6 Sol127956.7%33.6%
  11. #11xAIGrok 4.6126540.0%33.2%
  12. #12xAIGrok 4.7—20.8%32.5%
  13. #13GoogleGemini 3.6 Flash129723.3%31.2%
  14. #13OpenAIGPT-6 Luna—44.2%31.2%
  15. #15OpenAIGPT-5.6 Terra127154.2%30.8%
  16. #16AnthropicClaude Opus 5—60.8%30.4%
  17. #17Moonshot AIKimi K3—34.2%29.5%
  18. #18xAIGrok 4.5128822.5%27.3%
  19. #19OpenAIGPT-5.4130237.5%27.1%
  20. #20GoogleGemini 3.1 Pro129626.7%26.5%
  21. #21AnthropicClaude Sonnet 51275—24.9%
  22. #22AnthropicClaude Opus 4.7131633.3%24.5%
  23. #23OpenAIGPT-5.6 Luna126042.5%22.6%
  24. #24AnthropicClaude Opus 4.8128942.5%14.5%
  25. #25AnthropicClaude Sonnet 4.61283—6.7%
  26. #26Moonshot AIKimi K2.6128221.7%3.9%
  27. #27GoogleGemini 3 Flash1285—0.0%
  28. #27xAIGrok 4.31230—0.0%
  29. #27AnthropicClaude Haiku 4.5——0.0%
모델 절반이 30.8% 이하최종 갱신 2026-10-06