Blueprint-Bench 2
인용 많음높을수록 좋음 · 이미지 입력 모델만
Andon Labs가 만든 공간 지각 시험으로, AI 에이전트가 아파트 내부 사진 약 20장을 보고 방의 배치·연결·크기를 담은 평면도를 그립니다. 50채를 이어서 그리며, 정답 평면도와 구조를 비교해 무작위 수준을 0으로 맞춘 점수를 냅니다. 점수는 0~100%입니다. 높을수록 좋습니다.
최고 점수54.4%Gemini 4 Argon
측정한 모델29개
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
대중들이 가장 선호하는 사진·도표 답변을 하는 AI는?Arena Vision
Claude Fable 5🥇
Claude Fable 5🥇조립 사진을 보고 잘못된 단계를 찾아낼까?Furniture Assembly
Claude Opus 5.5🥇
Claude Opus 5.5🥇
- 🥇GoogleGemini 4 Argon——54.4%
- 🥈AnthropicClaude Opus 5.5—83.3%51.2%
- 🥉OpenAIGPT-6 Astra128080.0%49.7%
- #4AnthropicClaude Fable 5.1132070.0%41.9%
- #5AnthropicClaude Fable 5132535.8%38.6%
- #5GoogleGemini 3.8 Flash131631.7%38.6%
- #7OpenAIGPT-6 Sol—58.3%36.9%
- #8OpenAIGPT-5.5129744.2%36.2%
- #9GoogleGemini 3.5 Flash1308—33.6%
- #9OpenAIGPT-5.6 Sol127956.7%33.6%
- #11xAIGrok 4.6126540.0%33.2%
- #12xAIGrok 4.7—20.8%32.5%
- #13GoogleGemini 3.6 Flash129723.3%31.2%
- #13OpenAIGPT-6 Luna—44.2%31.2%
- #15OpenAIGPT-5.6 Terra127154.2%30.8%
- #16AnthropicClaude Opus 5—60.8%30.4%
- #17Moonshot AIKimi K3—34.2%29.5%
- #18xAIGrok 4.5128822.5%27.3%
- #19OpenAIGPT-5.4130237.5%27.1%
- #20GoogleGemini 3.1 Pro129626.7%26.5%
- #21AnthropicClaude Sonnet 51275—24.9%
- #22AnthropicClaude Opus 4.7131633.3%24.5%
- #23OpenAIGPT-5.6 Luna126042.5%22.6%
- #24AnthropicClaude Opus 4.8128942.5%14.5%
- #25AnthropicClaude Sonnet 4.61283—6.7%
- #26Moonshot AIKimi K2.6128221.7%3.9%
- #27GoogleGemini 3 Flash1285—0.0%
- #27xAIGrok 4.31230—0.0%
- #27AnthropicClaude Haiku 4.5——0.0%
모델 절반이 30.8% 이하최종 갱신 2026-10-06