AI 비교AI 찾기AI 뉴스AI 활용
회사 소개
개인정보처리방침이용약관FAQ문의하기문의하기
에이아이비 주식회사사업자정보
© 2026 AIB Inc.

비전 AI 모델, 색연필 드로잉 성능 비교 결과

비전 AI 모델, 색연필 드로잉 성능 비교 결과

tryai.dev·2026년 7월 22일 (수)
  • •TryAI가 동일한 색연필 도구 세트를 활용해 4개 비전 모델의 드로잉 능력을 시험했다.
  • •Claude Fable 5의 비용은 7개 그림 기준 160.58달러로, GPT-5.6 Sol 대비 약 20배 높았다.
  • •모델들은 드로잉 과정 중반에 최고 성능을 보인 뒤 최종 결과물에서는 성능이 하락하는 정체 현상을 나타냈다.
  • •TryAI가 동일한 색연필 도구 세트를 활용해 4개 비전 모델의 드로잉 능력을 시험했다.
  • •Claude Fable 5의 비용은 7개 그림 기준 160.58달러로, GPT-5.6 Sol 대비 약 20배 높았다.
  • •모델들은 드로잉 과정 중반에 최고 성능을 보인 뒤 최종 결과물에서는 성능이 하락하는 정체 현상을 나타냈다.
  • •TryAI가 동일한 색연필 도구 세트를 활용해 4개 비전 모델의 드로잉 능력을 시험했다.
  • •Claude Fable 5의 비용은 7개 그림 기준 160.58달러로, GPT-5.6 Sol 대비 약 20배 높았다.
  • •모델들은 드로잉 과정 중반에 최고 성능을 보인 뒤 최종 결과물에서는 성능이 하락하는 정체 현상을 나타냈다.
  • •TryAI가 동일한 색연필 도구 세트를 활용해 4개 비전 모델의 드로잉 능력을 시험했다.
  • •Claude Fable 5의 비용은 7개 그림 기준 160.58달러로, GPT-5.6 Sol 대비 약 20배 높았다.
  • •모델들은 드로잉 과정 중반에 최고 성능을 보인 뒤 최종 결과물에서는 성능이 하락하는 정체 현상을 나타냈다.

최근 TryAI는 GPT-5.6 Sol, Claude Fable 5, Grok 4.5, Gemini 3.6 Flash 등 4개 비전 모델을 대상으로 가상 색연필 도구를 활용한 이미지 생성 능력을 평가했다. 연구진은 모나리자와 반 고흐의 '별이 빛나는 밤' 재현을 포함해 고양이, 오두막 내부 그리기 등 5개 오픈형 과제를 모델에 부여했다. 각 모델은 캔버스 확인, 색상 및 브러시 설정, 획 긋기, 문지르기, 지우기 등의 도구를 사용할 수 있었다. 평가는 구조적 유사도(SSIM) 점수와 토큰 비용, 처리 시간 등 자원 지표를 기준으로 진행되었다.

데이터 분석 결과, 효율성과 비용 면에서 상당한 편차가 확인되었다. Claude Fable 5는 7개 그림 생성에 160.58달러를 소요해, 7.74달러가 든 GPT-5.6 Sol보다 약 20배가량 비쌌다. Grok 4.5는 3,400만 개의 토큰을 사용해 가장 높은 사용량을 기록했으나, 캐시 읽기를 통해 비용을 낮게 유지했다. 도구 사용 패턴을 보면, GPT-5.6 Sol은 그리기 호출 중에 브러시 속성을 인라인으로 자주 설정했다. 반면 Grok 4.5는 전체 1,349회의 도구 호출 중 65%를 색상, 브러시, 압력 설정에 할당했다. Gemini 3.6 Flash는 그림당 약 23회로 가장 빈번한 자체 검토 과정을 거쳤다.

실험 결과, 대부분의 모델이 작업 중반에 성능 정체기를 겪었다. 특히 대상 기반 드로잉 8건 모두에서 최종 결과물의 점수가 중반부 최고점보다 낮게 측정되었다. Gemini 3.6 Flash가 대상 재현에서 가장 높은 SSIM 점수를 기록했으나, 연구진은 높은 수치가 항상 인간이 평가하는 예술적 품질과 일치하지는 않는다고 지적했다. 전반적으로 GPT-5.6 Sol이 대부분의 과제에서 우수한 세부 묘사를 선보여 가장 효과적인 모델로 평가된 반면, Grok 4.5는 유용한 결과물을 생성하는 데 어려움을 겪었다. 이번 연구의 테스트 도구는 깃허브를 통해 오픈소스로 공개되어 추가 실험이 가능하다.

최근 TryAI는 GPT-5.6 Sol, Claude Fable 5, Grok 4.5, Gemini 3.6 Flash 등 4개 비전 모델을 대상으로 가상 색연필 도구를 활용한 이미지 생성 능력을 평가했다. 연구진은 모나리자와 반 고흐의 '별이 빛나는 밤' 재현을 포함해 고양이, 오두막 내부 그리기 등 5개 오픈형 과제를 모델에 부여했다. 각 모델은 캔버스 확인, 색상 및 브러시 설정, 획 긋기, 문지르기, 지우기 등의 도구를 사용할 수 있었다. 평가는 구조적 유사도(SSIM) 점수와 토큰 비용, 처리 시간 등 자원 지표를 기준으로 진행되었다.

데이터 분석 결과, 효율성과 비용 면에서 상당한 편차가 확인되었다. Claude Fable 5는 7개 그림 생성에 160.58달러를 소요해, 7.74달러가 든 GPT-5.6 Sol보다 약 20배가량 비쌌다. Grok 4.5는 3,400만 개의 토큰을 사용해 가장 높은 사용량을 기록했으나, 캐시 읽기를 통해 비용을 낮게 유지했다. 도구 사용 패턴을 보면, GPT-5.6 Sol은 그리기 호출 중에 브러시 속성을 인라인으로 자주 설정했다. 반면 Grok 4.5는 전체 1,349회의 도구 호출 중 65%를 색상, 브러시, 압력 설정에 할당했다. Gemini 3.6 Flash는 그림당 약 23회로 가장 빈번한 자체 검토 과정을 거쳤다.

실험 결과, 대부분의 모델이 작업 중반에 성능 정체기를 겪었다. 특히 대상 기반 드로잉 8건 모두에서 최종 결과물의 점수가 중반부 최고점보다 낮게 측정되었다. Gemini 3.6 Flash가 대상 재현에서 가장 높은 SSIM 점수를 기록했으나, 연구진은 높은 수치가 항상 인간이 평가하는 예술적 품질과 일치하지는 않는다고 지적했다. 전반적으로 GPT-5.6 Sol이 대부분의 과제에서 우수한 세부 묘사를 선보여 가장 효과적인 모델로 평가된 반면, Grok 4.5는 유용한 결과물을 생성하는 데 어려움을 겪었다. 이번 연구의 테스트 도구는 깃허브를 통해 오픈소스로 공개되어 추가 실험이 가능하다.

원문 보기 (영어)·2026년 7월 21일
#benchmark#vision models#gpt 5#claude#gemini#grok#tool use