AI 비교AI 찾기AI 뉴스AI 활용
회사 소개
개인정보처리방침이용약관FAQ문의하기문의하기
에이아이비 주식회사사업자정보
© 2026 AIB Inc.

Netlify, 코딩 모델 11종 테스트

Netlify, 코딩 모델 11종 테스트

netlify.com·2026년 8월 14일 (금)
  • •Netlify가 AI Gateway와 Agent Runners에 OpenRouter 모델을 추가해 모델 선택 폭을 넓혔다
  • •커피숍 프롬프트 테스트에서 11개 모델의 평균 비용은 519 credits부터 2.4 credits까지 벌어졌다
  • •Claude Opus 5는 한 실행에서 1,055 credits를 기록했고 DeepSeek V4 Flash 0731은 평균 2.4 credits였다
  • •Netlify가 AI Gateway와 Agent Runners에 OpenRouter 모델을 추가해 모델 선택 폭을 넓혔다
  • •커피숍 프롬프트 테스트에서 11개 모델의 평균 비용은 519 credits부터 2.4 credits까지 벌어졌다
  • •Claude Opus 5는 한 실행에서 1,055 credits를 기록했고 DeepSeek V4 Flash 0731은 평균 2.4 credits였다
  • •Netlify가 AI Gateway와 Agent Runners에 OpenRouter 모델을 추가해 모델 선택 폭을 넓혔다
  • •커피숍 프롬프트 테스트에서 11개 모델의 평균 비용은 519 credits부터 2.4 credits까지 벌어졌다
  • •Claude Opus 5는 한 실행에서 1,055 credits를 기록했고 DeepSeek V4 Flash 0731은 평균 2.4 credits였다
  • •Netlify가 AI Gateway와 Agent Runners에 OpenRouter 모델을 추가해 모델 선택 폭을 넓혔다
  • •커피숍 프롬프트 테스트에서 11개 모델의 평균 비용은 519 credits부터 2.4 credits까지 벌어졌다
  • •Claude Opus 5는 한 실행에서 1,055 credits를 기록했고 DeepSeek V4 Flash 0731은 평균 2.4 credits였다

Netlify는 2026년 8월 13일 새 OpenRouter 파트너십을 통해 AI Gateway의 모델 접근 범위를 넓히고, Agent Runners에 Kimi K3, GLM 5.2, DeepSeek V4 등 프런티어 코딩 모델을 추가한다고 밝혔다. Agent Runners는 Netlify 내부에서 전체 코딩 에이전트를 실행하는 기능이며, Netlify는 더 많은 모델이 프로젝트 생성과 반복 작업을 수행할 수 있도록 오픈소스 OpenCode 에이전트도 추가했다고 설명했다. 회사는 사용자가 출력 품질과 credit 사용량을 비교할 수 있도록 11개 모델에 같은 프롬프트를 적용했다.

Netlify는 최근 오픈소스로 공개한 모델 평가 도구 AXIS로 사이트 구축과 반복 작업 프롬프트를 실행했다. AXIS는 생성된 사이트의 디자인보다 기능이 제대로 작동하는지 확인하며, 필요한 경우 데이터베이스를 쓰는지, Netlify Database가 제대로 적용됐는지, 단순 정적 사이트가 불필요한 데이터베이스 설정을 피하는지 등을 본다. 공개 게시물은 첫 번째 시나리오만 다뤘으며, 영업시간, 주소, 짧은 메뉴, 사진을 담은 동네 커피숍 1페이지 사이트와 사용자가 편집하지 않으면 아무것도 바뀌지 않는다는 프롬프트 문구가 포함됐다.

커피숍 테스트는 Netlify 기본 설정에서 각 모델을 3번씩 실행했다. 평균 credit 사용량은 Claude Opus 5의 519 credits부터 DeepSeek V4 Flash 최신 수정판 0731의 2.4 credits까지였다. 전체 목록은 Claude Opus 5 519, Claude Sonnet 5 143, GPT 5.6 Sol 141, Gemini 3.6 Flash 103, Kimi K3 102, Gemini 3.1 Pro 53, GPT 5.6 Terra 39, DeepSeek V4 Pro 37, GLM 5.2 27, Kimi K2.7 Code 19, DeepSeek V4 Flash 2.4였다.

Claude Opus 5의 실행 비용은 253 credits, 249 credits, 1,055 credits였고, 1,055-credit 실행은 다른 어떤 실행보다 약 4x 비쌌다. Netlify는 해당 출력물이 세부적인 시각 디자인, 커피콩이 들어간 도장 형태의 텍스트 요소, 맞춤형 지도, 다크 모드를 포함했다고 밝혔다. Opus는 일반적인 기준선보다 과도한 credit 사용량을 보이는 경우가 잦지만, 이것이 더 나쁘거나 더 좋은 결과를 보장하지는 않는다고 설명했다.

Claude Sonnet 5는 81 credits, 245 credits, 103 credits로 평균 143 credits를 기록했다. Netlify는 페이지에 일부 디테일은 남아 있었지만 콘텐츠가 더 적었고, 벡터 그래픽도 더 단순했다고 평가했다. GPT 5.6 Sol은 기본적으로 낮은 effort 설정에서 실행됐으며 173 credits, 158 credits, 92 credits로 평균 141 credits를 기록했다. Netlify는 이 시나리오에서 Claude Sonnet 5보다 기본 디자인 감각이 더 강했고 콘텐츠도 풍부했지만, 이미지는 다소 일반적이었다고 밝혔다.

GPT 5.6 Terra는 43 credits, 23 credits, 49 credits로 평균 39 credits를 기록했다. Netlify는 Terra가 GPT 5.6 Sol보다 단순히 나쁜 모델이라기보다 시각적으로 다른 결과를 냈다고 설명했으며, 다만 더 단순한 콘텐츠, 누락된 이미지 1개, 이미지 위 저대비 텍스트를 지적했다. 작성자는 모호한 디자인 프롬프트라면 Opus 5와 GPT 5.6 Terra를 실행해 서로 다른 2가지 방향을 얻고 싶다고 밝혔다.

Gemini 3.1 Pro는 평균 53 credits를 기록했고, 프롬프트가 요구한 작업만 수행한 기본적인 결과를 냈다. Gemini 3.6 Flash는 109 credits, 91 credits, 111 credits로 평균 103 credits였으며, Netlify는 콘텐츠 작업이 더 들어간 새 세대 모델처럼 보였지만 반복도 더 많았다고 평가했다. Kimi K3는 125 credits, 95 credits, 86 credits로 평균 102 credits였지만, Netlify는 장기 에이전트 작업을 내세우는 마케팅과 달리 이 좁은 디자인 중심 과제에서는 두드러지지 않았다고 밝혔다.

Kimi K2.7 Code는 평균 19 credits였고 Netlify에 따르면 눈에 띄는 디자인이나 콘텐츠가 거의 없었다. GLM 5.2는 15 credits, 42 credits, 24 credits로 평균 27 credits를 기록했으며, 결과 편차가 컸고 단풍 테마가 반복됐다. Netlify는 GLM 5.2가 텍스트 전용이라 디자인 영감을 얻기 위해 스크린샷을 사용할 수 없다고 설명했다. DeepSeek V4 Pro는 평균 37 credits였고 이미지 1개가 깨졌으며, DeepSeek V4 Flash 0731은 3.4 credits, 1.3 credits, 2.5 credits로 평균 2.4 credits를 기록했다. Netlify는 후속 게시물에서 모델이 플랫폼 기능을 올바르게 선택하는지, 자체 작업을 검증하는지, 이미지 입력을 쓰는지, 피드백에 따라 문제를 고치는지 테스트할 예정이라고 밝혔다.

Netlify는 2026년 8월 13일 새 OpenRouter 파트너십을 통해 AI Gateway의 모델 접근 범위를 넓히고, Agent Runners에 Kimi K3, GLM 5.2, DeepSeek V4 등 프런티어 코딩 모델을 추가한다고 밝혔다. Agent Runners는 Netlify 내부에서 전체 코딩 에이전트를 실행하는 기능이며, Netlify는 더 많은 모델이 프로젝트 생성과 반복 작업을 수행할 수 있도록 오픈소스 OpenCode 에이전트도 추가했다고 설명했다. 회사는 사용자가 출력 품질과 credit 사용량을 비교할 수 있도록 11개 모델에 같은 프롬프트를 적용했다.

Netlify는 최근 오픈소스로 공개한 모델 평가 도구 AXIS로 사이트 구축과 반복 작업 프롬프트를 실행했다. AXIS는 생성된 사이트의 디자인보다 기능이 제대로 작동하는지 확인하며, 필요한 경우 데이터베이스를 쓰는지, Netlify Database가 제대로 적용됐는지, 단순 정적 사이트가 불필요한 데이터베이스 설정을 피하는지 등을 본다. 공개 게시물은 첫 번째 시나리오만 다뤘으며, 영업시간, 주소, 짧은 메뉴, 사진을 담은 동네 커피숍 1페이지 사이트와 사용자가 편집하지 않으면 아무것도 바뀌지 않는다는 프롬프트 문구가 포함됐다.

커피숍 테스트는 Netlify 기본 설정에서 각 모델을 3번씩 실행했다. 평균 credit 사용량은 Claude Opus 5의 519 credits부터 DeepSeek V4 Flash 최신 수정판 0731의 2.4 credits까지였다. 전체 목록은 Claude Opus 5 519, Claude Sonnet 5 143, GPT 5.6 Sol 141, Gemini 3.6 Flash 103, Kimi K3 102, Gemini 3.1 Pro 53, GPT 5.6 Terra 39, DeepSeek V4 Pro 37, GLM 5.2 27, Kimi K2.7 Code 19, DeepSeek V4 Flash 2.4였다.

Claude Opus 5의 실행 비용은 253 credits, 249 credits, 1,055 credits였고, 1,055-credit 실행은 다른 어떤 실행보다 약 4x 비쌌다. Netlify는 해당 출력물이 세부적인 시각 디자인, 커피콩이 들어간 도장 형태의 텍스트 요소, 맞춤형 지도, 다크 모드를 포함했다고 밝혔다. Opus는 일반적인 기준선보다 과도한 credit 사용량을 보이는 경우가 잦지만, 이것이 더 나쁘거나 더 좋은 결과를 보장하지는 않는다고 설명했다.

Claude Sonnet 5는 81 credits, 245 credits, 103 credits로 평균 143 credits를 기록했다. Netlify는 페이지에 일부 디테일은 남아 있었지만 콘텐츠가 더 적었고, 벡터 그래픽도 더 단순했다고 평가했다. GPT 5.6 Sol은 기본적으로 낮은 effort 설정에서 실행됐으며 173 credits, 158 credits, 92 credits로 평균 141 credits를 기록했다. Netlify는 이 시나리오에서 Claude Sonnet 5보다 기본 디자인 감각이 더 강했고 콘텐츠도 풍부했지만, 이미지는 다소 일반적이었다고 밝혔다.

GPT 5.6 Terra는 43 credits, 23 credits, 49 credits로 평균 39 credits를 기록했다. Netlify는 Terra가 GPT 5.6 Sol보다 단순히 나쁜 모델이라기보다 시각적으로 다른 결과를 냈다고 설명했으며, 다만 더 단순한 콘텐츠, 누락된 이미지 1개, 이미지 위 저대비 텍스트를 지적했다. 작성자는 모호한 디자인 프롬프트라면 Opus 5와 GPT 5.6 Terra를 실행해 서로 다른 2가지 방향을 얻고 싶다고 밝혔다.

Gemini 3.1 Pro는 평균 53 credits를 기록했고, 프롬프트가 요구한 작업만 수행한 기본적인 결과를 냈다. Gemini 3.6 Flash는 109 credits, 91 credits, 111 credits로 평균 103 credits였으며, Netlify는 콘텐츠 작업이 더 들어간 새 세대 모델처럼 보였지만 반복도 더 많았다고 평가했다. Kimi K3는 125 credits, 95 credits, 86 credits로 평균 102 credits였지만, Netlify는 장기 에이전트 작업을 내세우는 마케팅과 달리 이 좁은 디자인 중심 과제에서는 두드러지지 않았다고 밝혔다.

Kimi K2.7 Code는 평균 19 credits였고 Netlify에 따르면 눈에 띄는 디자인이나 콘텐츠가 거의 없었다. GLM 5.2는 15 credits, 42 credits, 24 credits로 평균 27 credits를 기록했으며, 결과 편차가 컸고 단풍 테마가 반복됐다. Netlify는 GLM 5.2가 텍스트 전용이라 디자인 영감을 얻기 위해 스크린샷을 사용할 수 없다고 설명했다. DeepSeek V4 Pro는 평균 37 credits였고 이미지 1개가 깨졌으며, DeepSeek V4 Flash 0731은 3.4 credits, 1.3 credits, 2.5 credits로 평균 2.4 credits를 기록했다. Netlify는 후속 게시물에서 모델이 플랫폼 기능을 올바르게 선택하는지, 자체 작업을 검증하는지, 이미지 입력을 쓰는지, 피드백에 따라 문제를 고치는지 테스트할 예정이라고 밝혔다.

원문 보기 (영어)·2026년 8월 13일
코딩#netlify#openrouter#agent runners#ai gateway#opencode#claude opus 5#gpt 5 6 sol#deepseek v4#kimi k3#glm 5 2