Qwen, 생성·편집 통합 이미지 모델 공개
- •Qwen, 이미지 생성과 편집을 결합한 오픈소스 Qwen-Image-2.1 공개
- •7B 매개변수 시각 구성 요소로 최대 10개 참조 이미지와 투명 레이어 지원
- •인물·제품 이미지 보존에 초점…파노라마·인포그래픽·스토리보드 생성도 지원
Qwen은 2026년 9월 20일 오픈소스 이미지 모델 Qwen-Image-2.1을 공개했습니다. 7B 매개변수 시각 생성 구성 요소에서 텍스트를 이미지로 만드는 기능과 이미지 편집 기능을 결합했으며, 투명 배경 이미지를 만들고 투명 레이어를 편집할 수 있습니다. 모델은 참조 이미지 최대 10개를 입력받으며 이미지 품질, 추론 효율, 계산 비용의 균형을 목표로 설계됐습니다.
모델은 단일 스트림 DiT 레이어 32개로 구성됩니다. Qwen은 여러 입력 이미지를 편집할 때 혼합 세분도 어텐션 구조가 효율을 높인다고 설명했습니다. 텍스트에는 토큰 단위 인과 마스크를, 이미지 생성에는 청크 단위 마스크를 적용합니다. KV 캐시 재사용은 첫 단계 이후 입력 이미지와 편집 지시를 고정 문맥으로 저장하며, 회사는 이 방식이 연산과 메모리 사용을 줄인다고 밝혔습니다.
Qwen-Image-2.1은 프롬프트로 일반 이미지나 투명 이미지를 생성하고, 배경을 유지한 채 투명 레이어를 편집하거나 그 안의 텍스트를 바꿀 수 있습니다. RGB 사진에서 피사체를 RGBA 레이어로 추출하는 기능도 갖췄습니다. 색이 있는 원, 직접 칠한 주석 또는 별도 마스크로 지정한 영역을 편집할 수 있으며, Qwen은 연속적인 부분 편집으로 장면의 나머지를 보존하며 간단한 애니메이션을 만들 수 있다고 설명했습니다.
여러 이미지를 함께 편집하는 예로는 인물 사진 6장을 단체 사진으로 합치기, 모델·옷·신발·가방·모자 등 입력 5개를 가상 착용 의상으로 구성하기, 가구 이미지 10개로 방을 꾸미기가 제시됐습니다. Qwen은 인물 편집에서 얼굴 정체성을 보존하고, 제품 이미지 변경 시 글자와 질감, 형태를 유지하는 데 초점을 뒀다고 밝혔습니다.
이 모델은 파노라마, 인포그래픽, 스토리보드 생성도 지원합니다. Qwen은 이미지 품질 개선 목표로 글자 표현, 인물 조명, 세부 묘사를 들었으며, 글자 렌더링에 글꼴 스타일과 배치, 구성을 반영한다고 설명했습니다. 회사는 디자인, 콘텐츠 제작, 전자상거래, 시각 스토리텔링을 위한 도구로 모델을 제시했습니다. 게시물에는 수치로 된 벤치마크 결과가 없습니다. Qwen은 2025년 12월 투명 이미지 생성 전용 모델 Qwen-Image-Layered를 먼저 선보였으며, Qwen-Image-2.1은 해당 기능을 통합 모델에 포함했습니다.