Issue 01중국 AI
AC POST
중국 AI 목록
开源中国2026년 9월 21일 11:28중국어 → 한국어

알리바바 통이치엔원, Qwen-Image-2.1 오픈소스 공개

비주얼 생성 부분이 7B 파라미터인 소형 모델로, 문장→이미지 생성과 투명 이미지 생성·편집을 하나의 모델로 통합하고 투명 이미지 생성·편집을 지원한다.

중국어 원문을 AI로 번역했습니다. 고유명사와 수치는 원문 표기를 우선하며, 중요한 판단에는 아래 출처 원문을 함께 확인하세요.

알리 통이치엔원(通义千问)이 Qwen-Image-2.1을 오픈소스로 공개했다. 한 문장으로 그 포지셔닝을 요약하면, 생성 효과와 추론 효율, 비용을 하나의 균형점으로 압축한 것이다. 시각 생성 부분은 파라미터가 7B에 불과하지만, 텍스트-투-이미지(문생도), 투명 이미지 생성, 이미지 편집을 하나의 모델에 통합했고, 투명 이미지의 생성과 편집을 네이티브로 지원한다.

몇 가지 짚어볼 만한 점이 있다. 첫 번째는 '작은 모델의 강력한 효율'이다. 시각 생성 부분은 32층 Single-Stream DiT를 사용하며 7B 파라미터다. 파라미터를 아낀다고 해서 두뇌까지 아끼는 것은 아니다. 원래 수십 B가 해야 할 일을 7B로 압축한 것은 추론 효율을 겨냥한 구조 최적화 덕분이다. 모델은 텍스트와 이미지에 서로 다른 처리 전략을 적용하는데, 텍스트(시스템 프리픽스, 편집 명령)는 Token 수준의 인과적 마스크(causal mask)로, 이미지 생성은 Chunk 수준의 마스크로 처리한다. 이어 KV Cache를 재사용해 입력 이미지와 편집 명령을 정적 컨텍스트로 취급하고 첫 단계에서 캐시를 미리 계산한다. 이 '혼합 세분도 어텐션'은 특히 다중 이미지 입력 시나리오에서 VRAM을 아끼고 속도를 높인다.

두 번째 포인트는 '네이티브 투명, 생성과 편집 일체'다. 2025년 12월에 통이치엔원은 투명 이미지 생성을 지원하는 전용 Qwen-Image-Layered를 발표했는데, 이번에는 그 능력을 통합 모델에 병합했다. 모델은 프롬프트에 따라 일반 이미지를 출력할지 투명 채널을 가진 이미지를 출력할지 자동으로 결정하며, 투명 레이어를 직접 편집할 수도 있다(예를 들어 투명 배경은 유지한 채 인물 표정만 바꾸거나 이미지 속 텍스트를 변경). 실제 사진에도 쓸 수 있다. RGB 이미지를 입력하면 모델이 주체를 누끼로 분리해 투명 채널을 가진 RGBA 레이어를 출력해 이후 디자인 합성에 편리하게 활용할 수 있다.

네이티브 투명 이미지 생성

편집 능력은 '다중 국부 보존(多局保全)'이라는 네 글자를 중심으로 펼쳐진다. 최대 10장의 참조 이미지 입력을 지원하며(인물 6장으로 단체사진 합성, 5장으로 코디 구성, 가구 이미지 10장으로 실내 배치 생성), 국부 편집은 원형 선택, 브러시 칠하기, 독립 마스크의 세 가지 지정 방식을 지원하고, 단계적으로 수정해 간단한 애니메이션으로 이어붙일 수도 있다. 보존의 핵심은 인물 일관성과 상품 일관성을 강화하는 것(편집 후에도 신원 특징, 상품 텍스트와 텍스처를 최대한 유지)이며, 동시에 파노라마 이미지, 인포그래픽, 스토리보드 이미지 등 다양한 작업을 포괄한다.

디자인, 이커머스, 콘텐츠 창작을 하는 팀 입장에서 보면, 이러한 '텍스트-투-이미지 + 투명 + 편집'을 하나의 작은 모델로 합치는 노선이 직접적으로 낮추는 것은 이 능력들을 서로 연결하는 엔지니어링 비용이다. 더 이상 투명 이미지, 누끼, 국부 리페인팅을 각각 별도의 모델로 연결할 필요가 없다.

얼마나 재사용할 수 있는지는 오픈소스 가중치, Hugging Face, ModelScope에서 직접 실측할 수 있다.

- https://github.com/QwenLM/Qwen-Image-2.1

- https://www.modelscope.cn/models/Qwen/Qwen-Image-2.1

출처: Qwen-Image-2.1: 소형 모델의 강력한 효율, 생성과 편집 일체 - Qwen Blog