Alibaba가 이미지 생성·편집 모델 Qwen-Image-2.1-Turbo를 2026년 10월 9일(현지시간) 내놨다. 기존 Qwen-Image-2.1에서 갈라져 나온 속도 중심 버전으로, 이미지를 만들 때 되풀이하는 디노이징을 40회에서 8회로 5분의 1까지 줄였다. 원본이 가진 70억 매개변수 구조와 성능은 그대로라고 한다.[1]
Thomas LOMBARD , designed by HASSELL (architects) / Wikimedia Commons · CC BY-SA 3.0 · 원본 · 크기 조정
대상은 개발자와 클라우드 API 이용자다. Alibaba 클라우드 모델 스튜디오(Model Studio)에서 터보와 상위 모델 Qwen-Image-2.1-Pro를 함께 쓸 수 있고, 가중치는 Hugging Face와 모델스코프에서 받을 수 있다.[1]
요금과 사용 조건
| 모델 | 이미지 1장당 가격 | 분당 요청 한도 |
|---|---|---|
| Qwen-Image-2.1-Turbo | 0.1위안(약 0.015달러) | 120회 |
| Qwen-Image-2.1-Pro | 0.25위안(약 0.037달러) | 20회 |
터보는 프로보다 60% 싸고 분당 호출 한도는 6배다.[1] 내려받은 가중치는 연구와 성능 검증 같은 비영리 용도로만 쓸 수 있다. 영리 목적으로 서버에 직접 올려 운영하려면 따로 허가를 받아야 한다. API를 쓰는 경우에도 가중치 허가와는 별도로 서비스 약관과 생성물 활용 규정을 살펴야 한다. 실제 적용 조건과 지역별 가격은 서비스 설정에 따라 다를 수 있다.[1]
기능과 내부 구조
원본처럼 2K 해상도로 이미지를 만들고 고칠 수 있다. 인물 사진과 여러 자세, 배경이 투명한 이미지, 포스터와 타이포그래피, UI 레이아웃이 생성 대상이다. 편집 쪽에서는 이미 있는 이미지를 다른 모습으로 바꾸거나, 참조 이미지 여러 장을 섞어 결과물을 얻을 수 있다.[1]
본체는 32층, 70억 매개변수의 디퓨전 트랜스포머(DiT)이며 단일 스트림 방식이다. 글과 이미지 입력은 80억 매개변수의 Qwen3-VL 8B 인코더가 해석하고, 알파 채널을 다루는 RGBA 오토인코더도 들어 있다.[1] 추론할 때는 접두부 KV 캐싱으로 텍스트와 참조 이미지 정보를 처음 한 번 계산하고 뒤 단계에서 다시 활용한다. 8회 생성에 맞춘 샘플링 스케줄도 기본으로 들어 있다.[1]
직접 돌리려면 파이썬 라이브러리 디퓨저스(Diffusers)의 최신 소스 버전과 트랜스포머 5.17.0 이상을 갖춰야 하고, 모델에 담긴 샘플링 설정을 읽을 수 있는 버전이어야 한다. CUDA를 지원하는 GPU에서 BF16 정밀도로 실행한다. 큐원팀은 필요한 최소 GPU 메모리를 공개하지 않았다.[1]
속도 향상을 읽는 법
디노이징은 확산 모델이 노이즈를 조금씩 지우며 그림을 완성해 가는 과정이어서, 반복 단계를 줄이면 일반적으로 연산 부담이 낮아진다.[1] 다만 단계 수가 5분의 1로 줄었다고 해서 전체 생성 시간이 반드시 5분의 1이 되는 것은 아니다. 모델을 불러오고, 결과를 이미지로 디코딩하고, GPU 메모리를 처리하는 시간이 따로 들기 때문이다.[1]
품질 근거도 제한적이다. 공개된 60.28점은 원본 Qwen-Image-2.1이 자체 벤치마크에서 받은 점수다. 터보가 원본 수준을 지키면서 빨라졌다는 점을 제3자가 비교해 확인한 것은 아니다. 체감 속도와 품질은 하드웨어, 해상도, 프롬프트 내용, 참조 이미지 장수에 따라 달라질 수 있다.[1]