AI의 변화, 근거와 맥락까지.AI NEWS & CONTEXT
AI 사전 · 멀티모달·피지컬 AI

텍스트-이미지 생성

텍스트-이미지 모델은 자연어 설명(프롬프트)을 입력받아 그 내용을 묘사하는 새 이미지를 만드는 생성형 AI다. 텍스트를 조건으로 이미지 분포를 학습하며, 2021년 OpenAI의 DALL-E 이후 확산 모델과 트랜스포머 기반 구조로 발전했다. 2025년 이후에는 언어와 이미지를 함께 생성하는 네이티브 멀티모달 모델이 최전선으로 올라섰다.

텍스트-이미지 모델
분류생성형 AI의 한 갈래로, 텍스트 설명에 맞는 이미지를 만드는 조건부 생성 모델[1]
입력과 출력자연어 설명(프롬프트)을 받아 2차원 래스터 이미지를 만듦[1]
최초 대중 시스템OpenAI의 DALL-E (2021년 1월)[1]
2026년 기준 주요 모델GPT Image, Gemini 이미지 모델, Midjourney, Imagen 4, Flux, Stable Diffusion, Qwen-Image[1]
기반 기술확산 모델, 트랜스포머, 자기회귀 토큰 모델[1]

쉽게 말하면, 텍스트-이미지 모델은 사람이 글로 적은 설명(프롬프트)을 받아 그 내용을 담은 그림을 새로 만들어 내는 생성형 AI다. 설명 한 줄을 입력하면 그 설명에 맞는 이미지를 하나 이상 만들어 준다. 최근에는 이미지 생성 기능이 ChatGPT와 Gemini 같은 대화형 AI에 들어가, 대화로 그림을 만들고 고칠 수 있게 되었다.[1]

1. 개요

텍스트-이미지 모델은 자연어 설명, 즉 프롬프트를 입력받아 그 내용을 묘사하는 새로운 2차원 래스터 이미지를 합성하는 인공지능 시스템이다. 모델은 p(image | text), 즉 텍스트가 주어졌을 때의 이미지 분포를 학습하는 조건부 생성 방식으로 작동한다. 가장 먼저 널리 쓰인 시스템은 2021년 1월 OpenAI의 DALL-E였다. 현대 텍스트-이미지 시스템은 컴퓨터 비전, 자연어 처리, 생성형 AI의 교차점에 있으며, 딥러닝의 가장 눈에 띄는 소비자용 응용 가운데 하나다.[1]

2025년 3월 OpenAI가 이미지 생성을 GPT-4o에 네이티브로 통합하자 ChatGPT는 1시간이 안 되어 신규 사용자가 100만 명 넘게 늘었다. 이 가입 속도는 CEO 샘 올트먼(Sam Altman)이 2022년 ChatGPT 출시 때보다 빠르다고 말한 수준이다.[2][3]

  • 2026년 기준 OpenAI의 GPT Image 계열(DALL-E 3의 후속). OpenAI는 2026년 DALL-E 3의 지원 종료(deprecation)를 발표했다.
  • Midjourney
  • Google의 Imagen 4와 Gemini 이미지 모델('Nano Banana', 'Nano Banana Pro')
  • Stable Diffusion과 그 공개 파생 모델
  • Black Forest Labs의 Flux 계열
  • Adobe Firefly, Ideogram, Recraft
  • Alibaba의 Qwen-Image[1]

2. 작동 원리

모델의 파이프라인은 거의 항상 세 부분으로 이루어진다. 프롬프트를 임베딩 시퀀스로 바꾸는 텍스트 인코더, 그 임베딩을 조건으로 이미지 내용을 만드는 생성기, 그리고 잠재 표현을 픽셀 공간으로 되돌리는 디코더다(잠재 확산 시스템의 경우). 텍스트 인코더는 보통 사전 학습된 언어 모델이다. 대표적으로 OpenAI의 CLIP(Radford 외, 2021)과 T5(Raffel 외, 2020)가 있고, 최근 시스템에서는 Gemma나 Llama 계열 변형이 쓰인다.[1]

모델마다 이미지를 만드는 공간이 다르다. 확산 모델 중 Imagen과 GLIDE는 목표 해상도의 노이즈 이미지를 픽셀 공간에서 반복해 제거하며, 필요하면 초해상도 단계를 뒤에 붙인다. 잠재 확산은 먼저 변분 오토인코더(VAE)로 이미지를 압축하고, 압축된 잠재 공간에서 확산을 수행한다. 계산량을 대략 10배 수준으로 줄이며, Stable Diffusion으로 대중화된 방식이다. Parti와 Muse 같은 토큰 기반 모델은 이미지를 이산 토큰으로 양자화한 뒤, 대형 언어 모델이 텍스트를 예측하듯 자기회귀 방식이나 마스크 토큰 목표로 예측한다.[1]

텍스트-이미지 생성은 이미지 변환(image-to-image), 텍스트-영상 생성, 텍스트-3D 생성과 밀접하다. 인페인팅 마스크나 참조 이미지를 짝지으면 많은 이미지 모델이 이미지 편집기로도 쓰이며, 같은 확산 백본이 Sora, Stable Video Diffusion, 그 밖의 텍스트-영상 모델에도 쓰인다.[1]

3. 발전 과정

이 분야는 약 10년 동안 대략 세 개의 기술 시대를 거쳤다. 초기 시스템은 순환 신경망과 어텐션을 쓰면서 새와 꽃의 32×32 썸네일을 만들었다. 두 번째 물결은 생성적 적대 신경망(GAN)을 써서, 좁은 데이터셋인 CUB와 Oxford-102에서 해상도를 256×256까지 끌어올렸다. 현재 시대는 2021년 OpenAI의 DALL-E와 함께 시작되었다.[1]

2022년에는 GLIDE, DALL-E 2, Imagen, Stable Diffusion을 계기로 확산 모델이 결정적으로 주류가 되었다. 2024년에는 디퓨전 트랜스포머(DiT), 렉티파이드 플로우(Rectified Flow), 플로우 매칭(Flow Matching)이 지배적인 구조 선택으로 굳어졌고, Stable Diffusion 3, Flux.1, Imagen 3, OpenAI의 gpt-image-1이 대표 사례다. 2025년과 2026년에는 하나의 자기회귀 또는 하이브리드 모델이 언어와 이미지를 함께 출력하는 네이티브 멀티모달 생성으로 최전선이 옮겨 갔다. 대표 사례는 GPT Image 후속 계열, Gemini 이미지 모델, Alibaba의 Qwen-Image다.[1]

3.1. 초기 어텐션 기반 생성 (2015~2016년)

가장 먼저 널리 인용되는 텍스트-이미지 신경망은 AlignDRAW다. Elman Mansimov, Emilio Parisotto, Jimmy Lei Ba, Ruslan Salakhutdinov가 발표했으며, 2015년 11월 arXiv:1511.02793에 올라왔고 2016년 ICLR 논문 「Generating Images from Captions with Attention」으로 실렸다. AlignDRAW는 캡션을 입력받도록 DRAW 순환 어텐션 모델을 확장했다. 샘플 해상도는 32×32 또는 64×64였고, '파란 하늘을 날고 있는 정지 표지판'처럼 함께 본 적 없는 사물의 조합도 만들 수 있었다. 다만 결과물은 알아볼 수 있는 사진이라기보다 흐릿한 제안에 가까웠다.[4]

2016년에는 Reed 외가 ICML 2016 논문 「Generative Adversarial Text to Image Synthesis」에서 조건부 GAN을 학습시켰다. Caltech-UCSD Birds(CUB)와 Oxford-102 꽃 데이터셋으로 학습해, 글 설명에 맞는 64×64 새 이미지를 만들었다.[1]

3.2. GAN 시대 (2017~2020년)

가장 영향력 있던 GAN 기반 시스템은 Han Zhang과 공동 연구진이 ICCV 2017에서 발표한 StackGAN이다(「StackGAN: Text to Photo-realistic Image Synthesis with Stacked Generative Adversarial Networks」). StackGAN은 두 단계 파이프라인으로, 먼저 캡션에서 64×64 스케치를 만든 뒤 256×256으로 다듬었다. StackGAN++는 여러 개의 트리 구조 생성기를 더해 이 방식을 확장했다.[1]

AttnGAN(Tao Xu 외, CVPR 2018, 「AttnGAN: Fine-Grained Text to Image Generation with Attentional Generative Adversarial Networks」)은 캡션과 이미지 특징 맵 사이에 단어 단위 교차 어텐션을 도입했다. 덕분에 특정 영역을 그릴 때 특정 단어에 집중할 수 있었다.[5] 같은 시기의 다른 GAN 계열로는 캡션 재생성 일관성 손실을 더한 MirrorGAN(Qiao 외, CVPR 2019), 동적 메모리 모듈을 쓴 DM-GAN(Zhu 외, CVPR 2019), ControlGAN(Li 외, NeurIPS 2019)이 있었다. 이들은 새, 꽃, COCO 캡션 같은 좁은 영역에서 인상적인 결과를 냈지만, 열린 프롬프트로 일반화하지 못했고 256×256을 넘는 경우가 드물었다.[1]

3.3. 자기회귀 시대 (2021~2022년)

현대 시대는 2021년 1월 OpenAI의 DALL-E와 함께 열렸다(Aditya Ramesh 외, 「Zero-Shot Text-to-Image Generation」, arXiv:2102.12092). DALL-E는 이산 변분 오토인코더(dVAE)로 256×256 이미지를 8,192개 토큰의 32×32 격자로 압축했다. 그다음 120억 매개변수 규모의 자기회귀 트랜스포머를 학습시켜, 텍스트 토큰 뒤에 이어지는 이미지 토큰의 결합 시퀀스를 예측하게 했다. 아보카도 모양의 안락의자 같은 제로샷 합성을 보여 주었고, 공개 후 텍스트-이미지 생성에 대한 대중의 관심이 크게 일었다. DALL-E는 상위 샘플을 다시 고를 때 CLIP을 사용했다.[6]

Google의 Parti(Pathways Autoregressive Text-to-Image)는 Jiahui Yu 등이 2022년 6월 arXiv:2206.10789에 발표한 「Scaling Autoregressive Models for Content-Rich Text-to-Image Generation」에서 소개되었다. 자기회귀 방식을 200억 매개변수까지 키웠으며, 텍스트 충실도에서 깔끔한 스케일링 곡선을 보였다. Parti는 ViT-VQGAN 이미지 토크나이저를 썼다. 2022년에는 Meta가 Make-A-Scene을 공개했다(Gafni 외, 「Make-A-Scene: Scene-Based Text-to-Image Generation with Human Priors」, arXiv:2203.13131). 텍스트 프롬프트와 함께 선택적으로 세그멘테이션 맵을 조건 입력으로 받는 기능을 더했다.[1]

Google의 Huiwen Chang과 공동 연구진은 2023년 1월 「Muse: Text-To-Image Generation via Masked Generative Transformers」(arXiv:2301.00704)에서 Muse를 소개했다. Muse는 자기회귀 순서 대신 MaskGIT에서 빌려 온 마스크 토큰 목표를 썼다. 이산 토큰 구조는 유지하면서, 왼쪽에서 오른쪽으로 생성하는 방식보다 훨씬 빠르게 이미지를 만들었다.[1]

3.4. 확산 모델 시대 (2021~2023년)

확산 모델은 2015년 Sohl-Dickstein 외의 연구와 Ho, Jain, Abbeel의 「Denoising Diffusion Probabilistic Models」(NeurIPS 2020)에서 연구되었다. 그러나 텍스트-이미지 분야에 들어온 계기는 GLIDE[7](Alex Nichol 외, 「GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models」, arXiv:2112.10741, 2021년 12월)였다. GLIDE는 CLIP 가이던스와 Ho와 Salimans(2022)가 제안한 분류기 없는 가이던스(classifier-free guidance)[8]를 비교했고, 분류기 없는 가이던스가 더 사실적인 결과를 낸다는 것을 보였다.[9]

Ramesh 외는 「Hierarchical Text-Conditional Image Generation with CLIP Latents」(arXiv:2204.06125, 2022년 4월)에서 DALL-E 2를 발표했다. DALL-E의 자기회귀 백본을 2단계 확산 모델로 바꾼 것이다. 첫 단계 prior는 CLIP 텍스트 임베딩을 CLIP 이미지 임베딩으로 매핑하고, 디코더는 그 임베딩으로 64×64 이미지를 만든 뒤 두 번의 초해상도 단계로 1024×1024까지 올렸다.[10]

Google의 Imagen(Chitwan Saharia 외, 「Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding」, arXiv:2205.11487, 2022년 5월)은 동결된 T5-XXL 텍스트 인코더가 CLIP보다 텍스트 정합성을 크게 높인다는 것을 보였다. 또 U-Net을 키우는 것보다 텍스트 인코더를 키우는 편이 더 효과적이었다고 밝혔다. Imagen은 잠재 공간이 아니라 픽셀 공간에서 이미지를 생성했다. 논문은 COCO로 학습하지 않고도 MS-COCO 데이터셋에서 제로샷 FID 7.27을 기록해 최고 수준이라고 보고했다. 나란히 비교했을 때 사람 평가자들은 샘플 품질과 이미지-텍스트 정합성 모두에서 VQ-GAN+CLIP, Latent Diffusion Models, DALL-E 2보다 Imagen을 선호했다.[11][11]

Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, Bjorn Ommer는 CVPR 2022 논문 「High-Resolution Image Synthesis with Latent Diffusion Models」(arXiv:2112.10752)에서 잠재 공간 확산 방식을 소개했다. 이 방식 덕분에 Stable Diffusion이 일반 소비자용 GPU에서도 실용적이 되었다.[12]

Stability AI는 2022년 8월 Stable Diffusion 1.4를 Creative ML OpenRAIL-M 라이선스로 공개했다. 공개 가중치가 풀리자 커뮤니티 파인튜닝, 웹 UI, 후속 응용 프로그램이 폭발적으로 늘었다. 2022년 10월의 Stable Diffusion 1.5는 지속 학습으로 품질이 조금 올랐다.[1]

Stable Diffusion 2.0(2022년 11월)과 2.1(2022년 12월)은 OpenCLIP ViT-H/14와 새 VAE로 재학습되었다. 하지만 원래 LAION-5B 학습 세트가 가진 유명인과 화가 범위를 갖추지 못했고, 1.5만큼의 커뮤니티 호응을 얻지 못했다.[1]

SDXL은 「SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis」(Podell 외, 2023년 7월)에서 소개되었다. U-Net 매개변수를 세 배로 늘려 26억 개로 만들었다. 두 번째 텍스트 인코더(OpenCLIP ViT-bigG와 CLIP ViT-L)를 추가했고, 1024×1024 해상도로 네이티브 학습했다.[1]

Google은 2023년 12월 Vertex AI의 Imagen API와 Bard 이미지 생성 기능의 일부로 Imagen 2를 공개했다.[1]

3.5. 디퓨전 트랜스포머 시대 (2023~2026년)

William Peebles와 Saining Xie는 「Scalable Diffusion Models with Transformers」(arXiv:2212.09748, 2022년 12월)에서 디퓨전 트랜스포머(DiT)를 소개했다. DiT는 U-Net 백본 대신, 패치로 나눈 노이즈 잠재 표현에 작동하는 순수 트랜스포머를 썼다. 구조는 ViT와 비슷하다. 이 구조는 규모를 키우기 쉬웠고, 2024년 2월 발표된 OpenAI의 Sora 영상 모델의 기반이 되었다.[1]

Stability AI는 DiT 아이디어를 Stable Diffusion 3에 적용했다. 논문 「Scaling Rectified Flow Transformers for High-Resolution Image Synthesis」(Patrick Esser 등, arXiv:2403.03206, 2024년 3월)은 MM-DiT(멀티모달 디퓨전 트랜스포머)를 도입했다. MM-DiT는 각 트랜스포머 블록에서 이미지 토큰과 텍스트 토큰에 별도의 가중치 행렬을 쓰되, 두 토큰 사이의 어텐션은 허용한다. SD3는 표준 DDPM 목표 대신 렉티파이드 플로우(rectified flow)로 학습해 명시적 노이즈 스케줄을 없앴다. 저자들은 가장 큰 모델이 사람 선호도 평가에서 PartiPrompts 기준 시각 미학, 프롬프트 따르기, 타이포그래피 생성 모두에서 현존하는 상용 및 공개 최신 이미지 생성 모델을 앞선다고 보고했다. SD3 Medium(20억 매개변수)은 2024년 6월 공개되었다.[1][13]

Black Forest Labs는 Robin Rombach, Patrick Esser, Andreas Blattmann, Dominik Lorenz 등 Stable Diffusion 팀의 전직 핵심 멤버가 세운 회사로, 2024년 8월 1일 Flux.1을 공개했다. Flux.1은 렉티파이드 플로우로 학습한 120억 매개변수 MM-DiT이며, Flux.1 Pro(폐쇄형 API), Flux.1 Dev(공개 가중치, 비상업 용도), Flux.1 Schnell(4단계 증류, Apache 2.0)의 세 변형으로 나왔다.[14] 회사는 가장 큰 Flux.1 모델이 내부 정성 테스트에서 Stable Diffusion 3 Ultra, Midjourney v6.0, DALL-E 3 HD를 앞섰다고 보고했다.[14] 2024년 10월에는 더 빠른 생성과 4메가픽셀 출력용 Ultra 모드를 더한 Flux.1.1 Pro가 나왔다. 맥락 기반 이미지 편집에 초점을 맞춘 Flux.1 Kontext는 2024년 12월 발표되었고 2025년에 공개되었다.

Stable Diffusion 3.5는 2024년 10월 출시되었으며, MM-DiT 구조로 돌아가 Large(80억 매개변수), Large Turbo, Medium 변형을 냈다.[1] Google은 2024년 8월 Imagen 3를 공개했고(2024년 12월 일반 제공), 2025년 5월 20일 Google I/O에서 Imagen 4를 발표했다. Imagen 4 계열(Fast, Standard, Ultra)은 2025년 8월 15일 Gemini API에서 일반 제공(GA)되었다.[15]

Recraft V3는 2024년 10월 출시되어 한동안 Artificial Analysis 텍스트-이미지 아레나 1위에 올랐다. Ideogram은 2023년 8월 V1, 2024년 8월 V2를 냈고, 2025년 3월 26일 Ideogram 3.0을 발표했다(2025년 5월 1일 개선). 이 모델은 정확한 이미지 속 글자 렌더링에 초점을 맞췄다.[16] NVIDIA의 Sana(Xie 외, 2024)는 효율적인 선형 어텐션 DiT를 소개했다.[1]

DeepSeek는 2025년 1월 Janus-Pro를 공개했다. 하나의 자기회귀 백본에서 텍스트-이미지 생성과 이미지 이해를 함께 처리하는 통합 멀티모달 모델이다. HiDream AI가 2025년 5월 공개한 HiDream-I1은 170억 매개변수 규모의 희소 전문가 혼합 DiT이며, 공개 직후 여러 리더보드 상위에 올랐다. 2024~2025년의 다른 출시 모델로는 Tencent의 Hunyuan-DiT(2024년 5월, 중국어·영어 이중 언어 DiT), Kuaishou의 Kolors(2024년 7월, 이중 언어 DiT), Alpha-VLLM의 Lumina-mGPT, Stability AI의 Stable Cascade(2024년 2월, Wurstchen 구조 기반)가 있다.[1]

폐쇄형 진영에서 Midjourney는 v6(2023년 12월), v6.1(2024년 7월), v7(2025년 4월 3일 공개, 2025년 6월 17일 기본 버전 지정)을 냈다. 2026년에는 V8 시리즈를 알파 공개와 정식 공개 단계로 옮겼고, 2026년 4월 30일 midjourney.com에서 V8.1을 공개했다. V8.1은 네이티브 2K 출력을 지원하는 가장 빠른 모델로, 일반 작업은 이전 버전보다 대략 4~5배 빠르게 렌더링되며 별도의 업스케일 단계 없이 2048×2048 이미지를 만든다.[1][17]

OpenAI의 ChatGPT 이미지 생성 기능은 내부적으로 gpt-image-1로 불리며, 2025년 3월 25일 GPT-4o에 통합된 자기회귀 이미지 모델로 출시되었다. 긴 구조화 프롬프트를 처리하고 읽을 수 있는 글자를 만드는 능력으로 주목받았다.[2] 이후 OpenAI는 ChatGPT의 기본 이미지 생성기를 DALL-E 3에서 GPT Image로 바꾸고, dall-e-2와 dall-e-3 API 스냅샷의 지원 종료를 발표했다. 두 스냅샷은 2026년 5월 12일 API에서 제거되었다.[18][18] Reve Image는 2024년에 출시된 또 다른 자기회귀 도전자다.[1]

3.6. 네이티브 멀티모달 시대 (2025~2026년)

2025년과 2026년의 결정적 변화는 전용 텍스트-이미지 파이프라인에서 벗어나, 대형 언어 모델이나 비전-언어 모델 백본에서 이미지를 직접 생성하는 네이티브 멀티모달 모델로 옮겨 간 것이다. 이들 모델은 지시 따르기 능력이 강하고, 이미지 속 글자와 대화형 편집을 지원하는 경우가 많다.[1]

OpenAI의 gpt-image-1(2025년 3월)은 ChatGPT를 통해 대중적으로 쓰인 첫 모델이며, 앞서 언급한 1시간 안의 100만 명 가입 급증을 이끌었다.[3] Google은 Gemini 이미지 생성으로 뒤따랐다. Gemini 2.5 Flash Image는 'Nano Banana'로 불리며 2025년 8월 26일 발표되었다. 저지연 이미지 생성·편집 모델로, 캐릭터 일관성이 강하고 보이지 않는 SynthID 워터마크가 들어간다. 출시 후 2주 동안 Gemini 앱에 신규 사용자 2,300만 명 넘게 더해졌고, 사용자는 5억 장 넘는 이미지를 만들었다. 그 결과 앱은 App Store와 Google Play에서 1위에 올랐다.[1][19]

Gemini 3 Pro Image는 'Nano Banana Pro'로 2025년 11월 20일 출시되었다. Gemini 3 Pro의 추론을 바탕으로 하며, 읽기 쉬운 글자 렌더링에서 업계 최상위권 수준을 내세운다. 최대 14장의 입력 이미지, 최대 5명 인물의 닮은 모습 보존, 1K·2K·4K 업스케일을 지원한다.[1][20]

ByteDance는 2025년 9월 Seedream 4.0을 내놓았다. 생성과 편집을 하나로 묶은 통합 DiT로, 최대 4K 출력을 지원하며 추론 실행 속도는 Seedream 3.0보다 약 10배 빠르다. 2025년 12월에는 Seedream 4.5가 나왔다. Alibaba는 2025년 8월 4일 Qwen-Image를 공개했다. Apache 2.0 라이선스를 따르는 200억 매개변수 MM-DiT이며, 중국어 표의문자를 포함한 글자 렌더링을 강조했다. 이어 2026년 2월 10일 Qwen-Image 2.0이 나왔다. 80억 매개변수 Qwen3-VL 인코더와 70억 매개변수 확산 디코더를 결합한 더 가벼운 통합 모델로, 네이티브 2K 해상도를 지원한다.[1][21]

Black Forest Labs는 Flux 라인을 넓혔다. Flux.1 Kontext는 2025년 5월 29일 Max, Pro, Dev 변형으로 발표되었으며, 맥락 안에서 이미지를 편집하는(in-context editing) 모델이다. 이어 2025년 11월 25일 발표된 Flux.2는 Pro, Flex, Dev, Apache 2.0 라이선스의 Klein과 Max 등급을 포함한 제품군이다. 여러 참조 이미지를 제어하며 최대 4메가픽셀 이미지를 만든다. 알려진 바에 따르면 Flux.2는 잠재 플로우 매칭과 Mistral-3 비전-언어 모델을 결합했고, Flux.2 [klein]은 2026년 1월 15일 공개되었다.[22]

3.7. 주요 출시 연표

주요 출시 연표 · 2026년 4월 기준
시점모델개발 기관비고
2015년AlignDRAW토론토 대학교캡션에서 이미지로 가는 최초의 신경 어텐션 모델[1]
2016년Reed 외 GAN미시간 대학교, 막스플랑크 연구소캡션 조건부 최초의 GAN[1]
2017년StackGAN러트거스, 리하이, 마이크로소프트2단계 GAN, 256×256[1]
2018년AttnGAN마이크로소프트 리서치단어 단위 교차 어텐션[1]
2021년 1월DALL-EOpenAIdVAE를 쓴 120억 매개변수 자기회귀 트랜스포머[1]
2021년 12월GLIDEOpenAI확산 모델용 분류기 없는 가이던스[1]
2022년 4월DALL-E 2OpenAICLIP 잠재 확산, 1024×1024[1]
2022년 5월Imagen구글 리서치T5-XXL 텍스트 인코더, 픽셀 공간 확산[1]
2022년 6월Parti구글 리서치200억 매개변수 자기회귀 트랜스포머[1]
2022년 8월Stable Diffusion 1.4Stability AI, LMU 뮌헨최초의 공개 가중치 잠재 확산[1]
2022년 11월Stable Diffusion 2.0Stability AIOpenCLIP ViT-H/14[1]
2023년 7월SDXLStability AIU-Net 26억 매개변수, 1024×1024 네이티브[1]
2023년 12월Midjourney v6Midjourney화질의 큰 도약[1]
2023년 12월Imagen 2구글Vertex AI 출시[1]
2024년 2월Stable CascadeStability AIWurstchen 방식의 계단식 잠재 확산[1]
2024년 2월Sora (DiT)OpenAIDiT를 텍스트-영상에 적용[1]
2024년 3월Stable Diffusion 3 논문Stability AIMM-DiT와 렉티파이드 플로우[1]
2024년 5월Hunyuan-DiT텐센트이중 언어 DiT[1]
2024년 6월SD3 MediumStability AI20억 매개변수 공개 가중치[1]
2024년 7월Midjourney v6.1Midjourney디테일과 일관성 개선[1]
2024년 7월Kolors쿠아이쇼우이중 언어 DiT[1]
2024년 8월Flux.1Black Forest Labs120억 매개변수 MM-DiT, Schnell 증류[1]
2024년 8월Imagen 3구글 딥마인드T5-XXL과 디퓨전 트랜스포머[1]
2024년 8월Ideogram 2.0Ideogram이미지 속 타이포그래피가 강함[1]
2024년 10월Recraft V3Recraft한때 Artificial Analysis 아레나 1위[1]
2024년 10월SD 3.5 LargeStability AIMM-DiT 80억[1]
2024년 10월Flux.1.1 ProBlack Forest Labs4메가픽셀 Ultra 모드[1]
2025년 1월Janus-ProDeepSeek통합 자기회귀 이해 및 생성[1]
2025년 3월Midjourney v7Midjourney새로운 개인화 기본값[1]
2025년 3월gpt-image-1OpenAIChatGPT 안의 자기회귀 이미지 생성[1]
주요 출시 연표(이어서) · 2026년 4월 기준
시점모델개발 기관비고
2025년 5월HiDream-I1HiDream AI170억 희소 MoE DiT[1]
2025년 5월Imagen 4구글 딥마인드I/O에서 발표, 2025년 8월 Gemini API 일반 제공[1]
2025년 5월Flux.1 KontextBlack Forest Labs맥락 기반 편집(Max, Pro, Dev)[1]
2025년 8월Gemini 2.5 Flash Image구글 딥마인드'Nano Banana', 네이티브 멀티모달, SynthID[1]
2025년 8월Qwen-Image알리바바200억 MM-DiT, Apache 2.0, 강한 글자 렌더링[1]
2025년 9월Seedream 4.0바이트댄스통합 DiT, 최대 4K[1]
2025년 11월Gemini 3 Pro Image구글 딥마인드'Nano Banana Pro', 최대 4K, 입력 이미지 14장[1]
2025년 11월Flux.2Black Forest LabsPro/Flex/Dev/Klein, 최대 4메가픽셀[1]
2025년 12월Seedream 4.5바이트댄스타이포그래피와 다중 이미지 편집 개선[1]
2026년 2월Qwen-Image 2.0알리바바70억 통합 생성·편집, 네이티브 2K[1]
2026년 4월Midjourney V8.1Midjourney가장 빠른 버전, 네이티브 2K 출력[1]

4. 주요 모델 비교

주요 모델 비교 · 2026년 기준(1/2)
모델첫 공개개발 기관백본공개 가중치
DALL-E2021년 1월OpenAI자기회귀 트랜스포머 + dVAE아니오[1]
GLIDE2021년 12월OpenAIU-Net 픽셀 확산일부 공개(필터링된 3억 규모 모델)[1]
DALL-E 22022년 4월OpenAICLIP 잠재를 쓰는 U-Net 확산아니오[1]
Imagen2022년 5월구글U-Net 픽셀 확산, T5-XXL아니오[1]
Parti2022년 6월구글자기회귀 트랜스포머(ViT-VQGAN)아니오[1]
Stable Diffusion 1.52022년 10월Stability AI, RunwayMLU-Net 잠재 확산예(CreativeML OpenRAIL-M)[1]
DALL-E 32023년 10월OpenAI확산 + GPT 프롬프트 재작성기아니오(API는 2026년 5월 제거)[1]
SDXL2023년 7월Stability AIU-Net 잠재 확산, 이중 텍스트 인코더예[1]
Midjourney v62023년 12월Midjourney비공개(DiT로 추정됨)아니오[1]
Imagen 22023년 12월구글픽셀 확산아니오[1]
Stable Cascade2024년 2월Stability AIWurstchen v3 계단식예[1]
SD3 Medium2024년 6월Stability AIMM-DiT + 렉티파이드 플로우예[1]
Flux.1 Dev2024년 8월Black Forest LabsMM-DiT + 렉티파이드 플로우(120억)예(비상업)[1]
Flux.1 Schnell2024년 8월Black Forest Labs4단계 증류 MM-DiT예(Apache 2.0)[1]
Imagen 32024년 8월구글 딥마인드확산 + T5아니오[1]
Recraft V32024년 10월Recraft폐쇄형아니오[1]
주요 모델 비교(이어서) · 2026년 기준
모델첫 공개개발 기관백본공개 가중치
SD 3.5 Large2024년 10월Stability AIMM-DiT(80억)예[1]
Hunyuan-DiT2024년 5월텐센트MM-DiT(15억), 이중 언어예[1]
Janus-Pro2025년 1월DeepSeek통합 자기회귀예[1]
gpt-image-12025년 3월OpenAI자기회귀아니오[1]
HiDream-I12025년 5월HiDream AI희소 MoE DiT(170억)예[1]
Imagen 42025년 5월구글 딥마인드확산(Fast, Standard, Ultra)아니오[1]
Flux.1 Kontext2025년 5월Black Forest LabsMM-DiT, 맥락 기반 편집Dev 변형만[1]
Gemini 2.5 Flash Image2025년 8월구글 딥마인드네이티브 멀티모달('Nano Banana')아니오[1]
Qwen-Image2025년 8월알리바바MM-DiT(200억)예(Apache 2.0)[1]
Seedream 4.02025년 9월바이트댄스통합 DiT, 최대 4K아니오[1]
Gemini 3 Pro Image2025년 11월구글 딥마인드네이티브 멀티모달('Nano Banana Pro')아니오[1]
Flux.22025년 11월Black Forest Labs잠재 플로우 매칭(Pro/Flex/Dev/Klein)Klein(Apache 2.0), Dev[1]
Recraft V32024년 10월Recraft폐쇄형(래스터 + 벡터)아니오[1]
Ideogram 3.02025년 3월Ideogram폐쇄형, 강한 타이포그래피아니오[1]
Qwen-Image 2.02026년 2월알리바바통합 70억(Qwen3-VL + 디퓨전)예[1]

5. 작동 구조

5.1. U-Net 확산

U-Net은 2015년 Olaf Ronneberger, Philipp Fischer, Thomas Brox가 생의학 이미지 분할을 위해 발표했다. Ho, Jain, Abbeel은 2020년 이를 DDPM의 표준 노이즈 제거 백본으로 채택했다. 확산 모델의 U-Net은 노이즈 잠재(또는 픽셀) 이미지, 시간 단계 임베딩, 텍스트 조건 벡터를 받아 노이즈를 예측한다. 다운샘플링, 중간, 업샘플링 블록과 스킵 연결을 갖추며, 텍스트 조건은 여러 해상도에 삽입된 교차 어텐션 층으로 들어온다. Stable Diffusion 1.x, 2.x, SDXL이 모두 U-Net 백본을 쓰며, GLIDE, DALL-E 2, Imagen, Imagen 2도 같다.[1]

잠재 확산(Rombach 외, 2022)은 확산 전에 VAE로 이미지를 압축한다. Stable Diffusion의 VAE는 8배 다운샘플링을 하므로 512×512 이미지가 64×64×4 잠재가 된다. 확산은 잠재 위에서 돌고, VAE 디코더가 마지막 잠재를 다시 픽셀로 바꾼다. 이 방식은 픽셀 공간 확산에 비해 계산량을 대략 10배 줄였고, 고해상도 공개 가중치 이미지 생성을 단일 소비자용 GPU에서 가능하게 한 핵심 공학적 통찰이었다.[1]

5.2. 디퓨전 트랜스포머(DiT)

William Peebles와 Saining Xie의 디퓨전 트랜스포머(「Scalable Diffusion Models with Transformers」, arXiv:2212.09748)는 U-Net을 순수 트랜스포머로 대체했다. 노이즈 잠재를 패치로 나누어 각 패치를 토큰으로 삼고, 트랜스포머가 셀프 어텐션으로 전체 시퀀스를 처리한다. 조건은 시간 단계와 클래스 또는 텍스트 임베딩으로 변조되는 적응형 층 정규화(adaLN)로 들어온다. DiT는 모델을 키우고 연산을 늘리면 FID가 낮아지는 깔끔한 스케일링을 보였고, 패치화 외에 이미지를 위한 구조적 특화가 없었다. DiT-XL/2가 표준 참조 모델이 되었다.[23]

DiT는 OpenAI의 Sora(2024년 2월 발표)가 채택했고, 이미지 생성에서 순수 트랜스포머 백본으로 옮겨 가는 흐름에 영향을 주었다. PixArt-Alpha(Chen 외, 2023)는 텍스트-이미지용으로 널리 쓰인 첫 공개 DiT다.[1]

MM-DiT는 Stable Diffusion 3 논문(Esser 외, 2024)에서 도입되었다. 각 트랜스포머 블록 안에서 이미지 토큰과 텍스트 토큰에 별도의 가중치 행렬을 두되, 연결된 시퀀스 위에서 셀프 어텐션이 동작하게 한다. 이로써 U-Net 설계의 교차 어텐션 병목을 피하고, 텍스트 토큰에 이미지 토큰과 동등한 지위를 준다. SD3와 Flux.1이 모두 MM-DiT를 쓴다.[1]

5.3. 토큰 기반과 플로우 매칭

자기회귀 이미지 모델은 VQ-VAE, VQ-GAN 또는 비슷한 이산 오토인코더로 이미지를 토큰화한 뒤, 텍스트 토큰 시퀀스 다음에 이미지 토큰 시퀀스를 왼쪽에서 오른쪽으로 예측한다. DALL-E(2021년 1월)는 처음 나온 대형 자기회귀 텍스트-이미지 모델이다. Parti는 이 방식을 200억 매개변수로 확장했다. Muse는 자기회귀 목표를 마스크 토큰 예측으로 바꿔 병렬 디코딩을 가능하게 했다. Janus-Pro와 gpt-image-1은 2025년에 자기회귀 이미지 생성으로 돌아갔지만, 텍스트 모델과 백본을 공유하는 멀티모달 트랜스포머를 썼다.[1]

Yaron Lipman, Ricky Chen, Heli Ben-Hamu, Maximilian Nickel, Matt Le는 「Flow Matching for Generative Modeling」(arXiv:2210.02747, 2022년 10월)에서 플로우 매칭을 소개했다. 각 노이즈 수준마다 노이즈 제거 단계를 배우는 대신, 플로우 매칭은 가우시안 노이즈 같은 단순한 기저 분포를 데이터 분포로 직선 또는 거의 직선인 경로를 따라 옮기는 벡터장을 학습한다. 시뮬레이션이 필요 없는 학습 목표이며 회귀 손실로 학습할 수 있다.[24]

렉티파이드 플로우(Liu, Gong, Liu, ICLR 2023, 「Flow Straight and Fast」)는 궤적을 명시적으로 곧게 펴는 플로우 매칭의 특정 변형이다. 2024년 SD3 논문은 트랜스포머 백본에서 렉티파이드 플로우가 대규모 텍스트-이미지 과제에서 표준 DDPM보다 낫다는 것을 보였다. 이 목표는 현재 SD3, SD 3.5, Flux.1의 기본 학습 목표다.[1]

6. 평가 방법

텍스트-이미지 품질 측정은 분류기 정확도를 재는 것보다 어렵다. 출력이 연속적인 이미지이고, 품질이 미학, 프롬프트 정합성, 사실 정확성, 결함 없음에 따라 달라지기 때문이다.[1]

주요 평가 지표와 벤치마크
벤치마크연도측정 대상비고
FID2017년분포 거리Fréchet 인셉션 거리. 실제·생성 이미지의 Inception-v3 특징 통계 간 프레셰 거리[25]
CLIPScore2021년프롬프트 정합성CLIP 텍스트·이미지 임베딩 사이의 코사인 유사도[26]
Inception Score(IS)2016년다양성과 클래스 확신도현재는 약한 지표로 여겨짐[1]
DrawBench2022년프롬프트 정합성Imagen 팀이 만든 수작업 프롬프트 200개[1]
PartiPrompts(P2)2022년프롬프트 정합성Parti 팀의 11개 범주 프롬프트 1,632개[1]
HPS2023년인간 선호인간 선호 점수. Wu 외, 사람이 라벨링한 이미지 쌍 9만 8천 개로 학습[27]
HPSv22023년인간 선호Wu 외, ICCV 2023. 라벨링 쌍 9만 8천~79만 8천 개[1]
ImageReward2023년인간 선호Xu 외, NeurIPS 2023. BLIP 기반 보상 모델, 사람 비교 13만 7천 건으로 학습[28]
PickScore2023년인간 선호Kirstain 외. Pick-a-Pic 데이터셋의 사용자 선호 50만 건으로 학습[1]
GenEval2023년구성 능력Ghosh, Hajishirzi, Schmidt, NeurIPS 2023. 객체 근거화, 개수, 색, 위치, 속성 결합[29]
T2I-CompBench2023년구성 능력Huang 외, NeurIPS 2023. 속성 결합, 객체 관계, 복합 조합[1]
DPG-Bench2024년긴 프롬프트 충실도ELLA 논문 제안. 문단 길이 프롬프트 평가[30]
PaintSkills2022년시각 추론Cho, Zala, Bansal, EMNLP 2022. 객체, 개수, 공간, 속성 능력[1]
Artificial Analysis Image Arena2024년사람 Elo여러 모델에 대한 크라우드소싱 쌍별 투표[1]
LMSys Image Arena2024년사람 Elo나란히 보여 주는 블라인드 투표[1]
Hugging Face Open T2I Arena2024년사람 Elo공개 가중치 모델 중심의 커뮤니티 아레나[1]

FID는 여전히 가장 많이 인용되는 자동 지표지만 데이터셋 선택에 민감하다(텍스트-이미지 FID에는 보통 MS-COCO 30K를 쓴다). 상위권 리더보드에서는 사람의 판단과 잘 맞지 않는다. 최근 논문은 프롬프트 정합성에 CLIPScore, 구성 능력에 GenEval, 인간 선호에 HPSv2나 PickScore를 쓰고, 공개 아레나의 Elo 점수를 함께 보고하는 경우가 많다.[1]

Hugging Face는 여러 공개 리더보드를 운영한다. 현재는 보관(archived) 상태인 Open Text-to-Image Leaderboard, GenAI-Arena, Open Image Arena가 있다. Artificial Analysis는 잦은 재순위를 적용한 자체 Image Arena를 운영한다. HiDream-I1, Flux.1.1 Pro, Imagen 3, Recraft V3는 2024~2025년 사이 각각 사람 Elo 최상위 자리를 차지한 적이 있다.[1]

7. 오픈소스 생태계

Stable Diffusion 가중치가 2022년 8월 공개되면서, 텍스트-이미지 생성을 클라우드 API 뒤에 가두지 않는 공개 가중치 기반 도구 생태계가 생겼다. 그 결과 이 기술은 취미 활동과 소규모 팀의 작업이 되었다. 지금도 SDXL, SD 3.5 Large, Flux.1 Dev와 Schnell, Qwen-Image(Apache 2.0), Janus-Pro, HiDream-I1, Flux.2 Klein(Apache 2.0)이 내려받을 수 있는 체크포인트를 제공한다. 반면 DALL-E, Imagen, Midjourney, Gemini 이미지 모델은 폐쇄형 API로 남아 있다.[1]

7.1. 추론 실행 라이브러리와 런타임

Hugging Face Diffusers는 텍스트-이미지 모델을 실행하는 표준 파이썬 라이브러리다. SD 1.x, SD 2.x, SDXL, SD3, Flux, Stable Cascade, Kandinsky, PixArt와 수십 개 커뮤니티 파인튜닝 모델을 하나의 API로 다룬다. 모든 주요 스케줄러(DDIM, DPM-Solver, Euler, UniPC, LCM)와 인페인팅, ControlNet, IP-Adapter, 이미지 변환 파이프라인을 구현해 둔다.[1]

ONNX Runtime, TensorRT, Apple Core ML은 제품 배포를 위한 하드웨어 가속 추론 실행 경로를 제공한다. Stability AI는 Apple Silicon에서 기기 내 생성을 위해 SDXL을 Core ML 형식으로 배포한다. Flux.1 Schnell은 4단계로 실행되며, 소비자 가격대에서 폐쇄형 API와 경쟁할 수 있는 가장 빠른 공개 모델이다.[1]

7.2. 그래픽 인터페이스

comfyanonymous가 2023년 초 만든 ComfyUI는 확산 파이프라인을 위한 노드 그래프 편집기다. 오픈 프런트엔드 가운데 가장 유연하다. 커스텀 노드, 복잡한 파이프라인, 다단계 워크플로, ControlNet 적층을 지원하며, 비상업용 Flux 배포에서 사실상의 기준 UI가 되었다.[1]

Automatic1111의 stable-diffusion-webui(2022년 8월 공개)는 가장 널리 채택된 첫 웹 프런트엔드이며, 플러그인 생태계와 원클릭 설치 도구로 여전히 인기가 많다. ControlNet 저자 lllyasviel이 만든 A1111 포크 Forge는 메모리 효율과 생성 속도에 초점을 맞춘다. InvokeAI는 전문 아티스트를 겨냥한 인터페이스를 제공한다. Fooocus는 UI를 기본값이 잘 잡힌 프롬프트 상자 하나로 줄였다. Pinokio는 이런 도구들을 원클릭 설치 앱으로 묶는다.[1]

Civitai(2022년 말 출시)는 Stable Diffusion 계열의 커뮤니티 파인튜닝과 LoRA를 호스팅하며, 정점기에는 월 수백만 건의 다운로드를 기록했다.[1]

8. 조건 확장 기능

텍스트 프롬프트만으로는 거친 조작 방식이다. 여러 확장 기능은 기존 텍스트-이미지 모델의 기본 가중치를 다시 학습하지 않고, 그 위에 세밀한 공간, 정체성, 스타일 조건을 더한다.[1]

8.1. ControlNet

ControlNet은 Lvmin Zhang, Anyi Rao, Maneesh Agrawala가 「Adding Conditional Control to Text-to-Image Diffusion Models」(arXiv:2302.05543, 2023년 2월)에서 소개했다. 확산 U-Net 인코더 절반을 복제해 추가 조건 이미지(Canny 에지, 깊이 맵, OpenPose 골격, 세그멘테이션 마스크, 스크리블, 노멀, 라인 아트, MLSD 선 등)를 받도록 학습한다. 학습 가능한 복사본은 제로 초기화 합성곱으로 동결된 기본 모델에 연결되어, 처음에는 효과가 없다가 기본 가중치를 해치지 않으면서 공간 제어를 배운다.[31] ControlNet은 정확한 포즈와 레이아웃 제어를 가능하게 했고, 이후 SD 기반 애니메이션과 디자인 워크플로의 핵심 구성 요소가 되었다.[1]

T2I-Adapter(Mou 외, 2023)는 ControlNet과 비슷한 기능을 하는 더 가벼운 대안으로, 어댑터 모듈이 더 작다.[1]

8.2. LoRA

LoRA(Low-Rank Adaptation)는 Hu 외가 2021년 언어 모델용으로 제안한 방법(「LoRA: Low-Rank Adaptation of Large Language Models」, arXiv:2106.09685)으로, 확산 모델을 소규모 데이터셋으로 미세 조정(fine-tuning)하는 표준 방식이 되었다. 어텐션 층(U-Net이나 DiT의 교차 어텐션 층 포함)에 저순위 학습 가능 행렬을 넣기 때문에, 새 캐릭터·스타일·개념을 위한 미세 조정은 수 기가바이트 단위의 전체 체크포인트 대신 수십 MB만 저장하면 된다. Civitai와 Hugging Face에는 Stable Diffusion 계열과 Flux용 공개 LoRA가 수만 개 호스팅되어 있다.[1]

8.3. IP-Adapter

IP-Adapter(Ye 외, 「IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models」, arXiv:2308.06721, 2023년 8월)는 사용자가 텍스트 프롬프트와 함께 참조 이미지를 두 번째 조건 신호로 줄 수 있게 한다. 한 번의 순전파로 정체성, 스타일, 구도를 옮길 수 있다.[32] InstantID와 PuLID 변형은 얼굴 정체성 보존을 위해 IP-Adapter를 특화한 것이다.[1]

8.4. AnimateDiff와 모션 모듈

AnimateDiff(Guo 외, 「AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning」, arXiv:2307.04725, 2023년 7월)는 동결된 SD 체크포인트에 시간 모션 모듈을 붙여, 어떤 이미지 체크포인트든 짧은 클립 영상 모델로 바꾼다. 이후 SD와 SDXL 기반 오픈소스 텍스트-영상 및 이미지-영상 파이프라인 중 많은 것의 길을 열었다.[1]

DreamBooth(Ruiz 외, 2022)는 더 이른 미세 조정 방식으로, 대부분 LoRA로 대체되었다. 3~5장의 예시 이미지로 확산 모델을 특정 피사체에 맞춰 개인화한다.[1]

9. 상업용 API 요금

2025년 주요 폐쇄형 API의 이미지 생성 요금은 대략 다음과 같았다(장당, 표준 해상도).[1]

API 요금 · 2025년 기준
서비스표준 요금비고
OpenAI gpt-image-1(낮음)약 1.1센트1024×1024 저품질[1]
OpenAI gpt-image-1(중간)약 4.2센트기본 소비자 등급[1]
OpenAI gpt-image-1(높음)약 16.7센트최고 수준 글자 렌더링[1]
Midjourney Basic약 2.5센트월 10달러에 200장[1]
Stability AI SD3 Large API약 6.5센트크레딧 단위 과금[1]
Black Forest Labs Flux.1.1 Pro약 4.0센트Replicate 또는 fal.ai[1]
Black Forest Labs Flux.1.1 Ultra약 6.0센트4메가픽셀[1]
Google Imagen 3약 3.0센트Vertex AI[1]
Google Imagen 4약 4.0센트Gemini API; Fast 2센트, Ultra 6센트[1]
Google Gemini 2.5 Flash Image약 3.9센트'Nano Banana'; 이미지당 출력 토큰 1,290개[1]
Ideogram V3약 8.0센트이미지 속 글자 품질이 높음[1]
Recraft V3약 4.0센트벡터와 브랜드 프리셋[1]

Google은 Gemini 2.5 Flash Image를 백만 출력 토큰당 30달러로 책정했다. 이미지 한 장이 출력 토큰 1,290개를 쓰므로 실질 비용은 장당 약 0.039달러(3.9센트)다.[19] Flux.1 Schnell이나 SDXL 같은 공개 가중치 모델을 자체 GPU에서 돌리면 전기와 감가상각된 하드웨어 비용만 든다. 워크플로가 구성되면 장당 0.1센트 미만인 경우가 많다.[1]

10. 활용 분야

텍스트-이미지 시스템은 소비자 창작 도구, 마케팅·광고 제작, 컨셉 아트와 사전 시각화, 스톡 사진 대체, 전자상거래 상품 이미지, 포장 디자인, 게임 에셋 생성, 교육용 삽화, 개인 사진 편집에 쓰인다. Adobe Firefly는 자체 확산 모델을 Photoshop의 Generative Fill에 통합했다. Canva, Figma, Microsoft Designer는 편집기 안에서 상용 텍스트-이미지 API를 쓴다. 게임 스튜디오는 SD나 Flux를 미세 조정한 모델로 환경과 캐릭터 구상을 하고, 건축·제품 디자인 팀은 스케치나 3D 렌더를 조건 입력으로 ControlNet을 쓴다.[1]

별도로, 텍스트-이미지는 많은 텍스트-영상 생성, 텍스트-3D, 개인화 시스템의 조건 기반이다. 이 모델들이 만든 합성 이미지는 비전 분류기와 탐지 모델의 학습 데이터를 늘리는 데도 쓰인다.[1]

11. 우려 사항

대부분의 대형 텍스트-이미지 모델은 LAION-5B(Schuhmann 외, 2022) 같은 웹 수집 데이터셋으로 학습되었다. LAION-5B는 Common Crawl에서 모은 58억 5천만 개 이미지-텍스트 쌍을 담는다.[33] 2023년 1월 여러 화가가 Stability AI, Midjourney, DeviantArt를 상대로 소송을 냈다. 동의 없이 자기 작품으로 학습한 것이 저작권을 침해한다는 주장이다. 영국의 Getty Images v. Stability AI 사건은 2023년에 시작되어 2024년 재판에 이르렀다. 미국 저작권청은 충분한 인간의 창작적 기여가 없는 생성형 AI 결과물은 저작권으로 보호되지 않는다는 결정을 여러 번 내렸다. 2023년 2월 Zarya of the Dawn 결정과 2025년 Allen v. Perlmutter 판결이 포함된다.[1]

LAION-5B는 스탠퍼드 인터넷 옵저버토리의 David Thiel 보고서가 데이터셋에서 아동 성적 학대 자료(CSAM)를 찾아낸 뒤, 2023년 12월 일시적으로 오프라인 전환되었다. 문제 콘텐츠를 제거한 재공개 버전은 2024년 중반에 공개되었다.[34]

11.2. 딥페이크와 동의 없는 이미지

프롬프트 하나로 실존 인물의 사실적 이미지를 만들 수 있게 되면서, 동의 없는 성적 이미지와 정치적 딥페이크라는 실제 피해가 기록되었다. 2024년 1월 테일러 스위프트(Taylor Swift)의 동의 없는 딥페이크 이미지가 X에서 퍼진 사건은 플랫폼 차원의 조치와 함께 미국의 NO FAKES Act, DEFIANCE Act 등 입법 논의를 다시 불러일으켰다. 많은 상업 모델은 실존 유명인의 이름을 막고 자동 나체 필터를 적용한다. 그러나 대부분의 공개 가중치 모델은 이 필터를 우회하도록 미세 조정될 수 있다.[1]

11.3. 편향과 재현

Buolamwini와 Gebru의 얼굴 인식 편향 연구(「Gender Shades」, 2018)는 이미지 생성에도 적용된다. 웹 데이터로 학습한 텍스트-이미지 시스템은 학습 세트의 인구통계, 직업, 고정관념 편향을 물려받는다. 블룸버그의 2023년 Stable Diffusion 출력 분석(Leonardo Nicoletti, Dina Bass)은 'CEO'나 'doctor' 프롬프트가 밝은 피부의 남성을 불균형하게 만들었고, 'social worker'나 'fast-food worker'는 반대 방향으로 기울었다고 밝혔다.[35]

Google의 2024년 Gemini 이미지 생성 기능은 공정성 조정 후 역사적으로 부정확한 결과(인종적으로 다양한 나치 군인 등)를 잠시 내놓았다. Google은 이 기능을 몇 주간 중단했다.[1]

11.4. 에너지와 환경 비용

대형 텍스트-이미지 모델 학습에는 수만 GPU-시간이 든다. 모델 카드에 따르면 Stable Diffusion 1.5는 약 15만 A100-시간을 썼다.[1] 대규모 추론 실행도 가볍지 않다. Luccioni, Jernite, Strubell의 2023년 논문은 대형 모델로 이미지 1,000장을 생성하는 데 스마트폰을 여러 번 완충하는 것과 비슷한 에너지가 든다고 추정했다.[36]

각주·출처 36개
  1. ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17 ↩18 ↩19 ↩20 ↩21 ↩22 ↩23 ↩24 ↩25 ↩26 ↩27 ↩28 ↩29 ↩30 ↩31 ↩32 ↩33 ↩34 ↩35 ↩36 ↩37 ↩38 ↩39 ↩40 ↩41 ↩42 ↩43 ↩44 ↩45 ↩46 ↩47 ↩48 ↩49 ↩50 ↩51 ↩52 ↩53 ↩54 ↩55 ↩56 ↩57 ↩58 ↩59 ↩60 ↩61 ↩62 ↩63 ↩64 ↩65 ↩66 ↩67 ↩68 ↩69 ↩70 ↩71 ↩72 ↩73 ↩74 ↩75 ↩76 ↩77 ↩78 ↩79 ↩80 ↩81 ↩82 ↩83 ↩84 ↩85 ↩86 ↩87 ↩88 ↩89 ↩90 ↩91 ↩92 ↩93 ↩94 ↩95 ↩96 ↩97 ↩98 ↩99 ↩100 ↩101 ↩102 ↩103 ↩104 ↩105 ↩106 ↩107 ↩108 ↩109 ↩110 ↩111 ↩112 ↩113 ↩114 ↩115 ↩116 ↩117 ↩118 ↩119 ↩120 ↩121 ↩122 ↩123 ↩124 ↩125 ↩126 ↩127 ↩128 ↩129 ↩130 ↩131 ↩132 ↩133 ↩134 ↩135 ↩136 ↩137 ↩138 ↩139 ↩140 ↩141 ↩142 ↩143 ↩144 ↩145 ↩146 ↩147 ↩148 ↩149 ↩150 ↩151 ↩152 ↩153 ↩154 ↩155 ↩156 ↩157 AI Wiki: Text-to-Image Models (2026-06-21 수정본) · CC BY 4.0 · 확인 2026-10-11
  2. ↩1 ↩2 Introducing 4o Image Generation · 확인 2026-10-11
  3. ↩1 ↩2 Altman: ChatGPT adds 1M users in 1 hour (AI Wiki 인용) · 확인 2026-10-11
  4. ↩1 Generating Images from Captions with Attention · 확인 2026-10-11
  5. ↩1 AttnGAN: Fine-Grained Text to Image Generation with Attentional Generative Adversarial Networks · 확인 2026-10-11
  6. ↩1 Zero-Shot Text-to-Image Generation · 확인 2026-10-11
  7. ↩1 Denoising Diffusion Probabilistic Models · 확인 2026-10-11
  8. ↩1 Classifier-Free Diffusion Guidance · 확인 2026-10-11
  9. ↩1 GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models · 확인 2026-10-11
  10. ↩1 Hierarchical Text-Conditional Image Generation with CLIP Latents · 확인 2026-10-11
  11. ↩1 ↩2 Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding · 확인 2026-10-11
  12. ↩1 High-Resolution Image Synthesis with Latent Diffusion Models · 확인 2026-10-11
  13. ↩1 Scaling Rectified Flow Transformers for High-Resolution Image Synthesis · 확인 2026-10-11
  14. ↩1 ↩2 Announcing Black Forest Labs · 확인 2026-10-11
  15. ↩1 Imagen 4 is now available in the Gemini API and Google AI Studio · 확인 2026-10-11
  16. ↩1 Ideogram 3.0 (AI Wiki 인용) · 확인 2026-10-11
  17. ↩1 Version · 확인 2026-10-11
  18. ↩1 ↩2 Deprecations · 확인 2026-10-11
  19. ↩1 ↩2 Introducing Gemini 2.5 Flash Image, our state-of-the-art image model · 확인 2026-10-11
  20. ↩1 Nano Banana Pro: Gemini 3 Pro Image model from Google DeepMind · 확인 2026-10-11
  21. ↩1 Qwen-Image: Crafting with Native Text Rendering · 확인 2026-10-11
  22. ↩1 FLUX.2 · 확인 2026-10-11
  23. ↩1 Scalable Diffusion Models with Transformers · 확인 2026-10-11
  24. ↩1 Flow Matching for Generative Modeling · 확인 2026-10-11
  25. ↩1 GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium · 확인 2026-10-11
  26. ↩1 CLIPScore: A Reference-free Evaluation Metric for Image Captioning · 확인 2026-10-11
  27. ↩1 Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis · 확인 2026-10-11
  28. ↩1 ImageReward: Learning and Evaluating Human Preferences for Text-to-Image Generation · 확인 2026-10-11
  29. ↩1 GenEval: An Object-Focused Framework for Evaluating Text-to-Image Alignment · 확인 2026-10-11
  30. ↩1 ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment · 확인 2026-10-11
  31. ↩1 Adding Conditional Control to Text-to-Image Diffusion Models · 확인 2026-10-11
  32. ↩1 IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models · 확인 2026-10-11
  33. ↩1 LAION-5B: An open large-scale dataset for training next generation image-text models · 확인 2026-10-11
  34. ↩1 Identifying and Eliminating CSAM in Generative ML Training Data and Models (AI Wiki 인용) · 확인 2026-10-11
  35. ↩1 Humans Are Biased. Generative AI Is Even Worse (AI Wiki 인용) · 확인 2026-10-11
  36. ↩1 Power Hungry Processing: Watts Driving the Cost of AI Deployment? · 확인 2026-10-11

함께 읽는 용어

GPU정확도신경망벤치마크어텐션데이터셋Google DeepMindMicrosoftNVIDIA프롬프트Google트랜스포머대규모 언어 모델토큰매개변수미세 조정ChatGPTGeminiOpenAI인공지능딥러닝생성형 AI

관련 AI 모델

GPT-4o (May 2024)Gemini 2.5 Flash (May 2025)Gemini 3 Pro

이 용어를 다룬 글

기업과 사람

Microsoft

Microsoft Corporation은 워싱턴주 레드몬드에 본사를 둔 미국 기술 기업으로, 인공지능 연산 자원과 모델, 응용 제품을 공급하는 대표 기업 가운데 하나다. 이 문서는 Microsoft 연구 조직, 자체 MAI 모델, Azure 인프라, Copilot 제품, OpenAI와의 제휴를 중심으로 AI 사업을 정리한다.

모델과 서비스

Gemini

Gemini는 Google DeepMind가 개발한 네이티브 멀티모달 대규모 언어 모델 계열로, 텍스트·이미지·오디오·영상·코드를 하나의 모델 안에서 다룬다. 2023년 12월 6일 처음 발표되었고 구글 제품 전반에 쓰인다.

모델과 서비스

Grok

Grok은 xAI가 만든 생성형 AI 챗봇이자 대규모 언어 모델 계열이다. 2023년 11월 4일 처음 출시되었고 X 플랫폼과의 통합으로 실시간 정보에 접근하는 것이 특징이며, 2026년 9월 기준 주력 모델은 Grok 4.7이다.