| 분류 | 데이터셋의 한 종류(인공 생성 데이터)[1] |
|---|---|
| 정의 | 실제 세계에서 수집하지 않고 알고리즘, 시뮬레이션, 생성 모델이 만든 데이터[1] |
| 주요 쓰임 | AI 시스템의 학습, 검증, 시험에서 실제 데이터의 대체 또는 보충[1] |
| 생성 방법 | 규칙 기반, 통계 모델, 생성 신경망, 시뮬레이션, LLM 생성[1] |
| 대표 사례 | Alpaca(2023), Phi 시리즈(2023~2024), Cosmopedia(2024)[2] [3] [4] [5] |
| 시장 전망 | Gartner가 2021년 7월 내놓은 전망: 2024년까지 AI·분석 프로젝트 데이터의 60%가 합성 데이터가 되며, 2021년 비율은 1%[6] |
쉽게 말하면, 합성 데이터는 현실에서 모은 자료 대신 컴퓨터가 인공적으로 만든 데이터다. 실제 데이터가 부족하거나 비싸거나 개인정보 문제가 있을 때 AI를 학습시키고 성능을 확인하는 데 대신 쓴다. 최근에는 대규모 언어 모델이 쓴 텍스트가 합성 데이터 중 가장 많이 쓰인다.[1]
1. 개요
합성 데이터(synthetic data)는 실제 사건에서 수집하지 않고 알고리즘, 시뮬레이션, 생성 모델이 인공적으로 만든 데이터이며, AI 시스템을 학습, 검증, 시험할 때 실제 데이터를 대신하거나 보충하는 데 쓰인다. 이 분야에서 가장 많이 인용되는 전망은 Gartner가 2021년 7월에 낸 것이다. AI와 분석 프로젝트에 쓰이는 데이터 중 합성 데이터 비율이 2021년 1%에서 2024년까지 60%에 이를 것이라는 예측이다.[6] 인공지능(artificial intelligence)과 머신러닝 맥락에서 합성 데이터 사용은 2022년 이후 크게 늘었다. 그 배경에는 대규모 언어 모델의 확장 수요, 고품질 사람 생성 학습 데이터의 희소성, 강화되는 개인정보 규제, 사람 주석 비용이 있다. 2024년 말 무렵 합성 데이터는 최전선 모델 학습의 중심에 있었다. Microsoft의 Phi-4는 약 400B 합성 토큰으로 학습되었고[4], Meta는 자사의 405B Llama 3 모델로 더 작은 계열 모델의 학습 데이터를 생성했으며[7], DeepSeek는 거절 샘플링으로 얻은 추론 과정으로 자사 V3와 R1 모델을 가르쳤다.[1]
한편 연구에서는 심각한 위험도 드러났다. 가장 널리 인용되는 위험은 모델 붕괴(model collapse)다. Shumailov와 동료들이 2024년 Nature 논문에서 기록한 현상으로, 합성 데이터로 재귀 학습한 모델은 점점 원래 분포의 꼬리(tail)를 표현하지 못하게 된다.[8] 저자들은 "학습에 모델이 만든 콘텐츠를 무분별하게 쓰면 결과 모델에 되돌릴 수 없는 결함이 생기고, 원래 콘텐츠 분포의 꼬리가 사라진다"고 썼다.[8] 편향 증폭, 문체의 획일화, 공개 웹에서 AI 생성 콘텐츠 비율의 꾸준한 증가도 상황을 복잡하게 만들었다.[1]
현재의 합의는 합성 데이터가 사람 생성 데이터를 대체하기보다 보강할 때, 그리고 생성 파이프라인에 공격적인 필터링, 다양성 통제, 검증이 포함될 때 가장 효과적이라는 것이다.[1]
2. 정의와 범위
합성 데이터는 실제 세계를 직접 측정해 얻지 않은 모든 데이터다. 범주는 생각보다 넓다. 날씨 시뮬레이터가 만든 합성 위성 이미지, 언어 모델이 쓴 지시-응답 쌍, 자율주행 학습을 위해 보행자를 렌더링하는 게임 엔진, 적합된 분포에서 새 행을 뽑는 통계 모델이 모두 합성 데이터를 만든다. 데이터는 다음 목적으로 쓰일 수 있다:[1]
- 실제 데이터가 부족하거나, 비싸거나, 제한될 때 새 모델을 학습시킨다
- 클래스 간 공백이나 드문 상황을 채워 실제 데이터셋을 보강한다
- 실제 기록을 노출하지 않고 소프트웨어와 ML 파이프라인을 테스트한다
- 식별 정보를 통계적으로 같은 기능의 대체물로 바꿔 개인정보를 보호한다
- 큰 교사 모델의 능력을 작은 학생 모델로 지식 증류한다
- 견고성 평가를 위해 적대적 또는 경계 사례 입력을 만든다[1]
핵심 속성은 충실도(fidelity)다. 즉 특정 다운스트림 과제에 대해 합성 데이터가 실제 데이터의 구조와 통계적 성질을 얼마나 가깝게 닮았는지다. 판별기를 속이는 합성 데이터셋도 포착한 관계가 피상적이면 쓸모 있는 분류기를 학습시키지 못할 수 있다. 품질은 언제나 과제에 따라 달라진다.[1]
3. 데이터 형태
합성 데이터는 여러 형태를 띤다. 아래 범주는 서로 배타적이지 않으며, 현대 파이프라인은 여러 형식을 결합하는 경우가 많다.[1]
| 형태 | 생성 방식과 쓰임 | 대표 사례 |
|---|---|---|
| 정형 데이터 | 실제 데이터셋의 통계적 성질을 닮되 실제 기록은 담지 않은 행과 열 구조. 가장 오래된 형태로 의료, 금융, 통신, 소프트웨어 테스트에서 여전히 널리 쓰인다. | MIT 연구진이 2016년 공개한 SDV는 가우시안 코퓰라, VAE, CTGAN으로 정형 데이터를 생성하는 오픈소스 프레임워크를 제공한다. 상용 플랫폼으로 MOSTLY AI, Tonic.ai, Gretel.ai, Hazy가 고객 데이터베이스, 거래 로그, 전자건강기록의 합성본을 만든다.[1] [9] |
| 텍스트 | 지시-응답 쌍, 대화, 코드, 기사, 추론 과정, 책 전체를 포함한다. 2022년 말 ChatGPT 출시 이후 LLM 생성 텍스트가 AI 학습 합성 데이터의 지배적 형태가 되었다. | Alpaca 같은 지시 튜닝 데이터셋, Phi 시리즈와 Cosmopedia의 사전 학습용 합성 교과서[1] |
| 이미지 | GAN, 확산 모델, Unity, Unreal Engine, Blender 같은 렌더링 엔진으로 만든다. 실제 라벨 이미지가 부족하거나 비싸거나 사생활에 민감할 때 객체 탐지와 컴퓨터 비전 모델 학습에 쓰인다. | 실제 인물 사진 없이 얼굴 인식 시스템을 학습시키는 합성 얼굴 데이터셋, 창고 환경을 렌더링해 피킹·배치 로봇을 학습시키는 이미지[1] |
| 비디오 | 이미지 합성을 시간 축으로 확장해 자율주행 시뮬레이션, 행동 인식, 로보틱스, 감시 연구에 쓰는 프레임 시퀀스를 만든다. Sora, Veo, Runway 같은 생성 영상 모델의 클립은 학습 데이터 원천으로 제안되었으나, 다른 생성 모델의 학습에 쓰는 것은 논란이 있다. | CARLA와 NVIDIA Isaac Sim이 만드는 사실적 영상은 강화 학습 에이전트와 인지 시스템 학습에 쓰인다[1] |
| 오디오·음성 | TTS 출력, 음성 복제, 음악을 포함한다. 음성 인식과 오디오 분류 시스템 학습에 쓰이며, 녹음이 적은 저자원 언어에 특히 중요하다. | 희귀 억양, 코드 전환 음성, 도메인 특화 어휘를 위한 ASR 미세 조정에 TTS 생성 데이터가 표준처럼 쓰인다[1] |
| 3D·센서 | 물리 시뮬레이터와 게임 엔진으로 3D 장면, 포인트 클라우드, LiDAR 반사, 레이더 신호, IMU 궤적을 만든다. 2017년 Dosovitskiy와 동료들이 소개한 CARLA는 자율주행 연구의 표준 벤치마크가 되었고, 카메라, 깊이, 의미 분할 스트림에 라벨을 제공한다. NVIDIA의 Omniverse와 Isaac Sim은 이를 산업용 로보틱스로 넓혔다. | CARLA 자율주행 센서 데이터, Omniverse 기반 산업 로보틱스 데이터[10] [11] |
4. 생성 방법
생성 방법은 크게 다섯 가지로 나눌 수 있다. 각 방법은 충실도, 조절 가능성, 비용, 포착할 수 있는 구조에서 서로 다른 절충을 보인다.[1]
| 방법 | 작동 방식 | 적합한 용도 | 한계 |
|---|---|---|---|
| 규칙 기반 | 미리 정한 템플릿, 문법, 휴리스틱으로 데이터 생성 | 소프트웨어 테스트, 퍼즈 테스트, 시뮬레이션, 규제 준수 | 복잡한 실제 분포를 포착하지 못함[1] |
| 통계 기반 | 가우시안 코퓰라, 베이지안 네트워크, KDE 같은 모델을 경험적 분포에 맞추고 새 점을 추출 | 분포가 잘 정의된 정형 데이터 | 고차원, 혼합 자료형, 복잡한 의존 관계에 약함[1] |
| 생성 신경망 | GAN, VAE, 확산 모델이 데이터의 생성 모델을 학습 | 이미지, 오디오, 정형 데이터, 시계열 | 모드 붕괴, 학습 불안정, 텍스트 같은 이산 출력에 어려움[1] |
| 시뮬레이션 | 물리 엔진이나 게임 엔진이 합성 환경을 렌더링하고 라벨 붙은 센서 데이터를 생성 | 로보틱스, 자율주행, 체화 AI, 물리 시뮬레이션 | sim-to-real 격차, 엔지니어링 비용 큼, 현실의 특이 현상을 놓칠 수 있음[1] |
| LLM 생성 | 사전 학습된 대규모 언어 모델에 프롬프트를 주어 텍스트, 코드, 구조화 데이터를 생성 | 지시 튜닝, 증류, 코드, 추론 과정, 합성 교과서 | 원본 모델의 편향과 지식 한계를 물려받음, 획일화 위험[1] |
4.1. 규칙 기반과 통계 기반
규칙 기반 방법은 가장 단순하고 오래된 접근이다. 사람이 규칙을 정한다. 예를 들어 목록에서 무작위 이름을 고르고, 정규분포에서 뽑은 18~90세 나이를 부여하며, 구매 금액은 나이와 상관되도록 고객 기록을 만든다. 이 방법은 투명하고 재현 가능하며 빠르고, 소프트웨어 테스트, 시뮬레이션, 규제 준수에 여전히 널리 쓰인다. 보안 취약점을 찾으려고 무작위나 템플릿 기반 입력을 넣는 퍼즈 테스트는 오래된 규칙 기반 활용이다.[1]
통계 기반 방법은 실제 데이터의 경험적 분포에 모델을 맞춘 뒤 그 분포에서 새 표본을 뽑는다. 가우시안 코퓰라(변수 간 의존 구조를 주변 분포와 따로 모델링), 베이지안 네트워크, 커널 밀도 추정이 쓰인다. SDV 라이브러리가 이들 방법 중 여럿을 구현한다.[9] 중간 정도로 복잡한 정형 데이터에는 잘 작동하지만, 고차원, 혼합 자료형, 복잡한 조건부 의존 관계가 있으면 어려움을 겪는다.[1]
4.2. GAN 기반 생성
신경망 두 개를 맞붙이는 생성적 적대 신경망(GAN)은 이언 굿펠로(Ian Goodfellow)와 동료들이 2014년에 제안했으며, 이미지용 합성 데이터 생성을 바꿔 놓았다. 이후 정형 데이터와 시계열 데이터에도 응용되었다.[1] 생성기는 합성 샘플을 만들고 판별기는 합성과 실제를 구별하려 한다. 이 적대적 과정을 거치며 생성기는 점점 더 현실적인 데이터를 만들게 된다.
- DCGAN(Deep Convolutional GAN): 합성곱 구조로 사실적인 이미지 생성
- NVIDIA가 개발한 StyleGAN: 고해상도 얼굴 이미지를 만들며 스타일 속성을 세밀하게 조절
- CTGAN(Conditional Tabular GAN): 연속형과 이산형 열이 섞인 정형 데이터용
- TimeGAN: 시간적 역학을 보존하며 시계열 데이터 생성[1]
GAN에는 잘 알려진 한계가 있다. 모드 붕괴(생성기가 가능한 출력 중 좁은 일부만 만드는 현상), 학습 불안정, 텍스트 같은 이산 데이터 생성의 어려움이다. 2022년 이후 이미지 생성 분야에서는 학습이 더 안정적이고 더 다양한 출력을 내는 확산 모델이 GAN을 대체로 대신하게 되었다.[1]
4.3. 시뮬레이션 기반 생성
시뮬레이션은 물리 엔진, 게임 엔진, 분야별 시뮬레이터로 합성 환경을 렌더링하고 라벨 붙은 센서 데이터를 만든다. CARLA 주행 시뮬레이터, NVIDIA Isaac Sim과 Omniverse Replicator, Unity Perception, Microsoft의 AirSim이 대표적이다.[10][11] 가장 큰 장점은 정확한 정답(ground truth)이다. 모든 픽셀에 완벽한 깊이, 의미, 인스턴스 라벨이 붙는다. 가장 큰 단점은 빛, 질감, 움직임, 센서 노이즈 분포에서 시뮬레이션과 현실이 체계적으로 다르다는 sim-to-real 격차다. 텍스처, 조명, 물리 파라미터를 넓은 범위에서 무작위로 바꾸는 도메인 랜덤화는 이 격차를 좁히는 표준 기법이다.[1]
비용 경제성이 도입을 이끌었다. NVIDIA는 이미지 한 장에 수작업으로 주석을 달면 보통 약 6달러가 들지만, Omniverse Replicator로 라벨 붙은 합성 이미지 한 장을 만드는 데는 약 6센트가 든다고 밝혔다. 약 100배 줄어든 셈이다.[11] 창고 로봇과 표면 결함 탐지 같은 응용에서 이런 경제성 덕분에 합성 데이터 우선 파이프라인이 표준이 되었다.[1]
4.4. LLM 기반 생성
2023년 이후 합성 학습 데이터를 만드는 가장 영향력 있는 방법은 대규모 언어 모델에 프롬프트를 주는 것이다. GPT-4, Claude, Llama 같은 모델의 넓은 지식과 생성 능력으로 학습 예시를 대량으로 만든다. 2022년 Yizhong Wang과 동료들이 제안한 Self-Instruct는 언어 모델이 자기 생성 지시 따르기 데이터를 반복 부트스트래핑으로 만드는 방식을 개척했다.[12]
LLM이 만든 합성 데이터는 질의응답 쌍, 다중 턴 대화, 코드 풀이, 추론 과정, 교과서 본문, 구조화된 출력 등 여러 형태를 띤다. 품질과 다양성은 프롬프트 전략, 원본 모델의 능력, 생성 후 적용하는 필터링과 큐레이션 파이프라인에 크게 좌우된다.[1]
5. LLM 합성 학습 데이터 생성 기법
LLM으로 만든 합성 데이터는 2022년 이후 모델 개발의 뚜렷한 특징이 되었다. 몇 편의 논문과 프로젝트가 이후 분야가 쌓아 올린 패턴을 정립했다.[1]
5.1. 지시문 데이터: Self-Instruct와 Alpaca
Self-Instruct(Wang 외, 2022)는 언어 모델로 지시 따르기 데이터를 생성하는 가장 널리 인용된 최초의 방법이다.[12] 사람이 쓴 소규모 시드 지시문 집합(원 논문은 175개)에서 시작해, 기반 모델이 같은 스타일의 새 지시문을 만들게 하고, 각 지시문을 분류 과제인지 생성 과제인지 나누며, 입력과 출력을 생성한 뒤 중복을 걸러낸다. GPT-3에 적용해 52,000개의 지시문을 얻었고, Super-NaturalInstructions에서 절대 33점 향상을 거둬 훨씬 비싼 사람 주석으로 학습된 InstructGPT-001과 대략 맞먹었다.[12] 이 논문은 ACL 2023에서 발표되었고, 이후 거의 모든 지시문 데이터셋의 틀을 정했다.[1]
2023년 3월 Rohan Taori, Ishaan Gulrajani, Tianyi Zhang 등 스탠퍼드 연구진이 공개한 Alpaca는 Self-Instruct 방식을 OpenAI의 text-davinci-003에 적용했다.[2] 총 API 비용 500달러 미만으로 52,000개의 지시-출력 쌍을 생성했고, 그 데이터로 LLaMA 7B 기반 모델을 미세 조정했다.[2] 공개된 모델은 단순한 지시 따르기 과제에서 text-davinci-003과 질적으로 대등했다. Alpaca는 오픈소스 지시 튜닝 붐을 시작한 것으로 널리 평가되지만, 폐쇄형 교사 모델에 의존한 점은 라이선스 문제를 낳았다.[1]
5.2. 대화와 복잡도 확장: Vicuna와 WizardLM
2023년 3월 UC 버클리, CMU, 스탠퍼드, UC 샌디에이고, MBZUAI 소속 LMSYS 연구진(Wei-Lin Chiang 외)이 공개한 Vicuna는 다른 접근을 택했다. 새 지시 데이터를 생성하지 않고 ShareGPT.com에서 사용자가 공유한 대화 약 70,000개를 수집했다(v1.3에서 125,000개로 확장). 이 다중 턴 대화 말뭉치로 LLaMA를 미세 조정했다.[13] 소규모 평가 세트에서 GPT-4가 평가한 결과 Vicuna-13B는 ChatGPT 품질의 약 90%에 이른 것으로 나타났고, 2023년 가장 많이 내려받은 오픈 채팅 모델 중 하나가 되었다.[13] ShareGPT에는 저품질이거나 부적절한 내용도 섞여 있어 데이터 품질은 고르지 않았지만, 수집한 LLM 출력으로 공개 기반 모델을 크게 개선할 수 있음을 보여 주었다.[1]
2023년 Microsoft와 베이징대학교(Peking University) 소속 Can Xu 외 연구진이 낸 WizardLM은 Self-Instruct와 Alpaca의 약점, 즉 생성된 지시가 단순하다는 문제를 다뤘다.[14] Evol-Instruct 방법은 기존 지시 하나를 고정된 '진화' 프롬프트 집합으로 더 복잡하게 다시 쓴다. 제약을 더하고, 질문을 깊게 하며, 추론 요구를 높이거나, 범위를 넓힌다.[14] Alpaca의 52K개 예시에서 출발해 GPT-3.5-Turbo로 점점 어려워지는 지시 말뭉치를 만들었다. 복잡도를 균형 있게 맞춘 시험 세트에서 사람 평가는 Evol-Instruct 출력을 원본 Alpaca 예시보다 선호했다.[14] 같은 아이디어는 코드(WizardCoder, 2023년, ICLR 2024 발표)와 수학(WizardMath)으로 확장되었다.[1]
5.3. 추론 과정과 교과서형 데이터: Orca와 Phi 시리즈
Microsoft Research의 Orca 시리즈는 더 강한 교사 모델의 답뿐 아니라 추론 방식까지 옮기는 데 초점을 맞췄다. Orca 1(Mukherjee 외, 2023)은 GPT-4에게 단계별 추론을 제공하도록 요청해 약 500만 개 예시를 모았고, 그 추론 기록으로 13B 기반 모델을 미세 조정했다.[15] Orca 2(2023년 11월)는 '설명 튜닝'을 추가했다. 학생 모델이 과제에 따라 여러 해법 전략(단계별 처리, 회상 후 생성, 추출 후 생성, 직접 답변) 중 하나를 고르도록 가르쳤다.[16] Orca 2는 FLAN-v2, Orca 1의 ChatGPT 예시 500만 개, GPT-4 예시 100만 개를 섞어 학습했다.[16] 13B Orca 2는 추론 벤치마크에서 13B Llama 2 기준선보다 47.5% 높은 성능을 보였고, 7B 모델은 추론 과제에서 Llama 2 70B와 경쟁할 만한 수준이라고 보고되었다.[16][1]
Microsoft의 Phi 계열은 작은 모델이 합성 데이터로 학습하면 매개변수 수보다 훨씬 나은 성능을 낼 수 있음을 가장 뚜렷하게 보여 준다. 이 주장은 Suriya Gunasekar 외가 2023년 논문 「Textbooks Are All You Need」에서 펼쳤다.[3] Phi-1은 1.3B 매개변수 Transformer로, A100 8개로 4일간 학습했다. 학습 데이터는 GPT-4 분류기로 거른 웹의 '교과서 수준' 코드 6B 토큰과, GPT-3.5가 만든 합성 Python 교과서와 연습문제 1B 토큰이다.[3] 그 결과 Phi-1은 HumanEval에서 pass@1 50.6%, MBPP에서 55.5%를 기록했고, 당시 크기가 10배인 모델들을 앞질렀다.[3]
Phi-1.5는 같은 방식을 일반 추론으로 확장했다. Phi-2(2.7B)는 특정 추론 벤치마크에서 최대 25배 큰 모델을 앞섰다. Phi-3(2024년 4월 공개)은 더 정교한 합성 데이터 파이프라인을 도입했다. Phi-4(2024년 12월, Marah Abdin 외의 기술 보고서)는 50개의 서로 다른 합성 데이터셋 유형에서 생성한 약 400B 토큰으로 학습한 14B 모델이다. 각 유형은 서로 다른 시드 집합과 다단계 프롬프팅으로 만들어졌다.[4][1]
보고서는 설계 원칙을 분명히 밝혔다. 대부분의 언어 모델은 사전 학습이 웹 콘텐츠나 코드 같은 자연 데이터를 위주로 이루어지지만, phi-4는 학습 과정 전반에 합성 데이터를 전략적으로 포함한다는 것이다.[4] 특히 Phi-4는 STEM 중심 질의응답에서 교사 모델인 GPT-4를 넘어섰다. 학습 데이터를 만든 모델을 Phi 모델이 의미 있게 앞선 것은 이때가 처음이다.[4] 2025년에는 별도의 Phi-4-reasoning 보고서가 나왔다.[1]
5.4. 교사 모델과 AI 피드백: Llama 3, DeepSeek, Constitutional AI
Meta의 Llama 3.1은 2024년 7월 공개되며 대규모 프로덕션 LLM 개발에 합성 데이터가 본격적으로 쓰이기 시작했음을 알렸다.[7] 405B 모델은 15T 토큰이 넘게 학습되었지만, 더 중요한 역할은 70B와 8B 모델의 교사였다.[7] Meta는 Llama 출력을 다른 모델 학습에 쓸 수 있도록 Llama 라이선스를 개정했다. Llama 3 논문은 반복 사후 학습 절차를 설명하며, 매 라운드에서 지도 미세 조정과 직접 선호 최적화를 이전 라운드 모델이 만든 합성 데이터로 수행했다고 밝혔다.[7] AWS, NVIDIA, Hugging Face는 Llama 3.1 405B로 작은 모델 미세 조정용 과제별 합성 데이터를 만드는 튜토리얼과 파이프라인을 공개했고, 강력한 공개 교사 모델로부터의 증류가 일상적 작업 흐름이 되었다.[17][18][1]
DeepSeek-V3와 DeepSeek-R1은 2024년 말과 2025년 초에 공개되었고 합성 추론 데이터를 적극 활용했다. R1의 학습 파이프라인에는 거절 샘플링으로 모델이 스스로 라벨 붙은 추론 데이터를 만드는 단계가 있다. 프롬프트마다 많은 후보 해법을 생성하고, V3를 판정자로 써서 가장 좋은 예시만 지도 미세 조정에 남긴다. DeepSeek는 R1로 약 800,000개의 고품질 추론 샘플을 생성하고, 이 합성 말뭉치로 Llama 3.1, Llama 3.3, Qwen 2.5 계열의 작은 공개 모델 6개를 증류했다. R1 논문(arXiv 2501.12948, 이후 2025년 Nature 게재)은 사람이 주석을 단 추론 데이터 없이도, 자체 생성한 추론 과정에 검증 가능한 보상을 준 순수 강화 학습으로 강한 추론 능력을 얻을 수 있음을 보였다. 흔치 않은 부트스트래핑 시연이다.[1]
Anthropic의 Constitutional AI(Bai 외, 2022년 12월, arXiv:2212.08073)는 RLHF 방식 학습에 합성 데이터를 대규모로 쓴 가장 이른 문서화된 사례다.[19] Anthropic은 사람에게 두 모델 응답 중 어느 쪽이 더 안전한지 표시하게 하는 대신, '가장 덜 해로운 응답을 고르라' 같은 원칙을 적은 '헌법'에 따라 언어 모델 자체가 라벨을 달게 했다.[19] 이 파이프라인은 지도 단계에서는 합성 비판과 수정을, 강화 학습 단계에서는 합성 선호 라벨을 만든다. Anthropic은 이 절차를 RLAIF(AI 피드백 강화 학습)라고 불렀다.[19] Constitutional AI는 현재 Claude 학습의 일부이며 외부에서도 재현되었다. Nathan Lambert는 RLHF Book에서, AI 라벨러는 규칙을 일관되게 적용하지만 라벨러 모델의 사각지대를 그대로 담기 때문에 합성 선호 데이터는 사람 선호 데이터보다 잡음은 적고 편향은 크다고 지적한다.[20][1]
5.5. 오픈 사전 학습 데이터: Cosmopedia
Hugging Face의 Cosmopedia는 2024년 3월 공개되었다. Mixtral-8x7B-Instruct-v0.1로 교과서, 블로그 글, 이야기, WikiHow 기사 3천만 개 이상을 생성했고, 총 25B 토큰에 이른다.[5] H100 GPU에서 TGI와 llm-swarm 라이브러리로 만들었으며 GPU 시간은 10,000시간 이상이 들었다.[5] 프롬프트의 80% 넘게는 웹 데이터에서 왔다. 연구진은 RefinedWeb 형식 샘플을 145개 주제 군집으로 묶고, Mixtral이 주제를 식별한 뒤 그 주제의 교육용 글을 쓰게 했다.[5] 당시 Cosmopedia는 가장 큰 공개 합성 사전 학습 데이터셋이었고, Phi식 합성 사전 학습 방법을 공개적으로 처음 널리 재현한 사례였다.[1]
6. AI 학습에서의 활용
합성 데이터는 현대 AI 학습 파이프라인에서 몇 가지 뚜렷한 역할을 맡는다.[1]
6.1. 지식 증류
지식 증류는 큰 교사 모델이 작은 학생 모델의 학습 데이터를 생성하는 방식이다. 학생은 정답뿐 아니라 교사의 추론 패턴, 응답 스타일, 표면적 지식까지 배운다. 오픈소스 LLM 생태계에서 널리 쓰였다. 스탠퍼드의 Alpaca는 text-davinci-003의 지시 따르기 능력을 LLaMA 7B로 증류했고[2], Orca 프로젝트는 GPT-4의 추론 과정을 더 작은 모델로 증류했으며[15], DeepSeek는 R1을 작은 공개 기반 모델 여섯 개로 증류했다. 2024년부터 2026년까지 흔한 패턴은 강한 최전선 모델이 작은 공개 모델을 가르치는 것이다. 예를 들어 GPT-4에서 Llama 3 70B로, 다시 Llama 3 8B로 이어지는 흐름이다.[1]
6.2. 데이터 증강
합성 데이터는 빈틈을 메우고, 클래스 분포를 맞추고, 다양성을 높여 실제 데이터셋을 늘릴 수 있다. 자연어 처리에서는 기존 예시를 바꿔 쓰거나 다른 언어로 번역하거나 소수 범주의 예시를 추가로 만든다. 컴퓨터 비전에서는 드문 객체, 특이한 조명, 경계 사례 장면을 렌더링한다. 증강과 완전 합성의 경계는 흐릿하다. RandAugment(Cubuk 외, 2020)는 증강을 무작위 변형의 파이프라인으로 다루고, 최근의 확산 기반 증강은 사실상 완전 합성이지만 분포에 고정된 예시를 만든다.[21]
6.3. 자기 대국과 자기 개선
자기 대국(self-play)에서 모델은 자신 또는 자신의 복사본과 상호작용해 데이터를 만들고, 그 데이터로 다시 학습한다. AlphaGo와 AlphaZero는 자기 대국으로 보드 게임에서 인간을 넘어서는 성능을 얻었다. LLM 영역에서 DeepSeek-R1은 자체 생성 추론 과정에 검증 가능한 보상을 준 순수 강화 학습만으로, 사람이 주석한 추론 데이터 없이 창발적 추론 능력을 얻을 수 있음을 보였다.[1]
SPIN(Self-Play Fine-Tuning)은 Zixiang Chen 외가 2024년 초 제안했다(arXiv:2401.01335). 모델이 생성한 응답을 정답 데이터와 비교하는 자기 대국 메커니즘으로, 추가 사람 주석 없이 정렬을 반복 개선한다.[22]
6.4. 사전 학습 데이터
합성 데이터의 가장 야심 찬 쓰임은 사전 학습이다. Phi 시리즈는 교과서 수준의 합성 데이터로 주로 사전 학습한 작은 모델이 웹 크롤링으로 학습한 훨씬 큰 모델을 앞설 수 있음을 보였다.[3] 코딩용 합성 교과서와 연습문제로 학습한 Phi-1은 작은 크기에도 강한 코드 생성 결과를 냈다.[3] Phi-4는 50개의 서로 다른 합성 데이터셋 유형에서 약 400B 토큰을 썼다.[4] Hugging Face의 Cosmopedia는 같은 접근을 공개적으로 적용해 Mixtral로 25B 토큰의 합성 사전 학습 말뭉치를 만들었다.[5]
6.5. 사후 학습과 정렬
합성 데이터는 이제 사후 학습의 표준이다. Llama 3의 반복 사후 학습 절차는 매 라운드의 지도 미세 조정과 직접 선호 최적화에 합성 데이터를 썼다.[7] Constitutional AI는 Claude용 합성 선호 데이터를 만든다.[19] 대부분의 최신 지시 튜닝 모델과 추론 모델은 사람과 합성 선호 데이터를 섞어 쓰며, 수학 추론과 코드처럼 검증 가능한 보상으로 품질을 관리할 수 있는 영역에서는 합성 데이터만 쓰기도 한다.[1]
6.6. 시뮬레이션에서 현실로의 전이
로보틱스에서 합성 데이터는 시뮬레이션에서 정책을 학습한 뒤 실제 하드웨어에 배포하는 시뮬레이션-현실 전이(sim-to-real transfer)에 쓰인다. 도메인 랜덤화와 도메인 적응이 격차를 줄인다. 2024년부터 2026년까지 흐름은 기초 모델 기반 연결 방식으로 옮겨 갔다. 텍스트나 이미지 프롬프트를 조건으로 한 잠재 확산 모델이 시뮬레이션 이미지를 더 사실적인 이미지로 바꿔 퓨샷 적응을 돕는다.[1] NVIDIA의 Cosmos와 Omniverse Replicator는 합성 데이터 생성을 산업 로보틱스 파이프라인의 일상적 부분으로 만들었다.[11]
7. 주요 사례
아래 표는 AI 학습에 쓰인 합성 데이터의 주요 사례를 정리한 것이다.[1]
| 프로젝트 | 연도 | 개발 주체 | 합성 데이터 유형 | 핵심 내용 |
|---|---|---|---|---|
| Self-Instruct | 2022 | Allen Institute / UW | 기반 모델이 만든 지시 데이터 | Super-NaturalInstructions 33점 향상; 기초 레시피[12] |
| Alpaca | 2023 | Stanford | 52K 지시-응답 쌍 | 500달러 미만 생성; LLaMA 7B 미세 조정[2] |
| Vicuna | 2023 | LMSYS | 약 70K ShareGPT 대화 | 다중 턴 대화; LLaMA 13B가 간단한 평가에서 ChatGPT의 약 90% 수준[13] |
| WizardLM / Evol-Instruct | 2023 | Microsoft / PKU | 복잡도가 다른 진화 지시문 | GPT-3.5-Turbo로 반복 재작성[14] |
| Phi-1 | 2023 | Microsoft | 합성 Python 교과서 1B 토큰 | 1.3B 모델; HumanEval 50.6%; 「Textbooks Are All You Need」[3] |
| Phi-2 | 2023 | Microsoft | 합성 교과서와 필터링된 웹 | 2.7B 모델; 25배 큰 모델 능가[1] |
| Phi-4 | 2024 | Microsoft | 50개 유형 약 400B 토큰 | 14B 모델; STEM QA에서 교사 GPT-4를 넘어선 최초의 Phi[4] |
| Orca | 2023 | Microsoft | GPT-4 추론 설명 5M개 | 설명 튜닝으로 교사의 추론 학습[15] |
| Orca 2 | 2023 | Microsoft | GPT-4 다중 전략 추론 | 13B가 Llama 2 13B보다 47.5% 높음[16] |
| UltraChat | 2023 | Tsinghua | 1.5M 다중 턴 합성 대화 | GPT-3.5-Turbo로 생성[1] |
| WizardCoder | 2023 | Microsoft | 진화된 코드 지시문 | Code Alpaca에 Code Evol-Instruct 적용[1] |
| Magicoder | 2023 | 다양 | OSS-Instruct 코드 문제 | 실제 오픈소스 코드 조각에서 문제 생성[1] |
| Cosmopedia | 2024 | Hugging Face | 25B 토큰 합성 교과서 말뭉치 | Mixtral 생성; 3천만 건 이상; GPU 시간 10,000시간 이상[5] |
| AgentInstruct | 2024 | Microsoft | 에이전트 지시 데이터 | 도구 사용과 추론용 다중 턴 궤적[1] |
| Llama 3.1 | 2024 | Meta | 반복 사후 학습 합성 데이터 | 405B가 70B와 8B를 가르치는 데 쓰임; 증류를 허용하도록 라이선스 변경[7] |
| DeepSeek-R1 증류 | 2025 | DeepSeek | R1 추론 샘플 800K | Llama 3.1/3.3, Qwen 2.5 계열 6개 기반 모델 미세 조정[1] |
| Constitutional AI / Claude | 2022~현재 | Anthropic | 합성 비판과 선호 라벨 | 대규모 RLAIF 첫 사례; Claude 정렬의 기반[19] |
8. 합성 데이터의 장점
합성 데이터는 빠른 확산을 이끈 여러 장점을 준다.[1]
8.1. 개인정보 보호
합성 데이터는 민감한 데이터셋의 통계적 성질을 복제하되 실제 개인 식별 정보는 담지 않을 수 있다. 환자 기록을 자유롭게 공유할 수 없는 의료와, 거래 데이터가 엄격히 규제되는 금융에서 특히 가치가 크다. MITRE의 Jason Walonoski 외가 개발한 오픈소스 환자 생성기 Synthea(2018년 JAMIA 논문)는 합성 환자의 생애를 시뮬레이션하며, 미국에서 가장 흔한 1차 진료 사유 10가지와 이환율이 가장 높은 만성 질환 10가지를 포함한다.[23] HL7 FHIR와 C-CDA 표준으로 부호화된 Synthea 환자 기록 100만 건이 무료로 공개되어 의료 AI 연구에 널리 쓰인다.[23]
차등 프라이버시 합성은 합성 데이터에 형식적 개인정보 보장을 결합한다. 생성 과정에 무작위 잡음을 넣어 최종 데이터셋으로 어떤 개인 레코드도 식별할 수 없게 한다. 2024년 연구는 강한 차등 프라이버시 보장(엡실론 1 이하)이 후속 통계 검정의 제1종 오류를 부풀릴 수 있다고 경고했다. 실무자는 목표 과제에서 합성 데이터가 여전히 타당한 추론을 지원하는지 검증해야 한다.[1]
8.2. 비용, 규모, 다양성, 통제
실제 데이터 수집과 주석은 비싸다. 객체 탐지용 이미지 라벨링은 장당 몇 센트가 들 수 있고, 의료 영상이나 법률 문서처럼 전문가 주석이 필요한 영역은 예시 하나에 수 달러가 든다. 합성 데이터는 이 비용을 자릿수 단위로 낮출 수 있다. Stanford의 Alpaca는 지시 튜닝 데이터셋 전체를 500달러 미만으로 만들 수 있음을 보였다.[2] NVIDIA는 Omniverse Replicator의 합성 이미지 한 장이 약 6센트로, 사람 주석 약 6달러에 비해 100배 낮다고 밝혔다.[11]
현대 AI 학습은 데이터를 많이 쓰고, 고품질 사람 생성 데이터는 유한하다. Epoch AI는 공개된 사람 생성 텍스트 재고를 약 300T 토큰으로 추정하고, 2026년에서 2032년 사이 어느 시점에 모두 소진되며 중앙값은 2028년이라고 전망했다.[24] 합성 데이터는 유기적으로 얻을 수 있는 텍스트의 한계를 넘는 확장 방법을 제공한다. Microsoft의 Phi-4가 쓴 400B 합성 토큰은 사람이 저작하기에는 매우 어려운 규모다.[4]
합성 데이터 생성은 학습 데이터의 특정 빈틈을 겨냥할 수 있다. 모델이 특정 유형의 질문이나 과제에 약하면 그 영역의 합성 예시를 필요할 때 만들 수 있다. WizardLM의 Evol-Instruct는 모델 능력의 한계를 밀어내기 위해 시드 집합보다 어려운 예시를 의도적으로 만든다.[14]
합성 데이터 생성은 완전히 통제 가능하고 재현 가능하다. 연구자는 데이터가 가져야 할 특성을 지정하고, 다른 난수 시드로 생성을 반복하며, 생성 파이프라인을 버전 관리할 수 있다. 이런 수준의 통제는 유기적 데이터 수집으로는 불가능하다.[1]
9. 합성 데이터의 위험
합성 데이터에는 연구 공동체가 점점 더 인식하는 중대한 위험이 따른다.[1]
9.1. 모델 붕괴
가장 널리 논의되는 위험은 모델 붕괴다. 이전 모델 세대가 만든 합성 데이터로 학습한 모델이 점점 원래 데이터 분포의 꼬리를 표현하지 못하게 되는 현상이다. 2024년 7월 Ilia Shumailov, Zakhar Shumaylov, Yiren Zhao, Nicolas Papernot, Ross Anderson, Yarin Gal이 Nature에 「AI Models Collapse When Trained on Recursively Generated Data」를 발표했다(Nature 631, 755-759).[8]
논문은 이전 세대 모델이 만든 데이터로 반복 학습하는 '대체(replace)' 시나리오에서 세대마다 품질과 다양성이 떨어짐을 보였다.[8] 원래 분포의 꼬리가 가장 먼저 사라져 희귀하지만 중요한 패턴이 손실된다. 한 예시에서 중세 건축에 관한 텍스트로 시작한 모델은 9세대에 이르러 반복적인 산토끼(jackrabbit) 목록을 만들어 냈다.[8] 이 효과는 LLM, 변분 오토인코더, 가우시안 혼합 모델에서 관찰되었다.[8]
메커니즘에는 상호작용하는 두 가지 효과가 있다.[1]
- 통계적 근사 오차: 세대마다 참 데이터 분포를 근사하면서 작은 오차가 생긴다
- 함수 근사 오차: 모델 구조 자체가 전체 분포를 표현할 용량이 제한적이다[8]
이 오차들은 세대를 거치며 누적되어 분포를 점진적으로 좁힌다. 순수 대체 설정에서는 이전 세대 합성 데이터가 학습 데이터의 0.1%만 섞여도 결국 붕괴에 기여할 수 있다.[8]
논문의 발견에는 중요한 단서가 있다. '누적(accumulate)' 시나리오에서는 각 세대가 이전 데이터를 대체하지 않고 지금까지의 실제 데이터와 합성 데이터를 모두 학습하므로 붕괴를 피하거나 크게 늦출 수 있다. 2024년 Ali Borji의 노트(arXiv:2410.12954) 등 후속 논평은 실제 파이프라인이 사람 데이터와 합성 데이터를 섞고 품질 필터를 쓰기 때문에 원 실험 설정이 실제 워크플로보다 비관적이었다고 지적했다.[25] 실무적 결론은 합성 데이터로 실제 데이터를 완전히 대체하지 말고, 합성 세대를 항상 사람 콘텐츠에 고정하라는 것이다.[1]
| 구분 | 대체 설정 | 누적 설정 | 완화 방법 |
|---|---|---|---|
| 학습 데이터 | 각 세대가 이전 모델의 합성 데이터만으로 학습 | 각 세대가 지금까지의 실제와 합성 데이터 전부로 학습 | 항상 사람 데이터를 남겨 둔다[8] |
| 결과 | 분포가 심하게 좁아지고 꼬리가 사라지며 붕괴 | 붕괴가 늦춰지거나 피해짐 | 실제와 합성을 섞는다[8] |
| 꼬리 패턴 | 가장 먼저 사라짐 | 보존됨 | 다양성 필터링[8] |
| 실무적 관련성 | 최악의 시나리오 | 실제 워크플로에 더 가까움 | 품질 검증[25] |
9.2. 편향과 품질 저하
합성 데이터는 생성 모델의 편향을 물려받고 증폭할 수 있다. 언어 모델이 성별 고정관념, 인종적 편향, 문화적 가정을 학습했다면 그 편향은 합성 데이터에 반영된다. 이런 합성 데이터로 새 모델을 학습하면 피드백 고리를 거쳐 편향이 커질 수 있다. 대규모로 쓰일수록 편향된 예시의 양이 실제 데이터 부분에 대한 편향 완화 노력을 압도할 수 있어 특히 우려된다.[1]
합성 데이터의 품질은 생성 모델의 능력에 묶여 있다. 모델은 자신이 만들 수 있는 것보다 체계적으로 나은 학습 데이터를 만들 수 없고, 기존 지식을 재배열하고 재조합할 뿐이다. 그래서 합성 데이터는 큰 모델을 근사하는 작은 모델을 만드는 증류에 가장 유용하지만, 능력의 최전선을 밀어내는 데는 본질적 한계가 있다. 합성 텍스트의 미묘한 오류, 불일치, 환각된 사실은 그것으로 학습한 모델에 전파될 수 있다. Phi-4는 부분적인 반례다. 검증된 해법과 거절 샘플링으로 합성 데이터를 신중히 구성해 STEM QA에서 교사 모델을 넘어섰다.[4]
9.3. 획일화와 출처 추적
LLM이 쓴 텍스트는 문체, 어휘, 구조에서 사람이 쓴 텍스트보다 획일적인 경향이 있다. LLM 생성 데이터를 많이 학습한 모델은 사람 언어의 표현 다양성을 잃고 좁은 'AI 말투'로 수렴할 수 있다. 이는 모델 붕괴와 관련되지만 구별된다. 재귀 학습이 없어도 합성 데이터 한 세대만으로 사람 콘텐츠의 다양성이 부족해질 수 있기 때문이다.[1]
합성 데이터가 보편화되면서 합성과 실제를 구별하기는 더 어려워졌다. SEO 회사 Graphite가 2025년 10월 낸 분석은 2020년 1월부터 2025년 5월 사이 발행된 영어 기사 약 65,000건을 표본으로 삼아, AI가 쓴 기사가 새로 발행된 웹 기사의 약 52%를 차지하며 2024년 11월에 사람이 쓴 기사를 처음 넘어섰다고 밝혔다.[26] 같은 회사의 관련 분석에서 Google 검색에 노출된 기사는 여전히 약 86%가 사람이 쓴 것이었고, 이는 검색 순위가 합성 콘텐츠의 상당 부분을 걸러 낸다는 뜻일 수 있다.[26] 공개 웹의 이런 오염으로 인터넷 크롤링 기반 미래 모델은 의도와 무관하게 합성 데이터로 학습하게 되며, 의도하지 않은 재귀 학습 효과의 위험이 커지고 사람만 쓴 기준선을 유지하기 어려워진다.[1]
10. 데이터 품질 관리
합성 데이터 파이프라인은 필터링과 검증에 많이 투자한다. LLM에 프롬프트를 주고 출력을 그대로 저장하면 학습 데이터로서 품질이 낮다. 현재의 모범 사례는 여러 층으로 이루어진다.[1]
LLM 위에 만든 품질 분류기는 이제 표준이다. Hugging Face가 2024년 공개한 FineWeb-Edu 파이프라인은 Llama-3-70B-Instruct로 웹 샘플 50만 개를 0~5점 교육 품질 척도로 채점했다. 이 채점 결과로 학습한 Snowflake 기반 회귀 분류기가 나머지 웹 데이터를 채점한다.[27] 분류기는 임계값 3에서 이진 분류 F1 82%를 기록했다. MMLU에서 FineWeb-Edu는 약 10배 적은 토큰으로 훨씬 큰 Matrix 데이터셋의 최종 성능에 맞먹었다.[27] 비슷한 LLM 평가자 파이프라인이 거의 모든 최신 사전 학습의 필터링 단계에서 쓰인다.[1]
MinHash 중복 제거, 정확한 부분 문자열 중복 제거, 주제 군집화는 합성 데이터가 넓은 입력을 포괄하도록 보장한다. 다양성은 LLM 생성 데이터의 알려진 약점이다. 비슷한 프롬프트를 같은 모델에 주면 비슷한 출력이 나오기 때문이다. Cosmopedia는 생성 전에 웹 데이터를 145개 주제 군집으로 나눠 이 문제를 다뤘다.[5] Phi-4는 시드 집합과 프롬프팅 절차를 달리한 50개 합성 데이터셋 유형을 사용했다.[4]
코드와 수학에서는 실행을 통한 검증이 자연스러운 품질 필터가 된다. 테스트 케이스를 통과하거나 정답에 도달한 생성 해법만 남긴다. 이는 DeepSeek 추론 데이터 파이프라인과 대부분의 최신 수학·코드 사후 학습의 기반이다.[1] 2025년 논문 「Escaping Model Collapse via Synthetic Data Verification」(Feng 외, arXiv:2510.16657)은 이 접근을 넓혀, 적절한 검증이 모델 붕괴의 여러 측면을 완화할 수 있음을 보였다.[28]
고위험 응용에서는 사람이 검토하는 과정이 여전히 필수다. Constitutional AI의 원칙은 Anthropic 연구자들이 작성했고[19], Phi-4의 합성 데이터는 광범위한 절제(ablation) 실험으로 점검되었다.[4] 의료 합성 데이터는 보통 사용 전에 도메인 전문가가 검증한다. 사람 검토는 가장 느리고 비싼 층이지만, 특정 유형의 실패를 잡아낼 유일한 방법으로 남아 있다.[1]
11. 응용 분야
합성 데이터는 머신러닝을 쓰는 거의 모든 분야에서 쓰인다. 주요 응용 분야는 다음 표와 같다.[1]
| 분야 | 일반적 쓰임 | 대표 도구와 데이터셋 |
|---|---|---|
| 컴퓨터 비전 | 객체 탐지, 분할, 얼굴 인식; 드문 클래스 증강 | RandAugment, StyleGAN 생성 얼굴, NVIDIA Omniverse Replicator[1] |
| NLP | 지시 튜닝, 코드 학습, 추론 데이터 | Alpaca, WizardLM, Phi-4, Cosmopedia, UltraChat[1] |
| 음성·오디오 | 저자원 언어용 TTS; ASR 증강용 음성 복제 | ElevenLabs 합성 음성, Whisper 미세 조정 말뭉치[1] |
| 로보틱스 | sim-to-real 전이; 조작 정책; 내비게이션 | NVIDIA Isaac Sim, Mujoco, Habitat, AI2-THOR[11] |
| 자율주행 | 인지, 계획, 경계 시나리오 생성 | CARLA, Waymo 시뮬레이터, NVIDIA DRIVE Sim, Mindtech[10] |
| 의료 | 개인정보 보호 학습; 희귀 질환 모델링 | Synthea, MIT MDClone, MOSTLY AI[23] |
| 금융 | 사기 탐지; 희귀 사건 모델링; 규제 검사 | CTGAN, MOSTLY AI, Hazy, Tonic.ai[1] |
| 사이버보안 | 적대적 예시 생성; 침입 탐지 학습 | 퍼즈 테스터, GAN 기반 악성코드 변종[1] |
| 산업 검사 | 희귀하거나 비싼 부품의 결함 탐지 | Datagen, NVIDIA Omniverse Replicator, Unity Perception[1] |
| 게임 | NPC 행동 데이터; 절차적 콘텐츠 | AlphaGo·AlphaZero의 자기 대국; LLM 대화 생성[1] |
컴퓨터 비전에서 합성 데이터는 고전적 증강(RandAugment, AutoAugment, MixUp)부터 완전 렌더링 장면까지 이른다. CVPR 2020에서 Ekin Cubuk 외가 소개한 RandAugment는 증강 탐색 공간을 10^32에서 100으로 줄였다. 연산들이 하나의 강도 매개변수를 공유하도록 한 덕분이며, 발표 당시 ImageNet에서 top-1 정확도 85.0%를 달성했다.[21] NVIDIA Isaac Sim, Unity Perception, CARLA는 객체 탐지, 의미 분할, 깊이 추정용 라벨 달린 합성 이미지와 영상을 만든다.[11]
자연어 처리에서 합성 데이터는 지시 따르기, 코드, 수학, 추론, 안전 정렬을 위한 LLM 사후 학습의 중심이다. Self-Instruct, Alpaca, Evol-Instruct가 세운 패턴은 오픈 생태계를 지배하고, Constitutional AI는 합성 안전 정렬을, Phi 방식은 합성 사전 학습을 지배한다.[1]
로보틱스와 자율주행에서는 시뮬레이션 기반 합성 데이터가 밤에 무단횡단하는 보행자, 센서 고장, 드문 날씨 같은 경계 사례를 얻는 유일하게 실용적인 방법이다. CARLA는 2017년 이후 핵심 도구였다.[10] NVIDIA의 Omniverse와 Cosmos 플랫폼은 로봇 기초 모델 학습용 대규모 합성 비디오를 만든다.[11] 2024~2026년에는 비디오 월드 모델과 물리 시뮬레이터가 로보틱스 파이프라인에 공급되는 추세여서, 합성 데이터는 체화 AI의 중심이 되고 있다.[1]
Synthea는 미국 의료 데이터 형식을 따르는 공개 합성 환자 기록을 제공한다.[23] 차등 프라이버시 합성은 행동 건강 데이터셋과 임상시험 데이터에 적용되고 있다. 2024년 Google DeepMind 연구는 실제 데이터에 합성 데이터를 보완하면 조직병리, 방사선, 피부과 과제에서 견고성이 높아진다고 밝혔다.[1]
금융에서 합성 데이터는 사기 탐지(양성 사례가 드문 경우)와 규제 검사(기관 간 실제 데이터 공유가 불가능한 경우)에 널리 쓰인다. MOSTLY AI는 Fortune 100 은행과 보험사를 핵심 고객으로 둔다. CTGAN 기반 파이프라인은 정형 사기 데이터셋에 흔히 쓰인다.[1]
12. 주요 기업과 플랫폼
| 기업·프로젝트 | 초점 | 비고 |
|---|---|---|
| MOSTLY AI | 기업용 합성 정형 데이터 | 핵심 고객은 Fortune 100 은행, 보험사, 통신사; 2022년 $25M 시리즈 B 유치[1] |
| Gretel.ai | 자연어 인터페이스를 갖춘 합성 데이터 플랫폼 | 2025년 3월 NVIDIA가 인수; 보도에 따르면 기업가치 $320M을 넘는 수억 달러 규모[1] |
| Tonic.ai | 소프트웨어 테스트와 ML용 합성 데이터 | 의료와 핀테크에 강한 입지[1] |
| Hazy | 금융 서비스용 합성 데이터 | 영국 기반, 규제 산업 중심[1] |
| MITRE Synthea | 오픈소스 합성 환자 생성기 | 환자 기록 100만 건 이상 무료 제공; HL7 FHIR 준수[23] |
| MIT SDV | 오픈소스 합성 데이터 라이브러리 | 정형 데이터용 통계, GAN, VAE 방법[9] |
| Datagen | 컴퓨터 비전용 합성 데이터 | 얼굴, 손, 실내 장면[1] |
| Mindtech | 영상과 감시용 합성 데이터 | 윤리적이고 균형 잡힌 데이터셋 중심[1] |
| NVIDIA Omniverse / Replicator / Cosmos | 로보틱스와 자율주행용 산업급 합성 데이터 | Skild AI 등이 로봇 정책 학습에 사용[11] |
| Microsoft Phi 팀 | 합성 중심 LLM 사전 학습 | Phi-1부터 Phi-4까지 접근을 입증[4] |
| Anthropic | Constitutional AI 기반 합성 선호 데이터 | Claude 정렬의 RLAIF 기반[19] |
| Hugging Face Cosmopedia | 공개 합성 사전 학습 데이터셋 | Mixtral로 만든 25B 토큰[5] |
13. 규제 현황
합성 데이터의 빠른 성장은 전 세계 규제 당국의 관심을 끌었다.[1]
유럽연합은 이 분야에서 가장 활발한 규제 기관이다. EU AI법은 2024년부터 단계적으로 시행되며 합성 데이터와 관련된 조항을 담고 있다. 고위험 AI 시스템은 합성 구성 요소를 포함해 학습 데이터를 문서화해야 한다. 2025년 4월 European Data Protection Board(EDPB)는 GDPR 아래 합성 데이터 생성을 직접 다루는 지침을 냈다. 개인정보 보호 가능성을 인정하면서 준수 가능한 생성 틀을 제시했다.[29] 지침은 조직이 합성 데이터를 재식별할 수 없고 생성 과정이 개인 데이터의 무단 처리를 포함하지 않는다는 점을 입증하도록 요구한다.[29]
여러 관할권이 AI 생성 콘텐츠 표시를 요구하거나 검토하고 있으며, 이는 합성 학습 데이터에도 확장된다. 목표는 데이터 출처를 유지하고, 하류 사용자가 모델 학습 데이터 중 합성과 사람 생성의 비율을 알 수 있게 하는 것이다.[1]
한 모델의 출력으로 다른 모델을 학습시키는 것은 해결되지 않은 지식재산 문제를 낳는다. OpenAI의 이용 약관은 역사적으로 API 출력을 경쟁 모델 학습에 쓰는 것을 제한해 왔다. Meta는 Llama 3 라이선스를 개정해 증류를 명시적으로 허용했다.[7] 상용 모델이 만든 합성 학습 데이터의 법적 지위는 아직 불확실하며 관할권마다 다르다.[1]
14. 시장 규모
합성 데이터 시장은 빠르게 성장해 왔다. 업계 추정으로 세계 합성 데이터 생성 시장은 2025년 약 $510M이며, Mordor Intelligence는 2030년 $2.67B에 이르러 연평균 39.4%로 성장할 것으로 전망한다.[30] Kings Research는 2033년 $7.22B, 연평균 37.65% 성장을 전망했다. 두 전망의 차이는 시장 정의가 다르기 때문이다.[31] 합성 정형 데이터 하위 시장은 2024년 $1.36B로 추정되었고 2025년에는 $1.88B에 이를 것으로 예상되었다.[1] 2021년 1%였던 비율이 2024년까지 60%가 된다는 Gartner 예측은 여전히 수요 측 신호로 가장 많이 인용된다. Gartner는 2030년까지 AI 모델에서 합성 데이터가 실제 데이터를 완전히 압도할 것이라고도 추정했다.[6]
| 연도 | 추정 시장 규모(USD) | 주요 동인 |
|---|---|---|
| 2023 | 약 $300M | LLM 학습 붐; Phi 모델이 합성 사전 학습의 실현 가능성을 보임[1] |
| 2024 | 약 $400~575M | 개인정보 규정 준수를 위한 기업 도입; EU AI법 시행 시작; Phi-4 공개[1] |
| 2025 | 약 $510M (Mordor) | 산업 전반의 주류 도입; GDPR 합성 데이터 지침 발표; NVIDIA의 Gretel 인수[30] |
| 2026 (전망) | 약 $710M (Mordor) | 데이터 희소성과 규제 요구에 따른 지속 성장[30] |
| 2030 (전망) | 약 $2.67B (Mordor) | AI 학습 인프라의 확립된 구성 요소[30] |
대형 기술 기업들은 크게 투자하고 있다. Microsoft는 Phi 라인을 합성 데이터 중심으로 구축했다. Google은 Gemini 모델 학습에 합성 데이터를 광범위하게 썼다. Anthropic은 Claude를 위해 합성 선호 데이터에 의존한다.[19] Meta는 Llama 라이선스를 개정해 증류를 장려했다.[7] 데이터 라이선스 시장도 커졌다. Reddit과 News Corp 같은 회사는 AI 연구소와 계약해 검증된 사람 생성 콘텐츠를 제공하며, 순수 합성 학습의 위험을 막는 닻으로 삼게 하고 있다.[1]
15. 현재 상황(2025~2026)
2026년 초 기준으로 합성 데이터는 AI 학습 파이프라인의 일상적 구성 요소가 되었고, 분야는 몇 가지 변화하는 과제에 직면해 있다.[1]
고품질 사람 생성 텍스트 공급이 빠듯해지고 있다. Epoch AI는 공개된 사람 생성 텍스트 재고를 약 300T 토큰으로 추산하며, 2026년에서 2032년 사이 소진되고 중앙값은 2028년이라고 전망했다.[24] 이 희소성 때문에 합성 데이터는 편리한 수단을 넘어 확장에 필수적인 수단이 되었다. 공개 웹의 AI 생성 콘텐츠 증가로 '유기적' 웹 크롤링도 합성 텍스트를 점점 많이 담게 되어, 실제와 합성 데이터의 구분이 흐려지고 있다.[26]
가장 성공적인 현재 접근은 합성 데이터와 실제 데이터를 전략적으로 결합하는 것이다. Apple의 「Rephrasing the Web」 접근, Microsoft의 Phi 시리즈, Hugging Face의 Cosmopedia는 최선의 결과가 사람이 만든 기반에 합성 데이터를 고정할 때 나온다는 것을 보여 준다.[5] 합의된 권고는 실제 데이터를 합성 데이터로 완전히 대체하지 않고, 합성 데이터로 증강하고 다양화하고 확장하는 것이다.[1]
점점 정교해지는 파이프라인은 학습 전에 합성 데이터를 검증하고 거른다. 자동 품질 점수(FineWeb-Edu 방식), 사실 일관성 검사, 다양성 지표, 사람 참여 검토가 포함된다.[27] 합성 데이터 검증에 관한 최근 연구는 적절한 검증이 모델 붕괴의 일부 측면을 포함해 많은 위험을 완화할 수 있다고 시사한다.[28]
가장 활발한 영역 중 하나는 합성 데이터로 추론을 개선하는 것이다. 단계별 수학 증명, 테스트 케이스가 있는 코드 해법, 논리 추론 과정이 포함된다. 검증 가능한 보상이 자연스러운 품질 필터가 되므로, 생성된 해법이 테스트를 통과하면 누가 만들었는지와 무관하게 쓸모가 있다. DeepSeek R1 증류 파이프라인과 Microsoft의 Phi-4-reasoning 보고서가 이 흐름을 보여 준다.[1]
멀티모달 모델의 등장과 함께 합성 데이터 생성은 텍스트와 이미지를 넘어 비디오, 오디오, 3D 장면, 교차 모달리티로 확장되었다. Sora 같은 생성 비디오 모델은 로보틱스, 자율주행, 체화 AI 학습 데이터를 만드는 데 쓰이고 있다. NVIDIA의 Cosmos 월드 모델은 로봇 정책 학습을 위한 사실적인 합성 비디오를 특별히 만든다.[11]
오픈소스 도구 생태계도 빠르게 성숙했다. 활성 프로젝트로 Synthetic Data Vault(SDV)[9], YData synthetic, Hugging Face의 synthetic-data-generator, Cosmopedia에 쓰인 llm-swarm[5], Argilla 등이 지시 데이터셋을 만드는 데 쓰는 distilabel, Microsoft의 AgentInstruct 프레임워크가 있다. 상용 제품으로는 Gretel(현재 NVIDIA 소속), MOSTLY AI, Tonic.ai, Hazy가 내장된 개인정보 통제를 갖춘 기업용 플랫폼을 제공한다.[1]
각주·출처 31개
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17 ↩18 ↩19 ↩20 ↩21 ↩22 ↩23 ↩24 ↩25 ↩26 ↩27 ↩28 ↩29 ↩30 ↩31 ↩32 ↩33 ↩34 ↩35 ↩36 ↩37 ↩38 ↩39 ↩40 ↩41 ↩42 ↩43 ↩44 ↩45 ↩46 ↩47 ↩48 ↩49 ↩50 ↩51 ↩52 ↩53 ↩54 ↩55 ↩56 ↩57 ↩58 ↩59 ↩60 ↩61 ↩62 ↩63 ↩64 ↩65 ↩66 ↩67 ↩68 ↩69 ↩70 ↩71 ↩72 ↩73 ↩74 ↩75 ↩76 ↩77 ↩78 ↩79 ↩80 ↩81 ↩82 ↩83 ↩84 ↩85 ↩86 ↩87 ↩88 ↩89 ↩90 ↩91 ↩92 ↩93 ↩94 ↩95 ↩96 ↩97 AI Wiki: Synthetic data (2026-06-21 수정본) · CC BY 4.0 · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 Stanford Alpaca: An Instruction-following LLaMA Model · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 Textbooks Are All You Need · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 Phi-4 Technical Report · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 Cosmopedia: How to Create Large-Scale Synthetic Data for Pre-training · 확인 2026-10-11
- ↩1 ↩2 ↩3 By 2024, 60% of the data used for the development of AI and analytics projects will be synthetically generated (AI Wiki 인용) · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 The Llama 3 Herd of Models · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 AI Models Collapse When Trained on Recursively Generated Data · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 The Synthetic Data Vault · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 CARLA: An Open Urban Driving Simulator · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 Isaac Sim: Robotics Simulation and Synthetic Data Generation · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 Self-Instruct: Aligning Language Models with Self-Generated Instructions · 확인 2026-10-11
- ↩1 ↩2 ↩3 Vicuna: An Open-Source Chatbot Impressing GPT-4 with 90% ChatGPT Quality · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 WizardLM: Empowering Large Pre-trained Language Models to Follow Complex Instructions · 확인 2026-10-11
- ↩1 ↩2 ↩3 Orca: Progressive Learning from Complex Explanation Traces of GPT-4 · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 Orca 2: Teaching Small Language Models How to Reason · 확인 2026-10-11
- ↩1 Creating Synthetic Data Using Llama 3.1 405B · 확인 2026-10-11
- ↩1 Use Llama 3.1 405B for synthetic data generation and distillation to fine-tune smaller models (AI Wiki 인용) · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 Constitutional AI: Harmlessness from AI Feedback · 확인 2026-10-11
- ↩1 Synthetic Data and CAI · 확인 2026-10-11
- ↩1 ↩2 RandAugment: Practical Automated Data Augmentation with a Reduced Search Space · 확인 2026-10-11
- ↩1 Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 Synthea: An approach, method, and software mechanism for generating synthetic patients and the synthetic electronic health care record (AI Wiki 인용) · 확인 2026-10-11
- ↩1 ↩2 Will we run out of data? Limits of LLM scaling based on human-generated data · 확인 2026-10-11
- ↩1 ↩2 A Note on Shumailov et al. (2024): 'AI Models Collapse When Trained on Recursively Generated Data.' · 확인 2026-10-11
- ↩1 ↩2 ↩3 More Articles Are Now Created by AI Than Humans · 확인 2026-10-11
- ↩1 ↩2 ↩3 The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale · 확인 2026-10-11
- ↩1 ↩2 Escaping Model Collapse via Synthetic Data Verification · 확인 2026-10-11
- ↩1 ↩2 Guidelines on Synthetic Data Generation under GDPR · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 Synthetic Data Market Size, Share, Trends & Research Report, 2030 · 확인 2026-10-11
- ↩1 Synthetic Data Generation Market to Reach $7.22 Bn by 2033 · 확인 2026-10-11