AI의 변화, 근거와 맥락까지.AI NEWS & CONTEXT
AI 사전 · 학습과 데이터

합성 데이터

합성 데이터는 실제 세계에서 수집하지 않고 알고리즘, 시뮬레이션, 생성 모델로 인공적으로 만든 데이터다. AI 시스템을 학습, 검증, 시험할 때 실제 데이터를 대신하거나 보충하는 데 쓰이며, 2022년 이후 대규모 언어 모델 학습을 중심으로 사용이 크게 늘었다.

합성 데이터
분류데이터셋의 한 종류(인공 생성 데이터)[1]
정의실제 세계에서 수집하지 않고 알고리즘, 시뮬레이션, 생성 모델이 만든 데이터[1]
주요 쓰임AI 시스템의 학습, 검증, 시험에서 실제 데이터의 대체 또는 보충[1]
생성 방법규칙 기반, 통계 모델, 생성 신경망, 시뮬레이션, LLM 생성[1]
대표 사례Alpaca(2023), Phi 시리즈(2023~2024), Cosmopedia(2024)[2] [3] [4] [5]
시장 전망Gartner가 2021년 7월 내놓은 전망: 2024년까지 AI·분석 프로젝트 데이터의 60%가 합성 데이터가 되며, 2021년 비율은 1%[6]

쉽게 말하면, 합성 데이터는 현실에서 모은 자료 대신 컴퓨터가 인공적으로 만든 데이터다. 실제 데이터가 부족하거나 비싸거나 개인정보 문제가 있을 때 AI를 학습시키고 성능을 확인하는 데 대신 쓴다. 최근에는 대규모 언어 모델이 쓴 텍스트가 합성 데이터 중 가장 많이 쓰인다.[1]

1. 개요

합성 데이터(synthetic data)는 실제 사건에서 수집하지 않고 알고리즘, 시뮬레이션, 생성 모델이 인공적으로 만든 데이터이며, AI 시스템을 학습, 검증, 시험할 때 실제 데이터를 대신하거나 보충하는 데 쓰인다. 이 분야에서 가장 많이 인용되는 전망은 Gartner가 2021년 7월에 낸 것이다. AI와 분석 프로젝트에 쓰이는 데이터 중 합성 데이터 비율이 2021년 1%에서 2024년까지 60%에 이를 것이라는 예측이다.[6] 인공지능(artificial intelligence)과 머신러닝 맥락에서 합성 데이터 사용은 2022년 이후 크게 늘었다. 그 배경에는 대규모 언어 모델의 확장 수요, 고품질 사람 생성 학습 데이터의 희소성, 강화되는 개인정보 규제, 사람 주석 비용이 있다. 2024년 말 무렵 합성 데이터는 최전선 모델 학습의 중심에 있었다. Microsoft의 Phi-4는 약 400B 합성 토큰으로 학습되었고[4], Meta는 자사의 405B Llama 3 모델로 더 작은 계열 모델의 학습 데이터를 생성했으며[7], DeepSeek는 거절 샘플링으로 얻은 추론 과정으로 자사 V3와 R1 모델을 가르쳤다.[1]

한편 연구에서는 심각한 위험도 드러났다. 가장 널리 인용되는 위험은 모델 붕괴(model collapse)다. Shumailov와 동료들이 2024년 Nature 논문에서 기록한 현상으로, 합성 데이터로 재귀 학습한 모델은 점점 원래 분포의 꼬리(tail)를 표현하지 못하게 된다.[8] 저자들은 "학습에 모델이 만든 콘텐츠를 무분별하게 쓰면 결과 모델에 되돌릴 수 없는 결함이 생기고, 원래 콘텐츠 분포의 꼬리가 사라진다"고 썼다.[8] 편향 증폭, 문체의 획일화, 공개 웹에서 AI 생성 콘텐츠 비율의 꾸준한 증가도 상황을 복잡하게 만들었다.[1]

현재의 합의는 합성 데이터가 사람 생성 데이터를 대체하기보다 보강할 때, 그리고 생성 파이프라인에 공격적인 필터링, 다양성 통제, 검증이 포함될 때 가장 효과적이라는 것이다.[1]

2. 정의와 범위

합성 데이터는 실제 세계를 직접 측정해 얻지 않은 모든 데이터다. 범주는 생각보다 넓다. 날씨 시뮬레이터가 만든 합성 위성 이미지, 언어 모델이 쓴 지시-응답 쌍, 자율주행 학습을 위해 보행자를 렌더링하는 게임 엔진, 적합된 분포에서 새 행을 뽑는 통계 모델이 모두 합성 데이터를 만든다. 데이터는 다음 목적으로 쓰일 수 있다:[1]

  • 실제 데이터가 부족하거나, 비싸거나, 제한될 때 새 모델을 학습시킨다
  • 클래스 간 공백이나 드문 상황을 채워 실제 데이터셋을 보강한다
  • 실제 기록을 노출하지 않고 소프트웨어와 ML 파이프라인을 테스트한다
  • 식별 정보를 통계적으로 같은 기능의 대체물로 바꿔 개인정보를 보호한다
  • 큰 교사 모델의 능력을 작은 학생 모델로 지식 증류한다
  • 견고성 평가를 위해 적대적 또는 경계 사례 입력을 만든다[1]

핵심 속성은 충실도(fidelity)다. 즉 특정 다운스트림 과제에 대해 합성 데이터가 실제 데이터의 구조와 통계적 성질을 얼마나 가깝게 닮았는지다. 판별기를 속이는 합성 데이터셋도 포착한 관계가 피상적이면 쓸모 있는 분류기를 학습시키지 못할 수 있다. 품질은 언제나 과제에 따라 달라진다.[1]

3. 데이터 형태

합성 데이터는 여러 형태를 띤다. 아래 범주는 서로 배타적이지 않으며, 현대 파이프라인은 여러 형식을 결합하는 경우가 많다.[1]

합성 데이터 형태별 생성 방식과 쓰임
형태생성 방식과 쓰임대표 사례
정형 데이터실제 데이터셋의 통계적 성질을 닮되 실제 기록은 담지 않은 행과 열 구조. 가장 오래된 형태로 의료, 금융, 통신, 소프트웨어 테스트에서 여전히 널리 쓰인다.MIT 연구진이 2016년 공개한 SDV는 가우시안 코퓰라, VAE, CTGAN으로 정형 데이터를 생성하는 오픈소스 프레임워크를 제공한다. 상용 플랫폼으로 MOSTLY AI, Tonic.ai, Gretel.ai, Hazy가 고객 데이터베이스, 거래 로그, 전자건강기록의 합성본을 만든다.[1] [9]
텍스트지시-응답 쌍, 대화, 코드, 기사, 추론 과정, 책 전체를 포함한다. 2022년 말 ChatGPT 출시 이후 LLM 생성 텍스트가 AI 학습 합성 데이터의 지배적 형태가 되었다.Alpaca 같은 지시 튜닝 데이터셋, Phi 시리즈와 Cosmopedia의 사전 학습용 합성 교과서[1]
이미지GAN, 확산 모델, Unity, Unreal Engine, Blender 같은 렌더링 엔진으로 만든다. 실제 라벨 이미지가 부족하거나 비싸거나 사생활에 민감할 때 객체 탐지와 컴퓨터 비전 모델 학습에 쓰인다.실제 인물 사진 없이 얼굴 인식 시스템을 학습시키는 합성 얼굴 데이터셋, 창고 환경을 렌더링해 피킹·배치 로봇을 학습시키는 이미지[1]
비디오이미지 합성을 시간 축으로 확장해 자율주행 시뮬레이션, 행동 인식, 로보틱스, 감시 연구에 쓰는 프레임 시퀀스를 만든다. Sora, Veo, Runway 같은 생성 영상 모델의 클립은 학습 데이터 원천으로 제안되었으나, 다른 생성 모델의 학습에 쓰는 것은 논란이 있다.CARLA와 NVIDIA Isaac Sim이 만드는 사실적 영상은 강화 학습 에이전트와 인지 시스템 학습에 쓰인다[1]
오디오·음성TTS 출력, 음성 복제, 음악을 포함한다. 음성 인식과 오디오 분류 시스템 학습에 쓰이며, 녹음이 적은 저자원 언어에 특히 중요하다.희귀 억양, 코드 전환 음성, 도메인 특화 어휘를 위한 ASR 미세 조정에 TTS 생성 데이터가 표준처럼 쓰인다[1]
3D·센서물리 시뮬레이터와 게임 엔진으로 3D 장면, 포인트 클라우드, LiDAR 반사, 레이더 신호, IMU 궤적을 만든다. 2017년 Dosovitskiy와 동료들이 소개한 CARLA는 자율주행 연구의 표준 벤치마크가 되었고, 카메라, 깊이, 의미 분할 스트림에 라벨을 제공한다. NVIDIA의 Omniverse와 Isaac Sim은 이를 산업용 로보틱스로 넓혔다.CARLA 자율주행 센서 데이터, Omniverse 기반 산업 로보틱스 데이터[10] [11]

4. 생성 방법

생성 방법은 크게 다섯 가지로 나눌 수 있다. 각 방법은 충실도, 조절 가능성, 비용, 포착할 수 있는 구조에서 서로 다른 절충을 보인다.[1]

합성 데이터 생성 방법 비교
방법작동 방식적합한 용도한계
규칙 기반미리 정한 템플릿, 문법, 휴리스틱으로 데이터 생성소프트웨어 테스트, 퍼즈 테스트, 시뮬레이션, 규제 준수복잡한 실제 분포를 포착하지 못함[1]
통계 기반가우시안 코퓰라, 베이지안 네트워크, KDE 같은 모델을 경험적 분포에 맞추고 새 점을 추출분포가 잘 정의된 정형 데이터고차원, 혼합 자료형, 복잡한 의존 관계에 약함[1]
생성 신경망GAN, VAE, 확산 모델이 데이터의 생성 모델을 학습이미지, 오디오, 정형 데이터, 시계열모드 붕괴, 학습 불안정, 텍스트 같은 이산 출력에 어려움[1]
시뮬레이션물리 엔진이나 게임 엔진이 합성 환경을 렌더링하고 라벨 붙은 센서 데이터를 생성로보틱스, 자율주행, 체화 AI, 물리 시뮬레이션sim-to-real 격차, 엔지니어링 비용 큼, 현실의 특이 현상을 놓칠 수 있음[1]
LLM 생성사전 학습된 대규모 언어 모델에 프롬프트를 주어 텍스트, 코드, 구조화 데이터를 생성지시 튜닝, 증류, 코드, 추론 과정, 합성 교과서원본 모델의 편향과 지식 한계를 물려받음, 획일화 위험[1]

4.1. 규칙 기반과 통계 기반

규칙 기반 방법은 가장 단순하고 오래된 접근이다. 사람이 규칙을 정한다. 예를 들어 목록에서 무작위 이름을 고르고, 정규분포에서 뽑은 18~90세 나이를 부여하며, 구매 금액은 나이와 상관되도록 고객 기록을 만든다. 이 방법은 투명하고 재현 가능하며 빠르고, 소프트웨어 테스트, 시뮬레이션, 규제 준수에 여전히 널리 쓰인다. 보안 취약점을 찾으려고 무작위나 템플릿 기반 입력을 넣는 퍼즈 테스트는 오래된 규칙 기반 활용이다.[1]

통계 기반 방법은 실제 데이터의 경험적 분포에 모델을 맞춘 뒤 그 분포에서 새 표본을 뽑는다. 가우시안 코퓰라(변수 간 의존 구조를 주변 분포와 따로 모델링), 베이지안 네트워크, 커널 밀도 추정이 쓰인다. SDV 라이브러리가 이들 방법 중 여럿을 구현한다.[9] 중간 정도로 복잡한 정형 데이터에는 잘 작동하지만, 고차원, 혼합 자료형, 복잡한 조건부 의존 관계가 있으면 어려움을 겪는다.[1]

4.2. GAN 기반 생성

신경망 두 개를 맞붙이는 생성적 적대 신경망(GAN)은 이언 굿펠로(Ian Goodfellow)와 동료들이 2014년에 제안했으며, 이미지용 합성 데이터 생성을 바꿔 놓았다. 이후 정형 데이터와 시계열 데이터에도 응용되었다.[1] 생성기는 합성 샘플을 만들고 판별기는 합성과 실제를 구별하려 한다. 이 적대적 과정을 거치며 생성기는 점점 더 현실적인 데이터를 만들게 된다.

  • DCGAN(Deep Convolutional GAN): 합성곱 구조로 사실적인 이미지 생성
  • NVIDIA가 개발한 StyleGAN: 고해상도 얼굴 이미지를 만들며 스타일 속성을 세밀하게 조절
  • CTGAN(Conditional Tabular GAN): 연속형과 이산형 열이 섞인 정형 데이터용
  • TimeGAN: 시간적 역학을 보존하며 시계열 데이터 생성[1]

GAN에는 잘 알려진 한계가 있다. 모드 붕괴(생성기가 가능한 출력 중 좁은 일부만 만드는 현상), 학습 불안정, 텍스트 같은 이산 데이터 생성의 어려움이다. 2022년 이후 이미지 생성 분야에서는 학습이 더 안정적이고 더 다양한 출력을 내는 확산 모델이 GAN을 대체로 대신하게 되었다.[1]

4.3. 시뮬레이션 기반 생성

시뮬레이션은 물리 엔진, 게임 엔진, 분야별 시뮬레이터로 합성 환경을 렌더링하고 라벨 붙은 센서 데이터를 만든다. CARLA 주행 시뮬레이터, NVIDIA Isaac Sim과 Omniverse Replicator, Unity Perception, Microsoft의 AirSim이 대표적이다.[10][11] 가장 큰 장점은 정확한 정답(ground truth)이다. 모든 픽셀에 완벽한 깊이, 의미, 인스턴스 라벨이 붙는다. 가장 큰 단점은 빛, 질감, 움직임, 센서 노이즈 분포에서 시뮬레이션과 현실이 체계적으로 다르다는 sim-to-real 격차다. 텍스처, 조명, 물리 파라미터를 넓은 범위에서 무작위로 바꾸는 도메인 랜덤화는 이 격차를 좁히는 표준 기법이다.[1]

비용 경제성이 도입을 이끌었다. NVIDIA는 이미지 한 장에 수작업으로 주석을 달면 보통 약 6달러가 들지만, Omniverse Replicator로 라벨 붙은 합성 이미지 한 장을 만드는 데는 약 6센트가 든다고 밝혔다. 약 100배 줄어든 셈이다.[11] 창고 로봇과 표면 결함 탐지 같은 응용에서 이런 경제성 덕분에 합성 데이터 우선 파이프라인이 표준이 되었다.[1]

4.4. LLM 기반 생성

2023년 이후 합성 학습 데이터를 만드는 가장 영향력 있는 방법은 대규모 언어 모델에 프롬프트를 주는 것이다. GPT-4, Claude, Llama 같은 모델의 넓은 지식과 생성 능력으로 학습 예시를 대량으로 만든다. 2022년 Yizhong Wang과 동료들이 제안한 Self-Instruct는 언어 모델이 자기 생성 지시 따르기 데이터를 반복 부트스트래핑으로 만드는 방식을 개척했다.[12]

LLM이 만든 합성 데이터는 질의응답 쌍, 다중 턴 대화, 코드 풀이, 추론 과정, 교과서 본문, 구조화된 출력 등 여러 형태를 띤다. 품질과 다양성은 프롬프트 전략, 원본 모델의 능력, 생성 후 적용하는 필터링과 큐레이션 파이프라인에 크게 좌우된다.[1]

5. LLM 합성 학습 데이터 생성 기법

LLM으로 만든 합성 데이터는 2022년 이후 모델 개발의 뚜렷한 특징이 되었다. 몇 편의 논문과 프로젝트가 이후 분야가 쌓아 올린 패턴을 정립했다.[1]

5.1. 지시문 데이터: Self-Instruct와 Alpaca

Self-Instruct(Wang 외, 2022)는 언어 모델로 지시 따르기 데이터를 생성하는 가장 널리 인용된 최초의 방법이다.[12] 사람이 쓴 소규모 시드 지시문 집합(원 논문은 175개)에서 시작해, 기반 모델이 같은 스타일의 새 지시문을 만들게 하고, 각 지시문을 분류 과제인지 생성 과제인지 나누며, 입력과 출력을 생성한 뒤 중복을 걸러낸다. GPT-3에 적용해 52,000개의 지시문을 얻었고, Super-NaturalInstructions에서 절대 33점 향상을 거둬 훨씬 비싼 사람 주석으로 학습된 InstructGPT-001과 대략 맞먹었다.[12] 이 논문은 ACL 2023에서 발표되었고, 이후 거의 모든 지시문 데이터셋의 틀을 정했다.[1]

2023년 3월 Rohan Taori, Ishaan Gulrajani, Tianyi Zhang 등 스탠퍼드 연구진이 공개한 Alpaca는 Self-Instruct 방식을 OpenAI의 text-davinci-003에 적용했다.[2] 총 API 비용 500달러 미만으로 52,000개의 지시-출력 쌍을 생성했고, 그 데이터로 LLaMA 7B 기반 모델을 미세 조정했다.[2] 공개된 모델은 단순한 지시 따르기 과제에서 text-davinci-003과 질적으로 대등했다. Alpaca는 오픈소스 지시 튜닝 붐을 시작한 것으로 널리 평가되지만, 폐쇄형 교사 모델에 의존한 점은 라이선스 문제를 낳았다.[1]

5.2. 대화와 복잡도 확장: Vicuna와 WizardLM

2023년 3월 UC 버클리, CMU, 스탠퍼드, UC 샌디에이고, MBZUAI 소속 LMSYS 연구진(Wei-Lin Chiang 외)이 공개한 Vicuna는 다른 접근을 택했다. 새 지시 데이터를 생성하지 않고 ShareGPT.com에서 사용자가 공유한 대화 약 70,000개를 수집했다(v1.3에서 125,000개로 확장). 이 다중 턴 대화 말뭉치로 LLaMA를 미세 조정했다.[13] 소규모 평가 세트에서 GPT-4가 평가한 결과 Vicuna-13B는 ChatGPT 품질의 약 90%에 이른 것으로 나타났고, 2023년 가장 많이 내려받은 오픈 채팅 모델 중 하나가 되었다.[13] ShareGPT에는 저품질이거나 부적절한 내용도 섞여 있어 데이터 품질은 고르지 않았지만, 수집한 LLM 출력으로 공개 기반 모델을 크게 개선할 수 있음을 보여 주었다.[1]

2023년 Microsoft와 베이징대학교(Peking University) 소속 Can Xu 외 연구진이 낸 WizardLM은 Self-Instruct와 Alpaca의 약점, 즉 생성된 지시가 단순하다는 문제를 다뤘다.[14] Evol-Instruct 방법은 기존 지시 하나를 고정된 '진화' 프롬프트 집합으로 더 복잡하게 다시 쓴다. 제약을 더하고, 질문을 깊게 하며, 추론 요구를 높이거나, 범위를 넓힌다.[14] Alpaca의 52K개 예시에서 출발해 GPT-3.5-Turbo로 점점 어려워지는 지시 말뭉치를 만들었다. 복잡도를 균형 있게 맞춘 시험 세트에서 사람 평가는 Evol-Instruct 출력을 원본 Alpaca 예시보다 선호했다.[14] 같은 아이디어는 코드(WizardCoder, 2023년, ICLR 2024 발표)와 수학(WizardMath)으로 확장되었다.[1]

5.3. 추론 과정과 교과서형 데이터: Orca와 Phi 시리즈

Microsoft Research의 Orca 시리즈는 더 강한 교사 모델의 답뿐 아니라 추론 방식까지 옮기는 데 초점을 맞췄다. Orca 1(Mukherjee 외, 2023)은 GPT-4에게 단계별 추론을 제공하도록 요청해 약 500만 개 예시를 모았고, 그 추론 기록으로 13B 기반 모델을 미세 조정했다.[15] Orca 2(2023년 11월)는 '설명 튜닝'을 추가했다. 학생 모델이 과제에 따라 여러 해법 전략(단계별 처리, 회상 후 생성, 추출 후 생성, 직접 답변) 중 하나를 고르도록 가르쳤다.[16] Orca 2는 FLAN-v2, Orca 1의 ChatGPT 예시 500만 개, GPT-4 예시 100만 개를 섞어 학습했다.[16] 13B Orca 2는 추론 벤치마크에서 13B Llama 2 기준선보다 47.5% 높은 성능을 보였고, 7B 모델은 추론 과제에서 Llama 2 70B와 경쟁할 만한 수준이라고 보고되었다.[16][1]

Microsoft의 Phi 계열은 작은 모델이 합성 데이터로 학습하면 매개변수 수보다 훨씬 나은 성능을 낼 수 있음을 가장 뚜렷하게 보여 준다. 이 주장은 Suriya Gunasekar 외가 2023년 논문 「Textbooks Are All You Need」에서 펼쳤다.[3] Phi-1은 1.3B 매개변수 Transformer로, A100 8개로 4일간 학습했다. 학습 데이터는 GPT-4 분류기로 거른 웹의 '교과서 수준' 코드 6B 토큰과, GPT-3.5가 만든 합성 Python 교과서와 연습문제 1B 토큰이다.[3] 그 결과 Phi-1은 HumanEval에서 pass@1 50.6%, MBPP에서 55.5%를 기록했고, 당시 크기가 10배인 모델들을 앞질렀다.[3]

Phi-1.5는 같은 방식을 일반 추론으로 확장했다. Phi-2(2.7B)는 특정 추론 벤치마크에서 최대 25배 큰 모델을 앞섰다. Phi-3(2024년 4월 공개)은 더 정교한 합성 데이터 파이프라인을 도입했다. Phi-4(2024년 12월, Marah Abdin 외의 기술 보고서)는 50개의 서로 다른 합성 데이터셋 유형에서 생성한 약 400B 토큰으로 학습한 14B 모델이다. 각 유형은 서로 다른 시드 집합과 다단계 프롬프팅으로 만들어졌다.[4][1]

보고서는 설계 원칙을 분명히 밝혔다. 대부분의 언어 모델은 사전 학습이 웹 콘텐츠나 코드 같은 자연 데이터를 위주로 이루어지지만, phi-4는 학습 과정 전반에 합성 데이터를 전략적으로 포함한다는 것이다.[4] 특히 Phi-4는 STEM 중심 질의응답에서 교사 모델인 GPT-4를 넘어섰다. 학습 데이터를 만든 모델을 Phi 모델이 의미 있게 앞선 것은 이때가 처음이다.[4] 2025년에는 별도의 Phi-4-reasoning 보고서가 나왔다.[1]

5.4. 교사 모델과 AI 피드백: Llama 3, DeepSeek, Constitutional AI

Meta의 Llama 3.1은 2024년 7월 공개되며 대규모 프로덕션 LLM 개발에 합성 데이터가 본격적으로 쓰이기 시작했음을 알렸다.[7] 405B 모델은 15T 토큰이 넘게 학습되었지만, 더 중요한 역할은 70B와 8B 모델의 교사였다.[7] Meta는 Llama 출력을 다른 모델 학습에 쓸 수 있도록 Llama 라이선스를 개정했다. Llama 3 논문은 반복 사후 학습 절차를 설명하며, 매 라운드에서 지도 미세 조정과 직접 선호 최적화를 이전 라운드 모델이 만든 합성 데이터로 수행했다고 밝혔다.[7] AWS, NVIDIA, Hugging Face는 Llama 3.1 405B로 작은 모델 미세 조정용 과제별 합성 데이터를 만드는 튜토리얼과 파이프라인을 공개했고, 강력한 공개 교사 모델로부터의 증류가 일상적 작업 흐름이 되었다.[17][18][1]

DeepSeek-V3와 DeepSeek-R1은 2024년 말과 2025년 초에 공개되었고 합성 추론 데이터를 적극 활용했다. R1의 학습 파이프라인에는 거절 샘플링으로 모델이 스스로 라벨 붙은 추론 데이터를 만드는 단계가 있다. 프롬프트마다 많은 후보 해법을 생성하고, V3를 판정자로 써서 가장 좋은 예시만 지도 미세 조정에 남긴다. DeepSeek는 R1로 약 800,000개의 고품질 추론 샘플을 생성하고, 이 합성 말뭉치로 Llama 3.1, Llama 3.3, Qwen 2.5 계열의 작은 공개 모델 6개를 증류했다. R1 논문(arXiv 2501.12948, 이후 2025년 Nature 게재)은 사람이 주석을 단 추론 데이터 없이도, 자체 생성한 추론 과정에 검증 가능한 보상을 준 순수 강화 학습으로 강한 추론 능력을 얻을 수 있음을 보였다. 흔치 않은 부트스트래핑 시연이다.[1]

Anthropic의 Constitutional AI(Bai 외, 2022년 12월, arXiv:2212.08073)는 RLHF 방식 학습에 합성 데이터를 대규모로 쓴 가장 이른 문서화된 사례다.[19] Anthropic은 사람에게 두 모델 응답 중 어느 쪽이 더 안전한지 표시하게 하는 대신, '가장 덜 해로운 응답을 고르라' 같은 원칙을 적은 '헌법'에 따라 언어 모델 자체가 라벨을 달게 했다.[19] 이 파이프라인은 지도 단계에서는 합성 비판과 수정을, 강화 학습 단계에서는 합성 선호 라벨을 만든다. Anthropic은 이 절차를 RLAIF(AI 피드백 강화 학습)라고 불렀다.[19] Constitutional AI는 현재 Claude 학습의 일부이며 외부에서도 재현되었다. Nathan Lambert는 RLHF Book에서, AI 라벨러는 규칙을 일관되게 적용하지만 라벨러 모델의 사각지대를 그대로 담기 때문에 합성 선호 데이터는 사람 선호 데이터보다 잡음은 적고 편향은 크다고 지적한다.[20][1]

5.5. 오픈 사전 학습 데이터: Cosmopedia

Hugging Face의 Cosmopedia는 2024년 3월 공개되었다. Mixtral-8x7B-Instruct-v0.1로 교과서, 블로그 글, 이야기, WikiHow 기사 3천만 개 이상을 생성했고, 총 25B 토큰에 이른다.[5] H100 GPU에서 TGI와 llm-swarm 라이브러리로 만들었으며 GPU 시간은 10,000시간 이상이 들었다.[5] 프롬프트의 80% 넘게는 웹 데이터에서 왔다. 연구진은 RefinedWeb 형식 샘플을 145개 주제 군집으로 묶고, Mixtral이 주제를 식별한 뒤 그 주제의 교육용 글을 쓰게 했다.[5] 당시 Cosmopedia는 가장 큰 공개 합성 사전 학습 데이터셋이었고, Phi식 합성 사전 학습 방법을 공개적으로 처음 널리 재현한 사례였다.[1]

6. AI 학습에서의 활용

합성 데이터는 현대 AI 학습 파이프라인에서 몇 가지 뚜렷한 역할을 맡는다.[1]

6.1. 지식 증류

지식 증류는 큰 교사 모델이 작은 학생 모델의 학습 데이터를 생성하는 방식이다. 학생은 정답뿐 아니라 교사의 추론 패턴, 응답 스타일, 표면적 지식까지 배운다. 오픈소스 LLM 생태계에서 널리 쓰였다. 스탠퍼드의 Alpaca는 text-davinci-003의 지시 따르기 능력을 LLaMA 7B로 증류했고[2], Orca 프로젝트는 GPT-4의 추론 과정을 더 작은 모델로 증류했으며[15], DeepSeek는 R1을 작은 공개 기반 모델 여섯 개로 증류했다. 2024년부터 2026년까지 흔한 패턴은 강한 최전선 모델이 작은 공개 모델을 가르치는 것이다. 예를 들어 GPT-4에서 Llama 3 70B로, 다시 Llama 3 8B로 이어지는 흐름이다.[1]

6.2. 데이터 증강

합성 데이터는 빈틈을 메우고, 클래스 분포를 맞추고, 다양성을 높여 실제 데이터셋을 늘릴 수 있다. 자연어 처리에서는 기존 예시를 바꿔 쓰거나 다른 언어로 번역하거나 소수 범주의 예시를 추가로 만든다. 컴퓨터 비전에서는 드문 객체, 특이한 조명, 경계 사례 장면을 렌더링한다. 증강과 완전 합성의 경계는 흐릿하다. RandAugment(Cubuk 외, 2020)는 증강을 무작위 변형의 파이프라인으로 다루고, 최근의 확산 기반 증강은 사실상 완전 합성이지만 분포에 고정된 예시를 만든다.[21]

6.3. 자기 대국과 자기 개선

자기 대국(self-play)에서 모델은 자신 또는 자신의 복사본과 상호작용해 데이터를 만들고, 그 데이터로 다시 학습한다. AlphaGo와 AlphaZero는 자기 대국으로 보드 게임에서 인간을 넘어서는 성능을 얻었다. LLM 영역에서 DeepSeek-R1은 자체 생성 추론 과정에 검증 가능한 보상을 준 순수 강화 학습만으로, 사람이 주석한 추론 데이터 없이 창발적 추론 능력을 얻을 수 있음을 보였다.[1]

SPIN(Self-Play Fine-Tuning)은 Zixiang Chen 외가 2024년 초 제안했다(arXiv:2401.01335). 모델이 생성한 응답을 정답 데이터와 비교하는 자기 대국 메커니즘으로, 추가 사람 주석 없이 정렬을 반복 개선한다.[22]

6.4. 사전 학습 데이터

합성 데이터의 가장 야심 찬 쓰임은 사전 학습이다. Phi 시리즈는 교과서 수준의 합성 데이터로 주로 사전 학습한 작은 모델이 웹 크롤링으로 학습한 훨씬 큰 모델을 앞설 수 있음을 보였다.[3] 코딩용 합성 교과서와 연습문제로 학습한 Phi-1은 작은 크기에도 강한 코드 생성 결과를 냈다.[3] Phi-4는 50개의 서로 다른 합성 데이터셋 유형에서 약 400B 토큰을 썼다.[4] Hugging Face의 Cosmopedia는 같은 접근을 공개적으로 적용해 Mixtral로 25B 토큰의 합성 사전 학습 말뭉치를 만들었다.[5]

6.5. 사후 학습과 정렬

합성 데이터는 이제 사후 학습의 표준이다. Llama 3의 반복 사후 학습 절차는 매 라운드의 지도 미세 조정과 직접 선호 최적화에 합성 데이터를 썼다.[7] Constitutional AI는 Claude용 합성 선호 데이터를 만든다.[19] 대부분의 최신 지시 튜닝 모델과 추론 모델은 사람과 합성 선호 데이터를 섞어 쓰며, 수학 추론과 코드처럼 검증 가능한 보상으로 품질을 관리할 수 있는 영역에서는 합성 데이터만 쓰기도 한다.[1]

6.6. 시뮬레이션에서 현실로의 전이

로보틱스에서 합성 데이터는 시뮬레이션에서 정책을 학습한 뒤 실제 하드웨어에 배포하는 시뮬레이션-현실 전이(sim-to-real transfer)에 쓰인다. 도메인 랜덤화와 도메인 적응이 격차를 줄인다. 2024년부터 2026년까지 흐름은 기초 모델 기반 연결 방식으로 옮겨 갔다. 텍스트나 이미지 프롬프트를 조건으로 한 잠재 확산 모델이 시뮬레이션 이미지를 더 사실적인 이미지로 바꿔 퓨샷 적응을 돕는다.[1] NVIDIA의 Cosmos와 Omniverse Replicator는 합성 데이터 생성을 산업 로보틱스 파이프라인의 일상적 부분으로 만들었다.[11]

7. 주요 사례

아래 표는 AI 학습에 쓰인 합성 데이터의 주요 사례를 정리한 것이다.[1]

AI 학습 합성 데이터 주요 사례
프로젝트연도개발 주체합성 데이터 유형핵심 내용
Self-Instruct2022Allen Institute / UW기반 모델이 만든 지시 데이터Super-NaturalInstructions 33점 향상; 기초 레시피[12]
Alpaca2023Stanford52K 지시-응답 쌍500달러 미만 생성; LLaMA 7B 미세 조정[2]
Vicuna2023LMSYS약 70K ShareGPT 대화다중 턴 대화; LLaMA 13B가 간단한 평가에서 ChatGPT의 약 90% 수준[13]
WizardLM / Evol-Instruct2023Microsoft / PKU복잡도가 다른 진화 지시문GPT-3.5-Turbo로 반복 재작성[14]
Phi-12023Microsoft합성 Python 교과서 1B 토큰1.3B 모델; HumanEval 50.6%; 「Textbooks Are All You Need」[3]
Phi-22023Microsoft합성 교과서와 필터링된 웹2.7B 모델; 25배 큰 모델 능가[1]
Phi-42024Microsoft50개 유형 약 400B 토큰14B 모델; STEM QA에서 교사 GPT-4를 넘어선 최초의 Phi[4]
Orca2023MicrosoftGPT-4 추론 설명 5M개설명 튜닝으로 교사의 추론 학습[15]
Orca 22023MicrosoftGPT-4 다중 전략 추론13B가 Llama 2 13B보다 47.5% 높음[16]
UltraChat2023Tsinghua1.5M 다중 턴 합성 대화GPT-3.5-Turbo로 생성[1]
WizardCoder2023Microsoft진화된 코드 지시문Code Alpaca에 Code Evol-Instruct 적용[1]
Magicoder2023다양OSS-Instruct 코드 문제실제 오픈소스 코드 조각에서 문제 생성[1]
Cosmopedia2024Hugging Face25B 토큰 합성 교과서 말뭉치Mixtral 생성; 3천만 건 이상; GPU 시간 10,000시간 이상[5]
AgentInstruct2024Microsoft에이전트 지시 데이터도구 사용과 추론용 다중 턴 궤적[1]
Llama 3.12024Meta반복 사후 학습 합성 데이터405B가 70B와 8B를 가르치는 데 쓰임; 증류를 허용하도록 라이선스 변경[7]
DeepSeek-R1 증류2025DeepSeekR1 추론 샘플 800KLlama 3.1/3.3, Qwen 2.5 계열 6개 기반 모델 미세 조정[1]
Constitutional AI / Claude2022~현재Anthropic합성 비판과 선호 라벨대규모 RLAIF 첫 사례; Claude 정렬의 기반[19]

8. 합성 데이터의 장점

합성 데이터는 빠른 확산을 이끈 여러 장점을 준다.[1]

8.1. 개인정보 보호

합성 데이터는 민감한 데이터셋의 통계적 성질을 복제하되 실제 개인 식별 정보는 담지 않을 수 있다. 환자 기록을 자유롭게 공유할 수 없는 의료와, 거래 데이터가 엄격히 규제되는 금융에서 특히 가치가 크다. MITRE의 Jason Walonoski 외가 개발한 오픈소스 환자 생성기 Synthea(2018년 JAMIA 논문)는 합성 환자의 생애를 시뮬레이션하며, 미국에서 가장 흔한 1차 진료 사유 10가지와 이환율이 가장 높은 만성 질환 10가지를 포함한다.[23] HL7 FHIR와 C-CDA 표준으로 부호화된 Synthea 환자 기록 100만 건이 무료로 공개되어 의료 AI 연구에 널리 쓰인다.[23]

차등 프라이버시 합성은 합성 데이터에 형식적 개인정보 보장을 결합한다. 생성 과정에 무작위 잡음을 넣어 최종 데이터셋으로 어떤 개인 레코드도 식별할 수 없게 한다. 2024년 연구는 강한 차등 프라이버시 보장(엡실론 1 이하)이 후속 통계 검정의 제1종 오류를 부풀릴 수 있다고 경고했다. 실무자는 목표 과제에서 합성 데이터가 여전히 타당한 추론을 지원하는지 검증해야 한다.[1]

8.2. 비용, 규모, 다양성, 통제

실제 데이터 수집과 주석은 비싸다. 객체 탐지용 이미지 라벨링은 장당 몇 센트가 들 수 있고, 의료 영상이나 법률 문서처럼 전문가 주석이 필요한 영역은 예시 하나에 수 달러가 든다. 합성 데이터는 이 비용을 자릿수 단위로 낮출 수 있다. Stanford의 Alpaca는 지시 튜닝 데이터셋 전체를 500달러 미만으로 만들 수 있음을 보였다.[2] NVIDIA는 Omniverse Replicator의 합성 이미지 한 장이 약 6센트로, 사람 주석 약 6달러에 비해 100배 낮다고 밝혔다.[11]

현대 AI 학습은 데이터를 많이 쓰고, 고품질 사람 생성 데이터는 유한하다. Epoch AI는 공개된 사람 생성 텍스트 재고를 약 300T 토큰으로 추정하고, 2026년에서 2032년 사이 어느 시점에 모두 소진되며 중앙값은 2028년이라고 전망했다.[24] 합성 데이터는 유기적으로 얻을 수 있는 텍스트의 한계를 넘는 확장 방법을 제공한다. Microsoft의 Phi-4가 쓴 400B 합성 토큰은 사람이 저작하기에는 매우 어려운 규모다.[4]

합성 데이터 생성은 학습 데이터의 특정 빈틈을 겨냥할 수 있다. 모델이 특정 유형의 질문이나 과제에 약하면 그 영역의 합성 예시를 필요할 때 만들 수 있다. WizardLM의 Evol-Instruct는 모델 능력의 한계를 밀어내기 위해 시드 집합보다 어려운 예시를 의도적으로 만든다.[14]

합성 데이터 생성은 완전히 통제 가능하고 재현 가능하다. 연구자는 데이터가 가져야 할 특성을 지정하고, 다른 난수 시드로 생성을 반복하며, 생성 파이프라인을 버전 관리할 수 있다. 이런 수준의 통제는 유기적 데이터 수집으로는 불가능하다.[1]

9. 합성 데이터의 위험

합성 데이터에는 연구 공동체가 점점 더 인식하는 중대한 위험이 따른다.[1]

9.1. 모델 붕괴

가장 널리 논의되는 위험은 모델 붕괴다. 이전 모델 세대가 만든 합성 데이터로 학습한 모델이 점점 원래 데이터 분포의 꼬리를 표현하지 못하게 되는 현상이다. 2024년 7월 Ilia Shumailov, Zakhar Shumaylov, Yiren Zhao, Nicolas Papernot, Ross Anderson, Yarin Gal이 Nature에 「AI Models Collapse When Trained on Recursively Generated Data」를 발표했다(Nature 631, 755-759).[8]

논문은 이전 세대 모델이 만든 데이터로 반복 학습하는 '대체(replace)' 시나리오에서 세대마다 품질과 다양성이 떨어짐을 보였다.[8] 원래 분포의 꼬리가 가장 먼저 사라져 희귀하지만 중요한 패턴이 손실된다. 한 예시에서 중세 건축에 관한 텍스트로 시작한 모델은 9세대에 이르러 반복적인 산토끼(jackrabbit) 목록을 만들어 냈다.[8] 이 효과는 LLM, 변분 오토인코더, 가우시안 혼합 모델에서 관찰되었다.[8]

메커니즘에는 상호작용하는 두 가지 효과가 있다.[1]

  • 통계적 근사 오차: 세대마다 참 데이터 분포를 근사하면서 작은 오차가 생긴다
  • 함수 근사 오차: 모델 구조 자체가 전체 분포를 표현할 용량이 제한적이다[8]

이 오차들은 세대를 거치며 누적되어 분포를 점진적으로 좁힌다. 순수 대체 설정에서는 이전 세대 합성 데이터가 학습 데이터의 0.1%만 섞여도 결국 붕괴에 기여할 수 있다.[8]

논문의 발견에는 중요한 단서가 있다. '누적(accumulate)' 시나리오에서는 각 세대가 이전 데이터를 대체하지 않고 지금까지의 실제 데이터와 합성 데이터를 모두 학습하므로 붕괴를 피하거나 크게 늦출 수 있다. 2024년 Ali Borji의 노트(arXiv:2410.12954) 등 후속 논평은 실제 파이프라인이 사람 데이터와 합성 데이터를 섞고 품질 필터를 쓰기 때문에 원 실험 설정이 실제 워크플로보다 비관적이었다고 지적했다.[25] 실무적 결론은 합성 데이터로 실제 데이터를 완전히 대체하지 말고, 합성 세대를 항상 사람 콘텐츠에 고정하라는 것이다.[1]

모델 붕괴 실험의 대체 설정과 누적 설정 비교
구분대체 설정누적 설정완화 방법
학습 데이터각 세대가 이전 모델의 합성 데이터만으로 학습각 세대가 지금까지의 실제와 합성 데이터 전부로 학습항상 사람 데이터를 남겨 둔다[8]
결과분포가 심하게 좁아지고 꼬리가 사라지며 붕괴붕괴가 늦춰지거나 피해짐실제와 합성을 섞는다[8]
꼬리 패턴가장 먼저 사라짐보존됨다양성 필터링[8]
실무적 관련성최악의 시나리오실제 워크플로에 더 가까움품질 검증[25]

9.2. 편향과 품질 저하

합성 데이터는 생성 모델의 편향을 물려받고 증폭할 수 있다. 언어 모델이 성별 고정관념, 인종적 편향, 문화적 가정을 학습했다면 그 편향은 합성 데이터에 반영된다. 이런 합성 데이터로 새 모델을 학습하면 피드백 고리를 거쳐 편향이 커질 수 있다. 대규모로 쓰일수록 편향된 예시의 양이 실제 데이터 부분에 대한 편향 완화 노력을 압도할 수 있어 특히 우려된다.[1]

합성 데이터의 품질은 생성 모델의 능력에 묶여 있다. 모델은 자신이 만들 수 있는 것보다 체계적으로 나은 학습 데이터를 만들 수 없고, 기존 지식을 재배열하고 재조합할 뿐이다. 그래서 합성 데이터는 큰 모델을 근사하는 작은 모델을 만드는 증류에 가장 유용하지만, 능력의 최전선을 밀어내는 데는 본질적 한계가 있다. 합성 텍스트의 미묘한 오류, 불일치, 환각된 사실은 그것으로 학습한 모델에 전파될 수 있다. Phi-4는 부분적인 반례다. 검증된 해법과 거절 샘플링으로 합성 데이터를 신중히 구성해 STEM QA에서 교사 모델을 넘어섰다.[4]

9.3. 획일화와 출처 추적

LLM이 쓴 텍스트는 문체, 어휘, 구조에서 사람이 쓴 텍스트보다 획일적인 경향이 있다. LLM 생성 데이터를 많이 학습한 모델은 사람 언어의 표현 다양성을 잃고 좁은 'AI 말투'로 수렴할 수 있다. 이는 모델 붕괴와 관련되지만 구별된다. 재귀 학습이 없어도 합성 데이터 한 세대만으로 사람 콘텐츠의 다양성이 부족해질 수 있기 때문이다.[1]

합성 데이터가 보편화되면서 합성과 실제를 구별하기는 더 어려워졌다. SEO 회사 Graphite가 2025년 10월 낸 분석은 2020년 1월부터 2025년 5월 사이 발행된 영어 기사 약 65,000건을 표본으로 삼아, AI가 쓴 기사가 새로 발행된 웹 기사의 약 52%를 차지하며 2024년 11월에 사람이 쓴 기사를 처음 넘어섰다고 밝혔다.[26] 같은 회사의 관련 분석에서 Google 검색에 노출된 기사는 여전히 약 86%가 사람이 쓴 것이었고, 이는 검색 순위가 합성 콘텐츠의 상당 부분을 걸러 낸다는 뜻일 수 있다.[26] 공개 웹의 이런 오염으로 인터넷 크롤링 기반 미래 모델은 의도와 무관하게 합성 데이터로 학습하게 되며, 의도하지 않은 재귀 학습 효과의 위험이 커지고 사람만 쓴 기준선을 유지하기 어려워진다.[1]

10. 데이터 품질 관리

합성 데이터 파이프라인은 필터링과 검증에 많이 투자한다. LLM에 프롬프트를 주고 출력을 그대로 저장하면 학습 데이터로서 품질이 낮다. 현재의 모범 사례는 여러 층으로 이루어진다.[1]

LLM 위에 만든 품질 분류기는 이제 표준이다. Hugging Face가 2024년 공개한 FineWeb-Edu 파이프라인은 Llama-3-70B-Instruct로 웹 샘플 50만 개를 0~5점 교육 품질 척도로 채점했다. 이 채점 결과로 학습한 Snowflake 기반 회귀 분류기가 나머지 웹 데이터를 채점한다.[27] 분류기는 임계값 3에서 이진 분류 F1 82%를 기록했다. MMLU에서 FineWeb-Edu는 약 10배 적은 토큰으로 훨씬 큰 Matrix 데이터셋의 최종 성능에 맞먹었다.[27] 비슷한 LLM 평가자 파이프라인이 거의 모든 최신 사전 학습의 필터링 단계에서 쓰인다.[1]

MinHash 중복 제거, 정확한 부분 문자열 중복 제거, 주제 군집화는 합성 데이터가 넓은 입력을 포괄하도록 보장한다. 다양성은 LLM 생성 데이터의 알려진 약점이다. 비슷한 프롬프트를 같은 모델에 주면 비슷한 출력이 나오기 때문이다. Cosmopedia는 생성 전에 웹 데이터를 145개 주제 군집으로 나눠 이 문제를 다뤘다.[5] Phi-4는 시드 집합과 프롬프팅 절차를 달리한 50개 합성 데이터셋 유형을 사용했다.[4]

코드와 수학에서는 실행을 통한 검증이 자연스러운 품질 필터가 된다. 테스트 케이스를 통과하거나 정답에 도달한 생성 해법만 남긴다. 이는 DeepSeek 추론 데이터 파이프라인과 대부분의 최신 수학·코드 사후 학습의 기반이다.[1] 2025년 논문 「Escaping Model Collapse via Synthetic Data Verification」(Feng 외, arXiv:2510.16657)은 이 접근을 넓혀, 적절한 검증이 모델 붕괴의 여러 측면을 완화할 수 있음을 보였다.[28]

고위험 응용에서는 사람이 검토하는 과정이 여전히 필수다. Constitutional AI의 원칙은 Anthropic 연구자들이 작성했고[19], Phi-4의 합성 데이터는 광범위한 절제(ablation) 실험으로 점검되었다.[4] 의료 합성 데이터는 보통 사용 전에 도메인 전문가가 검증한다. 사람 검토는 가장 느리고 비싼 층이지만, 특정 유형의 실패를 잡아낼 유일한 방법으로 남아 있다.[1]

11. 응용 분야

합성 데이터는 머신러닝을 쓰는 거의 모든 분야에서 쓰인다. 주요 응용 분야는 다음 표와 같다.[1]

분야별 합성 데이터 응용
분야일반적 쓰임대표 도구와 데이터셋
컴퓨터 비전객체 탐지, 분할, 얼굴 인식; 드문 클래스 증강RandAugment, StyleGAN 생성 얼굴, NVIDIA Omniverse Replicator[1]
NLP지시 튜닝, 코드 학습, 추론 데이터Alpaca, WizardLM, Phi-4, Cosmopedia, UltraChat[1]
음성·오디오저자원 언어용 TTS; ASR 증강용 음성 복제ElevenLabs 합성 음성, Whisper 미세 조정 말뭉치[1]
로보틱스sim-to-real 전이; 조작 정책; 내비게이션NVIDIA Isaac Sim, Mujoco, Habitat, AI2-THOR[11]
자율주행인지, 계획, 경계 시나리오 생성CARLA, Waymo 시뮬레이터, NVIDIA DRIVE Sim, Mindtech[10]
의료개인정보 보호 학습; 희귀 질환 모델링Synthea, MIT MDClone, MOSTLY AI[23]
금융사기 탐지; 희귀 사건 모델링; 규제 검사CTGAN, MOSTLY AI, Hazy, Tonic.ai[1]
사이버보안적대적 예시 생성; 침입 탐지 학습퍼즈 테스터, GAN 기반 악성코드 변종[1]
산업 검사희귀하거나 비싼 부품의 결함 탐지Datagen, NVIDIA Omniverse Replicator, Unity Perception[1]
게임NPC 행동 데이터; 절차적 콘텐츠AlphaGo·AlphaZero의 자기 대국; LLM 대화 생성[1]

컴퓨터 비전에서 합성 데이터는 고전적 증강(RandAugment, AutoAugment, MixUp)부터 완전 렌더링 장면까지 이른다. CVPR 2020에서 Ekin Cubuk 외가 소개한 RandAugment는 증강 탐색 공간을 10^32에서 100으로 줄였다. 연산들이 하나의 강도 매개변수를 공유하도록 한 덕분이며, 발표 당시 ImageNet에서 top-1 정확도 85.0%를 달성했다.[21] NVIDIA Isaac Sim, Unity Perception, CARLA는 객체 탐지, 의미 분할, 깊이 추정용 라벨 달린 합성 이미지와 영상을 만든다.[11]

자연어 처리에서 합성 데이터는 지시 따르기, 코드, 수학, 추론, 안전 정렬을 위한 LLM 사후 학습의 중심이다. Self-Instruct, Alpaca, Evol-Instruct가 세운 패턴은 오픈 생태계를 지배하고, Constitutional AI는 합성 안전 정렬을, Phi 방식은 합성 사전 학습을 지배한다.[1]

로보틱스와 자율주행에서는 시뮬레이션 기반 합성 데이터가 밤에 무단횡단하는 보행자, 센서 고장, 드문 날씨 같은 경계 사례를 얻는 유일하게 실용적인 방법이다. CARLA는 2017년 이후 핵심 도구였다.[10] NVIDIA의 Omniverse와 Cosmos 플랫폼은 로봇 기초 모델 학습용 대규모 합성 비디오를 만든다.[11] 2024~2026년에는 비디오 월드 모델과 물리 시뮬레이터가 로보틱스 파이프라인에 공급되는 추세여서, 합성 데이터는 체화 AI의 중심이 되고 있다.[1]

Synthea는 미국 의료 데이터 형식을 따르는 공개 합성 환자 기록을 제공한다.[23] 차등 프라이버시 합성은 행동 건강 데이터셋과 임상시험 데이터에 적용되고 있다. 2024년 Google DeepMind 연구는 실제 데이터에 합성 데이터를 보완하면 조직병리, 방사선, 피부과 과제에서 견고성이 높아진다고 밝혔다.[1]

금융에서 합성 데이터는 사기 탐지(양성 사례가 드문 경우)와 규제 검사(기관 간 실제 데이터 공유가 불가능한 경우)에 널리 쓰인다. MOSTLY AI는 Fortune 100 은행과 보험사를 핵심 고객으로 둔다. CTGAN 기반 파이프라인은 정형 사기 데이터셋에 흔히 쓰인다.[1]

12. 주요 기업과 플랫폼

주요 기업과 프로젝트
기업·프로젝트초점비고
MOSTLY AI기업용 합성 정형 데이터핵심 고객은 Fortune 100 은행, 보험사, 통신사; 2022년 $25M 시리즈 B 유치[1]
Gretel.ai자연어 인터페이스를 갖춘 합성 데이터 플랫폼2025년 3월 NVIDIA가 인수; 보도에 따르면 기업가치 $320M을 넘는 수억 달러 규모[1]
Tonic.ai소프트웨어 테스트와 ML용 합성 데이터의료와 핀테크에 강한 입지[1]
Hazy금융 서비스용 합성 데이터영국 기반, 규제 산업 중심[1]
MITRE Synthea오픈소스 합성 환자 생성기환자 기록 100만 건 이상 무료 제공; HL7 FHIR 준수[23]
MIT SDV오픈소스 합성 데이터 라이브러리정형 데이터용 통계, GAN, VAE 방법[9]
Datagen컴퓨터 비전용 합성 데이터얼굴, 손, 실내 장면[1]
Mindtech영상과 감시용 합성 데이터윤리적이고 균형 잡힌 데이터셋 중심[1]
NVIDIA Omniverse / Replicator / Cosmos로보틱스와 자율주행용 산업급 합성 데이터Skild AI 등이 로봇 정책 학습에 사용[11]
Microsoft Phi 팀합성 중심 LLM 사전 학습Phi-1부터 Phi-4까지 접근을 입증[4]
AnthropicConstitutional AI 기반 합성 선호 데이터Claude 정렬의 RLAIF 기반[19]
Hugging Face Cosmopedia공개 합성 사전 학습 데이터셋Mixtral로 만든 25B 토큰[5]

13. 규제 현황

합성 데이터의 빠른 성장은 전 세계 규제 당국의 관심을 끌었다.[1]

유럽연합은 이 분야에서 가장 활발한 규제 기관이다. EU AI법은 2024년부터 단계적으로 시행되며 합성 데이터와 관련된 조항을 담고 있다. 고위험 AI 시스템은 합성 구성 요소를 포함해 학습 데이터를 문서화해야 한다. 2025년 4월 European Data Protection Board(EDPB)는 GDPR 아래 합성 데이터 생성을 직접 다루는 지침을 냈다. 개인정보 보호 가능성을 인정하면서 준수 가능한 생성 틀을 제시했다.[29] 지침은 조직이 합성 데이터를 재식별할 수 없고 생성 과정이 개인 데이터의 무단 처리를 포함하지 않는다는 점을 입증하도록 요구한다.[29]

여러 관할권이 AI 생성 콘텐츠 표시를 요구하거나 검토하고 있으며, 이는 합성 학습 데이터에도 확장된다. 목표는 데이터 출처를 유지하고, 하류 사용자가 모델 학습 데이터 중 합성과 사람 생성의 비율을 알 수 있게 하는 것이다.[1]

한 모델의 출력으로 다른 모델을 학습시키는 것은 해결되지 않은 지식재산 문제를 낳는다. OpenAI의 이용 약관은 역사적으로 API 출력을 경쟁 모델 학습에 쓰는 것을 제한해 왔다. Meta는 Llama 3 라이선스를 개정해 증류를 명시적으로 허용했다.[7] 상용 모델이 만든 합성 학습 데이터의 법적 지위는 아직 불확실하며 관할권마다 다르다.[1]

14. 시장 규모

합성 데이터 시장은 빠르게 성장해 왔다. 업계 추정으로 세계 합성 데이터 생성 시장은 2025년 약 $510M이며, Mordor Intelligence는 2030년 $2.67B에 이르러 연평균 39.4%로 성장할 것으로 전망한다.[30] Kings Research는 2033년 $7.22B, 연평균 37.65% 성장을 전망했다. 두 전망의 차이는 시장 정의가 다르기 때문이다.[31] 합성 정형 데이터 하위 시장은 2024년 $1.36B로 추정되었고 2025년에는 $1.88B에 이를 것으로 예상되었다.[1] 2021년 1%였던 비율이 2024년까지 60%가 된다는 Gartner 예측은 여전히 수요 측 신호로 가장 많이 인용된다. Gartner는 2030년까지 AI 모델에서 합성 데이터가 실제 데이터를 완전히 압도할 것이라고도 추정했다.[6]

합성 데이터 시장 규모 추정 · 2026년 9월 기준
연도추정 시장 규모(USD)주요 동인
2023약 $300MLLM 학습 붐; Phi 모델이 합성 사전 학습의 실현 가능성을 보임[1]
2024약 $400~575M개인정보 규정 준수를 위한 기업 도입; EU AI법 시행 시작; Phi-4 공개[1]
2025약 $510M (Mordor)산업 전반의 주류 도입; GDPR 합성 데이터 지침 발표; NVIDIA의 Gretel 인수[30]
2026 (전망)약 $710M (Mordor)데이터 희소성과 규제 요구에 따른 지속 성장[30]
2030 (전망)약 $2.67B (Mordor)AI 학습 인프라의 확립된 구성 요소[30]

대형 기술 기업들은 크게 투자하고 있다. Microsoft는 Phi 라인을 합성 데이터 중심으로 구축했다. Google은 Gemini 모델 학습에 합성 데이터를 광범위하게 썼다. Anthropic은 Claude를 위해 합성 선호 데이터에 의존한다.[19] Meta는 Llama 라이선스를 개정해 증류를 장려했다.[7] 데이터 라이선스 시장도 커졌다. Reddit과 News Corp 같은 회사는 AI 연구소와 계약해 검증된 사람 생성 콘텐츠를 제공하며, 순수 합성 학습의 위험을 막는 닻으로 삼게 하고 있다.[1]

15. 현재 상황(2025~2026)

2026년 초 기준으로 합성 데이터는 AI 학습 파이프라인의 일상적 구성 요소가 되었고, 분야는 몇 가지 변화하는 과제에 직면해 있다.[1]

고품질 사람 생성 텍스트 공급이 빠듯해지고 있다. Epoch AI는 공개된 사람 생성 텍스트 재고를 약 300T 토큰으로 추산하며, 2026년에서 2032년 사이 소진되고 중앙값은 2028년이라고 전망했다.[24] 이 희소성 때문에 합성 데이터는 편리한 수단을 넘어 확장에 필수적인 수단이 되었다. 공개 웹의 AI 생성 콘텐츠 증가로 '유기적' 웹 크롤링도 합성 텍스트를 점점 많이 담게 되어, 실제와 합성 데이터의 구분이 흐려지고 있다.[26]

가장 성공적인 현재 접근은 합성 데이터와 실제 데이터를 전략적으로 결합하는 것이다. Apple의 「Rephrasing the Web」 접근, Microsoft의 Phi 시리즈, Hugging Face의 Cosmopedia는 최선의 결과가 사람이 만든 기반에 합성 데이터를 고정할 때 나온다는 것을 보여 준다.[5] 합의된 권고는 실제 데이터를 합성 데이터로 완전히 대체하지 않고, 합성 데이터로 증강하고 다양화하고 확장하는 것이다.[1]

점점 정교해지는 파이프라인은 학습 전에 합성 데이터를 검증하고 거른다. 자동 품질 점수(FineWeb-Edu 방식), 사실 일관성 검사, 다양성 지표, 사람 참여 검토가 포함된다.[27] 합성 데이터 검증에 관한 최근 연구는 적절한 검증이 모델 붕괴의 일부 측면을 포함해 많은 위험을 완화할 수 있다고 시사한다.[28]

가장 활발한 영역 중 하나는 합성 데이터로 추론을 개선하는 것이다. 단계별 수학 증명, 테스트 케이스가 있는 코드 해법, 논리 추론 과정이 포함된다. 검증 가능한 보상이 자연스러운 품질 필터가 되므로, 생성된 해법이 테스트를 통과하면 누가 만들었는지와 무관하게 쓸모가 있다. DeepSeek R1 증류 파이프라인과 Microsoft의 Phi-4-reasoning 보고서가 이 흐름을 보여 준다.[1]

멀티모달 모델의 등장과 함께 합성 데이터 생성은 텍스트와 이미지를 넘어 비디오, 오디오, 3D 장면, 교차 모달리티로 확장되었다. Sora 같은 생성 비디오 모델은 로보틱스, 자율주행, 체화 AI 학습 데이터를 만드는 데 쓰이고 있다. NVIDIA의 Cosmos 월드 모델은 로봇 정책 학습을 위한 사실적인 합성 비디오를 특별히 만든다.[11]

오픈소스 도구 생태계도 빠르게 성숙했다. 활성 프로젝트로 Synthetic Data Vault(SDV)[9], YData synthetic, Hugging Face의 synthetic-data-generator, Cosmopedia에 쓰인 llm-swarm[5], Argilla 등이 지시 데이터셋을 만드는 데 쓰는 distilabel, Microsoft의 AgentInstruct 프레임워크가 있다. 상용 제품으로는 Gretel(현재 NVIDIA 소속), MOSTLY AI, Tonic.ai, Hazy가 내장된 개인정보 통제를 갖춘 기업용 플랫폼을 제공한다.[1]

각주·출처 31개
  1. ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17 ↩18 ↩19 ↩20 ↩21 ↩22 ↩23 ↩24 ↩25 ↩26 ↩27 ↩28 ↩29 ↩30 ↩31 ↩32 ↩33 ↩34 ↩35 ↩36 ↩37 ↩38 ↩39 ↩40 ↩41 ↩42 ↩43 ↩44 ↩45 ↩46 ↩47 ↩48 ↩49 ↩50 ↩51 ↩52 ↩53 ↩54 ↩55 ↩56 ↩57 ↩58 ↩59 ↩60 ↩61 ↩62 ↩63 ↩64 ↩65 ↩66 ↩67 ↩68 ↩69 ↩70 ↩71 ↩72 ↩73 ↩74 ↩75 ↩76 ↩77 ↩78 ↩79 ↩80 ↩81 ↩82 ↩83 ↩84 ↩85 ↩86 ↩87 ↩88 ↩89 ↩90 ↩91 ↩92 ↩93 ↩94 ↩95 ↩96 ↩97 AI Wiki: Synthetic data (2026-06-21 수정본) · CC BY 4.0 · 확인 2026-10-11
  2. ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 Stanford Alpaca: An Instruction-following LLaMA Model · 확인 2026-10-11
  3. ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 Textbooks Are All You Need · 확인 2026-10-11
  4. ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 Phi-4 Technical Report · 확인 2026-10-11
  5. ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 Cosmopedia: How to Create Large-Scale Synthetic Data for Pre-training · 확인 2026-10-11
  6. ↩1 ↩2 ↩3 By 2024, 60% of the data used for the development of AI and analytics projects will be synthetically generated (AI Wiki 인용) · 확인 2026-10-11
  7. ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 The Llama 3 Herd of Models · 확인 2026-10-11
  8. ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 AI Models Collapse When Trained on Recursively Generated Data · 확인 2026-10-11
  9. ↩1 ↩2 ↩3 ↩4 The Synthetic Data Vault · 확인 2026-10-11
  10. ↩1 ↩2 ↩3 ↩4 CARLA: An Open Urban Driving Simulator · 확인 2026-10-11
  11. ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 Isaac Sim: Robotics Simulation and Synthetic Data Generation · 확인 2026-10-11
  12. ↩1 ↩2 ↩3 ↩4 Self-Instruct: Aligning Language Models with Self-Generated Instructions · 확인 2026-10-11
  13. ↩1 ↩2 ↩3 Vicuna: An Open-Source Chatbot Impressing GPT-4 with 90% ChatGPT Quality · 확인 2026-10-11
  14. ↩1 ↩2 ↩3 ↩4 ↩5 WizardLM: Empowering Large Pre-trained Language Models to Follow Complex Instructions · 확인 2026-10-11
  15. ↩1 ↩2 ↩3 Orca: Progressive Learning from Complex Explanation Traces of GPT-4 · 확인 2026-10-11
  16. ↩1 ↩2 ↩3 ↩4 Orca 2: Teaching Small Language Models How to Reason · 확인 2026-10-11
  17. ↩1 Creating Synthetic Data Using Llama 3.1 405B · 확인 2026-10-11
  18. ↩1 Use Llama 3.1 405B for synthetic data generation and distillation to fine-tune smaller models (AI Wiki 인용) · 확인 2026-10-11
  19. ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 Constitutional AI: Harmlessness from AI Feedback · 확인 2026-10-11
  20. ↩1 Synthetic Data and CAI · 확인 2026-10-11
  21. ↩1 ↩2 RandAugment: Practical Automated Data Augmentation with a Reduced Search Space · 확인 2026-10-11
  22. ↩1 Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models · 확인 2026-10-11
  23. ↩1 ↩2 ↩3 ↩4 ↩5 Synthea: An approach, method, and software mechanism for generating synthetic patients and the synthetic electronic health care record (AI Wiki 인용) · 확인 2026-10-11
  24. ↩1 ↩2 Will we run out of data? Limits of LLM scaling based on human-generated data · 확인 2026-10-11
  25. ↩1 ↩2 A Note on Shumailov et al. (2024): 'AI Models Collapse When Trained on Recursively Generated Data.' · 확인 2026-10-11
  26. ↩1 ↩2 ↩3 More Articles Are Now Created by AI Than Humans · 확인 2026-10-11
  27. ↩1 ↩2 ↩3 The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale · 확인 2026-10-11
  28. ↩1 ↩2 Escaping Model Collapse via Synthetic Data Verification · 확인 2026-10-11
  29. ↩1 ↩2 Guidelines on Synthetic Data Generation under GDPR · 확인 2026-10-11
  30. ↩1 ↩2 ↩3 ↩4 Synthetic Data Market Size, Share, Trends & Research Report, 2030 · 확인 2026-10-11
  31. ↩1 Synthetic Data Generation Market to Reach $7.22 Bn by 2033 · 확인 2026-10-11

함께 읽는 용어

GPUAI 안전정확도신경망벤치마크강화 학습데이터셋데이터 라벨링AnthropicGoogle DeepMindMicrosoftNVIDIA프롬프트도구 사용Google트랜스포머대규모 언어 모델토큰매개변수미세 조정ChatGPTGeminiOpenAI인공지능Claude머신러닝

관련 AI 모델

GPT-4 (Mar 2023)GPT-3 175B (davinci)GPT-3.5 Turbo (Jan 2024)

이 용어를 다룬 글

학습과 데이터

강화 학습

강화 학습은 에이전트가 환경에서 행동을 취하고 그 결과로 받는 보상을 바탕으로, 누적 보상을 최대화하는 행동 방식을 시행착오로 찾아내는 머신러닝 분야다. 정답 예시 대신 보상 신호로 학습한다는 점에서 지도 학습과 구별된다. 게임 플레이와 대규모 언어 모델의 정렬에 쓰이며, 2024년 튜링상이 이 분야의 기초 연구에 수여되었다.

학습과 데이터

데이터 라벨링

데이터 라벨링은 머신러닝 알고리즘이 학습할 수 있도록 원시 데이터에 의미 있는 태그, 레이블, 메타데이터를 붙이는 작업이다. 데이터 어노테이션이라고도 부른다. 지도 학습의 정답과 인간 피드백 강화 학습(RLHF)의 선호 신호로 쓰이며, 이미지·텍스트·오디오·영상 등 거의 모든 데이터 형식에 걸쳐 이뤄지는 대형 산업으로 성장했다.

기업과 사람

NVIDIA

엔비디아(NVIDIA)는 그래픽 처리 장치(GPU)를 설계하는 미국 반도체·AI 컴퓨팅 기업이다. 2026년 기준 AI 가속기 시장의 80~90%를 차지한다고 추산되며, 게임용 그래픽 칩 회사에서 AI 학습과 추론 실행의 핵심 하드웨어 공급자로 성장했다. 대표 제품으로 데이터센터 GPU, GeForce, DGX 시스템, CUDA 플랫폼이 있다.

학습과 데이터

미세 조정

미세 조정은 사전 학습된 모델의 매개변수 전부 또는 일부를 목표 과제·분야·행동에 맞춘 데이터로 계속 최적화해 적응시키는 전이 학습의 한 형태다. 전체 미세 조정, 부분 미세 조정, 어댑터와 LoRA 같은 매개변수 효율적 방법, 지시 튜닝과 선호 기반 사후 학습을 포괄한다.

AI 첫걸음

환각

환각은 생성형 AI가 근거가 없거나, 출처와 모순되거나, 사실과 다르거나, 내부적으로 일관되지 않은 내용을 충분한 근거 없이 제시하는 출력 실패다. 정의는 연구마다 다르며, 환각 비율은 과제와 평가 방식에 따라 달라진다.

AI 첫걸음

대규모 언어 모델

대규모 언어 모델은 수십억에서 수조 개의 매개변수를 가진 트랜스포머 신경망을 방대한 텍스트로 학습시켜 다음 토큰을 예측하게 만든 인공지능 시스템이다. 번역, 요약, 질의응답, 코드 생성, 대화에 쓰이며 ChatGPT, Claude, Gemini 같은 제품의 바탕이 된다.

AI 첫걸음

인공 일반 지능

인공 일반 지능(AGI)은 개발 중 예상하지 못한 과제까지 포함해 여러 인지 과제에서 폭넓고 적응력 있는 능력을 갖춘 AI를 가리키는 제안된 개념이다. 단일한 표준 정의는 없고, 정의마다 비교 대상과 과제 범위, 학습 능력, 자율성에 대한 입장이 다르다.

AI 첫걸음

딥러닝

딥러닝은 여러 층의 인공 신경망으로 데이터의 표현을 여러 수준의 추상화에서 자동으로 학습하는 머신러닝의 한 갈래다. 2012년 AlexNet이 ImageNet 대회에서 우승하면서 현대 AI의 핵심 기술로 자리 잡았다.

AI 첫걸음

생성형 AI

생성형 AI는 예시에서 통계적 구조를 학습한 뒤 모델에서 표본을 추출하거나 복호화해 텍스트, 코드, 이미지, 오디오, 영상, 분자 구조 같은 새 데이터를 만드는 인공지능 시스템의 한 부류다. 기술의 핵심은 데이터 분포를 나타내는 생성 모델이다.