| 분류 | 머신러닝의 데이터 준비 과정[1] |
|---|---|
| 다른 이름 | 데이터 어노테이션(data annotation)[1] |
| 주요 쓰임 | 지도 학습의 정답 데이터, RLHF의 인간 선호 신호[1] |
| 대상 데이터 | 이미지, 텍스트, 오디오, 영상, 3차원 포인트 클라우드[1] |
| 시장 규모 | 2024년 약 37억 7,000만 달러, 2030년 171억 달러 전망(연평균 약 28% 성장)[2] |
| 대표 도구 | Label Studio, CVAT, Prodigy 등[3] [4] [5] |
쉽게 말하면, 데이터 라벨링은 AI가 배울 수 있도록 사람이 데이터에 뜻을 담은 표시를 붙이는 일이다. 사진 속 자동차에 네모 상자를 그리고 '자동차'라고 적는 것이 대표적인 예다. 이렇게 만든 정답 데이터는 AI 모델을 학습시키고, 평가하고, 사람의 선호를 반영하는 데 쓰인다.[1]
1. 개요
데이터 라벨링(data labeling)은 머신러닝 알고리즘이 학습할 수 있도록 원시 데이터에 의미 있는 태그, 레이블, 메타데이터를 붙이는 작업이다. 라벨이 붙은 데이터는 지도 학습에서 정답(ground truth) 역할을 하고, RLHF에서는 사람의 선호 신호 역할을 한다. 이 작업은 큰 산업으로 성장했다. 2024년 전 세계 데이터 수집·라벨링 시장 규모는 약 37억 7,000만 달러로 추정되며, 2030년에는 171억 달러에 이를 것으로 전망된다. 연평균 성장률은 약 28%다.[2] 라벨이 없으면 이미지 인식 모델부터 대규모 언어 모델까지 대부분의 현대 AI 시스템은 효과적으로 학습되거나 정렬될 수 없다.[1]
데이터 라벨링은 이미지, 텍스트, 오디오, 영상, 3차원 포인트 클라우드 등 주요 데이터 형식 전반에 걸친다. 작업은 사진 속 물체에 사각형을 치는 일부터 두 챗봇 응답 중 어느 쪽이 더 도움이 되는지 평가하는 일까지 다양하다. 최첨단 AI 연구소들이 웹 텍스트를 수동적으로 학습하는 방식에서 전문가의 업무 과정을 능동적으로 모델링하는 방향으로 옮겨 가면서, 업계도 값싼 크라우드 작업에서 비용이 높은 전문가 어노테이션으로 올라서고 있다. 이 수요를 바탕으로 Scale AI, Surge AI, Mercor, Turing 같은 전문 기업들이 수십억 달러 규모의 기업가치를 얻었다.[6][7][8]
2. 데이터 라벨링이 필요한 이유
데이터 라벨링의 핵심은 비정형 또는 반정형 데이터를 통계 모델이 처리할 수 있는 형식으로 바꾸는 것이다. 예를 들어 사진에는 픽셀 값만 있을 뿐 그 픽셀이 무엇을 나타내는지는 적혀 있지 않다. 사람 작업자가 사진을 보고 '자동차', '보행자', '신호등' 같은 대상을 표시하면, 컴퓨터 비전 모델이 학습 중에 쓸 수 있는 구조화된 주석이 만들어진다.[1]
라벨링의 용도는 초기 모델 학습에만 있지 않다. 라벨이 붙은 데이터는 따로 빼 둔 테스트 세트로 모델 성능을 평가하는 데 쓰이고, 사전 학습된 모델을 분야별 과제에 맞게 미세 조정할 때도 쓰인다. 또 인간 피드백 강화 학습(RLHF)에 필요한 선호 비교 데이터를 만드는 데도 쓰인다. 운영 중인 시스템에서는 새로 모은 데이터를 흔히 계속 라벨링해, 데이터 분포가 바뀔 때마다 모델을 다시 학습시킬 수 있게 한다.[1]
3. 종류
3.1. 이미지와 영상 어노테이션
객체 탐지와 이미지 분류는 가장 흔한 컴퓨터 비전 과제이며, 과제마다 필요한 어노테이션 방식이 다르다.[1]
| 방식 | 설명 | 주요 용도 |
|---|---|---|
| 바운딩 박스 | 물체를 꼭짓점 좌표(x_min, y_min, x_max, y_max)로 정해진 사각형으로 딱 맞게 감싼다 | 자율주행 차량의 물체 탐지, 매장 재고 관리[1] |
| 폴리곤 | 물체의 정확한 경계를 따라가는 여러 꼭짓점의 외곽선을 그린다 | 모양이 중요한 개체 단위 어노테이션[1] |
| 시맨틱 세그멘테이션 | 이미지의 모든 픽셀을 클래스(예: 도로, 인도, 하늘)에 배정한다 | 자율주행, 로보틱스, 의료 영상[1] |
| 인스턴스 세그멘테이션 | 시맨틱 세그멘테이션과 비슷하지만, 같은 클래스라도 서로 다른 개체에 각각 다른 라벨을 붙인다 | 겹친 물체 세기, 창고 물류[1] |
| 키포인트 | 물체의 자세나 구조를 나타내는 특정 랜드마크 점을 찍는다 | 자세 추정, 얼굴 랜드마크 탐지, 제스처 인식[1] |
| 큐보이드(3D 바운딩 박스) | 2D 또는 3D 장면 속 물체를 감싸는 입체 상자를 둔다 | 자율주행용 라이다 데이터, 로보틱스[1] |
| 폴리라인 | 선형 대상을 따라가는 연결된 선분을 그린다 | 도로 차선, 전선, 인프라 균열[1] |
바운딩 박스는 만드는 속도가 가장 빠르고 많은 객체 탐지 파이프라인에서 여전히 기본 방식이다. 시맨틱 세그멘테이션과 인스턴스 세그멘테이션은 픽셀 단위 정밀도가 필요해 이미지당 비용이 더 들지만 더 풍부한 학습 신호를 준다. 키포인트는 사람 자세 추정 과제의 표준 방식이며, 어노테이터가 어깨, 팔꿈치, 손목, 무릎 같은 관절에 점을 찍어 골격 구조를 정의한다.[1]
영상 어노테이션은 이미지 어노테이션을 시간 축으로 확장한 것이다. 어노테이터는 개별 프레임에 라벨을 붙이거나, 보간(interpolation) 기능으로 수동 표시한 키프레임 사이의 물체 위치를 도구가 자동으로 추정하게 하면서 여러 프레임에 걸쳐 물체를 추적한다. 자율주행, 스포츠 분석, 보안 감시 모델을 학습시키는 데 핵심적으로 쓰인다.[1]
3.2. 텍스트 어노테이션
텍스트 어노테이션은 자연어 처리(NLP) 과제를 지원한다. 주요 종류는 다음과 같다.[1]
| 방식 | 설명 | 주요 용도 |
|---|---|---|
| 개체명 인식(NER) | 텍스트 안의 사람, 기관, 장소, 날짜, 금액 같은 개체를 찾아 분류한다 | 정보 추출, 지식 그래프 구축[1] |
| 감성 분석 | 텍스트에 긍정, 부정, 중립 감정 라벨을 붙인다 | 고객 피드백 분석, 브랜드 모니터링[1] |
| 텍스트 분류 | 문서나 단락 전체를 미리 정한 범주에 배정한다 | 스팸 탐지, 주제 분류, 콘텐츠 모더레이션[1] |
| 관계 추출 | 식별된 개체 사이의 관계에 라벨을 붙인다 | 생의학 문헌 분석, 법률 문서 분석[1] |
| 상호 참조 해결 | 같은 개체를 가리키는 서로 다른 언급을 연결한다 | 대화 시스템, 문서 요약[1] |
| 품사 태깅 | 각 단어에 문법적 역할(명사, 동사, 형용사)을 붙인다 | 구문 분석, 문법 검사, 언어학 연구[1] |
개체명 인식에서 어노테이터는 'Apple이 런던에서 30억 달러 규모의 채권 발행을 발표했다'라는 문장을 읽고, 'Apple'은 기관, '30억 달러'는 금액, '런던'은 장소로 표시할 수 있다. 감성 어노테이션은 보통 1~5점 리커트 척도나 긍정/부정의 이진 라벨을 쓴다.[1]
3.3. 오디오와 음성 어노테이션
오디오 어노테이션은 음성 인식, 화자 식별, 소리 사건 탐지를 위한 데이터를 준비한다.[1]
| 방식 | 설명 | 주요 용도 |
|---|---|---|
| 전사 | 말소리를 타임스탬프가 붙은 글로 옮긴다 | 음성 비서, 회의 기록[1] |
| 화자 분리 | 녹음을 화자별로 나누고 각 구간에 '화자 A', '화자 B' 같은 라벨을 붙인다 | 콜센터 분석, 팟캐스트 색인[1] |
| 소리 사건 탐지 | 유리 깨짐, 개 짖는 소리, 사이렌처럼 말이 아닌 소리 사건에 태그를 붙인다 | 감시, 환경 모니터링[1] |
| 감정·의도 라벨링 | 발화 뒤의 감정 톤이나 의도를 분류한다 | 고객 응대 분류, 음성 기반 사용자 경험 연구[1] |
| 음소 어노테이션 | 개별 음소나 운율 특징에 라벨을 붙인다 | 언어학 연구, 음성 합성 학습[1] |
화자 분리는 '누가 언제 말했는가?'라는 질문에 답하며, 여러 사람이 참여하는 대화에서 유용하다. AssemblyAI 문서에 따르면 신뢰할 만한 군집화를 위해서는 화자마다 방해 없이 최소 30초 이상의 발화가 필요하다.[1]
4. 플랫폼과 도구
라벨링 작업 흐름을 관리하는 오픈소스 및 상용 플랫폼은 다양하다. 아래 표는 널리 쓰이는 옵션 몇 가지를 비교한다.[1]
| 플랫폼 | 유형 | 지원 데이터 | 주요 특징 | 라이선스·요금 |
|---|---|---|---|---|
| Label Studio | 오픈소스·엔터프라이즈 | 이미지, 텍스트, 오디오, 영상, 시계열 | 설정 가능한 템플릿, REST API, ML 백엔드 연동, Python SDK | Apache 2.0(커뮤니티), HumanSignal의 유료 엔터프라이즈·클라우드 요금제[1] |
| Labelbox | 상용 | 이미지, 영상, 텍스트, 지리 공간, 문서 | 모델 보조 라벨링, 능동 학습, API 중심 설계, 전문가 마켓플레이스 Alignerr | 유료 요금제. 2018년 설립, 1억 8,900만 달러 이상 투자 유치[1] |
| Scale AI | 상용(관리형 서비스) | 이미지, 영상, 텍스트, LiDAR, 문서, RLHF 데이터 | 관리형 인력, 품질 관리, 정부·국방 계약, LLM 평가용 데이터 엔진 | 기업 맞춤 가격. 2016년 Alexandr Wang이 설립, 2025년 6월 Meta 투자 후 기업가치 약 290억 달러[1] |
| Amazon SageMaker Ground Truth | 클라우드 서비스 | 이미지, 영상, 텍스트, 3D 포인트 클라우드 | 능동 학습으로 라벨링 비용을 최대 70% 절감, Mechanical Turk 연동(50만 명 이상 작업자), 비공개 인력 또는 외부 업체 인력 선택 | 객체당 과금[1] |
| Prodigy | 상용(로컬 설치) | 텍스트, 이미지, 오디오, 영상 | Explosion AI 개발, 로컬 실행, 스크립트 가능한 레시피, 능동 학습, spacy-llm을 통한 LLM 연동 | 일회성 라이선스 비용. 데이터가 사용자 기기를 벗어나지 않음[1] |
| CVAT | 오픈소스 | 이미지, 영상 | 인텔 개발 후 OpenCV가 관리, 바운딩 박스·다각형·큐보이드, 키프레임 보간, OpenVINO 기반 AI 보조 라벨링 | MIT 라이선스[1] |
| Encord | 상용 | 이미지, 영상, DICOM(의료) | 자동 라벨링, 품질 지표, 온톨로지 관리, HIPAA 준수 워크플로 | 유료 요금제[1] |
| V7 | 상용 | 이미지, 영상, 문서 | 파운데이션 모델 기반 자동 주석, 픽셀 단위 마스크, 데이터셋 관리 | 유료 요금제[1] |
| SuperAnnotate | 상용 | 이미지, 영상, 텍스트, 오디오 | 인력 관리, 품질 보증 대시보드, 모델 보조 도구 | 유료 요금제[1] |
| Snorkel AI | 상용(프로그램 방식 라벨링) | 텍스트, 표 형식 데이터, 이미지 | 라벨링 함수 기반 약한 지도, 데이터 프로그래밍 방식, 스탠퍼드 연구에서 출발 | 기업 맞춤 가격[1] |
4.1. 전문 데이터 기업
Scale AI는 2016년 Alexandr Wang과 Lucy Guo가 Y Combinator를 통해 창업했다.[9] 그 전에 Quora에서 엔지니어로 일했던 Wang은 당시 19세로 MIT를 중퇴한 상태였다.[9] 이 회사는 AI 개발을 위한 데이터 라벨링 서비스, 모델 평가, 데이터 인프라를 제공한다.[1]
2024년 5월 Scale AI는 Accel이 주도한 시리즈 F 라운드에서 10억 달러를 조달했다. Amazon, Meta, NVIDIA, Intel Capital 등이 참여했다.[10][11] 이 라운드로 회사 가치는 약 138억 달러로 평가되어 직전 기업가치의 거의 두 배가 되었다.[10][11] 연간 반복 매출(ARR)은 2023년에 세 배로 늘었고, 2024년 매출은 약 8억 7,000만 달러로 보고되었다.[10][6]
2025년 6월 메타(Meta Platforms)는 Scale AI의 의결권 없는 지분 49%를 얻기 위해 143억 달러를 투자하기로 합의했다. 이 거래로 회사 가치는 약 290억 달러로 평가되었고, AI 업계에서 손꼽히는 대형 거래가 되었다.[6] 거래의 일환으로 창업자이자 CEO인 Alexandr Wang은 Meta의 새 초지능 프로젝트를 이끌기 위해 회사를 떠났다. Scale은 최고전략책임자 Jason Droege를 CEO로 승진시키고, 독립적으로 운영을 이어 갔다.[6]
이 거래 직후 고객 이탈이 빠르게 일어났다. 며칠 안에 Google(2025년에 Scale과 약 2억 달러를 쓸 계획이었다고 보도됨), OpenAI, Microsoft, xAI가 모두 Scale과의 데이터 라벨링 작업을 중단하거나 축소하기 시작했다. 직접 경쟁 관계인 회사가 자사 학습 파이프라인을 들여다볼 수 있게 된다는 우려 때문이었다.[12] OpenAI는 다른 공급업체로 옮기면서 Scale AI와의 작업을 "단계적으로 중단"하고 있다고 확인했다.[12]
Scale AI의 고객에는 주요 AI 연구소, 미국 국방부, 포춘 500대 기업이 포함된다.[9] 이 회사는 관리형 인력 모델로 알려져 있다. 작업자의 채용, 교육, 품질 관리를 고객에게 맡기지 않고 직접 맡는다.[1]
Surge AI는 2020년 Google, Facebook, Twitter의 전 엔지니어 Edwin Chen이 세운 데이터 라벨링 회사다. 크라우드소싱 라벨링의 품질에 불만을 품고 창업했다.[7] 이 회사는 저가의 대량 작업이 아니라, 최첨단 연구소를 위한 전문가 중심의 RLHF급 인간 피드백에 특화되어 있다.[1] 2024년에는 연간 환산 매출이 약 12억 달러에 이른 것으로 보도되어, 같은 해 Scale AI의 약 8억 7,000만 달러를 넘어섰다. 성장은 OpenAI를 포함해 Google, Anthropic, Microsoft, Meta 등 약 12곳의 최첨단 연구소가 이끌었다.[7] 2025년 중반 Meta와 Scale의 거래로 Scale의 고객들이 동요하자, Surge는 처음으로 외부 자금 조달에 나섰다. 최대 10억 달러를 목표로 했으며, 기업가치는 150억~250억 달러로 보도되었다.[7]
Mercor는 2022년 설립되어 2023년에 법인으로 등록된 AI 학습·인재 마켓플레이스 스타트업이다. 틸 펠로(Thiel Fellow) 출신인 Brendan Foody, Adarsh Hiremath, Surya Midha가 창업했다. 박사, 의사, 변호사, 소프트웨어 엔지니어 같은 분야 전문가를 고품질 인간 데이터와 모델 평가가 필요한 AI 연구소에 연결한다.[1]
2025년 후반 기준 Mercor는 3만 명 이상의 계약 인력을 관리했으며, 평균 시간당 약 95달러를 지급했다. 연간 환산 매출은 약 4억 5,000만 달러라고 공개했다.[8] 2025년 10월에는 Felicis가 주도한 3억 5,000만 달러 규모의 시리즈 C를 유치해 기업가치 약 100억 달러로 평가받았다. 이는 2025년 2월 시리즈 B의 기업가치 20억 달러에서 약 5배 뛴 것이다.[8]
Turing은 2018년 Jonathan Siddharth와 Vijay Krishnan이 세웠다. 원격 엔지니어 인재 플랫폼으로 출발했고, 이후 OpenAI를 포함한 AI 연구소에 코딩 중심의 학습 데이터와 인간 피드백을 공급하는 쪽으로 방향을 바꿨다. 'Turing AGI Advancement' 부서는 연구자들이 학습 데이터 속 코드가 모델의 추론을 개선한다는 점을 확인한 뒤, 최첨단 연구소들과 협업하고 있다. 2025년 3월에는 Khazanah Nasional이 주도한 1억 1,100만 달러 규모의 시리즈 E를 유치해 기업가치를 두 배인 22억 달러로 끌어올렸다. Siddharth는 회사를 "AGI에 거는 지수형 베팅"이라고 표현했다.[1]
4.2. 대표 도구
Label Studio는 Apache 2.0 라이선스로 공개된 오픈소스 데이터 라벨링 도구다.[3] Heartex가 만들었고, 이후 HumanSignal로 이름을 바꿨다. 대부분의 대안보다 넓은 데이터 형식을 지원하며, 이미지, 텍스트, 오디오, 영상, HTML, 시계열 데이터를 다룬다.[3] 팀은 XML과 비슷한 설정 문법으로 라벨링 화면을 직접 정의할 수 있다.[3] HumanSignal은 월 149달러 안팎에서 시작하는 관리형 클라우드 Starter 요금제와, SSO·역할 기반 접근 제어·감사 로그를 갖춘 자체 서버 설치형 Enterprise 요금제를 제공한다.[1]
CVAT(Computer Vision Annotation Tool)는 원래 인텔이 내부용으로 개발했고, 이후 MIT 라이선스로 오픈소스화되었다.[4] 현재는 OpenCV 프로젝트의 일부로 관리된다.[4] 이미지와 영상 라벨링에 특화되어 있으며, 바운딩 박스, 다각형, 폴리라인, 큐보이드, 키포인트를 기본 지원한다.[4] 보간 기능을 쓰면 어노테이터가 몇 개의 키프레임에만 라벨을 붙이고 중간 프레임은 도구가 자동으로 채운다.[4] 인텔의 OpenVINO 툴킷과 연동해 AI 보조 라벨링도 할 수 있다.[4]
Prodigy는 spaCy 자연어 처리 라이브러리를 만든 Explosion AI가 개발한 상용 라벨링 도구다.[5] 클라우드 기반 플랫폼과 달리 사용자의 로컬 컴퓨터에서만 실행되며, 데이터가 제3자 서버로 전송되지 않는다.[5] 그래서 민감하거나 규제를 받는 데이터에 적합하다. 가장 정보가 많은 예시를 골라 보여 주는 능동 학습과, 수락·거부 같은 이진 선택 화면을 써서 어노테이터가 빠르게 작업하도록 설계되었다.[5] 2023년에는 spacy-llm 라이브러리를 통해 LLM 연동 기능을 추가해, 모델 예측과 사람 검토를 결합할 수 있게 했다.[1]
5. RLHF와 선호 라벨링
인간 피드백 강화 학습(RLHF)은 대규모 언어 모델을 사람의 선호에 맞추는 표준 기법이 되었다.[13] RLHF의 데이터 라벨링 요구는 전통적인 어노테이션 작업과 다르며, 그 효과는 클 수 있다. OpenAI의 InstructGPT 연구에서는 13억 파라미터 InstructGPT 모델의 출력이 100배 적은 파라미터에도 불구하고 1,750억 파라미터 GPT-3의 출력보다 선호되었다. 이 결과는 규모가 아니라 사람의 선호 데이터에서 나온 것이다.[13]
5.1. RLHF 데이터 수집과 어려움
- 시연 데이터: 사람 작업자가 프롬프트에 대한 고품질 응답을 직접 쓴다. 이 예시로 기반 언어 모델을 지도 학습 방식으로 미세 조정한다.[13]
- 비교 데이터: 미세 조정된 모델이 한 프롬프트에 대해 둘 이상의 후보 응답을 만들고, 사람 평가자가 이를 순위 매겨 어느 쪽이 더 나은지 표시한다. 결과 데이터의 각 예시는 프롬프트, 두 응답, 선호 라벨로 구성된다.[13]
- 보상 모델 학습: 비교 데이터로 사람이 응답에 줄 점수를 예측하는 보상 모델을 학습시킨다. 이 보상 모델이 강화 학습(보통 Proximal Policy Optimization, PPO)으로 언어 모델의 최적화를 이끈다.[13]
OpenAI의 InstructGPT 논문(2022년)은 이 과정을 자세히 설명했다.[13] 이 과정에는 1단계의 사람이 쓴 텍스트와 2단계의 사람 선호 판단이 모두 필요하다. 어노테이터는 흔히 리커트 척도 평가나 쌍별 순위 매기기 인터페이스를 쓴다.[1]
선호 라벨링에는 고유한 어려움이 있다. 평가자마다 품질, 유용성, 안전성을 다르게 해석한다. 한 평가자가 유용하다고 본 응답을 다른 평가자는 장황하다고 여길 수 있다. 이런 차이 때문에 바운딩 박스 같은 객관적 작업보다 어노테이터 간 일치를 맞추기 어렵다. RLHF 어노테이션 팀은 이를 상세한 채점 기준표, 보정 세션, 어노테이터 일관성 정기 감사로 관리한다.[1]
RLHF 어노테이션은 일반 라벨링보다 비용도 높다. 평가자는 여러 단락에 이르는 전체 텍스트 응답을 읽고 비교해야 해서 처리량이 낮다. 전문 지식이 필요한 복잡한 과제에서는 예시당 비용이 50~100달러에 이를 수 있다.[1]
6. 전문가 어노테이션으로의 전환
수년간 라벨링 산업은 물량과 저비용에 맞춰져 있었고, 단순 작업을 대규모 크라우드 작업자 풀에 나눠 주었다. 사후 학습(post-training) 방법(지시 튜닝, RLHF, 추론 데이터)이 등장하면서 이 우선순위가 뒤집혔다. 최첨단 연구소들은 수백만 개의 값싼 라벨보다 어려운 문제에 대한 정확한 전문가급 피드백을 점점 더 필요로 한다. 벤처 투자사 SignalFire는 AI가 인터넷을 수동적으로 반영하는 단계에서 전문가의 업무 과정을 능동적으로 모델링하는 단계로 옮겨 가고 있다고 주장했다. 사후 학습의 행동은 큐레이션된 고품질 주제 전문가 피드백으로 형성된다고 봤다.[14]
업계 성과도 이 변화를 보여 준다. Surge AI는 소프트웨어 엔지니어가 채점한 코딩 답변과 의사가 라벨링한 의료 데이터에 높은 단가를 받으며, 2024년 매출이 추정 12억 달러에 이른 것으로 알려졌다. 회사는 규모를 작게 유지하면서 이 매출을 냈다.[7] Mercor는 도메인 전문가 계약자에게 평균 시간당 약 95달러를 지급하며, 설립 3년이 안 돼 기업가치 100억 달러에 이르렀다.[8] Turing은 전문 엔지니어가 채점한 코드와 추론 데이터를 공급한다.[8]
공통된 흐름은 라벨 한 개당 비용을 낮추는 데서 각 라벨 판단의 질을 높이는 쪽으로 옮겨 가는 것이다. 가장 어려운 과제에서는 전문 어노테이터, AI 보조 사전 라벨링, 촘촘한 품질 루프가 고물량 크라우드 파이프라인을 대체하고 있다.[1]
7. 크라우드 소싱과 전문가 라벨링
데이터 라벨링이 필요한 조직은 크라우드 어노테이터와 도메인 전문가 사이에서 선택해야 한다. 두 방식에는 각각 장단점이 있다.[1]
크라우드 소싱은 2005년 출시된 Amazon Mechanical Turk(MTurk)가 대표적이다. 대규모 분산 온라인 작업자를 라벨링에 활용한 초기 플랫폼으로, 전성기에는 190개국 이상에서 50만 명이 넘는 작업자가 등록되어 있었다.[15] 작업은 HIT(Human Intelligence Task) 단위로 배포되며, 요청자는 완료된 작업마다 비용을 낸다.[15] 크라우드 소싱은 단위당 가장 저렴한 방식이다. 해외 어노테이터의 시간당 요금은 보통 4~12달러이며, 이미지 분류나 감성 태깅 같은 단순 작업은 빨리 끝낼 수 있다. 다만 품질 관리는 여전히 어렵다. 2018년 학술 연구에서는 MTurk 작업자의 시간당 임금 중앙값이 약 2달러로 나타나, 작업자 동기와 세심함에 의문이 제기되었다.[16] 많은 요청자는 항목마다 여러 어노테이션을 모아 다수결로 최종 라벨을 정하는 방식으로 보완한다.[1]
전문가 라벨링은 특수 지식이 필요한 과제에서 품질 높은 라벨을 만들지만 비용이 훨씬 크다. DICOM 영상에서 종양이나 해부학적 구조를 찾아야 하는 의료 영상 어노테이션은 시간당 50~100달러가 들 수 있다. 법률 문서, 유전체 데이터, 금융 컴플라이언스 라벨링도 훈련된 전문가를 요구한다. AI 학습 작업을 위해 박사, 의사, 엔지니어를 모집하는 Mercor 같은 마켓플레이스는 이들에게 평균 시간당 약 95달러를 지급한다.[8] Scale AI, Surge AI, Appen, Sama 같은 기업이 제공하는 관리형 라벨링 서비스는 순수 크라우드 소싱과 사내 전문가 팀의 중간에 위치한다. 이 서비스는 일반 과제에 보통 시간당 6~12달러를 받으며, 어노테이터 모집, 교육, 품질 보증을 고객을 대신해 맡는다.[1]
| 구분 | 크라우드 소싱 | 전문가 | 관리형 서비스 |
|---|---|---|---|
| 시간당 비용 | 2~12달러 | 25~100달러 이상 | 6~40달러[1] |
| 품질(전형적 수준) | 편차가 큼, 품질 검사 계층 필요 | 높음, 오류가 적음 | 중간~높음[1] |
| 규모 확장 속도 | 빠름(대규모 작업자 풀) | 느림(공급이 제한됨) | 보통[1] |
| 적합한 용도 | 단순하고 물량이 많은 과제 | 도메인 특화, 고위험 과제 | 사내 어노테이션 인프라가 없는 팀[1] |
| 단점 | 품질 불일치, 낮은 임금에 대한 윤리 문제 | 비용이 크고 채용이 어려움 | 벤더 종속, 통제력 약화[1] |
8. 어노테이션 품질 측정
라벨 품질은 모델 성능에 직접 영향을 준다. 잡음이 많은 라벨로 학습한 모델은 잡음이 많은 패턴을 배운다. 품질을 측정하고 유지하는 여러 기법이 쓰인다.[1]
어노테이터 간 일치도(IAA, inter-annotator agreement)는 서로 다른 어노테이터가 같은 데이터에 얼마나 일관되게 라벨을 붙이는지 측정한다. 가장 흔한 지표는 우연에 의한 일치를 보정하는 Cohen's kappa(코헨의 카파)다.[17] 계산식은 다음과 같다.
K = (Pr(a) - Pr(e)) / (1 - Pr(e))Pr(a)는 어노테이터 사이에서 관찰된 일치율이고, Pr(e)는 우연으로 기대되는 일치율이다.[17] 카파 값은 보통 Landis와 Koch의 척도로 해석한다.[18]
| 카파 값 | 해석 |
|---|---|
| 0.81~1.00 | 거의 완벽한 일치[18] |
| 0.61~0.80 | 상당한 일치[18] |
| 0.41~0.60 | 중간 정도의 일치[18] |
| 0.21~0.40 | 적당한 일치[18] |
| 0.00~0.20 | 약한 일치[18] |
| 0.00 미만 | 우연보다 낮은 일치[18] |
어노테이터가 셋 이상이면 Fleiss' kappa가 이 지표를 일반화한다. Krippendorff's alpha는 결측 데이터를 다룰 수 있고 명목, 순서, 구간, 비율 척도 전반에 쓸 수 있는 다른 선택지다.[1]
IAA 점수가 낮으면 어노테이터 성과보다 모호한 라벨링 지침 때문인 경우가 많다. 일치도가 허용 기준 아래로 떨어지면 팀은 보통 지침을 고치고, 예시를 추가하거나, 보정 세션을 연다.[1]
골드 스탠더드 항목은 상급 어노테이터나 도메인 전문가가 검증한 정답 라벨을 가진 데이터 포인트다. 이 항목들은 각 어노테이터의 작업 대기열에 대략 5~10% 비율로 무작위로 섞여 들어간다. 어노테이터는 어떤 항목이 골드 스탠더드인지 알지 못한다. 골드 항목에서의 정확도가 기준치(흔히 90~95%) 아래로 떨어지면 해당 작업은 검토 대상이 되거나 과제에서 제외된다.[1]
이 방식은 모든 어노테이션을 검사하지 않고도 지속적인 품질 신호를 준다. 과제를 서둘러 처리하거나 지침을 잘못 이해하는 어노테이터를 찾아내는 데도 도움이 된다.[1]
많은 라벨링 파이프라인은 항목마다 독립적인 어노테이션을 두세 개 모으고, 다수결이나 전담 판정자(adjudicator)로 불일치를 해결한다. 판정자는 보통 상급 어노테이터나 주제 전문가로, 논쟁 항목을 검토해 올바른 라벨을 고른다. 이 방식은 정확도를 높이지만 비용도 그만큼 늘어난다.[1]
9. 능동 학습으로 효율 높이기
능동 학습은 목표 모델 성능에 도달하는 데 필요한 라벨 데이터의 양을 줄이는 머신러닝 기법이다. 데이터 포인트를 무작위로 라벨링하는 대신 모델에 가장 정보가 많은 예시를 골라 라벨링한다.[1]
능동 학습 과정은 다음과 같은 반복 루프로 이루어진다.[1]
- 현재 라벨이 붙은 데이터셋으로 모델을 학습한다.
- 모델로 라벨이 없는 데이터 포인트마다 정보량 점수(예: 모델이 얼마나 불확실한지)를 매긴다.
- 점수가 가장 높은 포인트를 사람 어노테이터에게 보내 라벨을 붙이게 한다.
- 새로 라벨이 붙은 데이터를 학습 데이터에 추가하고 재학습한다.
- 원하는 성능에 도달할 때까지 반복한다.[1]
다음에 라벨을 붙일 예시를 고르는 전략은 여러 가지다.[1]
| 전략 | 작동 방식 | 사용할 때 |
|---|---|---|
| 불확실성 샘플링 | 모델이 예측에 가장 자신 없어 하는 예시를 고른다 | 범용적이며 대부분의 분류기에서 잘 작동[1] |
| 위원회 질의(query by committee) | 여러 모델을 학습시켜 서로 가장 많이 의견이 갈리는 예시를 고른다 | 앙상블 방법을 쓸 수 있을 때[1] |
| 밀도 가중 샘플링 | 불확실성과 데이터 밀도를 결합해 불확실하면서도 대표성 있는 예시를 고른다 | 라벨이 없는 풀의 분포가 고르지 않을 때[1] |
| 기대 모델 변화 | 라벨이 붙었을 때 모델 파라미터를 가장 크게 바꿀 예시를 고른다 | 계산 비용은 크지만 예산이 적을 때 효과적[1] |
효과적으로 적용하면 능동 학습은 여러 연구에 따라 무작위 샘플링보다 필요한 라벨 수를 30~70% 줄일 수 있다.[1] Amazon SageMaker Ground Truth는 능동 학습으로 신뢰도가 높은 예시는 자동으로 라벨링하고, 불확실한 예시만 사람 어노테이터에게 보낸다. AWS는 이 방식으로 라벨링 비용을 최대 70%까지 줄인다고 주장한다.[19]
10. 합성 데이터 대안
합성 데이터(synthetic data)는 실제 세계 데이터의 통계적 특성을 흉내 낸 인공적으로 생성된 데이터다. 일부 학습 상황에서는 수작업 라벨 데이터를 보완하거나 부분적으로 대체할 수 있다.[1]
10.1. 장점과 한계
합성 데이터 생성은 초기 구축 이후 수작업 어노테이션 비용을 없앤다. 생성 파이프라인(3D 렌더링 엔진, 생성적 적대 신경망, 확산 모델)을 한 번 만들면 추가 라벨 예시는 단위당 비용이 거의 들지 않는다. 생성된 예시에 실제 개인이 나오지 않아 개인정보 문제도 피한다. 실제 데이터가 엄격한 규제를 받는 의료와 금융에서 특히 가치가 크다.[1]
Gartner는 2030년까지 합성 데이터가 실제 세계 데이터셋보다 AI 학습에 더 널리 쓰일 것으로 예측했다.[20]
합성 데이터는 분포 격차를 만들 수 있다. 합성 예시만으로 학습한 모델은 생성된 분포와 다른 실제 데이터를 만나면 실패하기도 한다. 그래서 합성 데이터는 실제 라벨 데이터를 완전히 대체하기보다 보완하는 용도로 쓸 때 가장 적합하다. 성능 검증에는 여전히 실제 세계 테스트 세트 벤치마킹이 필요하다.[1]
자율주행 모델 학습에 쓰이는 시뮬레이션 환경은 수백만 개의 라벨 프레임을 만들 수 있다. 다만 비현실적인 조건에서 학습하지 않도록 시각적 충실도와 시나리오 다양성을 신중하게 관리해야 한다.[1]
11. LLM으로 학습 데이터 라벨링하기
대규모 언어 모델의 등장으로 라벨링 과정 일부를 자동화할 가능성이 열렸다. 팀은 사람 어노테이터에만 의존하지 않고, 대규모 언어 모델이 초기 라벨을 만들면 사람이 검토해 고치는 방식을 쓸 수 있다.[1]
Refuel AI의 연구에서 GPT-4는 여러 텍스트 분류 데이터셋에서 정답 라벨과 88.4% 일치했고, 같은 과제에서 사람 어노테이터는 86.2%였다.[21] 테스트한 모델 중 정확도와 효율을 합친 점수는 GPT-4o가 가장 높았다.[21] 이 결과는 LLM이 특정 텍스트 라벨링 과제에서 크라우드 소싱 사람 어노테이터와 대등하거나 그 이상일 수 있음을 시사한다. 다만 특수 분야의 전문가 수준 성능에는 여전히 사람의 감독이 필요하다.[1]
12. 약한 지도와 사람 검토
약한 지도(weak supervision)는 스탠퍼드 대학교의 Snorkel 프로젝트(2015년 시작)가 개척한 방식으로, 라벨링을 프로그램 방식으로 접근한다.[22] 사람이 예시를 하나씩 주석 달지 않고 라벨링 함수(labeling function)를 쓴다. 라벨링 함수는 휴리스틱 규칙, 키워드 일치, 외부 지식 베이스를 적용해 잡음이 있는 라벨을 붙이는 간단한 프로그램이다.[22] Snorkel 시스템은 여러 라벨링 함수의 출력을 결합하고, 각 함수의 정확도와 함수 사이의 상관관계를 자동으로 학습해 보정한다.[22]
이 방식은 수작업 어노테이션보다 훨씬 빠르다.[1] 평가에서 Snorkel을 쓴 주제 전문가들은 7시간 동안 수작업 라벨링만 한 경우와 비교해 모델을 2.8배 빨리 만들었고, 예측 성능은 45.5% 높았다.[22]
가장 효과적인 현대 라벨링 파이프라인은 LLM 예측과 사람의 검토를 결합한다. 흔한 패턴은 다음과 같다.[1]
이 혼합 방식은 데이터셋의 최대 75%를 자동으로 라벨링해, 사람의 노력을 남은 어려운 사례에 집중하게 한다. HILTS 프레임워크(효과적인 데이터 라벨링을 위한 Human-LLM 협업)는 이 패턴을 정식화했다. 능동 학습으로 사람이 집중 검토할 가장 불확실한 LLM 라벨을 고른다.[1]
13. 데이터 라벨링 비용과 시장
데이터 라벨링 비용은 과제의 복잡도, 어노테이터의 전문성, 데이터 형식, 품질 요구 수준에 따라 크게 달라진다.[1]
13.1. 작업 유형별 비용
| 작업 유형 | 어노테이션당 비용 | 비고 |
|---|---|---|
| 이미지 분류(이진) | 0.01~0.05달러 | 단순한 예/아니요 또는 범주 배정[1] |
| 바운딩 박스 | 0.05~0.50달러 | 이미지당 물체 수에 따라 다름[1] |
| 시맨틱 세그멘테이션 | 0.50~7.00달러 | 픽셀 단위 라벨링이라 노동 집약적[1] |
| 텍스트 분류 | 0.02~0.10달러 | 감성, 주제, 스팸 탐지[1] |
| 개체명 인식 | 0.10~1.00달러 | 개체 밀도와 분야에 따라 다름[1] |
| 오디오 전사 | 분당 0.50~3.00달러 | 잡음이 많거나 전문 어휘일 때 높아짐[1] |
| RLHF 선호 비교 | 예시당 1.00~100달러 | 응답 길이와 필요한 전문성에 따라 다름[1] |
| 의료 영상 어노테이션 | 2.00~50.00달러 | 훈련된 방사선 전문의나 병리학자 필요[1] |
컴퓨터 비전 모델 하나에 10만 장의 라벨링 이미지가 필요할 수 있다. 어노테이션당 0.50~5.00달러라고 하면 직접 라벨링 비용만 5만 달러에서 50만 달러에 이른다. 여기에는 프로젝트 관리, 품질 보증 비용, 도구 라이선스, 프로젝트 중간에 라벨링 지침이 바뀔 때의 재작업 비용이 포함되지 않는다.[1]
13.2. 시장 규모
Grand View Research에 따르면 전 세계 데이터 수집·라벨링 시장은 2024년 약 37억 7천만 달러 규모였고, 연평균 성장률 약 28%로 2030년에 171억 달러에 이를 것으로 전망된다.[2]
추정치는 시장 정의의 범위에 따라 다르다. Mordor Intelligence는 좁은 의미의 데이터 라벨링 시장을 2026년 약 26억 달러로 보고, 연 약 22%로 성장할 것으로 봤다. Grand View Research의 더 넓은 '데이터 라벨링 솔루션 및 서비스' 부문은 2024년 약 186억 달러로 평가되었다.[2] 분석가들은 방향에는 대체로 동의한다. 성장을 이끄는 요인은 자율주행, 의료, 금융 서비스의 AI 도입이며, 무엇보다 대규모 언어 모델을 학습시키고 정렬하기 위한 인간 피드백 데이터 수요의 증가다.[2]
14. 윤리적 쟁점
데이터 라벨링 작업에는 여러 윤리 문제가 따른다. 노동의 상당 부분은 저소득 국가의 작업자가 맡고 있으며, 이들은 과제 단위로 보수를 받는데 그 금액이 현지 최저임금에 못 미치는 경우도 있다. 2018년 Amazon Mechanical Turk 연구는 플랫폼 작업자의 시간당 임금 중앙값이 약 2달러라고 밝혔다.[16] Time 매거진은 2023년 케냐 작업자들이 OpenAI의 안전 필터를 위해 유해 콘텐츠에 라벨을 붙이면서 시간당 2달러 미만을 받았다고 보도했다.[23]
폭력 이미지, 혐오 발언, 노골적인 자료 같은 콘텐츠 모더레이션 데이터를 라벨링하는 어노테이터는 심리적으로 고통스러운 자료에 노출된다.[23] 일부 기업은 웰니스 프로그램과 콘텐츠 순환 배치 정책을 도입해 피해를 줄이고 있지만, 업계 전반의 기준은 제각각이다.[1]
라벨 데이터의 편향도 문제다. 어노테이터가 체계적인 편향을 라벨링 판단에 가져오면(예: 특정 이름을 특정 인구 집단과 연결하는 경우), 그 편향이 학습 데이터에 담기고 모델이 이를 재현한다. 신중한 지침 설계, 다양한 어노테이터 풀, 완성된 데이터셋의 편향 감사가 표준적인 완화 전략이다.[1]
15. 향후 전망
데이터 라벨링의 진화를 형성하는 흐름은 다음과 같다.[1]
- 파운데이션 모델 사전 라벨링: Meta의 Segment Anything Model(SAM) 같은 모델은 제로샷 정확도로 이미지를 미리 분할할 수 있어, 사람은 처음부터 그리기보다 검증하고 고치는 역할을 맡는다.[24] 이 방식은 이미지 어노테이션 작업 흐름을 상당히 빠르게 한다.
- 연속 라벨링(MLOps): 라벨링은 일회성 작업이 아니라 머신러닝 수명 주기의 지속적인 부분으로 다뤄지는 추세다. 운영 중에 발견된 오류와 분포 변화가 라벨링 파이프라인으로 되돌아와 지속적인 개선의 순환을 만든다.
- 멀티모달 어노테이션: 멀티모달 AI 모델이 보편화되면서 한 과제가 여러 데이터 형식에 동시에 걸치는 경우가 늘고 있다. 예를 들어 영상의 시각 내용과 말로 된 대화를 함께 라벨링하는 식이다.
- 규제 요구: EU AI법과 유사한 규정은 학습 데이터의 출처와 라벨링 절차에 대한 문서화를 요구할 수 있으며, 이는 라벨링 작업 흐름에 새로운 준수 부담을 만든다.
- 자기지도·준지도 대안: 자기지도 학습과 준지도 학습은 사전 학습 중 대량의 비라벨 데이터를 활용해 라벨 데이터 의존을 줄인다. 다만 의존을 완전히 없애지는 못한다.[1]
각주·출처 24개
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17 ↩18 ↩19 ↩20 ↩21 ↩22 ↩23 ↩24 ↩25 ↩26 ↩27 ↩28 ↩29 ↩30 ↩31 ↩32 ↩33 ↩34 ↩35 ↩36 ↩37 ↩38 ↩39 ↩40 ↩41 ↩42 ↩43 ↩44 ↩45 ↩46 ↩47 ↩48 ↩49 ↩50 ↩51 ↩52 ↩53 ↩54 ↩55 ↩56 ↩57 ↩58 ↩59 ↩60 ↩61 ↩62 ↩63 ↩64 ↩65 ↩66 ↩67 ↩68 ↩69 ↩70 ↩71 ↩72 ↩73 ↩74 ↩75 ↩76 ↩77 ↩78 ↩79 ↩80 ↩81 ↩82 ↩83 ↩84 ↩85 ↩86 ↩87 ↩88 ↩89 ↩90 ↩91 ↩92 ↩93 ↩94 ↩95 ↩96 ↩97 ↩98 ↩99 ↩100 ↩101 ↩102 AI Wiki: Data labeling (2026-06-23 수정본) · CC BY 4.0 · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 Grand View Research. "Data Collection And Labeling Market Size Report, 2030." (2025); Mordor Intelligence. "Data Labeling Market Size, Competitive Landscape 2025-2031." (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 Label Studio documentation. labelstud.io. (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 CVAT documentation. cvat.ai. (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 Explosion AI. "Prodigy: A new tool for radically efficient machine teaching." explosion.ai. (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 Scale AI's Alexandr Wang confirms departure for Meta as part of $14.3 billion deal · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 Sacra. "Surge AI revenue, funding & news." (2025); Reuters reporting on Surge AI fundraise, July 2025. (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 CNBC. "AI hiring startup Mercor now valued at $10 billion with new $350 million funding round." October 27, 2025; TechCrunch. "Turing raises $111M at a $2.2B valuation." March 6, 2025. (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 ↩2 ↩3 Wikipedia. "Scale AI." Accessed March 2026. (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 ↩2 ↩3 Fortune. "Exclusive: Scale AI secures $1B funding at $14B valuation." May 21, 2024. (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 ↩2 CNBC. "Amazon, Meta back Scale AI in $1 billion funding deal that values firm at $14 billion." May 21, 2024. (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 ↩2 Fortune. "OpenAI is phasing out Scale AI work following startup's Meta deal." June 19, 2025; TechCrunch. "Google reportedly plans to cut ties with Scale AI." June 14, 2025. (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 Training language models to follow instructions with human feedback · 확인 2026-10-11
- ↩1 Why expert data is becoming the new fuel for AI models · 확인 2026-10-11
- ↩1 ↩2 Wikipedia. "Amazon Mechanical Turk." Accessed March 2026. (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 ↩2 Hara, K., et al. "A Data-Driven Analysis of Workers' Earnings on Amazon Mechanical Turk." Proceedings of the 2018 CHI Conference on Human Factors in Computing Systems (2018). (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 ↩2 Cohen, J. "A Coefficient of Agreement for Nominal Scales." Educational and Psychological Measurement 20, no. 1 (1960): 37-46. (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 Landis, J. R., and Koch, G. G. "The Measurement of Observer Agreement for Categorical Data." Biometrics 33, no. 1 (1977): 159-174. (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 Amazon Web Services. "Amazon SageMaker Ground Truth: Build Highly Accurate Datasets and Reduce Labeling Costs by up to 70%." AWS Blog. (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 Gartner. "Predicts 2024: Synthetic Data." Forecast on synthetic data adoption by 2030. (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 ↩2 Refuel AI. "LLMs can structure data as well as humans, but 100x faster." Technical Report (2024). (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 Ratner, A., et al. "Snorkel: Rapid Training Data Creation with Weak Supervision." Proceedings of the VLDB Endowment 11, no. 3 (2017). (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 ↩2 Perez, S. "Time: OpenAI Used Kenyan Workers on Less Than $2 Per Hour." Time, January 2023. (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 Kirillov, A., et al. "Segment Anything." Proceedings of the IEEE/CVF International Conference on Computer Vision (2023). (AI Wiki 참고문헌) · 확인 2026-10-11