AI의 변화, 근거와 맥락까지.AI NEWS & CONTEXT
AI 사전 · AI 첫걸음

매개변수

매개변수는 모델을 학습하는 과정에서 데이터로부터 값이 정해지는 모델 내부 변수로, 신경망의 가중치와 편향이 대표적이다. 모델이 입력을 출력으로 바꾸는 방식을 결정하며, 그 총수는 모델 용량을 가늠하는 지표로 자주 쓰인다.

매개변수
분류머신러닝·통계에서 쓰는 모델 내부 변수[2]
값이 정해지는 방식학습 과정에서 데이터로부터 학습됨[2]
대표 예신경망의 가중치와 편향, 선형 회귀의 계수와 절편[1]
하이퍼파라미터와의 차이하이퍼파라미터는 학습 전에 실무자가 정하고, 매개변수는 최적화 알고리즘이 자동으로 추정함[1]
규모 사례LeNet-5(1998년) 약 6만 개, GPT-3(2020년) 1,750억 개[3] [1]

쉽게 말하면, 매개변수는 기계에 달린 수많은 작은 조절 손잡이와 같다. 처음에는 손잡이가 모두 무작위로 맞춰져 있고, 수천 개의 예시를 보여 주면 기계가 각 손잡이를 조금씩 돌려 가며 일을 아주 잘하게 된다. 손잡이가 많을수록 더 복잡한 것을 배울 수 있지만, 더 많은 예시와 시간이 필요하다.[1]

1. 개요

매개변수(parameter)는 머신러닝과 통계에서 학습 과정 중 데이터로부터 값이 정해지는 모델의 내부 변수다.[2] 매개변수는 모델의 동작을 정의하고, 모델이 입력을 출력으로 바꾸는 방식을 결정한다. 신경망에서 가장 익숙한 매개변수는 가중치와 편향이고, 선형 회귀에서는 계수와 절편이다. 학습을 시작하기 전에 실무자가 정하는 하이퍼파라미터와 달리, 매개변수는 경사 하강법 같은 최적화 알고리즘이 자동으로 추정한다.[1]

모델의 전체 매개변수 수는 모델의 용량(capacity), 곧 복잡한 함수를 표현하는 능력을 나타내는 지표로 가장 흔히 인용된다. 최근의 대규모 언어 모델은 수천억 개, 심지어 수조 개의 매개변수를 갖는다. 2020년에 공개된 GPT-3는 매개변수가 1,750억 개이고,[3] GPT-4는 약 1조 8,000억 개로 추정된다. 이는 1998년의 합성곱 신경망 LeNet-5가 가진 약 6만 개에 비해 약 10자릿수(orders of magnitude) 늘어난 것이다.[1]

2. 하이퍼파라미터와의 차이

처음 접하는 사람이 흔히 혼동하는 것이 매개변수와 하이퍼파라미터의 차이다. 아래 표는 핵심 차이를 정리한 것이다.[1]

매개변수와 하이퍼파라미터 비교
구분매개변수하이퍼파라미터
정하는 주체학습 중 데이터에서 학습됨학습 전에 실무자가 선택함[1]
예가중치, 편향, 임베딩 벡터학습률, 배치 크기, 층 수[1]
개수수십억~수조 개에 이를 수 있음보통 소수(수십~수백 개)[1]
최적화 방법경사 하강법, 역전파격자 탐색, 무작위 탐색, 베이즈 최적화[1]
학습 후 저장예. 모델 체크포인트 파일에 저장됨보통 실험 설정 파일에 기록됨[1]

요컨대 매개변수는 모델이 학습하는 것이고, 하이퍼파라미터는 엔지니어가 정하는 것이다.[1]

3. 매개변수의 종류

모델 구조마다 학습 가능한 매개변수의 종류가 다르다. 가장 중요한 유형은 다음과 같다.[1]

3.1. 가중치와 편향

가중치는 신경망에서 뉴런 사이의 연결에, 또는 선형 모델에서 입력 특징에 붙는 스칼라 값이다. 가중치 하나는 한 입력 신호가 다음 층의 계산에 얼마나 강하게 영향을 주는지 정한다. 학습 중에는 손실 함수를 최소화하도록 가중치가 조정된다. 입력이 n개, 출력이 m개인 완전 연결(밀집) 층에는 $$n \times m$$개의 가중치 매개변수가 있다.[1]

편향(bias)은 각 뉴런의 계산에 더해지는 상수다. 뉴런의 활성화를 이동시켜 원점을 지나지 않는 데이터에도 맞출 수 있게 해 준다. 뉴런마다 보통 편향 항이 하나이므로, 출력이 m개인 밀집 층에는 편향 매개변수가 m개 있다.[1]

3.2. 임베딩 테이블과 정규화 매개변수

자연어 처리에서 임베딩 테이블은 이산적인 토큰(단어 또는 하위 단어)을 밀집된 연속 벡터로 대응시킨다. 어휘 크기가 V, 임베딩 차원이 d인 임베딩 테이블에는 $$V \times d$$개의 매개변수가 있다. 대규모 언어 모델에서는 임베딩 테이블이 전체 매개변수의 상당 부분을 차지하는 경우가 많다.[1]

배치 정규화와 층 정규화 같은 층에는 학습 가능한 크기 조절($$\gamma$$)과 이동($$\beta$$) 매개변수가 있다. 특징 차원의 크기가 d이면 이 층들은 학습 가능한 매개변수를 $$2d$$개 더한다. 가중치 행렬에 비하면 수는 적지만, 정규화 매개변수는 학습 과정을 안정시키는 데 중요한 역할을 한다.[1]

3.3. 합성곱 필터와 어텐션 투영 행렬

합성곱 신경망에서 각 필터는 학습 가능한 가중치로 이루어진 작은 텐서로, 입력 위를 훑으며 가장자리·질감·모양 같은 공간 패턴을 감지한다. 입력 채널이 $$C_{\text{in}}$$개, 출력 필터가 $$C_{\text{out}}$$개, 커널 크기가 $$k \times k$$인 합성곱 층은 (편향 포함) $$C_{\text{in}} \times C_{\text{out}} \times k \times k + C_{\text{out}}$$개의 매개변수를 갖는다.[1]

트랜스포머 구조에서 셀프 어텐션은 쿼리·키·값 투영 행렬과 출력 투영 행렬을 사용한다.[4] 모델 차원이 $$d_{\text{model}}$$이고 어텐션 헤드가 h개(헤드 차원 $$d_k = d_{\text{model}} / h$$)일 때, 각 어텐션 하위 층에는 $$4 \times d_{\text{model}}^2$$개의 가중치 매개변수가 있고 여기에 편향이 더해진다.[1]

4. 층별 매개변수 수 세기

매개변수 수를 셀 줄 알면 필요한 메모리를 추정하고 구조를 비교하는 데 도움이 된다.[1]

층 유형별 매개변수 수 공식과 예
층 유형공식(편향 포함)예
밀집(완전 연결)$$(n_{\text{in}} \times n_{\text{out}}) + n_{\text{out}}$$입력 768, 출력 3072: 2,362,368[1]
2D 합성곱$$(k \times k \times C_{\text{in}} \times C_{\text{out}}) + C_{\text{out}}$$3x3 커널, 입력 64, 출력 128: 73,856[1]
임베딩$$V \times d$$어휘 50,257, 차원 768: 38,597,376[1]
층 정규화$$2 \times d$$d = 768: 1,536[1]
멀티헤드 어텐션$$4 \times d_{\text{model}}^2 + 4 \times d_{\text{model}}$$d_model = 768: 2,362,368[1]
트랜스포머 FFN$$2 \times d_{\text{model}} \times d_{\text{ff}} + d_{\text{model}} + d_{\text{ff}}$$d_model = 768, d_ff = 3072: 4,722,432[1]

전체 모델의 매개변수 수는 모든 층의 매개변수를 더해서 구한다. 층이 L개인 트랜스포머의 대략적인 공식은 $$L \times (4 \times d_{\text{model}}^2 + 2 \times d_{\text{model}} \times d_{\text{ff}}) + V \times d_{\text{model}}$$이며, 1차 추정에서는 편향과 정규화 항을 무시한다.[1]

5. 주요 모델의 매개변수 수

매개변수 수는 구조와 적용 분야에 따라 크게 다르다.[1]

주요 모델의 대략적인 매개변수 수
모델유형대략적인 매개변수 수
단순 선형 회귀(특징 10개)선형11개[1]
로지스틱 회귀(MNIST, 클래스 10개)선형7,850개[1]
LeNet-5 (1998)CNN6만 개[1]
AlexNet (2012)CNN6,000만 개[1]
VGG-16 (2014)CNN1억 3,800만 개[1]
ResNet-50 (2015)CNN2,560만 개[1]
BERT-Base (2018)트랜스포머(인코더)1억 1,000만 개[1]
BERT-Large (2018)트랜스포머(인코더)3억 4,000만 개[1]
GPT-2 (2019)트랜스포머(디코더)15억 개[1]
GPT-3 (2020)트랜스포머(디코더)1,750억 개[1]
GPT-4 (2023)트랜스포머(MoE, 디코더)약 1조 8,000억 개(추정)[1]
LLaMA 3.1 405B (2024)트랜스포머(디코더)4,050억 개[1]
Mixtral 8x22B (2024)트랜스포머(MoE)약 1,410억 개(활성 390억 개)[1]

표에서 보듯 초기 선형 모델부터 최신 대규모 언어 모델까지 매개변수 수는 약 10자릿수 늘어났다.[3][5] 그러나 크다고 해서 항상 더 좋은 것은 아니며, 구조 혁신과 데이터 품질, 학습 방법도 매우 중요하다. DeepMind의 친칠라(Chinchilla) 연구가 이를 직접 보여 주었다. 토큰 1조 4,000억 개로 학습한 700억 매개변수 모델이 1,750억 매개변수의 GPT-3와 2,800억 매개변수의 Gopher보다 좋은 성능을 냈는데, 더 큰 이 모델들이 크기에 비해 학습이 크게 부족했기 때문이다.[6]

6. 매개변수 추정 방법

통계와 머신러닝에는 관측 데이터로부터 최적의 매개변수 값을 추정하는 여러 틀이 있다.[7]

최대 가능도 추정(MLE)은 가정한 모델에서 관측 데이터의 확률(가능도)을 최대로 하는 매개변수 값을 찾는다. 데이터 D와 매개변수 $$\theta$$가 주어졌을 때 $$\theta_{\text{MLE}} = \arg\max_{\theta} P(D \mid \theta)$$를 푼다. MLE는 실무에서 가장 널리 쓰이는 추정 방법이다. 교차 엔트로피 또는 평균 제곱 오차 손실로 신경망을 경사 기반으로 최적화하는 표준 방식은 MLE를 수행하는 것과 같다.[2][1]

최대 사후 확률(MAP) 추정은 매개변수에 대한 사전 분포를 반영해 MLE를 확장한 것으로, $$\theta_{\text{MAP}} = \arg\max_{\theta} P(\theta \mid D) = \arg\max_{\theta} P(D \mid \theta)\, P(\theta)$$를 찾는다. 사전 분포가 균등하면 MAP는 MLE와 같아진다. 사전 분포가 가우시안이면 MAP는 L2 규제(가중치 감쇠)와 같다.[2] MAP는 매개변수 값에 대한 도메인 지식이나 선호를 담는 원칙적인 방법이다.[1]

베이즈 추론은 점 추정 하나를 구하는 대신 사후 분포 전체 $$P(\theta \mid D)$$를 계산한다. 이를 통해 가장 가능성이 높은 설정만이 아니라 매개변수 값에 대한 불확실성의 전체 모습을 얻는다.[7] 이론적으로는 매력적이지만, 대규모 신경망에서는 정확한 베이즈 추론을 계산할 수 없다. 실제로는 변분 추론, 마르코프 연쇄 몬테카를로(MCMC), 몬테카를로 드롭아웃 같은 근사 방법을 쓴다.[1]

추정 방법 비교
방법출력사전 분포 반영계산 비용
MLE점 추정아니요낮음[1]
MAP점 추정예낮음~보통[1]
베이즈 추론사후 분포 전체예높음[1]

7. 매개변수 공간과 최적화 지형

모델의 매개변수 공간은 학습 가능한 모든 매개변수가 정의하는 고차원 공간이다. 매개변수가 N개인 모델의 매개변수 공간은 N차원 실수 공간이다. 손실 함수는 이 공간 위에 곡면(지형)을 정의하며, 학습은 그 곡면에서 낮은 지점을 찾는 일이다. 최적화 지형의 주요 특징은 다음과 같다.[1]

  • 지역 최솟값: 주변 모든 방향보다 손실이 낮지만 반드시 전역 최솟값은 아닌 지점이다. 고차원 공간에서는 대부분의 지역 최솟값이 전역 최솟값과 손실 값이 비슷해서, 어떤 지역 최솟값에 도달해도 좋은 해를 얻는 경우가 많다.
  • 안장점: 기울기는 0이지만 어떤 방향으로는 손실이 늘고 다른 방향으로는 줄어드는 지점이다. 고차원 지형에서는 지역 최솟값보다 훨씬 흔하며 최적화를 느리게 할 수 있다.
  • 손실 고원: 기울기가 매우 작아 진행이 느린 평평한 영역이다. 모멘텀 기반 최적화 알고리즘과 적응형 학습률 방법이 이런 영역을 지나는 데 도움이 된다.
  • 날카로운 최솟값과 평탄한 최솟값: 연구에 따르면 평탄한 최솟값(최솟값 주변에서 손실이 천천히 변하는 곳)은 날카로운 최솟값보다 일반화가 더 잘되는 경향이 있다. 큰 배치 잡음을 동반한 확률적 경사 하강법 같은 기법은 자연스럽게 평탄한 최솟값을 선호한다.

8. 매개변수 공유

매개변수 공유는 모델의 여러 부분이 각자 복사본을 두지 않고 같은 매개변수 집합을 쓰는 설계 기법이다. 학습 가능한 매개변수의 총수를 줄이고, 일종의 규제로 작용하며, 유용한 귀납적 편향(inductive bias)을 담는다.[1]

합성곱 신경망에서는 입력의 모든 공간 위치에 같은 필터 가중치를 적용한다. 입력 채널이 64개인 3x3 필터 하나는 가중치 매개변수가 576개뿐이지만, 이미지 전체에서 수백~수천 번 적용된다. 이런 공유에는 같은 국소 패턴이 이미지 어디에나 나타날 수 있다는 평행 이동 등변성의 가정이 담겨 있다.[1]

순환 신경망에서는 모든 시간 단계에 같은 가중치 행렬을 적용한다. 그래서 시퀀스 길이와 상관없이 매개변수 수가 일정하게 유지되며, 시퀀스의 모든 위치에서 같은 변환이 유용하다는 가정이 담긴다.[1]

가중치 묶기(weight tying)는 모델의 서로 다른 두 구성 요소가 같은 가중치 행렬을 쓰도록 강제하는 기법이다. 언어 모델에서 입력 임베딩 행렬과 출력 소프트맥스 투영 행렬을 묶는 것이 대표적인 예다. 두 행렬은 같은 어휘를 같은 벡터 공간과 연결하므로, 이를 공유하면 메모리 사용량이 줄고 성능도 자주 좋아진다. 원래의 트랜스포머 논문과 이후의 많은 언어 모델이 이 기법을 쓴다.[4][1]

9. 매개변수 효율적 미세 조정

사전 학습된 대형 모델을 전부 미세 조정하려면 모든 매개변수를 갱신해야 하므로 연산과 메모리 비용이 크다. 매개변수 효율적 미세 조정(PEFT, parameter-efficient fine-tuning) 방법은 나머지는 동결한 채 매개변수의 작은 일부만 수정해 모델을 새 작업에 맞춘다.[1]

대표적인 PEFT 방법
방법방식학습 가능 매개변수(일반적)핵심 장점
LoRA(Low-Rank Adaptation)어텐션 층에 학습 가능한 저랭크 행렬을 삽입원래의 0.1%~1%병합 후 추론 실행 시 지연이 늘지 않음[1]
어댑터기존 층 사이에 작은 병목 모듈을 삽입원래의 1%~5%모듈식이라 작업별로 교체하기 쉬움[1]
프리픽스 튜닝트랜스포머 입력 앞에 학습 가능한 연속 벡터를 붙임원래의 1% 미만데이터가 적거나 퓨샷 상황에서 효과적[1]
QLoRALoRA와 기반 모델의 4비트 양자화를 결합원래의 0.1%~1%일반 소비자용 GPU 한 대에서 미세 조정 가능[1]
BitFit편향 항만 학습하고 모든 가중치는 동결원래의 0.1% 미만매우 가벼움[1]

LoRA는 가장 널리 채택된 PEFT 방법이 되었다. 저자들은 이 방법이 “사전 학습된 모델 가중치를 동결하고, 트랜스포머 구조의 각 층에 학습 가능한 랭크 분해 행렬을 주입하여 하위 작업의 학습 가능 매개변수 수를 크게 줄인다”고 설명한다.[8][1]

LoRA는 각 가중치 갱신을 두 개의 저랭크 행렬 A와 B로 분해하므로, 갱신 $$\Delta W = AB$$의 랭크는 $$r$$이고 r은 보통 4~64이다. 원 논문은 GPT-3 175B를 전체 미세 조정할 때와 비교해 LoRA가 학습 가능 매개변수 수를 최대 10,000배, GPU 메모리 요구량을 3배 줄일 수 있다고 보고했다.[8] 학습 뒤에는 저랭크 갱신을 원래 가중치에 병합할 수 있어, 추론 실행 시점에 지연이 추가되지 않는다.[8][1]

10. 동결 매개변수와 학습 가능 매개변수

현대 딥러닝 작업 흐름에서는 일부 매개변수를 동결하고 나머지만 학습하는 일이 흔하다. 동결된 매개변수는 학습 중 값이 갱신되지 않는 매개변수이며, 해당 매개변수의 기울기 계산을 끄는 방식으로 동결한다. 동결이 쓰이는 대표적인 상황은 다음과 같다.[1]

  • 전이 학습: 사전 학습된 백본의 매개변수를 동결하고 새 분류 헤드만 학습한다.
  • PEFT 방법: 대형 모델 매개변수의 대부분이 동결된 상태로 남는다.
  • 특징 추출: 사전 학습된 인코더가 하위 작업에 쓸 고정된 표현을 만들어 낸다.

학습 가능한 매개변수는 최적화 중 기울기에 따른 갱신을 받는 매개변수다. 학습 가능한 매개변수 수는 학습 중 GPU 메모리 사용량에 직접 영향을 준다. 학습 가능한 매개변수마다 기울기와 옵티마이저 상태(Adam의 모멘텀과 분산)를 저장할 공간이 필요하기 때문이다.[1]

실제로 Adam 옵티마이저를 쓰면 학습 가능한 매개변수 하나당 대략 12~16바이트의 메모리가 필요하다(매개변수 4바이트, 기울기 4바이트, 옵티마이저 상태 4~8바이트). 따라서 학습 가능한 매개변수가 70억 개인 모델은 옵티마이저 메모리만으로 약 84~112GB가 필요하다.[1]

11. 매개변수 초기화

학습을 시작하기 전에 매개변수에 초기값을 정해 주어야 한다. 초기화 전략의 선택은 학습 속도, 안정성, 최종 모델 품질에 크게 영향을 준다. 초기화가 나쁘면 기울기 소실이나 기울기 폭주가 일어나 학습이 완전히 실패할 수 있다.[1]

대표적인 초기화 전략
전략분포분산적합한 경우
영 초기화모두 00편향에만 사용(가중치에는 절대 쓰지 않음)[1]
무작위 균등/정규균등 또는 가우시안고정단순한 신경망[1]
Xavier(Glorot)가우시안 또는 균등$$2 / (n_{\text{in}} + n_{\text{out}})$$시그모이드, tanh 활성화[1]
He(Kaiming)가우시안 또는 균등$$2 / n_{\text{in}}$$ReLU와 그 변형[1]
직교직교 행렬1RNN, 매우 깊은 신경망[1]

Xavier 초기화는 2010년 자비에르 글로럿(Xavier Glorot)과 요슈아 벤지오(Yoshua Bengio)가 제안했으며, 순방향과 역방향 전달 모두에서 층을 지나도 활성화의 분산이 대략 일정하게 유지되도록 가중치를 정한다.[9] tanh나 시그모이드처럼 대칭인 활성화 함수와 잘 맞는다.[1]

He 초기화는 2015년 Kaiming He와 공동 연구자들이 제안했으며, ReLU 활성화가 입력의 대략 절반을 0으로 만든다는 점을 반영한다.[10] 이를 보정하기 위해 $$2 / (n_{\text{in}} + n_{\text{out}})$$ 대신 $$2 / n_{\text{in}}$$이라는 더 큰 분산을 써서, ReLU를 쓰는 깊은 신경망에서 신호가 사라지는 것을 막는다.[1]

현대의 트랜스포머 모델은 잔차 연결에 대해 표준편차를 $$1 / \sqrt{2L}$$배로 줄이는 스케일된 정규 초기화를 자주 쓴다. 여기서 L은 층의 수다. 이렇게 하면 매우 깊은 모델에서 잔차 신호가 지나치게 커지는 것을 막을 수 있다.[1]

12. 매개변수 모델과 비매개변수 모델

머신러닝 모델은 매개변수 수가 고정되어 있는지에 따라 구분하기도 한다.[1]

매개변수 모델(parametric model)은 특정한 함수 형태를 가정하며, 학습 데이터의 양과 관계없이 고정된 유한한 수의 매개변수를 갖는다. 선형 회귀, 로지스틱 회귀, 신경망이 예다. 학습이 끝나면 학습된 매개변수만으로 예측할 수 있고 학습 데이터는 더 이상 필요하지 않다.[1]

비매개변수 모델(non-parametric model)은 고정된 함수 형태를 가정하지 않는다. 복잡도가 학습 데이터의 양에 따라 커지며, 학습 데이터 자체를 사실상 모델의 일부로 보유하기도 한다. k-최근접 이웃(k-NN), 커널 밀도 추정, 결정 트리(데이터가 많을수록 더 깊게 자람)가 예다. 가우시안 과정도 예인데, 하이퍼파라미터는 있지만 유효 매개변수의 수가 데이터셋 크기에 따라 커진다.[1]

매개변수 모델과 비매개변수 모델 비교
특성매개변수 모델비매개변수 모델
매개변수 수 고정예아니요(데이터에 따라 증가)[1]
데이터 분포에 대한 가정강함(특정 함수 형태)약하거나 없음[1]
데이터 효율높음(필요한 표본이 적음)낮음(더 많은 데이터가 필요)[1]
예측 시 계산 비용일정(학습 데이터 크기와 무관)학습 데이터 크기에 따라 커지는 경우가 많음[1]
과소적합 위험높음(함수 형태가 틀린 경우)낮음[1]
과적합 위험낮음(적절한 규제를 적용할 때)높음(특히 데이터셋이 작을 때)[1]
예선형 회귀, 신경망k-NN, 커널 방법, 결정 트리[1]

신경망은 매개변수 수가 고정되어 있지만, 매개변수가 많고 비선형 활성화 함수를 쓰기 때문에 매우 유연할 수 있다. 실제로 큰 신경망은 중간 지대에 놓인다. 기술적으로는 매개변수 모델이지만 매개변수가 충분하면 거의 모든 함수를 근사할 수 있다.[1]

13. 매개변수 수와 모델 성능

매개변수의 총수는 모델의 용량, 곧 복잡한 함수를 표현하는 능력을 대략 가늠하는 대용 지표로 자주 쓰인다. 매개변수가 많은 모델은 원칙적으로 더 많은 학습 데이터를 외우고 더 세밀한 패턴을 포착할 수 있다. 그러나 매개변수 수만으로는 용량을 정확히 잴 수 없고, 매개변수가 많다고 더 좋은 모델이 보장되지도 않는다. 매개변수 수가 용량의 불완전한 척도인 이유는 여러 가지다.[1]

  • 구조가 중요하다. 매개변수가 10억 개인 트랜스포머는 더 나은 귀납적 편향(어텐션, 잔차 연결, 층 정규화) 덕분에 매개변수 수가 같은 완전 연결 신경망보다 좋은 성능을 낼 수 있다.
  • 유효 매개변수가 다르다. 전문가 혼합 모델에서는 입력마다 매개변수의 일부만 활성화된다. 전체 매개변수가 약 1조 8,000억 개로 추정되는 GPT-4는, 널리 인용되는 비공식 분석에서 토큰마다 전문가 16개 중 2개로만 라우팅한다고 알려져 있다. 이 경우 순방향 계산 한 번에 활성화되는 매개변수는 전체 1조 8,000억 개가 아니라 수천억 개 수준이다. OpenAI는 공식 수치를 공개하지 않았다.
  • 규제가 있다. 드롭아웃, 가중치 감쇠, 조기 종료 같은 기법은 모델의 유효 용량을 원시 매개변수 수가 시사하는 것보다 낮춘다.[2]
  • 스케일링 법칙이 있다. Kaplan 외(2020년)와 Hoffmann 외(2022년)의 경험적 스케일링 법칙은 모델 성능이 매개변수 수만이 아니라 매개변수 수, 데이터셋 크기, 연산 예산의 상호작용에 달려 있음을 보여 준다.[11][6] Kaplan 등은 테스트 손실이 “모델 크기, 데이터셋 크기, 학습에 사용된 연산량에 따라 멱법칙으로 변한다”는 것을 발견했다.[11] Hoffmann의 친칠라 연구는 연산 최적 학습에서는 모델 크기와 학습 토큰 수를 대체로 같은 비율로 늘려야 하며 매개변수당 학습 토큰이 약 20개라는 점을 보여 이를 정교화했다.[6]

최근 몇 년간의 추세는 더 큰 모델을 향해 왔다. 한편으로는 더 나은 구조, 데이터 선별, 학습 방법으로 경쟁력 있는 성능을 내는 더 작고 효율적인 모델을 만들려는 관심도 커지고 있다.[1]

각주·출처 11개
  1. ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17 ↩18 ↩19 ↩20 ↩21 ↩22 ↩23 ↩24 ↩25 ↩26 ↩27 ↩28 ↩29 ↩30 ↩31 ↩32 ↩33 ↩34 ↩35 ↩36 ↩37 ↩38 ↩39 ↩40 ↩41 ↩42 ↩43 ↩44 ↩45 ↩46 ↩47 ↩48 ↩49 ↩50 ↩51 ↩52 ↩53 ↩54 ↩55 ↩56 ↩57 ↩58 ↩59 ↩60 ↩61 ↩62 ↩63 ↩64 ↩65 ↩66 ↩67 ↩68 ↩69 ↩70 ↩71 ↩72 ↩73 ↩74 ↩75 ↩76 ↩77 ↩78 ↩79 ↩80 ↩81 ↩82 ↩83 ↩84 ↩85 ↩86 AI Wiki: Parameter (2026-06-21 수정본) · CC BY 4.0 · 확인 2026-10-10
  2. ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 Goodfellow, I., Bengio, Y., & Courville, A. (2016). Deep Learning. MIT Press. Chapter 5 (Machine Learning Basics) and Chapter 7 (Regularization). (AI Wiki 참고문헌) · 확인 2026-10-10
  3. ↩1 ↩2 ↩3 Language models are few-shot learners · 확인 2026-10-11
  4. ↩1 ↩2 Vaswani, A., et al. (2017). "Attention is all you need." Advances in Neural Information Processing Systems (NeurIPS). (AI Wiki 참고문헌) · 확인 2026-10-10
  5. ↩1 Devlin, J., et al. (2019). "BERT: Pre-training of deep bidirectional transformers for language understanding." NAACL-HLT 2019. (AI Wiki 참고문헌) · 확인 2026-10-10
  6. ↩1 ↩2 ↩3 Training compute-optimal large language models · 확인 2026-10-11
  7. ↩1 ↩2 Bishop, C. M. (2006). Pattern Recognition and Machine Learning. Springer. Chapters 3-4 (Parameter Estimation). (AI Wiki 참고문헌) · 확인 2026-10-10
  8. ↩1 ↩2 ↩3 LoRA: Low-Rank Adaptation of Large Language Models · 확인 2026-10-11
  9. ↩1 Glorot, X., & Bengio, Y. (2010). "Understanding the difficulty of training deep feedforward neural networks." Proceedings of AISTATS. (AI Wiki 참고문헌) · 확인 2026-10-10
  10. ↩1 He, K., Zhang, X., Ren, S., & Sun, J. (2015). "Delving deep into rectifiers: Surpassing human-level performance on ImageNet classification." Proceedings of ICCV. (AI Wiki 참고문헌) · 확인 2026-10-10
  11. ↩1 ↩2 Scaling laws for neural language models · 확인 2026-10-11

함께 읽는 용어

미세 조정

이 용어를 다룬 글

학습과 데이터

미세 조정

미세 조정은 사전 학습된 모델의 매개변수 전부 또는 일부를 목표 과제·분야·행동에 맞춘 데이터로 계속 최적화해 적응시키는 전이 학습의 한 형태다. 전체 미세 조정, 부분 미세 조정, 어댑터와 LoRA 같은 매개변수 효율적 방법, 지시 튜닝과 선호 기반 사후 학습을 포괄한다.

모델과 서비스

Codex

Codex는 OpenAI가 코드 중심 AI 제품 두 세대에 쓴 이름이다. 2021년에는 자연어를 코드로 바꾸는 언어 모델이었고, 2025년에는 코드를 읽고 수정하고 테스트하는 에이전트형 개발 도구(Codex CLI, Codex Cloud)가 되었다.