| 분류 | 딥러닝 구조[2] [1] |
|---|---|
| 최초 제안 | 2017년 논문 「Attention Is All You Need」[2] |
| 제안자 | Google 연구원 8명(당시 Google Brain 또는 Google Research 소속)[2] [1] |
| 핵심 메커니즘 | 어텐션만 사용, 순환·합성곱 없음[2] |
| arXiv 제출 | 2017년 6월 12일[2] |
| 학회 발표 | 2017년 12월 제31회 NeurIPS[2] |
| 대표 모델 | GPT 시리즈, BERT, Claude, Gemini, LLaMA, Mistral, Qwen[1] |
| 주요 응용 | 언어 모델, 이미지 분류, 객체 탐지, 음성 인식, 단백질 구조 예측, 이미지·영상 생성[3] [4] [5] [6] [7] |
1. 개요
트랜스포머(Transformer)는 Google 연구원 8명이 2017년 논문 「Attention Is All You Need」에서 소개한 딥러닝 구조다. 순환이나 합성곱 없이 어텐션만을 시퀀스 요소 사이의 관계를 모델링하는 메커니즘으로 쓴다.[2]
논문은 핵심 아이디어를 한 문장으로 밝힌다. “우리는 어텐션 메커니즘만을 바탕으로, 순환과 합성곱을 완전히 배제한 새롭고 단순한 네트워크 구조인 트랜스포머를 제안한다.”[2]
어텐션 덕분에 모든 위치가 다른 모든 위치를 한 번의 병렬 연산으로 참조할 수 있어, 트랜스포머는 자신이 대체한 순환 신경망(recurrent neural network)과 LSTM 모델보다 훨씬 빠르게 학습되고 모델 크기와 데이터에 따라 매끄럽게 확장된다. 지금은 GPT 시리즈, BERT, Claude, Gemini, LLaMA, Mistral, Qwen을 비롯해 운영 환경에서 쓰이는 거의 모든 대규모 언어 모델(LLM)의 기반이다.[1]
언어 밖에서도 트랜스포머는 이미지 분류(Vision Transformer), 객체 탐지(DETR), 음성 인식(Whisper), 단백질 구조 예측(AlphaFold), 클래스 조건부 이미지·영상 생성(Diffusion Transformer)의 기본 구조가 되었다.[3][4][5][6][7]
2017년 논문은 25만 회 넘게 인용되었다. 2025년 4월 Nature가 주요 데이터베이스 다섯 곳의 인용을 분석한 결과, 이 논문은 21세기에 가장 많이 인용된 연구 논문 가운데 7위에 올랐다. 같은 분석의 1위는 또 다른 딥러닝 연구인 Microsoft의 2016년 심층 잔차 학습(ResNet) 논문이었다.[1]
2. 등장 경위
논문은 2017년 6월 12일 arXiv에 제출되었고, 2017년 12월 제31회 신경정보처리시스템 학회(NeurIPS)에서 발표되었다.[2] 저자 8명은 Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Lukasz Kaiser, Illia Polosukhin이며, 당시 모두 Google Brain 또는 Google Research에서 일했다.[1] 논문은 모든 저자가 동등하게 기여했고 저자 기재 순서는 무작위라고 밝혔다.[2]
원래 목표는 실용적이었다. RNN과 LSTM으로 만든 시퀀스-투-시퀀스 기계 번역 모델은 학습 중 토큰을 한 번에 하나씩 처리해야 해서 GPU의 병렬성을 효율적으로 쓰기 어려웠고, 아주 먼 거리의 의존 관계를 포착하기도 어려웠다. Bahdanau, Cho, Bengio(2014)의 가산 어텐션 연구와 Facebook의 Gehring 등(2017)의 합성곱 시퀀스 모델 연구는 어텐션이 먼 토큰 사이의 경로를 줄일 수 있음을 보였다.[8] 트랜스포머는 순환·합성곱 뼈대를 완전히 없애고 어텐션과 단순한 피드포워드 계층만 쓰는 방식으로 이 아이디어를 극한까지 밀어붙였다.[1]
WMT 2014 영어-독일어 번역 과제에서 대형 트랜스포머는 28.4 BLEU를 기록해 이전 최고 앙상블을 2 BLEU 넘게 앞섰다. WMT 2014 영어-프랑스어 과제에서는 단일 모델이 NVIDIA P100 GPU 8개로 3.5일 학습한 뒤 41.8 BLEU에 도달했다.[2] 이 모델은 영어 구성성분 구문 분석에도 일반화되었다.[1]
3. 개발 동기
순환 모델은 위치 t의 은닉 상태를 위치 t-1의 은닉 상태로부터 계산한다. 이 순차 의존성은 두 가지 문제를 낳는다. 첫째, 각 단계가 앞 단계를 기다리므로 한 시퀀스의 위치들에 걸친 학습을 완전히 병렬화할 수 없다. 둘째, 먼 토큰을 연결하려면 기울기가 많은 시간 단계를 거쳐야 해서 실제로 기울기 소실이나 폭주가 일어난다. LSTM과 게이트 순환 유닛은 둘째 문제를 완화하지만 없애지는 못한다.[1]
어텐션은 두 문제를 모두 피한다. 모든 출력 위치가 한 번의 행렬 곱으로 모든 입력 위치를 직접 볼 수 있다. 두 토큰 사이의 경로 길이는 얼마나 떨어져 있든 일정하므로, 장거리 의존성은 먼 거리로 오차를 전파하는 문제가 아니라 부드러운 검색의 문제가 된다. 같은 연산을 GPU나 TPU에서 하나의 배치 행렬 곱으로 실행할 수 있는데, 이는 현대 가속기가 겨냥하는 바로 그 유형의 작업이다.[1]
2014년의 Bahdanau 어텐션은 LSTM 인코더와 LSTM 디코더 사이에 작은 어텐션 계산을 이미 사용했으며, 주된 목적은 입력 문장 전체를 벡터 하나로 압축하는 병목을 완화하는 것이었다.[8] 2017년까지 이 분야는 3년 동안 순환 시스템에 어텐션을 점진적으로 더해 왔다. 트랜스포머의 기여는 순환 뼈대를 완전히 없애고 어텐션이 시퀀스 모델링의 전체 부담을 지게 한 것이다.[1]
4. RNN과의 차이
| 항목 | RNN / LSTM | 트랜스포머 |
|---|---|---|
| 시퀀스 처리 | 순차적, 한 번에 토큰 하나 | 병렬, 모든 위치를 한꺼번에[1] |
| 두 토큰 사이의 경로 길이 | 거리에 따라 늘어남 | 일정(어텐션 한 단계)[1] |
| 한 시퀀스 안의 학습 병렬성 | 순환 때문에 제한됨 | 완전함, 배치 행렬 곱 하나[1] |
| 장거리 의존성 | 기울기 소실로 약해짐 | 어텐션을 통한 직접적인 부드러운 검색[1] |
| 시퀀스 길이 n에 대한 비용 | 선형(O(n)) | 계층당 이차(O(n^2))[1] |
실질적으로는 절충 관계다. RNN은 시퀀스 길이에 선형 비용을 치르지만 시간축으로 병렬화할 수 없어서 현대 가속기를 충분히 활용하지 못하고 먼 토큰을 연결하는 데 어려움을 겪는다. 트랜스포머는 시퀀스 길이에 이차 비용을 치르지만 시퀀스 전체를 하나의 병렬 연산으로 바꾸어 GPU와 TPU에 정확히 들어맞고, 모든 토큰 쌍을 한 단계 거리에 둔다. 2010년대 후반의 시퀀스 길이와 하드웨어에서는 두 번째 절충이 압도적으로 우세했고, 그래서 어텐션이 거의 모든 분야에서 순환을 대체했다.[1]
5. 작동 방식
트랜스포머는 토큰 시퀀스를 문맥을 반영한 벡터 시퀀스로 바꾸고, 생성 모델에서는 다음 토큰을 예측한다. 이 과정은 몇 단계의 반복으로 이루어진다. 먼저 각 토큰을 임베딩에 대응시키고, 모델이 토큰 순서를 알도록 위치 인코딩(positional encoding)을 더한다. 그 결과를 동일한 계층을 쌓은 스택에 통과시키는데, 각 계층은 어텐션과 피드포워드 신경망을 결합하고 잔차 연결과 정규화 계층으로 감싼다. 마지막으로 소프트맥스를 적용해 어휘 전체에 대한 확률 분포를 만든다.[1]
5.1. 전체 구조
원래의 트랜스포머는 인코더·디코더 구조를 쓴다. 인코더는 입력 시퀀스를 읽어 문맥 표현의 스택을 만든다. 디코더는 인코더 출력과 부분적으로 생성된 목표 시퀀스를 읽어 다음 토큰을 만든다. 두 부분 모두 동일한 계층을 쌓은 스택이며, 각 계층은 소수의 표준 구성 요소로 이루어진다.[1]
논문은 인코더 6층과 디코더 6층, 임베딩 차원 512(대형 모델은 1024), 어텐션 헤드 8개(대형 모델은 16개), 피드포워드 내부 차원 2048(대형 모델은 4096)을 썼다.[2] 기본 모델의 매개변수는 약 6,500만 개이고 대형 모델은 약 2억 1,300만 개다.[1]
5.2. 인코더 계층
- 멀티헤드 셀프 어텐션 블록. 입력 시퀀스의 모든 토큰이 다른 모든 토큰에 어텐션을 건다.
- 위치별 피드포워드 신경망. 각 위치에 독립적으로 적용한다.[1]
각 인코더 계층에는 위 두 하위 계층이 있고, 각 하위 계층을 잔차 연결이 감싼 뒤 층 정규화(layer normalization)가 이어진다. 원 논문에서는 잔차 덧셈 뒤에 정규화를 적용한다(“post-LN”). 현대 구현 대부분은 정규화를 하위 계층 앞에 적용한다(“pre-LN”). pre-LN이 학습률 워밍업 없이도 더 안정적으로 학습되기 때문이다.[1]
5.3. 디코더 계층
- 마스크가 있는 멀티헤드 셀프 어텐션 블록. 각 위치는 목표 시퀀스에서 앞쪽 위치에만 어텐션을 걸 수 있다. 이 마스크가 자기회귀 생성을 강제한다.
- 멀티헤드 크로스 어텐션 블록. 쿼리는 디코더에서 오고, 키와 값은 인코더 출력에서 온다.
- 위치별 피드포워드 신경망.[1]
각 디코더 계층에는 위 세 하위 계층이 있고, 인코더와 마찬가지로 잔차 연결과 층 정규화가 각 하위 계층을 감싼다.[1]
5.4. 임베딩과 가중치 공유
입력 토큰은 임베딩 행렬을 통해 벡터로 바뀐다. 같은 행렬을 어휘에 대한 로짓을 만드는 출력 투영과 공유하는 경우가 많은데, 가중치 공유(weight tying)라 부르는 이 기법은 매개변수 수를 줄이고 퍼플렉시티를 개선하는 경향이 있다. 로짓에 마지막 소프트맥스를 적용하면 다음 토큰의 확률 분포가 나온다.[1]
6. 스케일드 점곱 어텐션
구조의 핵심인 어텐션 연산은 간단히 쓸 수 있다. 쿼리 Q, 키 K, 값 V(각각 벡터를 행으로 쌓은 행렬)가 주어지면 출력은 다음과 같다.[1]
\mathrm{Attention}(Q, K, V) = \mathrm{softmax}\left( \frac{Q K^\top}{\sqrt{d_k}} \right) V여기서 d_k는 각 키 벡터의 차원이다.[2] 점곱 QK^T는 각 쿼리가 각 키와 얼마나 잘 맞는지를 측정한다. d_k의 제곱근으로 나누면 값의 크기가 차원에 따라 커지는 것을 막는데, 그대로 두면 소프트맥스가 기울기가 사라지는 영역으로 밀려 들어간다. 소프트맥스는 점수를 분포로 바꾸고, 여기에 V를 곱하면 값 벡터의 가중합이 나온다.[1]
셀프 어텐션에서는 Q, K, V가 모두 같은 입력의 선형 투영이다. 크로스 어텐션에서는 Q가 한 시퀀스에서, K와 V가 다른 시퀀스에서 온다. 마스크가 있는 셀프 어텐션에서는 소프트맥스 전에 가산 마스크가 금지된 위치(예: 디코딩 중의 미래 토큰)의 점수를 음의 무한대로 만든다.[1]
6.1. 멀티헤드 어텐션
어텐션 연산 하나는 한 번에 한 묶음의 관계만 인코딩할 수 있다. 멀티헤드 어텐션은 입력의 서로 다른 학습된 투영에 대해 어텐션 연산 h개를 병렬로 수행하고, 결과를 이어 붙여 모델 차원으로 다시 투영한다.[1] 모델 차원이 d_model이고 헤드가 h개이면 각 헤드의 키·값 차원은 보통 d_model을 h로 나눈 값이므로, 전체 연산량은 전체 차원의 어텐션 하나와 비슷하다.[2]
헤드마다 전문화되는 경향이 있다. 인접한 토큰을 보는 헤드도 있고, 동사-주어 일치 같은 통사 구조를 추적하는 헤드도 있으며, 문장 부호나 드문 명사 같은 특정 토큰 유형에 어텐션을 거는 헤드도 있다.[1] 논문은 영어 문장에서 조응 해소와 장거리 의존성을 포착한 헤드 여러 개를 시각화했다.[2]
흔한 현대적 변형인 멀티쿼리 어텐션(multi-query attention)은 Noam Shazeer가 2019년에 도입했으며, 헤드별 쿼리는 그대로 두고 모든 헤드가 키와 값 투영을 하나만 공유한다.[9] 그룹드 쿼리 어텐션(grouped-query attention, GQA)은 2023년 5월 Google Research의 Ainslie 등이 도입했으며, 헤드를 묶어 키와 값을 공유하게 하는 중간 방식이다.[10] GQA는 표준 멀티헤드 어텐션과 멀티쿼리 어텐션 사이를 보간한다. 두 변형 모두 자기회귀 디코딩 중 KV 캐시의 크기를 줄이는데, 이 캐시가 긴 컨텍스트 추론 실행의 주된 메모리 병목이다.[1]
Meta는 더 큰 LLaMA 2 모델에 GQA를 채택했으며(70B 모델은 KV 헤드 8개를 쓰고, 7B와 13B 모델은 표준 멀티헤드 어텐션을 유지했다), LLaMA 3에서는 모든 크기에 적용했다.[10][11][1]
7. 위치 인코딩
어텐션은 순열 불변이다. 추가 정보가 없으면 트랜스포머는 “고양이가 매트 위에 앉았다”와 “매트가 고양이 위에 앉았다”를 같은 방식으로 다룬다. 위치 인코딩은 토큰의 순서를 모델에 넣어 준다. 원 논문은 고정된 사인·코사인 위치 인코딩을 썼다.[1]
PE(pos, 2i) = \sin\left( pos / 10000^{2i/d_{\mathrm{model}}} \right)
PE(pos, 2i+1) = \cos\left( pos / 10000^{2i/d_{\mathrm{model}}} \right)위 식에서 pos는 위치, i는 임베딩 차원 인덱스이며, 이 인코딩은 첫 어텐션 계층 앞에서 토큰 임베딩에 더해진다.[2] 사인과 코사인은 고정된 어떤 k에 대해서도 PE(pos + k)가 PE(pos)의 선형 함수가 되도록 골랐으며, 저자들은 이것이 모델이 상대 오프셋을 배우는 데 도움이 될 수 있다고 주장했다.[1]
| 방식 | 연도 | 사용 모델 | 아이디어 |
|---|---|---|---|
| 사인 함수 | 2017년 | 원래의 트랜스포머 | 고정된 사인·코사인 값을 임베딩에 더함[1] |
| 학습된 절대 위치 | 2018년 | BERT, GPT-2 | 인덱스마다 학습 가능한 위치 벡터를 둠[1] |
| 상대 위치 | 2018년 | Transformer-XL, T5 | 상대 거리에 따라 어텐션 점수에 편향을 줌[1] |
| RoPE(회전 위치 임베딩, Rotary Position Embedding) | 2021년 | LLaMA, GPT-NeoX, PaLM, Mistral | Q와 K 벡터를 위치에 비례하는 각도만큼 회전시킴[1] |
| ALiBi(Attention with Linear Biases) | 2021년 | BLOOM, MPT | 헤드마다 어텐션 로짓에 선형 편향을 더함[1] |
| NoPE / iRoPE(RoPE 계층과 위치 인코딩 없는 계층을 교차 배치) | 2023-2025년 | Llama 4 | RoPE 계층과 위치 인코딩을 전혀 쓰지 않는 계층을 번갈아 배치함[1] |
RoPE는 Jianlin Su 등이 2021년 4월 RoFormer 논문에서 도입했다. 쿼리와 키 벡터를 위치에 따라 각도가 달라지는 회전 행렬로 회전시켜 절대 위치를 인코딩하며, 그 부수 효과로 회전된 두 벡터의 점곱은 상대 오프셋에만 의존한다.[12]
2022년 이후 학습된 대부분의 대규모 언어 모델에서 RoPE가 기본이 되었다. 상대 위치를 깔끔하게 인코딩하고, 특히 위치 보간, NTK-aware 스케일링, YaRN 같은 기법과 결합하면 학습 때 본 것보다 긴 컨텍스트로 외삽할 수 있기 때문이다.[1] RoPE는 LLaMA, LLaMA 2, LLaMA 3, Gemma, Mistral, Code Llama의 기본 위치 전략이다.[12]
ALiBi는 Press, Smith, Lewis(2021)가 제안했다. 거리에 따라 커지는 고정 선형 편향을 각 어텐션 점수에 더해 모델이 더 가까운 토큰에 치우치게 하며, 학습되는 매개변수 없이 길이 외삽을 지원한다.[1]
모든 계층에 명시적 위치 정보가 필요한지 묻는 새로운 연구 흐름도 있다. Meta의 Llama 4(2025년 4월)는 Meta가 iRoPE(“interleaved” RoPE)라 부르는 방식을 쓴다. 표준 RoPE 계층과, 위치 인코딩이 없고(NoPE) 전체 컨텍스트에 완전한 인과 마스크를 적용하는 주기적 계층을 번갈아 배치한다. RoPE 계층은 청크 어텐션으로 국소 구조를 맡고 NoPE 계층은 편향 없는 전역 도달 범위를 유지하는데, Meta는 이 배열 덕분에 Llama 4 Scout 모델이 매우 긴 컨텍스트 길이(최대 1,000만 토큰으로 내세움)를 갖게 되었다고 설명한다.[1]
디코더 전용 트랜스포머가 덧붙인 위치 신호 없이 인과 마스크만으로도 순서를 부분적으로 추론할 수 있다는 관찰 때문에, NoPE와 RoPE/NoPE 혼합 방식은 2025년과 2026년에 걸쳐 활발한 연구 분야가 되었다.[1]
8. 피드포워드·잔차·정규화 계층
어텐션 뒤에는 각 위치가 독립적으로 적용되는 피드포워드 블록을 통과한다.[1]
\mathrm{FFN}(x) = \phi( x W_1 + b_1 ) W_2 + b_2원 논문은 ReLU를 사이에 둔 2층 완전 연결 신경망을 썼고, 내부 차원은 모델 차원의 네 배였다.[2] 현대 변형은 거의 항상 ReLU를 더 매끄러운 활성화 함수로 바꾼다. BERT와 GPT-2는 GELU를, LLaMA와 PaLM, 그리고 현재 대부분의 오픈 모델은 SwiGLU 또는 GeGLU를 쓴다.[13] 피드포워드 계층이 모델 매개변수의 대부분을 차지하며, 대규모 언어 모델에서는 종종 60퍼센트를 넘는다.[1]
잔차 연결은 하위 계층의 입력을 출력에 더해 기울기 신호를 강하게 유지하고, 매우 깊은 네트워크가 성능 저하 없이 학습되게 한다. 층 정규화는 임베딩 차원에 걸쳐 활성화를 안정시킨다. 평균 빼기를 생략하고 제곱평균제곱근 재조정만 남긴 더 단순한 변형인 RMSNorm은 이제 LLaMA를 비롯한 상용 모델에서 흔하다.[1][13]
9. 디코더 전용 트랜스포머의 처리 과정
앞 절들은 구성 요소를 하나씩 설명했다. 이 절은 그 요소들을 순서대로 놓고, 문자열 입력 하나가 디코더 전용 스택을 거쳐 표본 추출된 다음 토큰이 되기까지 따라간다. 디코더 전용은 GPT와 LLaMA 계열, 그리고 운영 환경의 대부분의 대규모 언어 모델이 쓰는 구성이다. 배치 차원은 생략했으며, 실제 구현에서는 아래 모든 형태 앞에 배치 축이 하나 붙는다.[1]
기호는 앞에서 쓴 것에 이 설명에 필요한 몇 가지를 더한 것이다. 시퀀스의 토큰은 n개, 모델 차원은 d_model이다. 어텐션 헤드는 h개이고 쿼리·키의 차원은 d_k, 값의 차원은 d_v다(이 설명은 2017년 모델과 그 뒤 대부분의 모델처럼 d_v = d_k로 두며, h·d_k = d_model이다). 피드포워드 내부 차원은 d_ff, 스택은 블록 L개 깊이, 어휘는 토큰 V개다.[1]
2017년 기본 모델은 스택 두 개 각각에 L = 6 계층, d_model = 512, h = 8, d_k = d_v = 64, d_ff = 2048을 썼다.[2] Llama 3 8B는 L = 32 블록, d_model = 4096, 쿼리 헤드 h = 32개와 키-값 헤드 8개, 피드포워드 내부 차원 14,336, 어휘 128,000 토큰을 쓰며, 헤드 차원 d_k는 4096을 32로 나눈 128이다.[11]
프롬프트 “프랑스의 수도는”을 예로 든다. 단계 1~3은 한 번만 일어나고, 단계 4~13은 L개의 블록마다 반복되며, 단계 14~17은 마지막 활성화를 토큰으로 바꾼다.[1]
아래 형태는 세 투영이 모두 헤드 h개를 만드는 표준 멀티헤드 어텐션을 가정한다.[1] 그룹드 쿼리와 멀티쿼리 모델은 키와 값을 더 적은 수의 헤드 h_kv로 투영하므로, W^K와 W^V의 형태는 d_model × h_kv·d_k이고 단계 5~9의 키·값 텐서는 h_kv × n × d_k이며, 각각 h / h_kv개의 쿼리 헤드가 공유한다.[10][9] 위 Llama 3 8B 구성에서는 W^K와 W^V가 4096 × 4096이 아니라 4096 × 1024이고, 키·값 텐서는 8 × n × d_k, 쿼리 텐서는 그대로 32 × n × d_k다.[11]
| 단계 | 연산 | 입력 형태 | 출력 형태 |
|---|---|---|---|
| 1 | 토큰화: 문자열을 서브워드로 나누어 각각 정수 id에 대응 | 문자열 하나 | 0~V - 1 범위의 id n개[1] |
| 2 | 임베딩 조회: 임베딩 행렬 E(V × d_model)에서 행 n개를 모음. 2017년 모델은 이어서 sqrt(d_model)을 곱함 | id n개 | n × d_model[1] |
| 3 | 절대 위치 인코딩을 더함(2017년 사인 함수, GPT-2 학습 벡터). RoPE 모델은 건너뛰고 단계 6에서 회전시킴 | n × d_model | n × d_model[1] |
| 4 | 블록 ℓ, pre-norm: 각 행을 d_model 축으로 정규화하고, 정규화 전 행은 잔차용으로 따로 둠 | n × d_model | n × d_model[1] |
| 5 | W^Q, W^K, W^V(표준 멀티헤드 어텐션에서 각각 d_model × h·d_k)를 곱한 뒤, 마지막 축을 헤드 h개로 나누도록 reshape | n × d_model | h × n × d_k 텐서 3개[1] |
| 6 | RoPE를 쓰면 모든 쿼리·키의 각 좌표 쌍을 그 토큰의 위치로 정해지는 각도만큼 회전 | h × n × d_k | h × n × d_k[1] |
| 7 | 점수: 헤드별 QK^T(행렬 곱)를 sqrt(d_k)로 나눔 | h × n × d_k 2개 | h × n × n[1] |
| 8 | 인과 마스크: j ≤ i이면 0, j > i이면 -∞인 행렬을 항목 (i, j)에 더함(헤드 전체에 브로드캐스트) | h × n × n | h × n × n[1] |
| 9 | 행마다 소프트맥스를 적용한 뒤 값 텐서를 곱함(행렬 곱) | h × n × n | h × n × d_k[1] |
| 10 | 헤드를 한 축으로 다시 이어 붙이고 W^O(h·d_v × d_model)로 투영 | h × n × d_k | n × d_model[1] |
| 11 | 잔차 덧셈: 단계 4에서 따로 둔 텐서와 원소별 합 | n × d_model | n × d_model[1] |
| 12 | 다시 정규화한 뒤 피드포워드 블록: d_ff로 올려 투영, 활성화를 원소별로 적용, 다시 내려 투영 | n × d_model | n × d_model[1] |
| 13 | 잔차 덧셈 뒤 다음 블록을 위해 단계 4로 복귀. 모두 L번 | n × d_model | n × d_model[1] |
| 14 | 마지막 블록 뒤 최종 정규화 한 번 | n × d_model | n × d_model[1] |
| 15 | 언임베딩: W_U(d_model × V)와 행렬 곱 한 번. 가중치를 공유하면 W_U는 E^T | n × d_model | n × V 로짓[1] |
| 16 | 마지막 행만 남기고 온도로 나눈 뒤 어휘 전체에 소프트맥스 | 1 × V | 1 × V 확률[1] |
| 17 | 토큰 id를 표본 추출(또는 argmax)해 시퀀스에 덧붙이고, 토큰 n + 1개로 단계 1부터 다시 시작 | 1 × V | id 하나[1] |
9.1. 행렬 곱이 되는 단계
단계 5, 7, 9, 10, 12, 15가 행렬 곱이며, 산술 연산 거의 전부가 여기서 일어난다. 단계 3, 6, 8, 11, 13은 원소별 연산이다. 위치 덧셈, 회전, 마스크 덧셈, 두 번의 잔차 합은 형태를 그대로 두고 텐서를 한 번 훑는 비용만 든다. 단계 2는 곱셈이 아니라 모으기(gather)지만, 수학적으로는 n × V 원-핫 행렬에 E를 곱하는 것과 같다. 구현이 행을 인덱싱하는 것은 원-핫 방식이 같은 답을 내는 데 V배의 일을 하기 때문이다. 단계 9와 16의 소프트맥스는 한 축을 따른 리덕션 뒤에 원소별 나눗셈이 이어지는 연산이다.[1]
9.2. 정규화의 위치와 변천
2017년 논문은 정규화를 마지막에 하는데, 각 하위 계층의 출력이 LayerNorm(x + Sublayer(x))이므로 정규화가 잔차 흐름 위에 바로 놓이고, 원래의 학습 방법은 이 구성에 학습률 워밍업을 짝지었다.[2] 이것이 post-norm이다. GPT-2는 층 정규화를 각 하위 블록의 입력으로 옮기고 마지막 블록 뒤에 하나를 더 두었으며,[14] GPT-3은 이 변경을 이어받았다.[15] 이후 Xiong 등이 분석을 내놓았다. 초기화 시점에 post-norm 트랜스포머는 출력 계층 근처 매개변수에서 기대 기울기가 커서 큰 학습률이 학습을 불안정하게 만드는 반면, pre-norm 트랜스포머는 초기화 시점의 기울기가 안정적이어서 워밍업 단계를 아예 없앨 수 있다.[1]
위 단계 표는 운영 중인 디코더 전용 모델이 쓰는 pre-norm을 가정한다. 차이는 이 과정에서 드러난다. pre-norm에서는 단계 2에서 만든 텐서가 정규화되지 않은 채 단계 14까지 이어지고, 각 블록은 그 정규화된 사본을 읽어 정규화되지 않은 갱신을 다시 더한다. post-norm에는 이렇게 끊기지 않는 경로가 없는데, 단계 11 앞이 아니라 뒤에 정규화가 오기 때문이다.[1]
9.3. 현대 블록이 채우는 자리
2017년 블록과 2026년 블록 사이의 거리는 대부분 세 가지 대체로 설명되며, 그중 표의 형태를 바꾸는 것은 없다. 정규화는 보통 RMSNorm으로, 평균 빼기를 없애고 제곱평균제곱근만으로 재조정하는데, 재중심화 불변성은 없어도 된다는 주장에 따른 것이다. 위치 정보는 보통 모든 블록 안의 단계 6에서 적용하는 RoPE이며, 이 때문에 단계 3이 완전히 사라진다.[12] 피드포워드 블록은 보통 게이트 변형이다. SwiGLU는 입력을 병렬로 두 번 투영하고, 한쪽 사본을 Swish 활성화에 통과시킨 뒤 둘을 원소별로 곱하고 내려 투영한다. 가중치 행렬이 둘이 아니라 셋이므로, 매개변수 수와 연산량을 그대로 두려고 d_ff를 3분의 2로 줄인다.[1]
원래의 LLaMA 논문은 세 가지를 한꺼번에 채택하면서 각각의 출처를 밝혔다. RMSNorm을 쓴 사전 정규화, ReLU 대신 SwiGLU, 절대 위치 임베딩 대신 모든 계층의 회전 임베딩이다.[13] Qwen3 보고서도 2025년에 같은 조합을 열거한다.[16]
9.4. 인과 마스크
이 순전파를 양방향 인코더와 가르는 것은 단계 8뿐이다. Vaswani 등은 이를 스케일드 점곱 어텐션 안에서 “소프트맥스 입력에서 불법적인 연결에 해당하는 모든 값을 가려(-∞로 설정)” 구현하며, 디코더에서 이는 시퀀스에서 뒤에 있는 모든 위치를 뜻한다.[2] 음의 무한대의 지수는 0이므로 이 항목들의 가중치는 정확히 0이 되고, 따라서 어텐션 출력의 행 i는 위치 0부터 i까지의 값 벡터에 대한 가중 평균이며 그 밖의 것은 없다. 마스크가 없으면 행 i에 이미 예측하려는 토큰이 들어 있게 된다. 마스크가 있으면 단계 15에서 나오는 n개 행 각각이 자기 위치 다음에 오는 토큰에 대한 정당한 예측이 되고, 그래서 토큰 n개에 대한 한 번의 순전파가 하나가 아니라 n개의 학습 신호를 준다.[1]
9.5. 학습과 생성의 차이
학습에서는 시퀀스 전체를 미리 알고 있으므로 교사 강제(teacher forcing)가 정답 토큰을 입력으로 주고, 단계 15 로짓의 n개 행 모두를 한 위치 왼쪽으로 민 같은 시퀀스와 비교해 채점한다. 이 채점이 공정하도록 지키는 것이 인과 마스크다. 생성에서는 마지막 행만 필요하므로 단계 16과 17이 나머지 n - 1개 행을 버리고, 모델은 토큰 하나가 더 붙은 입력으로 다시 실행된다.[1]
매 단계 n × n 어텐션 전체를 다시 계산하면 바뀔 수 없는 일을 반복하게 되는데, 뒤에서 설명하는 KV 캐시가 이를 피한다. 단계 5의 키와 값을 보관하고, 새 단계는 행 하나만 투영하며, 단계 7은 n × n 행렬이 아니라 길이 n의 점수 벡터를 만든다.[1] 멀티쿼리·그룹드 쿼리 어텐션은 여러 쿼리 헤드가 키와 값 투영을 공유하게 해서 이 캐시가 담는 양을 줄이며, 그래서 Llama 3는 세 가지 크기 모두에서 쿼리 헤드 32개, 64개, 128개를 키-값 헤드 8개와만 짝짓는다.[11][9]
9.6. 마지막 단계: 선택
단계 15까지는 가중치와 입력이 정해지면 결정적이다. 단계 16의 샘플링 온도는 소프트맥스 전에 로짓을 나눈다. 1보다 크면 분포가 평평해지고 1보다 작으면 뾰족해지며, 0으로 가는 극한에서는 argmax를 그대로 취하는 탐욕 디코딩(greedy decoding)이 된다. 절단 샘플링(truncated sampling)은 어휘의 일부에서만 뽑도록 제한한다. top-k는 확률이 가장 높은 k개 토큰을 남기고, 누클리어스(nucleus) 샘플링, 곧 top-p 샘플링은 확률의 합이 p가 되는 가장 작은 집합을 남긴다. Holtzman 등은 우도를 디코딩 목표로 쓰면 우도가 학습 목표로 잘 작동하는 모델에서조차 “밋밋하고 이상할 정도로 반복적인 텍스트로 이어진다”는 것을 발견한 뒤 누클리어스 방법을 도입했다.[1]
10. 학습
시퀀스-투-시퀀스 번역에서 트랜스포머는 교사 강제로 학습된다. 시점 t의 디코더 입력은 모델 자신의 이전 예측이 아니라 시점 t의 정답 토큰이다. 교차 엔트로피 손실을 모델이 예측한 분포와 실제 다음 토큰 사이에서 계산해 위치 전체에 걸쳐 합산하고, 확률적 경사 하강법의 변형으로 최소화한다. 원 논문의 워밍업 후 감쇠 학습률 일정을 쓴 Adam 옵티마이저가 수년 동안 기본이 되었다.[2] 현대의 학습은 보통 AdamW와 코사인 감쇠, 0.1 안팎의 레이블 스무딩을 쓴다.[1]
언어 모델은 자기 지도 목표로 학습한다. 디코더 전용 모델은 다음 토큰을 예측한다. 인코더 전용 모델은 시퀀스의 나머지가 주어졌을 때 가려진 토큰을 예측한다.[1] T5 같은 인코더·디코더 모델은 스팬 손상(span corruption) 목표를 쓰는데, 연속된 토큰 구간을 센티널로 바꾸고 디코더가 이를 복원하도록 학습시킨다.[17]
10.1. 토큰화
텍스트는 모델에 들어가기 전에 서브워드 토큰으로 나뉜다. 대표적인 방식은 GPT와 대부분의 오픈 모델이 쓰는 바이트 페어 인코딩(Byte-Pair Encoding, BPE), BERT가 쓰는 WordPiece, 두 방식을 모두 지원하는 언어 독립 라이브러리 SentencePiece다. 어휘 크기는 보통 30,000개에서 200,000개 사이다.[1] LLaMA 3은 128,000 토큰의 어휘를 쓰는데, 이는 LLaMA 1과 LLaMA 2의 32,000 토큰에서 크게 늘린 것이며, Meta는 이것이 토큰당 효율과 후속 작업 품질에서 무시할 수 없는 개선을 가져왔다고 보고했다.[11]
11. 스케일링 법칙
손실이 데이터, 모델, 연산량에 따라 예측 가능하게 변한다는 가장 이른 실증적 증거는 2017년 Baidu Research의 Joel Hestness 등에게서 나왔다. 이들의 논문 「Deep Learning Scaling is Predictable, Empirically」는 기계 번역, 언어 모델링, 이미지 처리, 음성 인식 전반에서 일반화 오차가 거듭제곱 법칙으로 변한다는 것을 발견했고, 모델 크기가 데이터 크기에 대해 부선형으로 커진다고 지적했다.[1]
2020년 OpenAI의 Jared Kaplan 등이 「Scaling Laws for Neural Language Models」를 발표했다.[18] 이들은 테스트 손실이 모델 크기 N, 데이터셋 크기 D, 학습 연산량 C라는 세 양에 대한 거듭제곱 법칙으로 떨어진다는 것을 발견했다. 넓은 범위 안에서 깊이와 너비 같은 구조적 세부 사항은 총량보다 훨씬 덜 중요하다. 이 결과는 연산량을 쓰는 방법을 알려 주었다. 아주 큰 모델을 비교적 적은 데이터로 학습하고 수렴하기 훨씬 전에 멈추는 것이다.[1] 이 추론이 GPT-3의 설계에 영향을 주었는데, GPT-3은 약 3,000억 토큰으로 학습한 1,750억 개 매개변수를 썼다.[18][15]
2022년 DeepMind의 Jordan Hoffmann 등은 친칠라(Chinchilla) 논문으로 알려진 「Training Compute-Optimal Large Language Models」를 발표했다.[19] 7,000만~160억 개 매개변수의 모델 400개 넘게를 50억~5,000억 토큰으로 학습시켜 보니, 연산 예산이 고정되어 있을 때 모델 크기와 데이터셋 크기는 대략 같은 비율로 키워야 했다. 매개변수가 두 배가 될 때마다 학습 토큰도 두 배가 되어야 한다.[1] 이를 보이려고 1.4조 토큰으로 70B 매개변수 모델 Chinchilla를 학습시켰고, 이 모델은 훨씬 큰 Gopher(280B), GPT-3(175B), Jurassic-1(178B), Megatron-Turing NLG(530B)를 폭넓은 평가에서 앞섰다.[19]
친칠라 결과는 이 분야를 바꾸었다. LLaMA 1, LLaMA 2, LLaMA 3을 비롯해 2023년 이후 대부분의 오픈소스 공개 모델은 연산 최적이거나 오히려 데이터 비중이 더 큰 학습 비율을 썼다.[1] 특히 LLaMA 3은 15조 토큰 넘게로 사전 학습되어 8B와 70B 크기의 친칠라 최적 비율을 훨씬 넘어섰는데, 추가 데이터가 있으면 작은 모델이 연산 최적점을 지나서도 계속 좋아진다는 경험적 근거에 따른 것이다.[11]
12. 트랜스포머의 종류
트랜스포머는 원래 구조의 어느 절반을 남기느냐에 따라 크게 세 가지로 나뉜다.[1]
| 유형 | 예 | 주된 용도 | 사전 학습 목표 |
|---|---|---|---|
| 인코더 전용 | BERT, RoBERTa, ALBERT, DeBERTa, ELECTRA | 분류, 검색, 문장 임베딩 | 마스크 언어 모델링[1] |
| 디코더 전용 | GPT-2, GPT-3, GPT-4, LLaMA, Mistral, Claude, Qwen, Falcon | 텍스트 생성, 대화, 코드 | 다음 토큰 예측[1] |
| 인코더·디코더 | 원래의 트랜스포머, T5, BART, mT5, FLAN-T5 | 번역, 요약, 구조화된 생성 | 스팬 손상 또는 잡음 제거[1] |
12.1. 인코더 전용 모델
BERT(Bidirectional Encoder Representations from Transformers)는 2018년 Google의 Jacob Devlin 등이 소개했으며, 널리 채택된 첫 인코더 전용 트랜스포머였다.[20] BERT-Base는 12층, 은닉 차원 768, 헤드 12개, 매개변수 1억 1,000만 개다. BERT-Large는 24층, 은닉 차원 1024, 헤드 16개, 매개변수 3억 4,000만 개다.[20] 무작위로 가려진 토큰 15퍼센트를 예측하는 마스크 언어 모델링과 다음 문장 예측으로 사전 학습되었다. BERT는 GLUE 벤치마크를 80.5로, SQuAD v1.1 F1을 93.2로 끌어올렸고 2019년 10월부터 Google 검색에 적용되었다.[1]
RoBERTa(Facebook AI, 2019)는 BERT가 학습이 덜 된 상태였음을 보였고, 다음 문장 예측을 없애고 더 많은 데이터로 더 오래 학습해 점수를 높였다. DeBERTa는 내용과 위치에 대한 분리된 어텐션을 더했고, ELECTRA는 마스크 토큰 목표를 대체 토큰 탐지로 바꾸었다.[1]
12.2. 디코더 전용 모델
최초의 GPT는 2018년 OpenAI의 Alec Radford, Karthik Narasimhan, Tim Salimans, Ilya Sutskever가 「Improving Language Understanding by Generative Pre-Training」에서 발표했으며, 은닉 차원 768, 어텐션 헤드 12개, 피드포워드 내부 차원 3072, 매개변수 약 1억 1,700만 개의 12층 디코더 전용 트랜스포머였다.[21] BookCorpus로 사전 학습한 뒤 하위 작업마다 판별적으로 미세 조정했다.[1]
GPT-2(2019)는 이를 15억 개 매개변수로 키웠고, Reddit 게시물에서 카르마 3 이상으로 링크된 웹페이지 800만 개로 이루어진 40GB 말뭉치 WebText로 학습되었다.[14] GPT-2는 하나의 모델이 여러 작업을 제로샷으로 수행할 수 있음을 보였다. GPT-3(2020)은 1,750억 개 매개변수에 이르러 퓨샷 학습을 보였고, 학습에 추정 3.14 × 10^23 FLOPs가 필요했다.[15] GPT-4와 이후 모델은 같은 디코더 전용 청사진을 따르면서 전문가 혼합, 더 긴 컨텍스트 창, 멀티모달 입력을 얹었다.[1]
2023년 이후 공개된 공개 가중치 대규모 언어 모델 대부분도 디코더 전용 트랜스포머를 쓴다. LLaMA, LLaMA 2, LLaMA 3, Mistral, Mixtral, Qwen, Yi, Falcon, DeepSeek, Gemma는 모두 정규화, 위치 인코딩, 어텐션 헤드, 피드포워드 활성화 함수에서 조금씩 다를 뿐 같은 방식을 따른다.[1]
12.3. 인코더·디코더 모델
T5(Text-to-Text Transfer Transformer)는 2019년 Google이 공개했으며, 모든 NLP 작업을 텍스트 입력·텍스트 출력으로 틀 짓고 원래의 인코더·디코더 구조를 C4 말뭉치에서 스팬 손상 목표로 사전 학습했다.[17] BART는 2019년 Facebook AI에서 나왔으며 비슷한 구조에 더 일반적인 잡음 제거 오토인코더 목표를 쓰고 요약에서 뛰어났다.[22] mT5와 FLAN-T5는 이 방식을 더 많은 언어와 지시 튜닝(instruction tuning)으로 확장했다.[1]
12.4. 긴 컨텍스트 트랜스포머
기본 트랜스포머에 들어가는 수천 토큰보다 긴 시퀀스를 다루려고 여러 변형이 등장했다.[1] Transformer-XL(Dai 등, 2019)은 이전 구간의 은닉 상태를 캐시해 재사용하는 구간 수준 순환을 도입해 어텐션이 구간 경계를 넘어 닿게 했다.[23] 저자들은 Transformer-XL이 RNN보다 80퍼센트, 기본 트랜스포머보다 450퍼센트 더 긴 의존성을 포착하고 평가 때 기본 트랜스포머보다 최대 1,800배 빠르다고 보고했다.[23]
최전선 규모의 긴 컨텍스트 추론 실행에서 Gemini 1.5 Pro(Google DeepMind, 2024)는 희소 전문가 혼합 구조를 쓰고 출시 때 컨텍스트 창 100만 토큰을 지원했으며 이후 프로덕션에서 200만 토큰으로 늘렸다. 건초더미 속 바늘 찾기 검색 시험에서 최대 100만 토큰까지 거의 완벽한 재현율(99.7퍼센트 이상)을 보였고, 컨텍스트를 텍스트 1,000만, 오디오 970만, 영상 990만 토큰까지 늘려도 쓸 만한 성능을 냈다.[24] Claude와 GPT-4도 2024년과 2025년에 걸쳐 컨텍스트 길이를 수십만 토큰까지 늘렸다.[1]
12.5. 비전과 멀티모달
Vision Transformer(ViT)는 Google Research의 Alexey Dosovitskiy 등이 2020년 논문 「An Image Is Worth 16x16 Words」에서 소개했으며, 이미지를 고정 크기 패치의 시퀀스로 다룬다.[3] 표준 ViT는 224 × 224 이미지를 16 × 16 픽셀 패치 14 × 14개로 나누고, 각 패치를 임베딩으로 투영하고, 학습 가능한 [CLS] 토큰을 앞에 붙이고, 위치 임베딩을 더한 뒤, 결과를 표준 트랜스포머 인코더 계층 스택에 통과시킨다.[1] 충분한 사전 학습 데이터가 있으면 ViT는 ImageNet 분류에서 최고의 합성곱 신경망과 맞먹거나 능가했다.[3]
변형이 빠르게 뒤따랐다. DeiT는 증류를 써서 ImageNet-1k만으로 ViT를 학습할 수 있게 했다.[1] Swin Transformer(Liu 등, 2021)는 이동 윈도 어텐션을 더해 계층적이고 CNN과 비슷한 귀납 편향을 주었고, ICCV 2021 Marr Prize를 받았으며 ImageNet-1K에서 top-1 정확도 87.3, COCO에서 박스 AP 58.7에 도달했다.[25] DETR은 객체 탐지에 트랜스포머 인코더·디코더를 썼다.[4]
멀티모달 모델은 모달리티에 걸쳐 트랜스포머를 짝짓는다. CLIP(OpenAI, 2021)은 텍스트 트랜스포머와 이미지 트랜스포머를 4억 개의 이미지-텍스트 쌍에서 대조 목표로 함께 학습한다.[26] Flamingo(DeepMind, 2022)는 시각과 언어 토큰을 교차시켜 배열해 퓨샷 시각 질의응답을 한다. 현대의 최전선 모델(GPT-4o, Gemini, Claude 3)은 텍스트와 함께 이미지, 오디오, 영상을 토큰 스트림으로 받는다.[1]
12.6. 오디오 트랜스포머
Whisper는 2022년 9월 OpenAI가 공개했으며, 웹에서 수집한 다국어·다중 작업 지도 오디오 68만 시간으로 학습한 인코더·디코더 트랜스포머다.[5] 입력 오디오는 30초 단위로 나뉘어 로그 멜 스펙트로그램으로 바뀐 뒤, 시간축을 따라 다운샘플링하는 1차원 합성곱 계층 두 개를 거쳐 트랜스포머 인코더로 들어간다. 디코더는 작업(전사, 번역, 음성 활동 탐지, 언어 식별)을 지정하는 특수 토큰을 조건으로 받으므로, 하나의 가중치 집합이 여러 음성 작업을 처리한다.[1] large-v3 모델은 인코더 32층, 모델 차원 1280, 어텐션 헤드 20개다.[5]
그 전에 wav2vec 2.0(Baevski 등, Meta AI, 2020)은 음성 표현을 위한 자기 지도 대조 목표를 도입해, 오디오의 잠재 표현 일부를 가리고 가려진 내용을 식별하도록 학습했다.[27] LibriSpeech의 레이블 데이터를 모두 쓰면 clean/other 테스트 세트에서 WER 1.8/3.3을 달성하고, 레이블 데이터 10분과 레이블 없는 오디오 53,000시간으로 사전 학습만 해도 WER 4.8/8.2에 도달한다.[27] AudioLM과 MusicLM은 트랜스포머를 오디오 생성으로 확장했고, 음성 인식 계보는 Whisper에서 정점을 이루었다.[1]
12.7. 생물학·화학 트랜스포머
DeepMind의 AlphaFold 2(Jumper 등, 2021)는 다중 서열 정렬을 잔기-잔기 쌍 표현과 통합하는 깊은 어텐션 기반 모듈인 Evoformer와, 3차원 점 구름용으로 특별히 설계된 Invariant Point Attention을 포함한 구조 모듈을 썼다.[6] AlphaFold 2는 CASP14 단백질 구조 예측 대회에서 큰 차이로 우승했고, 단일 도메인 단백질 접힘 문제를 상당 부분 해결한 것으로 널리 인정받는다. AlphaFold 3(2024)는 Evoformer를 Pairformer로 바꾸고 확산 기반 구조 디코더를 더해 단백질-단백질 및 단백질-리간드 복합체까지 다룬다.[1]
Meta의 Evolutionary Scale Modeling(ESM) 계열은 마스크 언어 모델링 목표로 수억 개의 아미노산 서열을 학습한 단백질 언어 모델을 만들었다. ESMFold(Lin 등, 2022)는 ESM-2를 백본으로 써서 AlphaFold가 의존하는 다중 서열 정렬 없이 서열 하나로 구조를 예측했다. Alexander Rives를 비롯한 전 Meta 연구자들이 세운 EvolutionaryScale은 2024년 6월 서열, 구조, 기능을 함께 추론하는 생성 모델 ESM3를 공개했다.[1]
12.8. 확산 트랜스포머
확산 트랜스포머(Diffusion Transformer, DiT)는 UC Berkeley의 William Peebles와 NYU의 Saining Xie가 ICCV 2023에서 소개했으며, 잠재 확산 모델의 U-Net 백본을 확산 잠재의 패치에 작동하는 트랜스포머로 바꾸었다.[7] DiT는 시간 단계와 클래스 레이블을 임베딩으로 받고 적응형 층 정규화(adaLN)로 조건을 주입한다.[1] 가장 큰 DiT-XL/2는 클래스 조건부 ImageNet 256x256에서 Frechet inception distance(FID) 2.27을 달성해 당시 최고 수준이었고, 모델의 학습 연산량(Gflops)이 늘수록 FID가 계속 떨어졌다.[7]
DiT는 Stable Diffusion 3, Stable Diffusion 3.5, FLUX.1, OpenAI의 Sora 텍스트-영상 모델을 비롯한 2024~2025년의 많은 생성 시스템의 기반이 되었다. Sora 자체는 영상을 시공간 패치 시퀀스로 다루며, 입력 해상도나 길이를 제한하지 않는 트랜스포머 기반 잡음 제거기에 통과시킨다.[28]
12.9. 강화 학습 트랜스포머
Decision Transformer는 UC Berkeley와 Facebook AI Research의 Lili Chen, Kevin Lu 등이 2021년 6월 소개했으며, 오프라인 강화 학습을 시퀀스 모델링 문제로 바꾸었다.[29] 인과 트랜스포머를 원하는 수익, 과거 상태, 과거 행동에 조건화하면, 모델은 가치 함수나 정책 경사 장치 없이도 목표 수익을 달성하는 미래 행동을 생성할 수 있다. Atari, OpenAI Gym, Key-to-Door 과제에서 최신 오프라인 RL 기준선과 맞먹거나 능가한다.[29] DeepMind의 Gato(2022)는 모든 모달리티를 공유 시퀀스로 토큰화해, 12억 개 매개변수의 트랜스포머 하나로 Atari를 하고, 이미지에 캡션을 달고, 대화하고, 로봇 팔을 제어하도록 학습했다. Robotics Transformer(RT-1, RT-2)는 같은 아이디어를 물리적 조작으로 확장했다.[1]
12.10. 전문가 혼합 트랜스포머
전문가 혼합(MoE)은 일부 트랜스포머 계층의 밀집 피드포워드 블록을 전문가 하위 네트워크로 이루어진 희소 계층과, 각 토큰을 보통 하나나 둘인 소수의 전문가에게 보내는 학습된 라우터로 바꾼다. 이는 전체 매개변수 수와 토큰당 연산량을 분리한다.[1] 최초의 대규모 MoE 트랜스포머는 GShard(Lepikhin 등, Google, 2020)였으며, 다국어 신경 기계 번역 트랜스포머를 전문가 2048개에 걸쳐 6,000억 개 매개변수로 키우고 TPU v3 칩 2048개로 4일 만에 효율적으로 학습해, 100개 언어-영어 번역에서 밀집 기준선을 앞섰다.[30] Switch Transformer(Fedus 등, Google, 2021)는 라우터가 최상위 전문가 하나만 고르도록 단순화해 1.6조 개 매개변수까지 키웠고, 같은 연산 자원에서 밀집 T5 기준선보다 최대 7배 빠른 사전 학습을 보였다.[31]
Mixtral 8x7B(Mistral AI, 2023년 12월)는 영향력 있는 공개 가중치 MoE였다. 각 계층이 토큰을 피드포워드 전문가 여덟 개 중 둘에게 보내며, 전체 매개변수 470억 개 가운데 토큰당 130억 개가 활성화되고, 대부분의 벤치마크에서 LLaMA 2 70B와 GPT-3.5를 맞먹거나 앞섰다.[32] DeepSeek V3(2024년 12월)는 전체 매개변수 6,710억 개, 토큰당 활성 370억 개로 공개 MoE를 더 밀어붙였고, 라우팅 전문가 256개와 공유 전문가 1개(토큰당 라우팅 8개와 공유 1개 활성화), Multi-head Latent Attention, FP8 혼합 정밀도 학습을 썼다.[33] Google의 Gemini 1.5 시리즈, (제3자 보고에 따르면) OpenAI의 GPT-4, 그 밖의 최전선 모델도 같은 연산 대 품질의 절충을 위해 MoE를 채택했다.[1]
2025년에 이르러 DeepSeek이 개척한 세분화된 소형 전문가 다수 방식이 공개 가중치 최전선 모델의 기본이 되었다. Meta의 Llama 4(2025년 4월)는 전문가 혼합으로 만든 첫 Llama 세대였고, Scout와 Maverick 모델은 각각 훨씬 큰 전체 매개변수 가운데 토큰당 170억 개를 활성화한다(Maverick은 전문가 128개로 라우팅한다). Alibaba의 Qwen3 계열(기술 보고서 2025년 5월)은 6억~2,350억 개 매개변수의 밀집·MoE 모델을 아우르며, 주력 모델 Qwen3-235B-A22B는 94개 계층에서 토큰마다 전문가 128개 중 8개로 라우팅해 2,350억 개 매개변수 중 220억 개를 활성화한다.[16] 전체 매개변수는 수천억 개인데 토큰당 활성 매개변수는 수백억 개에 그치는 이 패턴은 이제 DeepSeek, Qwen, Llama, 비공개 최전선 시스템 전반의 표준이다.[1]
12.11. 효율적인 어텐션 변형
표준 어텐션은 시퀀스 길이 n에 대해 시간·메모리 복잡도가 O(n^2)이어서 긴 컨텍스트에서 병목이 된다. 이 비용을 줄이려는 연구가 여러 갈래로 이어졌다.[1]
| 방법 | 연도 | 접근 |
|---|---|---|
| Sparse Transformer | 2019년 | 고정된 희소 패턴(스트라이드형, 고정형 분해)으로 어텐션을 제한[1] |
| Reformer | 2020년 | 지역성 민감 해싱으로 비슷한 쿼리·키를 묶고 가역 잔차로 메모리를 줄임[1] |
| Linformer | 2020년 | 키와 값을 고정된 낮은 차원으로 투영[1] |
| Longformer | 2020년 | 지역 슬라이딩 윈도 어텐션과 소수의 전역 토큰을 결합[1] |
| Performer | 2020년 | 소프트맥스 어텐션을 무작위 특성 커널로 근사[1] |
| BigBird | 2020년 | 무작위 + 지역 + 전역 어텐션 패턴[1] |
| FlashAttention | 2022년 | GPU 메모리 입출력을 최소화하도록 정확한 어텐션의 계산 순서를 바꿈[1] |
| FlashAttention-2 | 2023년 | 스레드 블록과 워프에 걸친 병렬성·작업 분할 개선[1] |
| FlashAttention-3 | 2024년 | Hopper 텐서 코어의 비동기 처리, FP8 지원[1] |
| FlashAttention-4 | 2026년 | NVIDIA Blackwell(B200/GB200)에 맞춘 알고리즘·커널 공동 설계[1] |
| Native Sparse Attention(NSA) | 2025년 | 하드웨어에 맞춘, 처음부터 학습 가능한 계층적 희소 어텐션[1] |
| DeepSeek Sparse Attention(DSA) | 2025년 | 라이트닝 인덱서를 쓰는 선형에 가까운 장문맥 어텐션[1] |
Sparse Transformer(OpenAI의 Child, Gray, Radford, Sutskever, 2019)는 비용을 O(n^2)에서 O(n√n)으로 줄이는 분해된 어텐션 패턴을 도입했고, 수만 토큰 길이의 시퀀스를 모델링하면서 CIFAR-10, Enwik8, ImageNet 64의 밀도 추정에서 최고 성능을 냈다. Reformer(Kitaev, Kaiser, Levskaya, 2020)는 지역성 민감 해싱으로 비슷한 쿼리와 키를 버킷에 묶어 어텐션을 O(L log L)로 줄이고 가역 잔차 계층과 짝지었으며, 저자들은 16GB 가속기 하나에서 최대 100만 토큰의 컨텍스트 창을 시연했다.[1]
Longformer(AI2의 Beltagy, Peters, Cohan, 2020)는 슬라이딩 윈도, 확장 슬라이딩 윈도, 작업별 전역 어텐션을 결합했다. Linformer(Facebook의 Wang 등, 2020)는 키와 값의 길이를 고정된 차원으로 줄여 투영했다. Performer(Google의 Choromanski 등, 2020)는 소프트맥스 커널을 양의 직교 무작위 특성으로 근사했다. BigBird(Google의 Zaheer 등, 2020)는 무작위, 윈도, 전역 어텐션을 결합하고 그 희소 어텐션이 범용 근사기이자 튜링 완전임을 증명했으며, 같은 하드웨어에서 전체 어텐션보다 최대 8배 긴 시퀀스를 지원했다.[1]
FlashAttention은 2022년 Stanford의 Tri Dao 등이 내놓았으며, 이런 효율화 기법 중 가장 널리 채택되었고 다른 기법과 달리 근사가 아니라 정확한 소프트맥스 어텐션을 계산한다. 계산을 빠른 온칩 SRAM에 들어가는 타일로 재구성해 GPU 고대역폭 메모리의 읽기·쓰기를 줄인다.[34] FlashAttention은 이제 PyTorch, JAX, 대부분의 추론 실행 프레임워크의 기본 어텐션 커널이다.[1]
FlashAttention-2(Dao, 2023년 7월)는 스레드 블록과 워프 사이의 병렬성과 분할을 다시 짜서 A100 GPU에서 이론적 최대 FLOPs의 50~73퍼센트에 도달했고, GPT 방식 학습에서는 종단 간 최대 225 TFLOPs/s(모델 FLOPs 활용률 72퍼센트)를 냈다.[35] FlashAttention-3(Shah 등, 2024년 7월)는 비동기 텐서 코어 스케줄링, 워프 특화, 행렬 곱과 소프트맥스의 교차 실행, FP8 블록 양자화로 NVIDIA Hopper H100 GPU를 겨냥한다.[1] FP16에서 약 740 TFLOPs/s(H100 최대치의 75퍼센트), FP8에서 1.2 PFLOPs/s에 가깝게 도달하면서 FP8 수치 오차는 기준 FP8 어텐션보다 2.6배 작다.[36]
FlashAttention-4(Zadouri, Hoehnerbach, Shah, Liu, Thakkar, Dao)는 2025년 8월 Hot Chips에서 처음 발표되고 2026년 3월 arXiv에 올라왔으며, 텐서 코어 처리량은 대략 두 배가 된 반면 공유 메모리 대역폭과 특수 함수(지수) 유닛은 그렇지 못한 NVIDIA Blackwell GPU(B200과 GB200)로 커널을 다시 겨냥한다. 빠른 텐서 코어를 놀리지 않으려고 FA4는 소프트맥스 지수 함수를 범용 연산 유닛에서 다항식으로 흉내 내고, 실행 중 최댓값이 수치 안정성을 위협할 만큼 바뀌지 않는 한 온라인 소프트맥스 재조정 단계를 건너뛰며, NVIDIA의 CuTe-DSL로 작성되었다. BF16에서 최대 약 1,613 TFLOPs/s(활용률 71퍼센트)에 도달하며, B200에서 NVIDIA 자체의 cuDNN 9.13 어텐션보다 최대 1.3배, Triton 기준선보다 2.7배 빠르다.[1]
2025~2026년에는 근사적인 희소 어텐션을 되살린 별개의 흐름이 나타났는데, 이번에는 사전 학습 뒤에 덧붙이는 것이 아니라 하드웨어와 함께 설계해 끝에서 끝까지 학습한다.[1] DeepSeek의 Native Sparse Attention(NSA)은 Jingyang Yuan 등(DeepSeek 창립자 Wenfeng Liang 포함)이 내놓았고 ACL 2025 최우수 논문상을 받았으며, 동적인 계층 전략으로 굵은 단위의 토큰 압축과 세밀한 단위의 토큰 선택을 결합한다. 학습 중에도 희소성이 있으므로 모델은 전체 어텐션의 품질을 유지하거나 넘어서면서 64,000 토큰 시퀀스의 디코딩, 순전파, 역전파에서 상당히 빠르게 실행된다.[37]
DeepSeek은 이 아이디어를 DeepSeek-V3.2의 DeepSeek Sparse Attention(DSA)으로 운영 모델에 옮겼다(DeepSeek-V3.2-Exp 체크포인트는 2025년 9월 29일 공개되었고 전체 기술 보고서는 2025년 12월에 나왔다).[1] DSA는 가벼운 “라이트닝 인덱서(lightning indexer)”로 각 쿼리가 어텐션을 걸 과거 토큰을 고르므로 컨텍스트 길이 L에 대해 선형에 가까운 O(kL) 비용이 들며, 같은 6,710억 개 매개변수 전문가 혼합 백본(활성 매개변수 370억 개)에서 품질을 대체로 유지하면서 보고된 긴 컨텍스트 API 가격을 밀집 DeepSeek-V3.1 모델 대비 대략 절반으로 줄였다.[38]
KV 캐시는 자기회귀 디코딩 중에 쓰는 보완적 기법이다. 토큰을 한 번 처리하면 그 키와 값 벡터는 바뀌지 않으므로, 저장해 두었다가 이후 모든 단계에서 재사용한다. 그 덕분에 단계당 추론 실행 비용이 시퀀스 길이에 대해 이차에서 선형으로 줄지만, 컨텍스트 길이 × 헤드 수 × 키 차원에 비례하는 메모리가 든다. 멀티쿼리·그룹드 쿼리 어텐션이 특히 겨냥하는 것이 이 캐시의 크기다.[1]
시퀀스가 가속기 하나에 더는 들어가지 않을 때, Ring Attention(UC Berkeley의 Liu, Zaharia, Abbeel, 2023년 10월)은 키와 값 블록을 개념상의 장치 고리를 따라 분산시키고 장치 간 통신을 장치 내 계산과 겹쳐, 컨텍스트 길이를 장치 수에 비례해 늘리며 수백만 토큰을 지원한다.[1]
13. 활용 분야
트랜스포머는 이제 시퀀스나 집합을 다루는 거의 모든 분야의 기본 구조다.[1]
- 자연어 처리: 기계 번역, 요약, 질의응답, 개체명 인식, 감성 분석, 대화 시스템, 코드 생성, 검색 증강 생성.
- 컴퓨터 비전: 이미지 분류(Vision Transformer, Swin Transformer), 객체 탐지(DETR, DINO), 분할(Mask2Former, SAM), 깊이 추정, 영상 이해.
- 음성·오디오: 음성 인식의 Whisper, 오디오 생성의 AudioLM과 MusicLM, 자기 지도 음성 표현의 wav2vec 2.0.
- 생물학·화학: AlphaFold 2와 AlphaFold 3는 어텐션 기반 모듈(Evoformer와 Pairformer)로 서열에서 단백질 구조를 예측한다. ESM3, ProGen 등 단백질 언어 모델은 아미노산 서열로 학습한 트랜스포머를 쓴다.[6]
- 이미지·영상 생성: Diffusion Transformer 백본이 Stable Diffusion 3, FLUX.1, OpenAI의 Sora 텍스트-영상 모델을 구동한다.[7][28]
- 코드: Codex, AlphaCode, Code Llama, StarCoder, DeepSeek-Coder는 소스 코드로 미세 조정되었거나 사전 학습된 디코더 전용 트랜스포머다.[1]
- 강화 학습과 로보틱스: Decision Transformer, Gato, Robotics Transformer는 궤적을 토큰 시퀀스로 다룬다.[29]
14. 도입 연혁과 규모 확대
- 2017년: 원 논문이 발표되었고, 대형 트랜스포머가 WMT 2014 영어-독일어에서 28.4 BLEU에 도달했다.[2]
- 2018년: BERT-Large(3억 4,000만 개 매개변수)가 GLUE, SQuAD를 비롯한 많은 NLP 벤치마크에서 새 최고 기록을 세웠다.[20] OpenAI가 최초의 GPT(1억 1,700만 개 매개변수)를 공개했다.[21]
- 2019년: GPT-2(15억 개 매개변수)가 제로샷 능력을 보였다.[14] T5(110억 개 매개변수)와 BART가 인코더·디코더 방식을 굳혔다.[17][22] Transformer-XL이 더 긴 컨텍스트로 확장했다.[23]
- 2020년: GPT-3(1,750억 개 매개변수)가 퓨샷 인컨텍스트 학습을 보였고 학습 연산 비용은 추정 수백만 달러였다.[15] Vision Transformer(ViT)가 이 구조를 이미지 분류로 가져왔다.[3] 여러 효율적 어텐션 변형이 공개되었다. GShard가 번역용 MoE를 6,000억 개 매개변수로 키웠다.[30] 음성용 wav2vec 2.0이 나왔다.[27]
- 2021년: Switch Transformer가 1.6조 개 매개변수에 이르렀다.[31] RoPE가 발표되었다.[12] DALL-E 1과 CLIP이 텍스트-이미지 짝짓기를 보였다.[26] Swin Transformer가 ICCV Marr Prize를 받았다.[25] AlphaFold 2가 발표되었다.[6] Decision Transformer가 발표되었다.[29]
- 2022년: PaLM(540B)이 TPU v4 칩 6144개로 규모에서의 창발 능력을 보였다. Chinchilla 논문이 스케일링 법칙을 다시 짰다.[19] FlashAttention이 공개되었다.[34] ChatGPT(GPT-3.5 기반)가 11월에 공개되어 두 달 만에 사용자 1억 명에 이르렀다. Whisper가 오픈소스로 공개되었다.[5]
- 2023년: GPT-4, LLaMA 1과 2, Mistral 7B, Claude 1과 2가 공개되었다. FlashAttention-2가 학습 처리량을 두 배로 늘렸다.[35] DiT가 이미지 생성용 확산-트랜스포머 스케일링 법칙을 세웠다.[7] Mamba 상태 공간 모델이 대안 후보로 부상했다. Mistral AI가 12월 Mixtral 8x7B를 공개했다.[32]
- 2024년: Mixtral 8x22B가 나왔다. LLaMA 3(8B, 70B, 405B)이 H100 GPU 16,000개로 15조 개 이상의 토큰을 학습했다.[11] Gemini 1.5가 200만 토큰 컨텍스트에 이르렀다.[24] Hopper용 FlashAttention-3가 나왔다.[36] DeepSeek V3(6,710억 개 매개변수 MoE)가 나왔다.[33] Sora가 12월에 공개 출시되었다.[28] AlphaFold 3가 단백질, 리간드, 핵산 복합체용으로 공개되었다.
- 2025년: MiniMax-01이 4,560억 개 매개변수에 400만 토큰 컨텍스트의 대부분 선형 어텐션 모델을 내놓았다.[39] DeepSeek의 Native Sparse Attention이 ACL 2025 최우수 논문상을 받았다.[37] Meta의 Llama 4가 iRoPE(RoPE 계층과 위치 인코딩 없는 계층의 교차)를 도입하고 Llama 계열을 전문가 혼합으로 옮겼다. Qwen3가 최대 2,350억 개 매개변수의 밀집·MoE 모델을 아우른다.[16] Kimi Linear(Kimi Delta Attention)와 DeepSeek-V3.2(DeepSeek Sparse Attention)가 실전 규모 모델에서 선형 또는 희소 어텐션을 섞은 혼합형을 보였다.[38][40]
- 2026년: FlashAttention-4가 정확한 어텐션을 NVIDIA Blackwell GPU로 겨냥했다. Mamba-3가 순수 상태 공간 설계를 다듬어 ICLR 2026에서 발표되었다. 최전선 모델은 수만~수십만 개 GPU로 학습하며, 학습 1회당 비용이 수억 달러에서 10억 달러가 넘는 것으로 추정된다. MoE는 최전선 전반의 표준이 되었고, 가장 강한 효율 지향 시스템은 소수의 전체 어텐션 계층을 유지하는 혼합형이다. 긴 컨텍스트 기법(Ring Attention, 네이티브·동적 희소 어텐션, 슬라이딩 윈도와 전체 어텐션 계층의 혼합)은 일상적으로 수백만 토큰을 겨냥한다.[1]
15. 한계와 비판
15.1. 이차 어텐션 비용
셀프 어텐션의 비용이 시퀀스 길이에 대해 커지는 것이 가장 뚜렷한 약점이다. FlashAttention과 KV 캐시를 써도 아주 긴 컨텍스트(수십만~수백만 토큰)에는 Ring Attention, 슬라이딩 윈도 어텐션, 희소 어텐션, 상태 공간 혼합형 같은 특별한 기법이 필요하다.[34] 2019~2021년의 효율적 어텐션 논문 다수는 이론상 선형 또는 준이차 대안을 약속했지만, 실제로는 메모리 계층을 최적화한 FlashAttention의 정확한 O(n^2) 커널이 수만 토큰 미만의 시퀀스에서 대부분을 앞섰고, 그래서 근사 방법이 여전히 경쟁력을 갖는 곳은 긴 컨텍스트 영역이 주가 되었다.[1]
2025~2026년에는 상황이 바뀌었다. 희소·선형 어텐션이 끝에서 끝까지 학습하고 하드웨어와 함께 설계된 형태(Native Sparse Attention, DeepSeek Sparse Attention, 라이트닝 어텐션, Kimi Delta Attention)로 돌아와, 앞선 사후 덧붙이기 방식이 잃었던 품질 대부분을 되찾으면서 그것들이 약속했던 긴 컨텍스트 속도 향상을 실현했다.[37][38][39][40]
15.2. 환각
자기회귀 트랜스포머는 자신 있지만 틀린 진술을 만들 수 있으며, 이 현상을 보통 환각이라 부른다. 모델은 사실을 검증하도록이 아니라 가장 그럴듯한 다음 토큰을 예측하도록 학습된다. 검색 증강 생성, 인간 피드백 강화 학습, 도구 사용, 명시적인 사고의 연쇄가 완화책이지만, 현재 환각을 없애는 기법은 없다.[1]
15.3. 학습 비용과 역량 집중
대형 트랜스포머는 학습 비용이 크다. GPT-3(1,750억 개 매개변수)은 연산 비용만 수백만 달러가 들었다고 알려져 있다.[15] PaLM 540B는 TPU v4 칩 6144개로 학습되었다. LLaMA 3 405B는 Meta의 모델 카드에 따르면 H100 GPU 16,000개와 약 3,084만 H100 GPU 시간의 학습 연산을 썼다.[11] 2025~2026년의 최전선 모델은 학습 1회당 수억 달러에서 10억 달러가 넘게 드는 것으로 추정된다. 필요한 하드웨어(수만 개의 고성능 GPU 또는 TPU)는 소수의 기업과 연구소에 집중되어 있다.[1]
15.4. 에너지와 환경 영향
Strubell, Ganesh, McCallum(ACL 2019)은 신경 구조 탐색을 쓴 대형 NLP 트랜스포머 하나를 학습시키면 이산화탄소 환산 약 626,000파운드(약 284톤)를 배출할 수 있다고 추정했는데, 이는 미국 평균 자동차 다섯 대의 수명 전체 배출량에 비견된다. 이들은 학습 연산량과 배출량을 투명하게 공개해야 한다고 주장했다. 이후 이 분야는 학습 효율(연산 최적 스케일링, MoE, FP8, FlashAttention) 쪽으로 옮겨 갔고 최대 모델 제공자들은 이제 부분적으로 재생 전력으로 운영되지만, 최전선 학습의 절대 규모는 계속 커지고 있다.[1]
15.5. 해석 가능성
연구자는 어텐션 가중치를 시각화하고 개별 뉴런을 탐침할 수 있지만, 700억 개 매개변수 모델이 왜 특정 출력을 내는지 이해하는 것은 대체로 미해결 문제이며 기계적 해석 가능성 연구 프로그램의 핵심 관심사다. 특히 어텐션 가중치는 종종 오해를 부른다. 헤드가 어떤 위치에 어텐션을 거는지는 보여 주지만, 헤드가 어떤 계산을 하는지는 보여 주지 않는다.[1]
15.6. 그 밖의 실패 양상
트랜스포머는 프롬프트 표현에 취약할 수 있고, 반복 루프에 빠지며, 학습에서 본 것보다 긴 길이의 산술과 기호 조작에 어려움을 겪고, 순환 신경망이 자연스럽게 처리하는 알고리즘(임의의 깊이까지 괄호 세기 같은)을 학습하지 못한다. 탈옥, 프롬프트 인젝션, 적대적 입력에도 취약하다.[1]
16. 현재 위상과 대안
2026년 기준 트랜스포머는 범용 언어 모델링과 대부분의 최전선 멀티모달 시스템에서 여전히 지배적인 구조지만, 더는 도전받지 않는 것은 아니다. 상태 공간 모델인 Mamba(Gu와 Dao, 2023)는 선형 시간 추론 실행과 언어 모델링에서 경쟁력 있는 품질을 달성하며, Mamba-3B 모델은 표준 벤치마크에서 같은 크기의 트랜스포머를 앞섰다. RWKV는 RNN의 순환 구조를 병렬화 가능한 학습으로 다시 짜며, 선형 시간·일정한 메모리 추론 실행으로 트랜스포머 수준의 품질을 낸다고 주장한다.[1]
Jamba 같은 혼합 구조는 상태 공간 블록과 어텐션 블록을 결합한다. Mamba 2(Dao와 Gu, 2024)는 순수 상태 공간 설계를 다듬었고, 트랜스포머와 구조화 상태 공간 모델이 같은 수학의 두 얼굴임을 보였다(구조화 상태 공간 이중성).[1]
2025~2026년 논쟁은 눈에 띄는 방향으로 옮겨 갔다. 어텐션을 통째로 대체하기보다, 가장 강한 새 시스템은 값싼 선형 또는 순환 계층을 다수로, 전체 어텐션 계층을 소수로 섞는다.[1] MiniMax-01(2025년 1월)은 선형 어텐션을 주로 쓴 최초의 대규모 모델로, 4,560억 개 매개변수의 전문가 혼합(활성 459억 개) 안에 소프트맥스 어텐션 계층 하나마다 “라이트닝 어텐션”(선형) 계층 일곱 개를 쌓았고 추론 실행 컨텍스트 400만 토큰에 이르렀다.[39] Moonshot AI의 Kimi Linear(2025년 10월)는 Gated DeltaNet을 확장한 게이트 선형 어텐션 모듈 Kimi Delta Attention을 전체 어텐션과 3:1 비율로 교차시켜, 키-값 캐시 사용을 최대 75퍼센트 줄이고 100만 토큰 컨텍스트에서 디코딩 처리량을 최대 6배 높이며, 저자들에 따르면 학습 조건을 맞춘 비교에서 전체 어텐션을 앞선다.[40]
순수 상태 공간 쪽에서는 Mamba-3(ICLR 2026 발표, Lahoti, Li, Chen, Wang, Bick, Kolter, Dao, Gu)가 더 표현력 있는 이산화 순환, 더 풍부한 상태 추적을 위한 복소수 값 상태 갱신, 다중 입력 다중 출력 정식화를 더해, 강한 트랜스포머 기준선과 맞먹는 성능을 대략 절반의 디코딩 비용으로 내면서 검색과 상태 추적 정확도를 개선했다. 병행하는 흐름은 학습된 테스트 시점 메모리를 추구한다. Google의 Titans(Behrouz, Zhong, Mirrokni, 2024년 12월 arXiv)는 순전파 중 스스로 가중치를 갱신하는 신경 장기 기억 모듈을 더하고, 기울기 기반 “놀람(surprise)” 신호로 무엇을 기억하고 잊을지 정하며, 컨텍스트 200만 토큰을 넘어서까지 확장된다.[1]
이 대안 중 하나가 결국 범용 언어 모델링에서 트랜스포머를 대체할지는 아직 열린 질문이다. 2026년 중반 기준 대부분의 최전선 모델은 어텐션 기반으로 남아 있으며, 효율 지향의 선두 설계조차 전체 어텐션 계층을 버리지 않고 일부 유지한다. 이 시기의 가장 분명한 교훈은 실용적 최전선이 혼합형의 것이라는 점으로, 어텐션이 중요한 곳(전역 회상, 컨텍스트 내 검색)에는 어텐션을 두고 나머지 모든 곳은 더 값싼 선형, 순환, 희소 계층으로 바꾸는 모델이다.[1]
각주·출처 40개
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17 ↩18 ↩19 ↩20 ↩21 ↩22 ↩23 ↩24 ↩25 ↩26 ↩27 ↩28 ↩29 ↩30 ↩31 ↩32 ↩33 ↩34 ↩35 ↩36 ↩37 ↩38 ↩39 ↩40 ↩41 ↩42 ↩43 ↩44 ↩45 ↩46 ↩47 ↩48 ↩49 ↩50 ↩51 ↩52 ↩53 ↩54 ↩55 ↩56 ↩57 ↩58 ↩59 ↩60 ↩61 ↩62 ↩63 ↩64 ↩65 ↩66 ↩67 ↩68 ↩69 ↩70 ↩71 ↩72 ↩73 ↩74 ↩75 ↩76 ↩77 ↩78 ↩79 ↩80 ↩81 ↩82 ↩83 ↩84 ↩85 ↩86 ↩87 ↩88 ↩89 ↩90 ↩91 ↩92 ↩93 ↩94 ↩95 ↩96 ↩97 ↩98 ↩99 ↩100 ↩101 ↩102 ↩103 ↩104 ↩105 ↩106 ↩107 ↩108 ↩109 ↩110 ↩111 ↩112 ↩113 ↩114 ↩115 ↩116 ↩117 ↩118 ↩119 ↩120 ↩121 ↩122 ↩123 ↩124 ↩125 ↩126 ↩127 ↩128 ↩129 ↩130 ↩131 ↩132 ↩133 ↩134 ↩135 ↩136 ↩137 ↩138 ↩139 ↩140 ↩141 ↩142 ↩143 AI Wiki: Transformers (2026-09-08 수정본) · CC BY 4.0 · 확인 2026-10-09
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17 ↩18 ↩19 ↩20 ↩21 ↩22 Attention Is All You Need · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 An Image Is Worth 16x16 Words: Transformers for Image Recognition at Scale · 확인 2026-10-11
- ↩1 ↩2 ↩3 End-to-End Object Detection with Transformers · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 Robust Speech Recognition via Large-Scale Weak Supervision · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 Highly accurate protein structure prediction with AlphaFold · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 Scalable Diffusion Models with Transformers · 확인 2026-10-11
- ↩1 ↩2 Neural Machine Translation by Jointly Learning to Align and Translate · 확인 2026-10-11
- ↩1 ↩2 ↩3 Fast Transformer Decoding: One Write-Head is All You Need · 확인 2026-10-11
- ↩1 ↩2 ↩3 GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 The Llama 3 Herd of Models · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 RoFormer: Enhanced Transformer with Rotary Position Embedding · 확인 2026-10-11
- ↩1 ↩2 ↩3 LLaMA: Open and Efficient Foundation Language Models · 확인 2026-10-11
- ↩1 ↩2 ↩3 Language Models Are Unsupervised Multitask Learners · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 Language Models Are Few-Shot Learners · 확인 2026-10-11
- ↩1 ↩2 ↩3 Qwen3 Technical Report · 확인 2026-10-11
- ↩1 ↩2 ↩3 Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer · 확인 2026-10-11
- ↩1 ↩2 Scaling Laws for Neural Language Models · 확인 2026-10-11
- ↩1 ↩2 ↩3 Training Compute-Optimal Large Language Models · 확인 2026-10-11
- ↩1 ↩2 ↩3 BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding · 확인 2026-10-11
- ↩1 ↩2 Improving Language Understanding by Generative Pre-Training · 확인 2026-10-11
- ↩1 ↩2 BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension · 확인 2026-10-11
- ↩1 ↩2 ↩3 Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context · 확인 2026-10-11
- ↩1 ↩2 Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context · 확인 2026-10-11
- ↩1 ↩2 Swin Transformer: Hierarchical Vision Transformer Using Shifted Windows · 확인 2026-10-11
- ↩1 ↩2 Learning Transferable Visual Models From Natural Language Supervision · 확인 2026-10-11
- ↩1 ↩2 ↩3 wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations · 확인 2026-10-11
- ↩1 ↩2 ↩3 Video generation models as world simulators (Sora technical report · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 Decision Transformer: Reinforcement Learning via Sequence Modeling · 확인 2026-10-11
- ↩1 ↩2 GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding · 확인 2026-10-11
- ↩1 ↩2 Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity · 확인 2026-10-11
- ↩1 ↩2 Mixtral of Experts · 확인 2026-10-11
- ↩1 ↩2 DeepSeek-V3 Technical Report · 확인 2026-10-11
- ↩1 ↩2 ↩3 FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness · 확인 2026-10-11
- ↩1 ↩2 FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning · 확인 2026-10-11
- ↩1 ↩2 FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision · 확인 2026-10-11
- ↩1 ↩2 ↩3 Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention · 확인 2026-10-11
- ↩1 ↩2 ↩3 DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models · 확인 2026-10-11
- ↩1 ↩2 ↩3 MiniMax-01: Scaling Foundation Models with Lightning Attention · 확인 2026-10-11
- ↩1 ↩2 ↩3 Kimi Linear: An Expressive, Efficient Attention Architecture · 확인 2026-10-11