| 분류 | 머신러닝의 한 갈래[2] |
|---|---|
| 기본 틀 | 지도 학습·비지도 학습과 함께 3대 기본 머신러닝 패러다임 중 하나[3] |
| 핵심 요소 | 에이전트, 환경, 상태, 행동, 보상[1] |
| 수학적 기반 | 마르코프 결정 과정(MDP), 벨만 방정식[4] [5] |
| 대표 교재 | 「Reinforcement Learning: An Introduction」(서튼·바토)[2] |
| 주요 수상 | 2024년 튜링상(리처드 서튼, 앤드루 바토)[6] |
| 대표 응용 | 게임 플레이, 대규모 언어 모델의 정렬(RLHF)[1] |
쉽게 말하면, 강화 학습은 정답을 미리 알려 주지 않고 행동의 결과로 얻는 보상을 보고 스스로 배우는 방식이다. 에이전트는 여러 행동을 시도하며 시행착오를 거치고, 장기적으로 보상을 가장 많이 얻는 쪽으로 행동을 바꿔 간다. 게임 플레이와 대규모 언어 모델의 정렬 등에 쓰인다.[1]
1. 정의
강화 학습(Reinforcement Learning, RL)은 머신러닝의 한 갈래로, 에이전트가 환경에서 행동을 취하며 누적 보상 신호를 최대화하도록 학습한다. 정답이 붙은 예시 없이 시행착오를 통해 좋은 행동을 찾아낸다.[2]
리처드 서튼(Richard Sutton)과 앤드루 바토(Andrew Barto)는 교재에서 "강화 학습은 무엇을 할지, 즉 상황을 행동에 어떻게 대응시킬지를 배워 수치로 된 보상 신호를 최대화하는 것"이라고 정의했다.[2] 두 사람은 이 분야의 개념과 알고리즘 기반을 세운 공로로 2024년 튜링상을 받았으며, 튜링상은 흔히 컴퓨팅 분야의 노벨상으로 불린다.[6] 강화 학습은 지도 학습, 비지도 학습과 함께 3대 기본 머신러닝 패러다임으로 꼽힌다.[3]
지도 학습은 입력과 정답 쌍이 붙은 데이터로 배우고, 비지도 학습은 라벨 없는 데이터에서 숨은 구조를 찾는다. 강화 학습은 환경과의 시행착오적 상호작용 속에서 미지의 영역을 시도하는 탐험과 현재 지식을 쓰는 활용 사이의 균형을 찾는다.[7] 많은 강화 학습 알고리즘이 동적 계획법 기법을 쓰므로 환경은 보통 마르코프 결정 과정(MDP)으로 정식화된다.[4] 강화 학습은 보드게임과 비디오 게임에서 세계 챔피언을 꺾는 일부터 대규모 언어 모델을 인간의 선호에 맞추는 일까지, 현대 인공지능의 눈에 띄는 성과를 여럿 이끌었다.[1]
2. 주요 성과
강화 학습은 몇 가지 상징적 성과로 널리 알려졌다. 2016년 DeepMind의 AlphaGo는 복잡한 바둑에서 세계 챔피언 이세돌을 이겼는데, 이는 그전까지 수십 년 뒤에나 가능할 것으로 여겨지던 성과였다.[8] 2019년 OpenAI Five는 Dota 2의 현역 세계 챔피언 팀을 꺾어, 팀 단위 전략 게임을 다루는 능력을 보였다.[9] 2022년에는 ChatGPT와 Claude 같은 대규모 언어 모델의 학습에 강화 학습이 핵심이 되었으며, 그 기법이 인간 피드백 강화 학습(RLHF)이다.[1]
강화 학습은 여러 지적 전통이 합쳐져 등장했다. 동물 학습 심리학에서는 1911년 에드워드 손다이크의 효과의 법칙이, 만족스러운 결과가 따른 행동은 반복되기 쉽다는 점을 확립했다. 수학적 틀은 최적 제어 이론과 1950년대 리처드 벨먼(Richard Bellman)의 동적 계획법에서 왔다. 이 흐름들은 서튼과 바토의 연구를 통해 현대 분야로 통합되었고, 두 사람은 이 기초적 공헌으로 2024년 튜링상을 받았다.[6] 튜링상은 컴퓨팅 기계 협회(ACM)가 수여하며 Google이 후원하는 100만 달러의 상금이 따른다. ACM은 발표문에서 바토와 서튼이 1980년대부터 발표한 일련의 논문에서 "강화 학습의 핵심 아이디어를 도입하고, 수학적 기초를 세웠으며, 중요한 알고리즘을 개발했다"고 밝혔다.[10] 두 사람의 교재 「Reinforcement Learning: An Introduction」은 7만 5천 회 넘게 인용되었다.[10]
3. 역사
강화 학습의 역사는 1세기를 넘으며, 심리학·제어 이론·컴퓨터 과학의 세 흐름이 독립적으로 발전하다가 하나로 합쳐졌다. 첫 흐름은 실험심리학이다. 이반 파블로프(Ivan Pavlov)는 1890년대와 1900년대에 고전적 조건 형성을 연구해, 동물이 자극과 보상을 연결해 학습할 수 있음을 보였다.[11] 에드워드 손다이크는 1911년 효과의 법칙을 정식화했다. 만족스러운 결과가 따른 반응은 상황과의 연결이 강해지고, 불쾌한 결과가 따른 반응은 가능성이 낮아진다는 내용이다.[12] B.F. 스키너는 1930년대에 조작적 조건 형성을 통해 보상과 처벌이 자발적 행동을 어떻게 형성하는지 연구했다. 이 심리학 원리들은 오늘날 강화 학습이 쓰는 보상 기반 학습 틀에 직접적인 영감을 주었다.[1]
둘째 흐름은 응용 수학에서 나왔다. 1950년대 리처드 벨먼은 다단계 의사 결정 문제를 풀기 위해 동적 계획법을 개발했다. 벨먼 방정식(1957)으로 정식화된 핵심 통찰은, 최적 정책이 즉각적 결정과 그 결과 상태부터의 최적 정책으로 분해된다는 것이었다.[5] 이 재귀적 공식은 거의 모든 강화 학습 알고리즘의 수학적 뼈대가 되었다. 「강화 학습」이라는 용어는 민스키(Minsky)가 1961년 공학 문헌에서 처음 사용했고, 이로써 강화라는 심리학 개념이 계산적 의사 결정과 이어졌다.[1]
셋째 흐름은 두 흐름을 잇는 시간차(TD) 학습이다. 리처드 서튼은 1988년 TD 학습을 제시했다. 이는 최종 결과를 기다리지 않고 현재의 가치 추정치로 부트스트래핑하며 배우는 모델 프리 방법 계열이다.[13] TD 방법은 몬테카를로 방법의 샘플링과 동적 계획법의 부트스트래핑을 결합해, 환경의 전체 모델을 알 수 없을 때도 쓸 수 있는 실용적 알고리즘을 만들었다.[1] 서튼과 바토의 1998년 교재 「Reinforcement Learning: An Introduction」은 세 흐름을 하나의 체계로 묶어 이 분야의 표준 참고서가 되었다.[14]
3.1. 연표
| 연도 | 사건 | 주요 인물·기관 | 의의 |
|---|---|---|---|
| 1890년대 | 고전적 조건 형성 실험 | 이반 파블로프 | 동물이 자극과 보상의 연결을 학습함을 보임[1] |
| 1911년 | 효과의 법칙 | 에드워드 손다이크 | 보상받은 행동이 강화된다는 점을 확립[1] |
| 1930년대 | 조작적 조건 형성 | B.F. 스키너 | 보상과 처벌이 행동을 형성하는 방식을 정식화[1] |
| 1950년대 | 동적 계획법, 벨먼 방정식 | 리처드 벨먼 | 순차적 의사 결정의 수학적 틀[1] |
| 1959년 | 체커 프로그램 | 아서 사무엘 | 최초의 자가 학습 게임 프로그램, 「머신러닝」 용어 창안[1] |
| 1961년 | 「Steps toward artificial intelligence」 | 마빈 민스키 | 공학 문맥에서 「강화」라는 용어 사용[1] |
| 1963년 | MENACE | 도널드 미치 | 틱택토를 학습한 성냥갑 기계[1] |
| 1988년 | TD(람다) | 리처드 서튼 | 몬테카를로와 동적 계획법 접근을 통합[1] |
| 1989년 | Q-러닝 | 크리스토퍼 왓킨스 | 모델 프리 오프 폴리시 제어 알고리즘[1] |
| 1992년 | REINFORCE 정책 경사 알고리즘 | 로널드 윌리엄스 | 정책 경사 방법의 기초 알고리즘[1] |
| 1992년 | TD-Gammon | 제럴드 테사우로 | 세계적 수준의 게임 성능을 낸 최초의 강화 학습 시스템[1] |
| 1994년 | SARSA | Gavin Rummery, Mahesan Niranjan | 온 폴리시 시간차 제어[1] |
| 1998년 | 「Reinforcement Learning: An Introduction」 | 리처드 서튼, 앤드루 바토 | 분야를 정의한 기념비적 교재[1] |
| 2013년 | 아타리 게임용 심층 Q 네트워크(DQN) | DeepMind (Mnih et al.) | 원시 픽셀 입력을 쓴 최초의 심층 강화 학습 돌파구[1] |
| 2015년 | DQN, Nature 게재 | DeepMind | 49개 아타리 게임에서 인간 수준 플레이[1] |
| 2016년 | AlphaGo, 이세돌 격파 | DeepMind | 바둑에서 세계 챔피언을 이긴 최초의 AI[1] |
| 2017년 | AlphaGo Zero, AlphaZero | DeepMind | 자기 대국만으로 바둑·체스·장기 학습[1] |
| 2017년 | PPO 발표 | OpenAI (Schulman et al.) | 온 폴리시 강화 학습 알고리즘의 기본값이 됨[1] |
| 2018년 | SAC 발표 | Haarnoja et al. (UC Berkeley) | 연속 제어를 위한 최대 엔트로피 틀[1] |
| 2019년 | OpenAI Five, Dota 2에서 OG 격파 | OpenAI | 복잡한 다중 에이전트 실시간 게임 정복[1] |
| 2019년 | AlphaStar, 그랜드마스터 도달 | DeepMind | 스타크래프트 II 그랜드마스터 수준 플레이[1] |
| 2020년 | MuZero | DeepMind | 환경 규칙을 모르고도 계획을 학습[1] |
| 2022년 | ChatGPT 학습에 RLHF 사용 | OpenAI | 강화 학습이 대규모 언어 모델 정렬의 핵심이 됨[1] |
| 2023년 | 프로세스 감독(「Let's Verify Step by Step」) | OpenAI (Lightman et al.) | 단계별 보상 모델이 수학 추론에서 결과 전용 보상보다 우수[1] |
| 2024년 | GRPO 도입(DeepSeekMath) | DeepSeek | 이후 추론용 RL의 중심이 된 비평가 없는 정책 최적화[1] |
| 2024년 | AlphaProof, IMO 은메달 수준 | DeepMind | 형식 수학 올림피아드를 위해 Lean 증명기와 RL 결합[1] |
| 2024년 | 튜링상 | 리처드 서튼, 앤드루 바토 | 강화 학습 기초 공로 인정[1] |
| 2025년 | GRPO를 쓴 DeepSeek-R1과 R1-Zero | DeepSeek | RL로 LLM의 추론 능력 학습, R1-Zero는 지도 미세 조정 없이 학습[1] |
| 2025년 | DeepSeek-R1, 동료 심사 후 Nature 게재 | DeepSeek | 독립 동료 심사를 통과한 최초의 주요 공개 가중치 LLM[1] |
4. 결과로 배우는 방식
강화 학습은 결과를 통해 에이전트를 가르친다. 에이전트는 올바른 행동을 전해 듣지 못하고, 행동을 시도한 뒤 얻은 보상을 관찰하면서 시간이 지날수록 보상을 가장 많이 얻는 쪽으로 행동을 바꾼다. 서튼과 바토는 강화 학습을 다른 모든 학습 형태와 구별하는 두 가지 특징으로 「시행착오 탐색」과 「지연된 보상」을 꼽았다.[2] 학습자는 직접 해 보며 어떤 행동이 가치 있는지 알아내야 한다. 하나의 행동은 즉각적 보상뿐 아니라 다음 상황과 이후의 모든 보상에도 영향을 주므로, 에이전트는 즉각적 이득이 아니라 장기적 결과를 따져야 한다.[2][1]
5. 핵심 개념
5.1. 에이전트와 환경의 상호작용
강화 학습 문제에서 에이전트는 관찰, 행동, 보상의 순환을 거쳐 환경과 상호작용한다.[7] 시점 t마다 다음 과정이 반복된다.
- 에이전트가 환경의 현재 상태 s_t를 관찰한다.
- 정책 pi에 따라 행동 a_t를 고른다.
- 환경은 전이 확률 P(s'|s,a)에 따라 새로운 상태 s_{t+1}로 바뀐다.
- 에이전트는 그 행동의 즉각적 이득을 나타내는 스칼라 보상 r_{t+1}을 받는다.[1]
에이전트의 목표는 기대 보상, 즉 할인된 누적 보상을 최대화하는 정책을 학습하는 것이다.[2]
G_t = R_{t+1} + gamma * R_{t+2} + gamma^2 * R_{t+3} + ... = Sum_{k=0}^{infinity} gamma^k * R_{t+k+1}할인율 감마(gamma, 0 <= gamma <= 1)는 에이전트가 미래 보상을 즉각적 보상과 비교해 얼마나 중시할지 정한다. 감마가 0에 가까우면 에이전트는 근시안적이어서 즉각적 보상을 우선한다. 감마가 1에 가까우면 원시안적이 되어 미래 보상을 현재 보상과 거의 같은 비중으로 따진다. 적절한 할인율은 문제에 따라 다르다. 미로를 찾는 로봇은 gamma = 0.99를 쓸 수 있고, 단타 거래 알고리즘은 더 낮은 값을 쓸 수 있다.[1]
5.2. 핵심 구성 요소
| 구성 요소 | 설명 | 예시 |
|---|---|---|
| 에이전트 | 학습자이자 의사 결정자 | 로봇, 게임 AI, 거래 알고리즘[1] |
| 환경 | 에이전트가 상호작용하는 외부 시스템 | 미로, 체스판, 주식 시장[1] |
| 상태(s) | 환경의 현재 구성에 대한 설명 | 체스 말의 위치, 로봇 관절 각도[1] |
| 행동(a) | 주어진 상태에서 에이전트가 고를 수 있는 선택 | 말 움직이기, 주식 사고팔기, 좌회전[1] |
| 보상(r) | 즉각적인 스칼라 피드백 신호 | 얻은 점수, 벌어들인 이익, 목표까지의 거리[1] |
| 정책(pi) | 상태를 행동에 대응시키는 에이전트의 전략 | 「상태 X이면 행동 Y를 한다」[1] |
| 가치 함수 V(s) | 정책 아래 상태에서 얻을 기대 장기 보상 | 체스 국면 평가[1] |
| 행동 가치 함수 Q(s,a) | 상태 s에서 행동 a를 한 뒤 정책을 따를 때의 기대 보상 | 특정 말을 움직이는 것의 추정 가치[1] |
| 모델 | 환경 동역학에 대해 에이전트가 학습한 표현 | 현재 상태와 행동이 주어졌을 때 예측한 다음 상태와 보상[1] |
5.3. 가치 함수
가치 함수는 에이전트가 특정 상태에 있거나 특정 상태에서 특정 행동을 하는 것이 얼마나 좋은지 추정한다.[2]
- 상태 가치 함수 V^pi(s): 정책 pi를 따를 때 상태 s에서 시작해 얻는 기대 보상이다.
- 행동 가치 함수 Q^pi(s,a): 상태 s에서 행동 a를 한 뒤 정책 pi를 따를 때 얻는 기대 보상이다.[1]
최적 가치 함수는 다음 벨만 최적성 방정식을 만족한다.[4]
V*(s) = max_a Sum_{s'} P(s'|s,a) [R(s,a,s') + gamma * V*(s')]
Q*(s,a) = Sum_{s'} P(s'|s,a) [R(s,a,s') + gamma * max_{a'} Q*(s',a')]이 식들의 핵심 재귀 관계는 상태의 가치가 가장 좋은 즉각적 보상에, 도달 가능한 최선의 다음 상태의 할인된 가치를 더한 것과 같다는 것이다.[1]
5.4. 탐색 대 활용
강화 학습의 근본적 과제 중 하나는 탐색-활용 상충 관계다.[3] 에이전트는 다음 두 가지 사이에서 균형을 잡아야 한다.
- 탐색: 새롭고 검증되지 않은 행동을 시도해 더 나은 전략을 찾는다.
- 활용: 이미 아는 지식을 써서 즉각적 보상을 최대화한다.[1]
활용만 하는 에이전트는 최적이 아닌 정책에 갇혀 더 나은 선택지를 발견하지 못할 수 있다. 탐색만 하는 에이전트는 이미 나쁜 것으로 알려진 행동에 시간을 낭비한다. 이 상충을 다루는 대표 전략은 다음과 같다.[1]
| 전략 | 설명 | 상충 관계 |
|---|---|---|
| 엡실론 탐욕(Epsilon-greedy) | 확률 엡실론으로 무작위 행동을, 나머지는 탐욕적으로 선택 | 단순하지만 균일한 무작위 탐색은 비효율적[1] |
| 엡실론 감소(Epsilon decay) | 엡실론을 시간에 따라 줄여 초기에 더 많이 탐색 | 초기 탐색과 후기 활용의 균형을 맞춤[1] |
| 상한 신뢰 구간(UCB) | 불확실성이 크거나 추정 가치가 높은 행동을 선택 | 신뢰 구간에 기반한 원칙적 방법[1] |
| 톰프슨 샘플링 | 행동 가치의 사후 분포에서 표본을 뽑음 | 베이즈 접근으로 탐색과 활용을 자연스럽게 균형 맞춤[1] |
| 볼츠만(소프트맥스) 탐색 | 지수화된 Q 값에 비례해 행동을 선택 | 온도 매개변수가 탐색 정도를 조절[1] |
| 호기심 기반 탐색 | 새로운 상태를 방문하면 에이전트에 보상 | 희소 보상 환경에서 효과적[1] |
6. 지도 학습과의 차이
강화 학습과 지도 학습은 모두 머신러닝의 갈래지만 학습 신호와 과제가 다르다. 지도 학습은 고정된 정답 입출력 쌍으로 학습하며 그 정답을 흉내 낸다. 강화 학습에는 정답이 없고 스칼라 보상만 있으며, 에이전트가 환경에서 행동하며 데이터를 스스로 만들어야 한다.[2][3] 지도 학습에서는 각 예시가 서로 독립적이지만, 강화 학습에서는 행동이 이후 상황을 바꾸므로 결정이 순차적이고 보상이 지연될 수 있다.[1]
| 차원 | 강화 학습 | 지도 학습 |
|---|---|---|
| 학습 신호 | 스칼라 보상, 종종 지연됨 | 입력마다 주어지는 정답 라벨[1] |
| 데이터 출처 | 에이전트가 상호작용하며 생성 | 고정된 사전 수집 데이터셋[1] |
| 피드백 | 평가적(행동이 얼마나 좋았는지) | 지시적(올바른 답이 무엇인지)[1] |
| 예시의 독립성 | 순차적, 행동이 이후 상태에 영향 | 독립적이며 동일 분포(i.i.d.)[1] |
| 핵심 목표 | 장기 누적 보상 최대화 | 라벨에 대한 예측 오차 최소화[1] |
| 대표 용도 | 제어, 게임, 로보틱스, LLM 정렬 | 분류, 회귀, 인식[1] |
실제로 두 패러다임은 자주 결합된다. 많은 시스템이 먼저 지도 학습으로 학습한 뒤 강화 학습으로 다듬는다. ChatGPT의 학습이 대표 사례로, 사람이 작성한 시연 데이터에 대한 지도 미세 조정으로 시작한 뒤 사람의 선호를 반영한 보상 모델을 최적화하는 강화 학습을 적용한다.[15][1]
7. 수학적 기초
강화 학습 문제는 공식적으로 마르코프 결정 과정(MDP)으로 모델링되며, 튜플 (S, A, P, R, gamma)로 정의된다.[1]
- S: 상태 집합(상태 공간)
- A: 행동 집합(행동 공간)
- P(s'|s,a): 상태 전이 확률 함수
- R(s,a,s'): 보상 함수
- gamma: 할인율(0 <= gamma < 1)[1]
마르코프 성질은 미래가 현재 상태에만 의존하고 그 이전 사건의 순서에는 의존하지 않는다는 뜻이다. 즉 P(s_{t+1} | s_t, a_t, s_{t-1}, ..., s_0) = P(s_{t+1} | s_t, a_t)이며, 이 무기억성이 MDP를 다루기 쉽게 만든다. 실제 많은 문제는 현재 관찰이 상태를 충분히 담지 못해 이 성질을 위반하며, 이런 경우를 부분 관찰 MDP(POMDP)라 하며 훨씬 풀기 어렵다.[1]
벨만 방정식은 리처드 벨만(Richard Bellman)의 이름을 딴 것으로, 거의 모든 강화 학습 알고리즘의 바탕이 되는 재귀적 분해를 제공한다. 정책 pi에 대해 V^pi(s) = Sum_a pi(a|s) Sum_{s'} P(s'|s,a) [R(s,a,s') + gamma * V^pi(s')]이며, 이는 정책 아래 상태의 가치가 기대 즉각 보상에 다음 상태의 할인된 가치를 더한 것을 모든 행동과 전이에 대해 평균한 것이라는 뜻이다. 벨만 최적성 방정식은 정책에 대한 평균을 최댓값으로 바꾸어, 가능한 최선의 정책이 얻을 값을 정의한다.[1]
시간차(TD) 학습은 1988년 서튼이 제안한 핵심 방법으로, 몬테카를로 방법과 동적 계획법의 아이디어를 결합한다.[13] 에피소드가 끝나기를 기다리는 몬테카를로 방법과 달리, 매 단계마다 관찰한 보상과 다음 상태 가치의 현재 추정치로 갱신한다. 갱신 규칙은 V(s_t) <- V(s_t) + alpha [r_{t+1} + gamma * V(s_{t+1}) - V(s_t)]이며, 괄호 안의 항을 TD 오차라고 부른다. 이 항은 현재 추정치와, 실제 보상과 다음 상태 추정치로 만든 더 나은 추정치의 차이를 잰다. TD 학습은 일정 조건에서 참 가치 함수로 수렴하며, Q-러닝과 SARSA의 바탕이 된다.[1]
8. 알고리즘 분류
강화 학습 알고리즘은 여러 축을 따라 분류할 수 있으며, 이 구분을 이해하는 것은 주어진 문제에 맞는 알고리즘을 고르는 데 필수적이다.[1]
8.1. 모델 기반 대 모델 프리
모델 프리(model-free) 알고리즘은 환경이 어떻게 작동하는지 명시적 모델을 만들지 않고, 경험에서 정책이나 가치 함수를 직접 학습한다. Q-러닝과 PPO가 모델 프리에 속한다. 구현은 단순하지만 환경과 훨씬 많은 상호작용을 필요로 하는 경우가 많다.[1]
모델 기반(model-based) 알고리즘은 환경 동역학(전이 확률과 보상)의 모델을 학습하거나 주어진 모델을 써서 계획을 세운다. 1990년 서튼이 소개한 Dyna-Q는 실제 경험과 학습된 모델이 만든 모의 경험을 결합한 초기 접근이다. 더 최근에는 원시 관찰보다 보상과 가치 예측에 집중하는 잠재 동역학 모델을 학습하는 MuZero와, 잠재 공간에서 세계 모델을 학습하고 상상된 롤아웃만으로 정책을 학습하는 Dreamer가 있다.[16] 모델 기반 방법은 머릿속 시뮬레이션으로 합성 학습 데이터를 만들 수 있어 보통 샘플 효율이 높다. 다만 학습된 모델이 부정확하면 오류가 누적되어 나쁜 정책으로 이어질 수 있다.[1]
8.2. 가치 기반 대 정책 기반
가치 기반(value-based) 방법(Q-러닝, DQN)은 가치 함수를 학습하고 그것에서 정책을 끌어낸다. 예를 들어 항상 Q 값이 가장 큰 행동을 고른다. 이산 행동 공간에서는 잘 작동하지만 연속 행동에는 어려움을 겪는다.[1]
정책 기반(policy-based) 방법(REINFORCE, PPO)은 가치 함수를 꼭 학습하지 않고 정책을 직접 매개변수화해 최적화한다. 연속 행동 공간을 자연스럽게 다루고 확률적 정책을 학습할 수 있지만, 기울기 추정의 분산이 더 큰 경향이 있다.[1]
액터-크리틱(actor-critic) 방법은 둘을 결합한다. 액터(정책 신경망)가 행동을 고르고 크리틱(가치 신경망)이 이를 평가한다. 순수 정책 기울기 방법보다 분산이 줄면서도 연속 행동을 다룰 수 있다.[1]
8.3. 온 폴리시 대 오프 폴리시
온 폴리시(on-policy) 알고리즘(SARSA, PPO, A2C)은 현재 실행 중인 정책에 대해 배우며, 현재 정책이 만든 데이터로 같은 정책을 갱신한다. 더 안정적일 수 있지만, 정책을 갱신한 뒤에는 오래된 데이터를 재사용할 수 없어 샘플 효율이 낮다.[1]
오프 폴리시(off-policy) 알고리즘(Q-러닝, DQN, SAC)은 과거 버전의 에이전트나 무작위 탐험을 포함한 어떤 정책이 만든 데이터로도 배울 수 있다. 과거 전이를 버퍼에 저장해 반복해서 뽑아 쓰는 경험 재현을 가능하게 하여 샘플 효율을 크게 높인다.[1]
| 분류 축 | 범주 A | 범주 B |
|---|---|---|
| 환경 모델 | 모델 프리: Q-러닝, PPO, SAC | 모델 기반: Dyna-Q, MuZero, Dreamer[1] |
| 학습 대상 | 가치 기반: Q-러닝, DQN | 정책 기반: REINFORCE, PPO[1] |
| 데이터 출처 | 온 폴리시: SARSA, A2C, PPO | 오프 폴리시: Q-러닝, DQN, SAC[1] |
| 상태 표현 | 표 형식: 고전적 Q-러닝 | 함수 근사: 딥러닝 기반 RL[1] |
9. 주요 알고리즘
9.1. Q-러닝
Q-러닝은 1989년 Christopher Watkins가 케임브리지 대학 박사 학위 논문 「Learning from Delayed Rewards」에서 소개한 모델 프리 오프 폴리시 알고리즘으로, 최적 행동 가치 함수를 직접 학습한다.[17] 갱신 규칙은 Q(s,a) <- Q(s,a) + alpha [r + gamma * max_{a'} Q(s',a') - Q(s,a)]이며, alpha는 학습률이다.[1]
핵심 통찰은 갱신이 다음 상태에서 실제로 선택한 행동과 무관하게 최대 Q 값을 쓴다는 점이다. 이 오프 폴리시 성질 덕분에 Q-러닝은 탐험적인 정책을 따르면서도 최적 정책을 학습할 수 있다. Watkins와 Dayan(1992)은 충분한 탐험과 감소하는 학습률 아래에서 Q-러닝이 확률 1로 최적 Q 함수에 수렴한다는 첫 엄밀한 증명을 제시했다.[17][1]
Q-러닝은 상태와 행동 공간이 작고 이산적인 문제에 단순하고 효과적이다. 더 큰 문제에서는 신경망 같은 함수 근사가 필요하다.[1]
9.2. SARSA
SARSA(State-Action-Reward-State-Action)는 Rummery와 Niranjan이 1994년 소개한 Q-러닝의 온 폴리시 변형이다. 갱신 규칙은 다음 상태에서 최댓값 대신 실제로 취한 행동의 가치를 쓴다. Q(s,a) <- Q(s,a) + alpha [r + gamma * Q(s',a') - Q(s,a)]이다.[1]
SARSA는 실제로 따르는 정책을 평가하므로 Q-러닝보다 안전한 정책을 학습하는 경향이 있다. 절벽 걷기 문제에서 Q-러닝은 절벽 가장자리를 따라가는 최적 경로를 학습하지만, SARSA는 탐험 행동이 낙하로 이어질 수 있다는 점을 고려해 절벽에서 더 멀리 떨어진 안전한 경로를 학습한다.[1]
9.3. 심층 Q 네트워크(DQN)
심층 Q 네트워크(DQN)는 DeepMind의 Mnih 등이 2013년 발표하고 2015년 Nature에 게재한 알고리즘으로, 합성곱 신경망으로 고차원 상태 공간의 Q 값을 근사해 강화 학습을 바꾸었다.[18] DQN은 Atari 2600 게임의 원시 픽셀 입력을 받아 같은 구조와 하이퍼파라미터로 49개 게임을 학습했고, 그중 29개에서 인간 수준 성능에 도달했다. Nature 논문은 픽셀과 게임 점수만 입력받은 에이전트가 같은 알고리즘, 네트워크 구조, 하이퍼파라미터로 49개 게임 전체에서 기존 알고리즘을 넘어서며 전문 인간 게임 테스터에 견줄 만한 수준에 이르렀다고 보고했다.[18] 두 가지 혁신이 이를 가능하게 했다.
- 경험 재현: 에이전트가 전이 (s, a, r, s')를 재현 버퍼에 저장하고 무작위 미니배치로 학습한다. 연속된 표본 사이의 상관을 깨뜨려 데이터 효율을 높인다.
- 목표 네트워크: Q 네트워크의 별도 복사본을 주기적으로 갱신해 목표 값을 계산한다. 목표가 매 갱신마다 함께 움직이는 것을 막아 학습을 안정시킨다.[1]
DQN은 하나의 강화 학습 에이전트가 여러 과제에서 감각 입력으로부터 복잡한 행동을 직접 배울 수 있음을 처음 보여 주었고, 심층 강화 학습 열풍을 일으켰다.[1]
9.4. 정책 기울기 방법
정책 기울기 방법은 기대 보상의 기울기를 추정해 매개변수화된 정책을 직접 최적화한다. 기초 알고리즘은 Williams(1992)의 REINFORCE로, 정책 매개변수 theta를 nabla_theta J(theta) ~ Sum_t G_t * nabla_theta log pi_theta(a_t | s_t)에 따라 갱신한다.[1]
G_t는 시점 t의 반환이다. 직관은 단순하다. 높은 반환으로 이어진 행동의 확률을 높이고, 낮은 반환으로 이어진 행동의 확률을 낮춘다. 다만 REINFORCE는 단순하지만 기울기 추정의 분산이 크다는 문제가 있다.[1]
기준선(보통 상태 가치 함수)을 더하면 편향을 만들지 않고 분산을 줄일 수 있다. nabla_theta J(theta) ~ Sum_t (G_t - V(s_t)) * nabla_theta log pi_theta(a_t | s_t). 여기서 (G_t - V(s_t)) 항을 어드밴티지(advantage)라 하며, 이는 어드밴티지 액터-크리틱 방법 계열로 이어진다.[1]
9.5. 액터-크리틱 방법
액터-크리틱 알고리즘은 정책 기반 학습과 가치 기반 학습을 결합한다. 액터는 행동을 고르는 정책 신경망이고, 크리틱은 상태나 상태-행동 쌍의 가치를 추정하는 가치 신경망이다. 크리틱은 학습된 기준선을 제공해 정책 기울기 추정의 분산을 줄인다.[1]
대표 변형은 다음과 같다. A2C(Advantage Actor-Critic)는 어드밴티지 함수 A(s,a) = Q(s,a) - V(s)로 액터를 갱신한다. A3C(Asynchronous Advantage Actor-Critic)는 Mnih 등이 2016년 소개했으며, 여러 에이전트가 환경 복사본에서 병렬로 실행되어 각자의 기울기를 공유 모델에 비동기로 전달한다. 이는 여러 CPU 코어에 걸쳐 강화 학습 학습을 확장한 초기 방법 중 하나다.[1]
DDPG(Deep Deterministic Policy Gradient)는 Lillicrap 등이 2015년 소개했으며, 결정론적 정책을 Q 함수와 함께 학습해 DQN을 연속 행동 공간으로 확장한다.[19] 경험 재현과 목표 네트워크를 DQN과 비슷하게 쓴다.[1]
TD3(Twin Delayed DDPG)는 Fujimoto 등이 2018년 발표했으며, DDPG의 과대 추정 편향을 다룬다. 두 개의 크리틱 네트워크를 두고 둘 중 작은 추정치를 취하며, 정책 갱신을 지연하고 목표 행동에 잡음을 더한다.[1]
9.6. 근접 정책 최적화(PPO)
근접 정책 최적화(Proximal Policy Optimization, PPO)는 OpenAI의 Schulman 등이 2017년 소개했으며, 정책이 파괴적으로 크게 바뀌지 않도록 갱신을 제한한다.[20] 이를 위해 클리핑된 대리 목적 함수 L^CLIP(theta) = E[min(r_t(theta) * A_t, clip(r_t(theta), 1 - epsilon, 1 + epsilon) * A_t)]를 최적화한다.[20][1]
r_t(theta) = pi_theta(a_t | s_t) / pi_{theta_old}(a_t | s_t)는 확률비이고 epsilon은 보통 0.2다. 클리핑은 한 번의 갱신에서 새 정책이 옛 정책에서 지나치게 멀어지는 것을 막는다.[1]
PPO는 단순성, 안정성, 강한 실험 성능 덕분에 가장 널리 쓰이는 강화 학습 알고리즘 중 하나가 되었다. OpenAI는 이를 OpenAI Five(Dota 2) 학습에 사용했으며, ChatGPT를 위한 RLHF에 쓰인 원래 강화 학습 알고리즘이기도 하다.[1]
9.7. 소프트 액터-크리틱(SAC)
소프트 액터-크리틱(SAC)은 Haarnoja 등이 2018년 소개했으며, 표준 강화 학습 목적 함수에 탐험을 장려하는 엔트로피 항을 더한다. 목적 함수는 J(pi) = Sum_t E[r(s_t, a_t) + alpha * H(pi(.|s_t))]이다.[1]
H는 정책의 엔트로피이고, alpha는 보상 최대화와 엔트로피(탐험) 사이의 상충을 조절하는 온도 매개변수다. SAC는 오프 폴리시이며 경험 재현을 쓰고, 온도 매개변수를 자동으로 조정한다. 연속 제어 벤치마크에서는 PPO 같은 온 폴리시 방법보다 샘플 효율이 더 좋으면서 강한 성능을 낸다.[1]
9.8. 알고리즘 비교
| 알고리즘 | 유형 | 연도 | 핵심 혁신 | 적합한 분야 | 샘플 효율 |
|---|---|---|---|---|---|
| Q-러닝 | 가치, 오프 폴리시 | 1989 | 모델 프리 최적 제어 | 작은 이산 문제 | 낮음[1] |
| SARSA | 가치, 온 폴리시 | 1994 | 온 폴리시 TD 제어 | 안전이 중요한 학습 | 낮음[1] |
| DQN | 가치, 오프 폴리시 | 2013 | 경험 재현을 쓴 심층 RL | 이산 행동, 시각 입력 | 보통[1] |
| DDPG | 액터-크리틱, 오프 폴리시 | 2015 | 연속 행동용 DQN | 연속 제어 | 보통[1] |
| TRPO | 정책, 온 폴리시 | 2015 | 신뢰 영역 제약 | 안정적 정책 최적화 | 낮음[1] |
| A3C | 액터-크리틱, 온 폴리시 | 2016 | 비동기 병렬 학습 | CPU 기반 분산 학습 | 낮음[1] |
| PPO | 정책, 온 폴리시 | 2017 | 클리핑된 대리 목적 함수 | 범용, RLHF | 낮음[1] |
| SAC | 액터-크리틱, 오프 폴리시 | 2018 | 최대 엔트로피 RL | 연속 제어, 로보틱스 | 높음[1] |
| TD3 | 액터-크리틱, 오프 폴리시 | 2018 | 쌍둥이 크리틱, 지연 갱신 | 연속 제어 | 높음[1] |
| AlphaZero | 모델 기반, 자기 대국 | 2017 | MCTS를 쓴 자기 대국 | 완전 정보 게임 | 매우 높음[1] |
| MuZero | 모델 기반, 학습된 모델 | 2020 | 학습된 잠재 동역학 | 규칙을 모르는 게임 | 매우 높음[1] |
| GRPO | 정책, 온 폴리시 | 2024 | 그룹 상대 어드밴티지 추정 | LLM 추론 학습 | 보통[1] |
10. 심층 강화 학습
심층 강화 학습(deep RL)은 RL 알고리즘에 딥러닝 모델인 심층 신경망을 함수 근사기로 결합해, 표 형식의 방법으로는 다루기 어려운 고차원 상태와 행동 공간을 다룰 수 있게 한다.[1]
고전적 Q-러닝 같은 표 형식 방법은 모든 상태-행동 쌍의 값을 표로 유지한다. 이 방식은 상태가 몇백 또는 몇천 개인 작은 문제에서만 작동하며, 상태가 이미지나 연속 변수 같은 고차원 입력으로 표현되면 완전히 실패한다. Atari 게임의 한 프레임은 210 x 160 픽셀이며 픽셀마다 128가지 색을 가질 수 있어, 원시 상태 공간이 천문학적으로 커진다.[1]
신경망은 가치 함수나 정책을 압축되고 일반화 가능한 형태로 학습해 이 문제를 푼다. 합성곱 신경망은 원시 픽셀을 처리해 Q 값이나 행동 확률을 출력하며, 물체 위치, 속도, 공간 관계 같은 관련 특징을 자동으로 학습한다.[1]
심층 RL은 반복적으로 쓰이는 몇 가지 구조 패턴을 사용한다.[1]
- 시각 관찰을 처리하는 합성곱 네트워크(DQN, AlphaGo)
- 부분 관찰과 순차적 의존성을 다루는 순환 네트워크(LSTM, GRU)
- 긴 이력에 대한 시퀀스 모델링과 어텐션을 위한 트랜스포머(Decision Transformer, Gato)
- 심층 가치·정책 네트워크의 학습 안정성을 위한 잔차 네트워크와 정규화 계층[1]
신경망을 RL과 결합하면 지도 학습에서는 생기지 않는 불안정성이 나타난다. 정책이 개선되면서 학습 데이터의 분포가 바뀌고, 가치 함수의 작은 변화가 정책의 큰 변화를 낳으며, 그 변화가 다시 데이터 분포를 바꾼다. 경험 재현, 목표 네트워크, 기울기 클리핑, 엔트로피 정규화가 이런 문제를 다루는 흔한 기법이다.[1]
11. 주요 이정표
TD-Gammon(1992)은 IBM의 토머스 J. 왓슨 연구소에 있던 Gerald Tesauro가 개발했으며, 신경망과 결합된 RL이 전문가 수준 성능에 이를 수 있음을 보인 초기 사례 중 하나다. 3층 신경망(입력 특징 198개, 은닉 유닛 80개, 출력 유닛 1개)으로 백개먼 국면을 평가했고, TD(람다)로 자기 자신과 약 150만 판을 두며 전적으로 자기 대국으로 학습했다. 2.1 버전은 세계 최상위 인간 선수에 조금 못 미치는 수준에 이르렀다. 이 프로그램은 약 20년 뒤 이어진 심층 RL의 돌파구를 예고한 선구자로 흔히 언급된다.[1]
DQN과 아타리(2013, 2015): DeepMind의 DQN은 여러 과제에서 원시 픽셀 입력만으로 성공적인 제어 정책을 직접 학습한 첫 시스템이다.[18] 2013년 논문은 아타리 게임 7개에서 강한 성능을 보였고, 2015년 Nature 논문은 이를 49개 게임으로 확장했다. 모든 게임에 같은 구조와 하이퍼파라미터를 쓰면서도 그중 29개에서 인간 수준 성능을 냈으며, 하나의 심층 RL 구조가 매우 다른 과제에 일반화할 수 있음을 보인 결과다.[1]
AlphaGo(2016): AlphaGo는 2016년 3월 18회 우승한 세계 바둑 챔피언 이세돌을 4대 1로 이겼으며, 이 대국은 2억 명이 넘는 사람이 지켜봤다.[8] 인간 전문가 대국으로 지도 학습한 뒤 자기 대국으로 RL을 결합했고, 정책 네트워크와 가치 네트워크가 이끄는 몬테카를로 트리 탐색(MCTS)을 사용했다.[1]
2017년 뒤이어 발표된 AlphaGo Zero는 인간 데이터 없이 무작위 플레이에서 출발해 자기 대국만으로 학습했으며, 40시간의 학습 뒤 기존 AlphaGo를 넘어섰다.[21] AlphaZero는 이 접근을 체스와 장기에도 확장해, 백지 상태에서 24시간 학습한 뒤 세 게임 모두에서 기존 최강 프로그램을 이겼다.[22]
OpenAI Five(2019): Dota 2는 바둑보다 훨씬 복잡한 게임으로, 불완전 정보, 실시간 의사 결정, 약 2만 프레임에 이르는 긴 시간 지평, 거대한 행동 공간, 5인 팀플레이가 특징이다.[9] 이 시스템은 PPO와 자기 대국을 썼고, CPU 코어 128,000개와 GPU 256개에서 실행되어 게임 경험 45,000년 분량을 쌓았다. 2019년 4월에는 현역 인간 세계 챔피언 팀 OG를 2대 0으로 이겼다. PPO와 대규모 자기 대국이 복잡한 실시간 환경의 다중 에이전트 협력을 다룰 수 있음을 보여 준 사례다.[1]
AlphaStar(2019): DeepMind의 AlphaStar는 스타크래프트 II에서 그랜드마스터 수준에 이르렀으며, 공식 유럽 래더에서 인간 플레이어 상위 0.2%에 올랐다.[23] 스타크래프트 II는 불완전 정보(전쟁의 안개), 실시간 행동, 장기 전략 계획, 조합적 행동 공간이라는 바둑보다 어려운 과제를 제시한다. AlphaStar는 인간 리플레이로 모방 학습한 뒤 다중 에이전트 RL을 결합해, 서로 경쟁하는 에이전트 리그를 학습시키며 다양한 전략을 개발했다.[1]
AlphaProof(2024): DeepMind의 AlphaProof는 AlphaZero 방식의 자기 대국 틀에 Lean 증명 보조기를 결합해 형식 수학에 RL을 적용했다. 생성된 모든 증명이 기계로 검증되므로 정확성이 보장된다.[24] 수백만 개의 자동 형식화된 문제로 된 교육과정으로 학습했고, 각 목표 문제의 변형을 만들어 내는 테스트 시점 RL을 사용했다. 그 결과 2024년 국제 수학 올림피아드(IMO)의 기하 이외 문제 5개 중 3개를 풀었으며, 여기에는 대회에서 가장 어려운 문제도 포함되었다. AlphaGeometry와 결합해 은메달 수상자 수준의 점수에 도달했고, AI가 IMO에서 메달 수준의 성적을 낸 것은 처음이었다. 이 연구는 2025년 11월 Nature에 실렸으며, AlphaZero의 자기 대국 방식을 고정된 규칙의 게임에서 정리 증명이라는 열린 영역으로 확장했다.[24][1]
12. 인간 피드백 강화 학습(RLHF)
RLHF는 강화 학습의 가장 큰 영향력을 가진 응용 중 하나가 되었다. 이 기법은 사전 학습된 언어 모델을 지시를 따르고, 유해한 요청을 거절하며, 전반적으로 사람이 도움이 된다고 여기는 방식으로 행동하는 대화형 어시스턴트로 바꾼다.[1]
RLHF 과정은 보통 세 단계로 이루어진다.[1]
- 지도 미세 조정(SFT): 사전 학습된 언어 모델을 사람이 쓴 바람직한 행동 시연 데이터셋으로 미세 조정한다.
- 보상 모델 학습: 사람 라벨러가 모델 출력 쌍을 비교해 선호하는 쪽을 고른다. 이 선호 라벨로 임의의 출력에 스칼라 점수를 예측하는 보상 모델을 학습한다.
- RL 최적화: SFT 모델을 보상 모델 점수를 최대화하도록 RL(보통 PPO)로 추가 학습하며, SFT 모델에서 지나치게 멀어지지 않도록 KL 발산 패널티를 둔다.[1]
OpenAI의 InstructGPT(2022)는 이 접근을 보인 최초의 공개 사례 중 하나이며,[15] 같은 방법론이 ChatGPT에도 쓰였다. Anthropic은 Claude를 학습하기 위해 헌법적 AI(Constitutional AI, CAI)라는 변형을 적용했으며, 여기서는 AI가 생성한 피드백이 사람의 라벨링을 부분적으로 대체한다.[25]
RLHF에서 강화 학습 단계는 빠르게 발전했다.[1]
| 방법 | 연도 | 설명 |
|---|---|---|
| PPO 기반 RLHF | 2022 | InstructGPT와 ChatGPT에 쓰인 최초의 접근[1] |
| 직접 선호 최적화(DPO) | 2023 | 별도 보상 모델과 RL 단계를 없애고 선호 쌍에서 직접 최적화[1] |
| 카너먼-트버스키 최적화(KTO) | 2024 | 쌍별 선호 대신 좋음/나쁨 이진 라벨을 사용[1] |
| 그룹 상대 정책 최적화(GRPO) | 2024 | 가치 네트워크를 없애고 그룹 보상 분포에서 어드밴티지를 추정[1] |
| AI 피드백 강화 학습(RLAIF) | 2023 이후 | AI가 만든 선호를 써서 정렬을 확장[1] |
GRPO는 원래 추론을 위해 만들어진 것이 아니다. 2024년 2월 DeepSeek의 DeepSeekMath 논문에서 PPO의 메모리 효율적인 변형으로 소개되었다. 별도의 가치(비평가) 네트워크를 없애고, 같은 프롬프트에 대해 샘플링한 응답 그룹의 평균 보상으로 각 행동의 어드밴티지를 추정한다.[26] 이 비평가 없는 설계는 이후 LLM의 RL에 잘 맞는 것으로 드러났다. 프롬프트마다 많은 완성문을 샘플링하는 일이 싸고, 긴 토큰 시퀀스에 걸쳐 안정적인 가치 함수를 학습하기 어렵기 때문이다.[1]
DeepSeek-R1은 2025년 1월 공개되었으며, 검증 가능한 보상을 쓴 GRPO 기반 RL로 LLM에 강한 추론 능력을 낼 수 있음을 보였다. 동반 모델인 DeepSeek-R1-Zero는 지도 미세 조정 단계 없이 학습되었으며, 자기 성찰, 검증, 사고의 연쇄 추론 같은 행동을 RL만으로 익혔다. 공개된 DeepSeek-R1 모델은 RL 학습 전에 콜드 스타트 지도 미세 조정 단계를 포함했고, 수학 추론 벤치마크에서 OpenAI의 o1과 비슷한 성능을 냈다.[1]
검증 가능한 보상을 쓴 강화 학습(RLVR)은 보상이 학습된 보상 모델이 아니라 결정론적 규칙 기반 검증기에서 나오는 학습 패러다임이다.[1] 수학 문제에서는 검증기가 모델의 최종 답이 정답 풀이와 일치하는지 확인하고, 코드 생성에서는 자동 테스트가 검증기 역할을 한다. RLVR은 학습된 보상 모델에 내재한 보상 해킹 문제를 피하며, 2025년 기준으로 추론 중심 LLM을 학습하는 표준 접근이 되었다. 오픈소스 추론 모델에서 RLVR과 함께 가장 많이 쓰이는 RL 최적화기는 GRPO다. 이 아이디어는 답 검사를 보상으로 쓴 DeepSeekMath(2024)에서 유래했다. 「검증 가능한 보상을 쓴 강화 학습」이라는 용어는 2024년 후반 Allen Institute for AI가 Tulu 3 오픈 사후 학습 작업에서 붙였으며, 이 작업은 RLVR을 학습된 보상 모델이 검증 함수로 대체된 표준 RLHF 루프로 설명했다.[26][27]
추론용 RL에서 핵심적인 구분은 보상 신호가 무엇을 채점하느냐다. 결과 보상 모델(ORM)은 최종 답만 채점하고, 과정 보상 모델(PRM)은 사고 연쇄의 각 중간 단계를 채점한다.[28] OpenAI의 2023년 연구 「Let's Verify Step by Step」(Lightman 등)은 MATH 문제 풀이에 대한 약 80만 개의 사람 단계별 정답 라벨로 된 PRM800K 데이터셋으로 PRM을 학습했다. 단계별 과정 감독이 결과만 감독하는 방식보다 더 신뢰할 만한 보상 모델을 만들었고, 과정 감독 검증기는 MATH 테스트 대표 부분 집합의 78%를 풀었다.[28] PRM은 더 조밀한 피드백을 주고 어느 단계에서 풀이가 틀렸는지 짚을 수 있지만, 라벨링 비용이 크고 악용될 수 있다. 2025~2026년 RLVR 흐름의 상당수는 의도적으로 PRM을 피하고, 값이 싸고 해킹이 어려우며 DeepSeek-R1이 보였듯 다단계 추론을 유도하기에 충분한 단순한 이진 결과 검증기(최종 답이 맞는지 틀린지)를 쓴다.[1]
GRPO가 추론에 빠르게 채택되면서 몇 가지 약점이 드러났고, 이를 고치려는 후속 알고리즘 계열이 등장했다. 이들 대부분은 원래 목적 함수에서 KL 패널티 항을 제거한다. DAPO(Decoupled Clip and Dynamic sAmpling Policy Optimization)는 2025년 ByteDance의 Seed 팀이 오픈소스로 공개했으며, 상한과 하한 클리핑 경계를 분리하고 정보가 많은 샘플을 남기도록 프롬프트를 동적으로 걸러낸다. Qwen2.5-32B 기반 모델로 AIME 2024에서 50점에 도달했다.[29] Dr. GRPO(2025)는 GRPO의 어드밴티지 정규화에 있는 길이 편향을 고쳐, 더 짧은 정답이 체계적으로 유리해지지 않도록 한다. GSPO(Group Sequence Policy Optimization)는 2025년 Qwen 팀이 소개했으며, 중요도 샘플링 비율을 토큰이 아니라 생성된 전체 시퀀스 단위로 계산하고 클리핑도 그 단위로 적용한다. 이는 혼합 전문가(MoE) 모델의 학습을 안정시키며 Qwen3 시리즈 학습에 쓰였다.[30][1]
13. 강화 학습의 활용 분야
강화 학습은 시스템이 장기적 결과를 최적화하려고 일련의 결정을 학습해야 하는 곳이면 어디서든 쓰인다. 가장 눈에 띄는 성공은 게임이지만, 같은 기법이 이제 산업 제어 시스템, 로봇, 추천 엔진, 대규모 언어 모델의 정렬을 학습시킨다. 아래에서 주요 응용 분야를 살펴본다.[1]
강화 학습은 여러 게임에서 초인적 성능을 냈다.[1]
- 보드게임: AlphaGo, AlphaZero, MuZero는 자기 대국으로 바둑, 체스, 장기를 정복했다.[22]
- 비디오 게임: DQN은 아타리 게임 49개를 정복했고, OpenAI Five는 Dota 2를, AlphaStar는 스타크래프트 II에서 그랜드마스터에 도달했다.[23]
- 포커: Pluribus(2019)는 6인 노리밋 텍사스 홀덤에서 프로 선수를 이겼으며, 주요 다인 포커 형식에서 인간을 이긴 최초의 AI다.
- 외교: Meta의 Cicero(2022)는 보드게임 Diplomacy에서 인간 수준의 성능을 냈으며, 협상을 위해 RL과 자연어 생성을 결합했다.[1]
강화 학습은 로봇이 수동 프로그래밍 대신 시행착오로 운동 기술을 익히게 한다.[1]
- 보행: 시뮬레이션에서 학습한 정책을 실제 로봇으로 옮겨 걷기, 달리기, 울퉁불퉁한 지형 탐색에 쓴다. Boston Dynamics는 로봇 행동의 일부 측면에 RL을 쓴다.
- 조작: OpenAI는 강화 학습, 시뮬레이션에서 실제로의 전이, 도메인 무작위화를 써서 로봇 손(Dactyl)이 루빅스 큐브를 푸는 모습을 2019년 보여 주었다.[31]
- 조립과 제조: 산업용 로봇이 조립 순서, 용접 경로, 집어 놓기 작업을 학습한다.
- 시뮬레이션에서 실제로의 전이: MuJoCo, Isaac Gym 같은 물리 시뮬레이터에서 학습한 뒤 실제 하드웨어로 옮기는 일은 여전히 주요 연구 분야다. 학습 중 시뮬레이션 매개변수를 바꾸는 도메인 무작위화는 시뮬레이션과 실제 환경의 차이를 메우는 데 도움을 준다.[1]
자율주행 시스템은 주행의 여러 측면에 RL을 쓴다.[1]
- 경로 계획과 궤적 최적화
- 차선 변경과 합류 결정
- 적응형 크루즈 컨트롤과 차간 거리 유지
- 교차로와 신호등에서의 협상
Waymo, Tesla 등 기업은 RL을 자율주행 스택의 한 구성 요소로 쓰지만, 대부분의 실제 운영 시스템은 RL을 규칙 기반 안전 제약 및 사람 운전자에 대한 모방 학습과 결합한다.[1]
의학 분야의 RL 응용은 다음과 같다.[1]
- 치료 최적화: 중환자실(ICU)의 패혈증 관리처럼 만성 질환에 대한 동적 치료 방식에서, RL 에이전트가 약물 투여량과 인공호흡기 설정을 권고한다.
- 신약 개발: 분자 설계와 화학 구조 최적화[1]
- 개인 맞춤 의학: 관찰된 반응에 따라 환자를 치료에 배정하는 적응형 임상 시험 설계
- 의료 영상: 해부학적 랜드마크 탐지와 영상 획득 최적화를 위한 RL 기반 전략
- 알고리즘 거래: 거래를 실행하고 재고를 관리하며 진입과 청산 시점을 정하는 법을 학습하는 자동 전략
- 포트폴리오 관리: 변화하는 시장 상황에 맞춰 조정되는 동적 자산 배분
- 위험 관리: 신용 점수 모델과 사기 탐지 시스템
- 시장 조성: 유동성을 공급하고 매수·매도 호가 차이를 관리하는 RL 에이전트[1]
- 데이터센터 냉각: Google DeepMind는 RL로 HVAC 설정을 최적화해 2016년 데이터센터 냉각 에너지 소비를 40% 줄였다.
- 스마트 그리드: 부하 균형, 수요 반응, 재생에너지 통합을 위한 RL[1]
- 풍력 발전: 터빈의 요 각도와 블레이드 피치를 최적화해 에너지 생산량을 최대화
- 건물 관리: 상업용 건물의 HVAC와 조명 최적화
- RLHF와 RLVR: ChatGPT, Claude, GPT-4, Gemini, Llama, DeepSeek를 지시를 따르고 인간의 가치에 맞추도록 학습.[1]
- 대화 시스템: 참여도와 과업 완료를 위해 대화형 에이전트를 최적화
- 기계 번역: BLEU 점수나 사람의 선호에 기반한 보상 신호로 번역 품질 향상
- 텍스트 요약: RL 기반 보상 신호로 최적화된 간결하고 유익한 요약 생성
추천 시스템에서 RL은 즉각적인 클릭률이 아니라 장기 사용자 참여를 최대화하는 목표에 쓰인다. YouTube, Netflix, Spotify 같은 플랫폼은 RL에서 영감을 받은 접근으로 탐험(새 콘텐츠 노출)과 활용(검증된 인기 콘텐츠 추천)의 균형을 맞추고, 사용자 상호작용의 순차적 성격을 고려하며, 짧은 기간의 클릭 대신 잔존율 같은 장기 지표를 최적화한다.[1]
14. 다중 에이전트 강화 학습
다중 에이전트 강화 학습(MARL)은 여러 에이전트가 공유 환경에서 상호작용하는 상황으로 RL을 확장한다. 단일 에이전트 RL에는 없는 어려움이 생기는데, 에이전트는 함께 학습하는 다른 에이전트의 행동을 고려해야 하며, 이 때문에 각 에이전트의 관점에서는 환경이 비정상적(non-stationary)이 된다.[1]
다중 에이전트 설정은 세 가지 유형으로 나뉜다.[1]
| 설정 | 설명 | 예시 |
|---|---|---|
| 완전 협력 | 모든 에이전트가 공통 보상을 공유 | 로봇 군집 조정, 팀 기반 게임[1] |
| 완전 경쟁 | 한 에이전트의 이득이 다른 에이전트의 손실이 됨(제로섬) | 보드게임, 경쟁형 비디오 게임[1] |
| 혼합(일반 합) | 에이전트의 목표가 일부는 맞고 일부는 충돌함 | 자율주행, 경제 시장, 협상[1] |
- 독립 학습자: 각 에이전트가 자신의 RL 알고리즘을 따로 실행하며 다른 에이전트를 환경의 일부로 취급한다. 단순하지만 다른 에이전트가 동시에 학습하며 생기는 비정상성을 무시한다.
- 중앙 집중 학습·분산 실행(CTDE): 학습 중에는 에이전트들이 정보를 공유한다(예: 전역 상태를 보는 공유 비평가). 배포 시에는 각자의 지역 관찰만으로 행동한다. QMIX와 MAPPO가 널리 쓰이는 CTDE 알고리즘이다.
- 통신 학습: 에이전트가 이산 또는 연속 메시지로 소통하는 법을 배우며, 부분 관찰 환경에서 협력을 가능하게 한다.
- 집단 기반 학습: 서로 다른 전략을 가진 에이전트 집단이 함께 진화한다. AlphaStar의 리그 학습이 이 방식을 썼다.[1]
MARL은 자율주행(교차로에서 협상하는 여러 차량), 로봇 군집(협조된 탐험과 과업 할당), 교통 신호 제어(도시 전체 교통 흐름 최적화), 다인 게임(Dota 2, StarCraft II), 스마트 그리드와 통신망의 자원 할당 등에 적용되어 왔다. 2024년 12월에는 MARL을 다룬 종합 MIT Press 교재가 출간되어 이 분야의 성숙도를 보여 준다.[1]
15. 한계와 과제
RL 알고리즘은 효과적인 정책을 배우는 데 보통 막대한 상호작용 데이터가 필요하다.[32]
- DQN: 아타리에서 2억 프레임이 필요했다(사람 플레이로 약 924시간 분량).
- OpenAI Five: Dota 2 게임 45,000년 분량의 경험
- AlphaGo Zero: 20블록 버전은 3일 동안 자기 대국 490만 판을 두었고, 40블록 버전은 40일 동안 학습하며 2,900만 판을 생성했다.[21]
이 때문에 로봇이나 실제 차량처럼 물리 시스템에서 직접 학습하는 것은 대부분의 현재 알고리즘에 비실용적이다. 해결책으로는 모델 기반 RL(학습된 모델로 합성 데이터 생성), 전이 학습(관련 과제의 지식 재사용), 커리큘럼 학습(과제 난이도를 점진적으로 높이기), 오프라인 RL(추가 상호작용 없이 고정 데이터셋으로 학습)이 있다.[1]
효과적인 탐험은 다음과 같은 환경에서 매우 어렵다.[1]
- 희소 보상: 에이전트가 드문 목표 상태에 도달하기 전까지 아무 피드백도 받지 못한다. 블록 쌓기를 배우는 로봇은 성공했을 때만 보상을 받고, 수많은 중간 단계 동안 신호가 없을 수 있다.
- 대규모 또는 연속 상태 공간: 가능한 구성의 수가 천문학적으로 많다.
- 안전이 중요한 영역: 탐험이 치명적 실패로 이어질 수 있다. 자율주행차는 나쁜 운전 전략을 탐험할 수 없다.
이 문제를 다루는 접근으로는 내재적 동기와 호기심 기반 탐험(새로운 상태 방문에 보상), 계층적 RL(문제를 하위 목표로 분해), 제약이 있는 안전 탐험 방법이 있다.[1]
진짜 목표를 담는 보상 함수를 설계하는 일은 악명 높을 만큼 어렵다.[1]
- 보상 해킹: 에이전트가 보상 함수의 의도하지 않은 지름길을 악용한다. 보트 경주 에이전트는 경주를 끝내는 대신 원을 그리며 보너스 아이템을 모았는데, 보너스 아이템이 경주 완주보다 더 많은 보상을 주었기 때문이다.
- 보상 형성: 중간 보상을 수작업으로 설계해 학습을 이끄는 방식은 오류가 나기 쉽고 편향을 낳을 수 있다.
- 명세 게이밍: 에이전트가 보상 함수의 문구는 만족하지만 의도와는 맞지 않는 예상치 못한 전략을 찾는다.[1]
LLM의 RLHF에서 보상 해킹은 보상 모델에서 높은 점수를 받지만 실제로는 더 도움이 되지 않는, 장황하고 아첨하는 응답으로 나타난다. 완화 전략으로는 역강화 학습(시연에서 보상을 학습), 보상 모델 앙상블, 2025년에 소개된 선호를 보상으로 쓰는(PAR) 접근이 있다.[1]
시뮬레이션에서 학습한 정책은 물리 법칙, 센서 잡음, 액추에이터 동역학, 시각적 외형의 차이, 즉 시뮬레이션과 현실의 격차(sim-to-real gap) 때문에 실제 하드웨어에 배포하면 자주 실패한다.[33] 연구에 따르면 물리 기반 동역학 모델은 단순화된 모델이 완전히 실패하는 엄격한 정밀도 제약 아래에서도 실제 성공률 최대 50%를 낼 수 있다. 도메인 무작위화(학습 중 시뮬레이션 매개변수 변화), 시스템 식별(시뮬레이션을 현실에 맞게 보정), 점진적 도메인 적응이 이 격차를 메우는 데 도움을 준다.[1]
RL 에이전트는 학습 환경 밖으로 일반화하는 데 자주 실패한다. 한 버전의 비디오 게임에서 학습한 정책이 조금 다른 버전에서는 실패할 수 있다. 여러 과제를 순차적으로 학습하면 신경망은 치명적 망각을 겪는데, 새 과제의 학습이 이전 과제에 필요한 가중치를 덮어쓴다. 메타 학습, 도메인 무작위화, 지속 학습이 이 문제를 다루는 활발한 연구 분야다.[1]
신경망 정책은 블랙박스여서 에이전트가 특정 행동을 하는 이유를 이해하기 어렵다. 이는 다음 문제를 낳는다.[1]
- 검증: RL 시스템이 가능한 모든 상황에서 안전하게 행동함을 증명하기
- 디버깅: 에이전트가 특정 상황에서 실패하는 이유 파악하기
- 규제: 의료나 자율주행 같은 안전이 중요한 영역에 RL을 배포하려면 설명 가능한 의사 결정이 필요하다
- AI 정렬: RL 에이전트가 학습한 목표가 인간의 가치와 의도에 맞는지 보장하기
16. 최근 연구 방향(2025~2026)
오프라인 RL(배치 RL이라고도 함)은 이전에 수집된 전이의 고정 데이터셋에서, 환경과 추가로 상호작용하지 않고 학습한다.[34] 온라인 탐험이 비싸거나 위험한 분야(의료, 자율주행, 산업 제어)에서 가치가 크다. 주요 방법은 다음과 같다.
- 보수적 Q-러닝(CQL): 분포 밖 행동의 Q 값에 패널티를 주어 과대 추정을 막는다.
- 암묵적 Q-러닝(IQL): 분포 밖 행동을 아예 조회하지 않는다.
- Decision Transformer: RL을 시퀀스 모델링 문제로 보고, 트랜스포머가 원하는 보상(return)을 조건으로 행동을 예측한다.[1]
파운데이션 모델과 RL의 교차점은 가장 활발한 연구 분야 중 하나다. 여러 방향이 등장했다.[1]
- 파운데이션 모델 학습을 위한 RL: 정렬과 개선을 위한 RLHF, RLVR, GRPO
- RL을 위한 파운데이션 모델: 사전 학습된 언어 및 시각 모델로 RL 에이전트에 표현, 세계 지식, 보상 신호를 제공
- 범용 에이전트: DeepMind의 Gato(2022)와 Google의 RT-2(2023) 같은 시스템은 대규모 사전 학습 모델과 RL을 결합해 텍스트, 이미지, 로봇 제어 등 여러 영역에서 작동하는 에이전트를 만든다.[35]
- 시각-언어-행동 모델: RT-1, RT-2 등은 트랜스포머 구조로 시각 관찰과 언어 지시를 로봇 행동에 직접 대응시킨다.[1]
학습된 세계 모델은 에이전트가 실제 환경과 상호작용하지 않고도 계획을 세우고 미래를 상상하게 한다.[1]
- Dreamer(v1, v2, v3): 잠재 동역학 모델을 학습하고 상상된 롤아웃만으로 정책을 학습해, 훨씬 적은 실제 데이터로 경쟁력 있는 성능을 낸다.[16]
- RLVR-World(2025): 검증 가능한 보상을 쓰는 RL로 세계 모델을 직접 최적화하는 프레임워크로, 텍스트 게임, 웹 탐색, 로봇 조작을 포함한 여러 영역을 다룬다.
- 미분 가능한 물리 시뮬레이터: 로보틱스 응용에서 시뮬레이션 물리를 통한 경사 기반 최적화를 가능하게 한다.[1]
계층적 RL은 복잡하고 긴 지평의 과제를 다룰 수 있는 하위 과제로 분해한다.[1]
- 옵션 프레임워크: 여러 시간 단계에 걸쳐 실행되는 하위 정책인 옵션을 통한 시간적 추상화
- 목표 조건 정책: 상위 정책이 하위 목표를 설정하고 하위 정책이 이를 달성한다
- Feudal networks: 관리자(manager)가 작업자(worker)에게 목표를 설정하는 계층 구조
이는 계획이 수백 또는 수천 단계에 걸쳐야 하는 로보틱스 및 내비게이션 과제와 특히 관련이 있다.[1]
안전 RL은 학습과 배포 과정 모두에서 안전 제약을 만족하는 알고리즘을 개발한다. 제약 MDP는 안전 요건을 기대 비용에 대한 제약으로 정식화한다. 차폐(shielding) 접근은 형식 검증으로 위험한 행동을 차단한다. 자율주행과 의료 치료 최적화처럼 안전이 중요한 응용으로 RL이 옮겨 가면서 이 분야가 커지고 있다.[1]
2026년에도 추론과 에이전트 모델을 위한 RL의 흐름은 계속되었다. 2025년 9월 DeepSeek-R1 연구가 독립 동료 심사를 거쳐 Nature(vol. 645, pp. 633-638)에 실렸다. 이로써 DeepSeek-R1은 그 기준을 통과한 최초의 주요 공개 가중치 LLM이 되었으며, GRPO를 쓴 순수 RL로 추론을 유도할 수 있다는 주장이 공식화되었다.[36]
2026년 4월 24일 DeepSeek는 차세대 공개 가중치 모델 DeepSeek-V4를 공개했다. MIT 라이선스의 두 가지 변형으로, V4-Pro(1.6조 매개변수 혼합 전문가 모델, 활성 매개변수 약 490억)와 더 작은 V4-Flash가 있으며, 둘 다 100만 토큰 컨텍스트 창을 갖는다. 모델 카드는 2단계 사후 학습 방식을 설명하는데, 지도 미세 조정과 GRPO 기반 RL로 도메인 전문가를 키운 뒤 온폴리시 증류로 통합한다.[37]
에이전트형 RL(agentic RL)이라는 별도의 연구 방향은 2026년에 자리 잡았다. 조사 연구들은 LLM 학습을 단일 단계 밴딧이 아니라 시간적으로 확장된 부분 관찰 MDP로 다시 본다. RL은 모델에 장기 계획, 도구 사용, 메모리, 자기 성찰 능력을 부여한다.[38] 보상 설계와 크레딧 할당 연구도 발전했다. 2026년 5월 소개된 부분 문제 커리큘럼 RL(SCRL)은 어려운 문제에서의 부분 진전을 검증 가능한 학습 신호로 바꾸며, Qwen3-Base 모델에서 GRPO 대비 최대 4.1점 향상을 보고했다.[39]
로보틱스에서는 sim-to-real RL이 눈에 띄게 저렴해졌다. 2025년 12월 버클리 주도 팀의 방법은 약 15분의 학습으로 하드웨어에 옮길 수 있는 휴머노이드 보행을 익혔다.[40]
17. 개발 도구와 프레임워크
| 프레임워크 | 언어 | 관리 주체 | 적합한 용도 |
|---|---|---|---|
| Gymnasium(구 OpenAI Gym) | Python | Farama Foundation | 환경 표준과 벤치마킹[1] |
| Stable-Baselines3 | Python | 커뮤니티 | 신뢰할 수 있는 알고리즘 구현(PPO, SAC, DQN)[1] |
| Ray RLlib | Python | Anyscale | 운영 규모의 분산 학습[1] |
| CleanRL | Python | 커뮤니티 | 단일 파일로 읽기 쉬운 알고리즘 구현[1] |
| TorchRL | Python | Meta(PyTorch) | 연구의 유연성과 모듈성[1] |
| Unity ML-Agents | C#/Python | Unity Technologies | 3D 시뮬레이션과 게임 환경[1] |
| TF-Agents | Python | TensorFlow 생태계 통합[1] | |
| Tianshou | Python | 커뮤니티 | 모듈형 연구 프레임워크[1] |
| ACME | Python | DeepMind | JAX 기반 대규모 연구[1] |
시뮬레이션 환경은 다음과 같다.[1]
| 환경 | 영역 | 설명 |
|---|---|---|
| MuJoCo | 물리·로보틱스 | 연속 제어를 위한 고충실도 물리 시뮬레이션[1] |
| Isaac Gym | 로보틱스 | 대규모 병렬 학습을 위한 GPU 가속 물리[1] |
| Arcade Learning Environment(ALE) | 아타리 게임 | 픽셀 입력 이산 제어의 표준 벤치마크[1] |
| PettingZoo | 다중 에이전트 | 다중 에이전트 환경을 위한 표준 API[1] |
| CARLA | 자율주행 | 오픈소스 도시 주행 시뮬레이터[1] |
| MineRL | 마인크래프트 | 복잡한 오픈월드 게임의 계층적 과제[1] |
| Meta-World | 로봇 조작 | 메타 학습 연구를 위한 50가지 조작 과제[1] |
| RoboSuite | 로봇 조작 | 로봇 학습을 위한 표준화된 벤치마크[1] |
18. 자주 묻는 질문
강화 학습을 한 사람이 발명한 것은 아니다. 동물 학습 심리학, 최적 제어, 시간차 학습이라는 세 전통에서 자랐고, 리처드 서튼과 앤드루 바토(Andrew Barto)가 1998년 교재에서 이를 통합했다. 두 사람은 이 기초로 2024년 튜링상을 함께 받았다.[6][10] 크리스토퍼 왓킨스(Christopher Watkins)는 1989년 Q-러닝을 도입했고,[17] 리처드 벨먼(Richard Bellman)은 1950년대에 동적 계획법의 수학을 제공했다.[5]
강화 학습은 지도 학습도 비지도 학습도 아니다. 라벨이나 라벨 없는 데이터의 구조 대신 평가적 보상 신호로 학습하므로, 지도 학습·비지도 학습과 나란한 세 번째 패러다임이다.[2][3]
ChatGPT를 비롯한 현대 어시스턴트는 RLHF로 정렬되며, DeepSeek-R1 같은 추론 모델은 검증 가능한 보상을 쓴 RL로 학습된다.[15][1]
가장 널리 쓰이는 범용 RL 알고리즘은 PPO다. OpenAI가 2017년 발표했으며, RLHF의 원래 최적화기이기도 했다. LLM 추론에서는 GRPO가 흔해졌다.[20][1]
각주·출처 40개
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17 ↩18 ↩19 ↩20 ↩21 ↩22 ↩23 ↩24 ↩25 ↩26 ↩27 ↩28 ↩29 ↩30 ↩31 ↩32 ↩33 ↩34 ↩35 ↩36 ↩37 ↩38 ↩39 ↩40 ↩41 ↩42 ↩43 ↩44 ↩45 ↩46 ↩47 ↩48 ↩49 ↩50 ↩51 ↩52 ↩53 ↩54 ↩55 ↩56 ↩57 ↩58 ↩59 ↩60 ↩61 ↩62 ↩63 ↩64 ↩65 ↩66 ↩67 ↩68 ↩69 ↩70 ↩71 ↩72 ↩73 ↩74 ↩75 ↩76 ↩77 ↩78 ↩79 ↩80 ↩81 ↩82 ↩83 ↩84 ↩85 ↩86 ↩87 ↩88 ↩89 ↩90 ↩91 ↩92 ↩93 ↩94 ↩95 ↩96 ↩97 ↩98 ↩99 ↩100 ↩101 ↩102 ↩103 ↩104 ↩105 ↩106 ↩107 ↩108 ↩109 ↩110 ↩111 ↩112 ↩113 ↩114 ↩115 ↩116 ↩117 ↩118 ↩119 ↩120 ↩121 ↩122 ↩123 ↩124 ↩125 ↩126 ↩127 ↩128 ↩129 ↩130 ↩131 ↩132 ↩133 ↩134 ↩135 ↩136 ↩137 ↩138 ↩139 ↩140 ↩141 ↩142 ↩143 ↩144 ↩145 ↩146 ↩147 ↩148 ↩149 ↩150 ↩151 ↩152 ↩153 ↩154 ↩155 ↩156 ↩157 ↩158 ↩159 ↩160 ↩161 ↩162 ↩163 ↩164 ↩165 ↩166 ↩167 ↩168 ↩169 ↩170 ↩171 ↩172 ↩173 ↩174 ↩175 ↩176 ↩177 ↩178 ↩179 ↩180 ↩181 ↩182 ↩183 ↩184 ↩185 ↩186 ↩187 ↩188 ↩189 ↩190 ↩191 ↩192 ↩193 ↩194 ↩195 ↩196 ↩197 ↩198 AI Wiki: Reinforcement learning (2026-07-23 수정본) · CC BY 4.0 · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 Sutton, R. S., & Barto, A. G. (2018). Reinforcement Learning: An Introduction (2nd ed.). MIT Press. (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 Kaelbling, L. P., Littman, M. L., & Moore, A. W. (1996). "Reinforcement learning: A survey." Journal of Artificial Intelligence Research, 4, 237-285. (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 Bellman, R. (1957). Dynamic Programming. Princeton University Press. (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 ↩2 ↩3 Bellman, R. (1957). "A Markovian decision process." Journal of Mathematics and Mechanics, 6(5), 679-684. (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ACM. (2024). "ACM A.M. Turing Award recognizes pioneers of reinforcement learning." (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 ↩2 Sutton, R. S., & Barto, A. G. (1998). Reinforcement Learning: An Introduction (1st ed.). MIT Press. (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 ↩2 Silver, D., et al. (2016). "Mastering the game of Go with deep neural networks and tree search." Nature, 529(7587), 484-489. (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 ↩2 OpenAI. (2019). "OpenAI Five defeats Dota 2 world champions." OpenAI Blog. (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 ↩2 ↩3 ACM Announces 2024 A.M. Turing Award Recipients: Andrew Barto and Richard Sutton · 확인 2026-10-11
- ↩1 Pavlov, I. P. (1927). Conditioned Reflexes: An Investigation of the Physiological Activity of the Cerebral Cortex. Oxford University Press. (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 Thorndike, E. L. (1911). Animal Intelligence: Experimental Studies. Macmillan. (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 ↩2 Sutton, R. S. (1988). "Learning to predict by the methods of temporal differences." Machine Learning, 3(1), 9-44. (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 Sutton, R. S., & Barto, A. G. (1998). Reinforcement Learning: An Introduction. MIT Press. (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 ↩2 ↩3 Ouyang, L., et al. (2022). "Training language models to follow instructions with human feedback." Advances in Neural Information Processing Systems, 35. (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 ↩2 Mastering diverse domains through world models · 확인 2026-10-11
- ↩1 ↩2 ↩3 Watkins, C. J. C. H. (1989). Learning from Delayed Rewards. PhD thesis, University of Cambridge. Convergence proof in Watkins, C. J. C. H., & Dayan, P. (1992). "Q-learning." Machine Learning, 8(3), 279-292. (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 ↩2 ↩3 Mnih, V., et al. (2015). "Human-level control through deep reinforcement learning." Nature, 518(7540), 529-533. (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 Continuous control with deep reinforcement learning · 확인 2026-10-11
- ↩1 ↩2 ↩3 Proximal policy optimization algorithms · 확인 2026-10-11
- ↩1 ↩2 Silver, D., et al. (2017). "Mastering the game of Go without human knowledge." Nature, 550(7676), 354-359. (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 ↩2 Silver, D., et al. (2018). "A general reinforcement learning algorithm that masters chess, shogi, and Go through self-play." Science, 362(6419), 1140-1144. (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 ↩2 Vinyals, O., et al. (2019). "Grandmaster level in StarCraft II using multi-agent reinforcement learning." Nature, 575(7782), 350-354. (AI Wiki 참고문헌) · 확인 2026-10-11
- ↩1 ↩2 Olympiad-level formal mathematical reasoning with reinforcement learning · 확인 2026-10-11
- ↩1 Constitutional AI: Harmlessness from AI feedback · 확인 2026-10-11
- ↩1 ↩2 DeepSeekMath: Pushing the limits of mathematical reasoning in open language models · 확인 2026-10-11
- ↩1 Tulu 3: Pushing frontiers in open language model post-training · 확인 2026-10-11
- ↩1 ↩2 Let's verify step by step · 확인 2026-10-11
- ↩1 DAPO: An open-source LLM reinforcement learning system at scale · 확인 2026-10-11
- ↩1 Group Sequence Policy Optimization · 확인 2026-10-11
- ↩1 Solving Rubik's Cube with a robot hand · 확인 2026-10-11
- ↩1 Challenges of real-world reinforcement learning · 확인 2026-10-11
- ↩1 Sim-to-real transfer in deep reinforcement learning for robotics: A survey · 확인 2026-10-11
- ↩1 Offline reinforcement learning: Tutorial, review, and perspectives on open problems · 확인 2026-10-11
- ↩1 A generalist agent · 확인 2026-10-11
- ↩1 DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning · 확인 2026-10-11
- ↩1 DeepSeek-V4-Pro model card · 확인 2026-10-11
- ↩1 The landscape of agentic reinforcement learning for LLMs: A survey · 확인 2026-10-11
- ↩1 From reasoning chains to verifiable subproblems: Curriculum reinforcement learning enables credit assignment for LLM reasoning · 확인 2026-10-11
- ↩1 Learning sim-to-real humanoid locomotion in 15 minutes · 확인 2026-10-11