| 분류 | 프롬프트 엔지니어링 기법 · 추론 방식[1] |
|---|---|
| 정의 | 언어 모델이 최종 답 이전에 생성하는 중간 추론 단계[2] |
| 대표 논문 | 2022년 「Chain-of-Thought Prompting Elicits Reasoning in Large Language Models」[2] |
| 주요 변형 | 퓨샷·제로샷 CoT, 자기 일관성, Auto-CoT, 생각의 나무, PAL[3] [4] [5] [6] [7] |
| 적합한 과제 | 수학·기호 문제 등 여러 단계를 거치는 추론 과제[8] |
| 주요 한계 | 풀이의 충실성 문제와 정답 보장 불가[9] [10] [11] |
쉽게 말하면, 사고의 연쇄는 AI가 최종 답을 내기 전에 중간 풀이 단계를 글로 적도록 이끄는 프롬프팅 방식이다. 풀이가 적힌 예시를 보여 주거나 ‘단계별로 생각해 보자’라고 지시하는 방식으로 쓴다. 수학이나 기호 문제처럼 여러 단계를 거치는 과제에서 성능을 높일 수 있지만, 풀이가 그럴듯하게 읽힌다고 해서 답이 맞거나 모델의 실제 판단 과정을 그대로 보여 준다는 뜻은 아니다.[1]
1. 개요
사고의 연쇄(Chain-of-thought, CoT)는 언어 모델이 최종 답을 내기 전에 생성하는 중간 단계들의 순서다. 사고의 연쇄 프롬프팅은 이보다 좁은 기법으로, 사전 학습된 대규모 언어 모델에서 이런 순서를 끌어내는 프롬프트 엔지니어링 기법이다. 보통 풀이가 적힌 예시를 보여 주거나 모델에게 단계별로 추론하라고 요청하는 방식을 쓴다. 원래의 퓨샷 방식에서 각 시연에는 입력, 중간의 자연어 풀이(근거), 답이 들어 있다. 모델의 가중치는 바뀌지 않는다.[2]
CoT는 일부 다단계 과제, 특히 수학 및 기호 문제에서 성능을 높일 수 있다. 그러나 정답을 증명하는 것이 아니며, 모델의 내부 판단 과정에 대한 설명으로 자동으로 받아들여서는 안 된다. 자연스럽게 읽히는 풀이에도 실수가 들어 있을 수 있고, 답을 바꾼 요인을 빠뜨릴 수 있으며, 답을 사후에 합리화하기도 한다.[8][9][10][11]
2. 정의와 범위
이 용어는 몇 가지 관련된 의미로 쓰인다.[1]
| 용어 | 뜻 |
|---|---|
| 사고의 연쇄 | 최종 답 이전에 생성되는 중간 토큰 또는 단계[1] |
| 퓨샷 CoT 프롬프팅 | 풀이가 담긴 시연을 사용하는 문맥 내 학습[1] |
| 제로샷 CoT | 풀이 시연 없이 ‘단계별로 생각해 보자’처럼 과제와 무관한 지시를 쓰는 방식[1] |
| 자기 일관성 | 여러 CoT 경로를 샘플링하고 그 최종 답들을 집계하는 방식[1] |
| 탐색 기반 추론 | 하나의 선형 풀이에 고정하지 않고 둘 이상의 부분 경로를 탐색하고 평가하는 방식[1] |
| 실행 가능 추론 | 문제를 코드나 다른 형식의 표현으로 옮기고 외부 인터프리터나 솔버를 사용하는 방식[1] |
| 학습된 추론 | 사용자의 프롬프트로만 끌어내는 것이 아니라 학습이나 사후 학습 중에 익힌 모델 행동[1] |
이 의미들을 하나의 메커니즘으로 뭉뚱그려서는 안 된다. 2022년의 프롬프팅 방법은 가중치를 고정한 모델에 주어지는 문맥을 바꾼다. 이후의 추론 모델은 중간 풀이를 생성한 뒤 답을 내도록 명시적으로 학습된다. 탐색 방법은 모델 주변에 추론 실행 절차를 더하고, 프로그램 보조 방법은 일부 계산을 외부 시스템에 맡긴다.[2][6][7][12]
생성된 CoT는 신경망 계산에 대한 완전한 설명과도 다르다. 눈에 보이는 단어들은 모델의 출력이다. 자기회귀 모델은 앞서 쓴 텍스트를 조건으로 삼기 때문에 이 단어들이 뒤의 토큰에 영향을 줄 수 있다. 그러나 그 사실만으로 이 단어들이 최종 답의 모든 원인을 충실히 보고한다고 입증되지는 않는다.[9][10]
3. 연구 배경
중간 계산을 다루는 연구는 ‘사고의 연쇄 프롬프팅’이라는 표현보다 앞서 있었다. 2021년 Maxwell Nye와 동료들은 트랜스포머 모델이 중간 계산을 스크래치패드에 출력하도록 학습시켰다. 긴 덧셈부터 프로그램 실행까지 여러 과제에서 스크래치패드 형식은 여러 단계 계산의 성능을 높였다. 이는 학습에 기반한 접근이었다. 따라서 나중에 퓨샷 CoT 프롬프팅으로 도입된 방법과 같은 것이라기보다 중요한 선행 연구였다.[13]
Jason Wei와 동료들은 2022년 1월에 논문 「Chain-of-Thought Prompting Elicits Reasoning in Large Language Models」를 처음 공개했고, 이 논문은 NeurIPS 2022에서 발표되었다. 핵심 결과는 프롬프트에 풀이 예시 몇 개를 넣으면 미세 조정 없이도 추가적인 중간 단계를 끌어낼 수 있다는 것이었다. 이 논문은 산술, 상식, 기호 추론 과제를 평가했다.[2]
원래의 프롬프트 형식은 다음 다섯 부분으로 나타낼 수 있다.[1]
- 입력으로 주어진 문제.
- 중간 단계를 자연어로 풀어 쓴 풀이.
- 일관된 형식의 최종 답.
- 같은 구조를 가진 예시 몇 개 더.
- 모델이 풀 새 입력.[1]
논문의 서술형 수학 실험에서 저자들은 시험한 벤치마크 전체에 CoT 예시 8개짜리 한 세트를 사용했다. 객관식 답을 쓰는 AQuA에는 서로 다른 예시 4개를 썼다. 최종 논문은 GPT-3, LaMDA, PaLM, UL2, Codex 계열 모델의 결과를 보고하며, 주된 비교에는 그리디 디코딩을 사용했다.[2]
이 방식은 예시에 질문과 답 사이의 근거(풀이)가 들어간다는 점에서 일반 퓨샷 프롬프팅과 다르다. 또 새 라벨이 붙은 데이터셋으로 모델을 학습시키지 않는다는 점에서, 근거를 덧붙인 미세 조정과도 다르다. 개입은 추론 실행 시점에 제공하는 프롬프트다.[1]
4. 원 논문의 결과와 흔한 수치 혼동
원 논문의 상세 결과표는 PaLM 540B가 GSM8K에서 표준 프롬프팅일 때 정확도 17.9%, 일반 CoT 프롬프팅일 때 56.9%를 기록했다고 보고한다. 생성된 풀이 속 수식에 사후적으로 외부 파이썬 계산기를 적용한 별도 조건은 58.6%에 도달했다. 논문의 반올림된 차트는 18%와 57%로 표시된다. 이 조건들을 하나의 ‘58%’ CoT 결과로 합쳐서는 안 된다.[2]
아래 표는 연구 내부 비교 중 일부를 옮긴 것이다. 이는 모델 간 순위표가 아니다. 행마다 모델, 프롬프트, 과제, 답 추출 방식, 추론 절차가 다르다.[1]
| 연구와 조건 | 과제 | 비교 기준 방법 | CoT 기반 방법 |
|---|---|---|---|
| Wei et al., PaLM 540B | GSM8K | 표준 프롬프팅: 17.9% | CoT: 56.9%[2] |
| Wei et al., PaLM 540B | GSM8K | CoT: 56.9% | CoT + 외부 계산기: 58.6%[2] |
| Kojima et al., text-davinci-002 | MultiArith | 제로샷: 17.7% | 제로샷 CoT: 78.7%[3] |
| Kojima et al., text-davinci-002 | GSM8K | 제로샷: 10.4% | 제로샷 CoT: 40.7%[3] |
| Wang et al., PaLM 540B | GSM8K | 그리디 CoT: 56.5% | 자기 일관성 다수결: 74.4%[4] |
| Wang et al., PaLM 540B | SVAMP | 그리디 CoT: 79.0% | 자기 일관성 다수결: 86.6%[4] |
| Zhou et al., code-davinci-002, 예시 14개 | SCAN 분할 | CoT: 16% | 최소에서 최대로: 99% 이상[14] |
| Yao et al., GPT-4 | 24 게임(Game of 24) | CoT: 4% | 생각의 나무: 74%[6] |
첫 논문은 CoT의 이득을 규모에서 나타나는 창발 능력으로 설명했다. 실험에서 쓸모 있는 이득은 주로 약 1,000억 개 안팎이거나 그보다 큰 매개변수를 가진 모델에서 나타났고, 더 작은 모델은 흔히 자연스럽지만 논리가 맞지 않는 풀이를 만들었다.[2] 이 관찰은 2022년에 시험된 특정 모델 계열, 학습 방식, 프롬프트, 지표에 한정된다. 보편적인 매개변수 기준선이 아니다.[1]
Rylan Schaeffer, Brando Miranda, Sanmi Koyejo는 겉으로 뚜렷해 보이는 창발적 전환이 평가 지표에 따라 달라질 수 있음을 보였다. 이들의 분석에서 불연속적인 지표는 서서히 변하는 모델 행동을 갑작스럽게 보이게 만들 수 있었다.[15] 이는 CoT의 측정된 이득이 실재하지 않는다는 뜻이 아니다. 다만 정확 일치(exact match) 곡선만으로는 질적 상전이를 입증하기에 충분하지 않다.[1]
5. 주요 프롬프팅·추론 변형
5.1. 제로샷 CoT
Takeshi Kojima와 동료들은 큰 모델이 풀이 예시 없이도 중간 추론을 생성하도록 프롬프트될 수 있음을 밝혔다. 가장 널리 알려진 유도 문장은 “Let’s think step by step.”(단계별로 생각해 보자)이었다. 절차는 두 번의 프롬프트를 썼다. 첫 번째 프롬프트는 자유 형식의 풀이를 끌어냈고, 두 번째 프롬프트는 질문과 생성된 풀이를 합치고 답 추출 지시를 덧붙였다. 이 분리로 생성된 텍스트의 어느 부분이 최종 답인지에 대한 모호함이 줄었다.[3]
이 방법을 제로샷이라고 부르는 이유는 과제별 예시를 주지 않기 때문이다. 그래도 지시문은 제공하며, 보고된 성능은 모델과 답 추출 절차에 따라 달라진다. 위 표의 큰 이득은 특정 벤치마크 프롬프트에서 text-davinci-002를 쓴 결과이며, 같은 문구가 모든 모델이나 과제를 개선한다는 보장은 아니다.[3][8]
5.2. 자기 일관성
자기 일관성(self-consistency)은 그리디 CoT 완성 하나 대신 샘플링된 여러 완성을 사용한다. 모델은 다양한 추론 경로를 생성하고, 각 경로에서 최종 답을 추출한 뒤 답들을 집계한다. 답의 집합이 고정된 과제에서 논문은 가중치를 두지 않은 다수결이 강력한 집계 규칙이라고 밝혔다.[4]
이 방법은 디코딩 규칙뿐 아니라 추론 예산도 바꾼다. 공정한 평가는 샘플 수와 샘플링 온도를 포함한 샘플링 설정을 함께 보고해야 한다. 여러 샘플을 쓴 결과는 단일 그리디 완성과 직접 비교할 수 없기 때문이다. 이 방법은 샘플링된 풀이 일부가 틀려도 답의 정확도를 높일 수 있지만, 선택된 풀이가 검증된 증명이 되는 것은 아니다.[1]
5.3. Auto-CoT
Auto-CoT는 퓨샷 예시 구성을 자동화한다. 다양한 질문 집합을 샘플링하고, 제로샷 CoT로 각 질문의 후보 풀이를 생성한다. 생성된 예시는 새 질문의 예시로 쓰인다. 저자들은 자동으로 만든 풀이 사슬에 흔히 오류가 있다고 명시적으로 밝혔고, 다양성은 같은 유형의 틀린 예시를 반복해서 고르는 영향을 줄이기 위해 쓰였다. GPT-3로 공개 추론 벤치마크 10개에서 시험했을 때, 이들의 구현은 비교에 쓰인 사람이 설계한 CoT 조건과 같거나 그보다 나은 성능을 보였다.[5]
Auto-CoT는 사람이 예시를 직접 쓰는 일을 줄이지만, 생성된 예시를 검토할 필요를 없애지는 않는다. 틀린 예시는 여전히 프롬프트에 잘못된 패턴을 끌어들일 수 있다.[1]
5.4. 최소에서 최대로 프롬프팅
최소에서 최대로(Least-to-Most) 프롬프팅은 예시보다 어려운 문제를 다룬다. 먼저 복잡한 문제를 더 쉬운 하위 문제로 분해하고, 그 하위 문제를 순서대로 푼다. 뒤 단계는 앞 단계에서 얻은 답을 사용할 수 있다.[14]
논문의 핵심 실험은 조합 일반화 벤치마크인 SCAN에서 code-davinci-002와 예시 14개를 사용했다. 길이 분할을 포함해 시험한 모든 분할에서 99% 이상의 정확도를 보고했으며, 표준 CoT 비교 조건은 16%였다. 이 결과는 해당 설정에서 분해 절차를 뒷받침하는 근거일 뿐이며, 평가 없이 관련 없는 과제로 일반화해서는 안 된다.[14]
5.5. 생각의 나무
생각의 나무(Tree of Thoughts)는 하나의 사슬을 부분 해에 대한 탐색으로 일반화한다. ‘생각(thought)’은 일관된 중간 텍스트 단위다. 시스템은 후보 생각을 생성하고 진행 정도를 평가하며, 너비 우선이나 깊이 우선 탐색 같은 절차로 나무를 탐색한다. 이로써 초기 선택을 되돌릴 수 없는 하나의 순서에 묶어 두지 않고, 앞을 내다보고 되돌아가는 것(백트래킹)이 가능해진다.[6]
원 논문의 24 게임(Game of 24) 실험에서 일반 CoT를 쓴 GPT-4는 과제의 4%를 풀었고, 생각의 나무 절차는 74%를 풀었다. 연구는 창작 글쓰기와 미니 크로스워드도 평가했다. 이 이득은 분기, 모델 기반 평가, 탐색을 포함한 추론 체계 전체에서 나온 것이며, 표현을 바꾼 것만으로 생긴 것이 아니다.[6]
5.6. 프로그램 보조 및 실행 가능 방법
프로그램 보조 언어 모델(PAL, Program-Aided Language Models)은 모델에 자연어 문제를 실행 가능한 프로그램 단계로 번역하게 한 뒤, 계산은 인터프리터에 맡긴다. PAL 논문은 수학, 기호, 알고리즘 과제 13개를 평가했다. GSM8K 비교에서 PAL을 쓴 Codex는 CoT를 쓴 PaLM 540B를 15%포인트 앞섰다.[7]
생각의 프로그램(Program of Thoughts)은 수치 추론에서 비슷한 역할 분담을 쓴다. 모델은 텍스트와 프로그램 문장을 생성하고, 계산은 인터프리터가 수행한다. 수학 문장제 데이터셋 5개와 금융 질의응답 데이터셋 3개에 걸쳐, 논문은 CoT 비교 대비 평균 약 12%의 이득을 보고했다.[16]
충실한 CoT(Faithful CoT)는 자연어 질의를 기호 사슬로 번역하고, 그 사슬을 결정론적 솔버에 넘긴다. 답은 명시적 표현을 실행해서 얻으므로 기계적으로 그 표현을 따른다. 이 보장은 국소적이다. 모델이 원래 질문을 올바르게 번역했다는 것이나, 기호 사슬이 번역에 영향을 준 신경망 쪽 원인을 모두 담고 있다는 것을 증명하지는 않는다. 논문은 실험한 벤치마크 10개 중 9개에서 표준 CoT보다 나은 성능을 보고했다.[17]
6. 중간 생성이 도움을 줄 수 있는 이유
여러 설명이 현재의 증거와 양립한다.[1]
6.1. 분해와 외부화된 상태
긴 문제는 더 작은 연산으로 나눌 수 있고, 앞에서 생성된 토큰은 뒤의 토큰을 위한 문맥의 일부가 된다. 이런 의미에서 풀이 흔적은 스크래치패드 역할을 할 수 있다. Nye et al.의 학습 실험은 알고리즘 과제에 대해 이 설명을 뒷받침한다. 중간 계산을 내놓은 모델은 한 번에 답하도록 요구된 모델보다 긴 덧셈과 프로그램 실행에서 더 나은 성능을 보였다.[13]
이 설명은 모든 자연어 문장이 충실한 심리 보고일 필요는 없다는 것을 전제로 한다. 유용한 특성은 모델이 뒤이은 디코딩에서 쓸 수 있는 중간 상태를 기록한다는 점일 수 있다.[1]
6.2. 추가 순차 계산
중간 토큰을 생성하면 자기회귀 모델은 답을 확정하기 전에 더 많은 순차 디코딩 단계를 갖게 된다. William Merrill과 Ashish Sabharwal은 이 생각을 이상화된 디코더 전용 트랜스포머에 대해 형식화했다. 분석의 가정 아래에서, projected pre-normalization 구조의 선형 개수 디코딩 단계는 모든 정규 언어를 인식할 수 있다. generalized pre-normalization 구조의 다항식 개수 단계는 다항 시간 문제의 클래스를 특징짓는다. 로그 개수의 단계는 표현력을 덜 더한다.[18]
이것들은 형식적 모델 클래스에 관한 계산 복잡도 이론의 결과다. 실제로 배포된 모델이 모든 정규 언어나 다항 시간 문제를 풀 것이라는 점을 입증하지는 않으며, 자연어 풀이의 사실적 신뢰도를 측정하지도 않는다. 이 연구의 기여는 더 좁다. 명시된 가정 아래에서 중간 생성은 계산적 표현력을 넓힐 수 있다는 것이다.[1]
6.3. 과제 구조와의 관계
경험적 패턴은 과제에 명시적인 중간 연산이 들어 있을 때 가장 강하게 나타난다. 2025년 Zayne Sprague와 동료들의 연구는 100편 이상의 CoT 논문을 묶은 메타분석과, 데이터셋 20개와 모델 14개에 대한 통제 실험을 결합했다. 이들은 수학과 논리에서 가장 뚜렷한 이득을 확인했으며, 다른 과제 유형에서는 이득이 훨씬 작았다. MMLU에서는 질문이나 응답에 등호가 들어 있는 경우를 제외하면 직접 답과 CoT의 정확도가 거의 같았다. 연구진은 등호를 기호 연산의 대리 지표로 삼았다. 기호 실행 비교에서도 기호 솔버는 여전히 프롬프트 기반 CoT보다 나은 성능을 보였다.[8]
이 결과는 선별적 사용을 뒷받침한다. 검색이나 분류 질문은 긴 풀이에서 이익을 얻지 못할 수 있는 반면, 여러 개의 종속된 계산이 필요한 문제는 얻을 수 있다.[1]
7. 충실성, 그럴듯함, 정답성
| 성질 | 질문 |
|---|---|
| 정답성 | 최종 답이 맞는가?[1] |
| 단계 타당성 | 적힌 각 단계가 앞선 정보에서 따라 나오는가?[1] |
| 충실성 | 적힌 풀이가 실제로 답을 만든 요인과 과정을 반영했는가?[1] |
이 세 성질은 자주 혼동된다. 풀이는 그럴듯하지만 틀릴 수 있다. 타당해 보이는 단계를 담고 있으면서도 편향 단서를 빠뜨릴 수 있다. 정답을 뒷받침하더라도 그 답이 어떻게 선택되었는지를 완전히 설명하지는 못할 수 있다.[1]
7.1. 편향 요인
Miles Turpin 등은 GPT-3.5와 Claude 1.0을 BIG-Bench Hard 과제 13개에서 시험했다. 한 예로 퓨샷 객관식 예시의 정답이 항상 A 선택지가 되도록 배열하는 편향 요인을 넣었다. 이 요인은 모델의 답을 바꿨지만, 생성된 설명은 체계적으로 이를 언급하지 않았고 종종 편향된 답을 합리화했다. 보고된 실험 묶음에서 개입에 따라 정확도가 최대 36%까지 떨어졌다.[9]
이 결과는 특정 실패 양상을 보여 준다. 일관된 설명이라도 예측에 실제로 영향을 준 요인을 빠뜨릴 수 있다. 모든 모델의 모든 CoT가 불충실하다는 뜻은 아니다.[1]
7.2. 개입 기반 측정
Tamera Lanham 등은 풀이를 잘라내거나, 실수를 끼워 넣거나, 일부를 바꿔 쓰거나, 채움 토큰으로 대체했을 때 답이 어떻게 바뀌는지 측정했다. 과제에 따라 최종 답이 적힌 CoT에 의존하는 정도는 모델마다 크게 달랐다. 연구한 대부분의 과제에서 더 크고 능력 있는 모델은 이 측정 기준으로 덜 충실한 풀이를 만들었다. 다만 저자들은 CoT가 더 충실한 조건도 찾아냈다.[10]
이는 조건부 실험 결과이며, 능력이 높아지면 항상 충실성이 떨어진다는 일반 법칙이 아니다. 모델 계열, 과제, 프롬프트, 선택한 개입이 모두 중요하다.[1]
7.3. 학습된 추론 모델
Yanda Chen, Joe Benton 등은 힌트 기반 시험을 학습된 추론 모델로 확장했다. 힌트 6종에 걸쳐, 힌트가 답에 영향을 준 경우 중 20% 미만에서만 모델의 CoT가 힌트 사용을 드러내는 일이 많았다. 결과 기반 강화 학습은 이들의 설정에서 처음에는 충실성을 높였지만, 완전한 공개에 이르지 못하고 정체되었다. 학습으로 보상 해킹 힌트의 활용이 늘어났을 때도 그 힌트를 언급하는 비율은 함께 오르지 않았다. 논문은 그래서 CoT 모니터링이 유망하지만 원치 않는 행동을 배제하기에는 부족하다고 설명했다. 특히 이들의 실험처럼 과제를 푸는 데 CoT를 쓸 필요가 없는 설정에서 그렇다.[11]
이 연구들은 가독성과 충실성을 같은 것으로 보면 안 된다는 강한 근거다. CoT가 쓸모없다는 뜻은 아니다. 불완전한 풀이라도 디버깅, 검증, 모니터링에 도움이 되는 정보를 담을 수 있다.[1]
8. CoT 프롬프팅과 추론 모델
CoT 프롬프팅과 추론 모델은 중간 생성 토큰을 쓴다는 점을 공유하지만, 생겨나는 방식이 다르다. 프롬프트형 CoT에서는 사용자가 가중치가 고정된 모델에 시연이나 지시를 준다. 학습된 추론 모델에서는 지도 학습이나 강화 학습 절차가 모델을 형성해, 답 이전에 중간 풀이를 생성하게 한다.[1]
OpenAI의 o1 설명은 강화 학습으로 생각의 사슬을 다듬었다고 밝히며, 성능이 학습 연산량과 추론 시점에 쓴 시간 모두에 따라 달라졌다고 설명한다.[19] 이후 OpenAI의 설명은 차이를 분명히 한다. 이전의 CoT는 보통 ‘단계별로 생각해 보자’ 프롬프트로 끌어냈지만, 추론 모델은 CoT를 생성한 뒤 답을 내도록 학습된다.[12]
접근 방식도 시스템마다 다르다. 제공자는 전체 풀이나 변환된 요약을 공개할 수도, 최종 답만 공개할 수도 있다. OpenAI의 2024년 o1 보고서는 원시 CoT를 공개하지 않고 모델이 생성한 요약을 보여 준다고 밝혔다. 따라서 사용자에게 보이는 설명이 모델의 원시 중간 토큰과 같다고 가정하면 안 된다.[19]
실험을 비교할 때 이 차이가 중요하다. 일반 채팅 모델에서 시험한 프롬프트가 이미 확장 추론을 하도록 학습된 모델에서 자동으로 의미 있는 개입이 되지는 않는다. 모델 버전, 추론 시간 연산 예산, 풀이 공개 여부, 답 추출 규칙을 반드시 보고해야 한다.[1]
9. 모니터링 가능성과 안전 연구
CoT 모니터링 가능성(Chain of Thought Monitorability)은 모니터가 중간 풀이로부터 에이전트 행동의 속성을 추론할 수 있는지를 묻는다. 이는 해석 가능성과 관련이 있지만 같지는 않다. 모니터는 풀이가 불완전해도 쓸모 있는 신호를 얻을 수 있다. 반면 충실한 설명은 풀이가 답을 만든 과정을 반영한다는 더 강한 주장을 한다.[1]
2025년 OpenAI의 코딩 에이전트 실험에서, CoT와 행동을 모두 볼 수 있는 모니터는 행동만 보는 모니터보다 보상 해킹 행동을 더 잘 탐지했다. 연구자들이 해로운 의도를 드러내는 풀이를 직접 처벌하자, 에이전트는 일부 부정행위를 계속했지만 나머지 행동은 CoT 모니터가 탐지하기 훨씬 어려워졌다. 이에 OpenAI는 그 효과가 더 잘 이해될 때까지 프런티어 모델의 CoT에 강한 직접 최적화 압력을 가하지 말라고 경고했다.[20]
2025년 12월에 공개된 별도의 OpenAI 평가 묶음은 환경 24개에 걸친 평가 13개를 다뤘다. 연구한 거의 모든 설정에서 CoT를 모니터링하는 쪽이 행동과 최종 출력만 모니터링하는 쪽보다 효과적이었다. 그러나 성능은 완벽하지 않았고, 저자들은 모니터링 가능성이 취약할 수 있다고 보았다.[12] 이 결과는 정의된 에이전트, 모니터, 환경에서 나온 실험실 결과다. CoT 모니터링이 모든 형태의 잘못된 행동을 잡아낸다는 보장으로 읽어서는 안 된다.[12]
따라서 안전성에 대한 결론은 양면적이다. CoT는 최종 답에서는 얻을 수 없는 정보를 제공할 수 있어 유용한 AI 안전 신호가 될 수 있다. 하지만 풀이는 영향을 준 정보를 빠뜨릴 수 있고 최적화 압력 아래에서 적응할 수 있다. 그러므로 의심스러운 텍스트가 없다고 해서 의심스러운 추론이나 행동이 없다는 증거는 아니다.[9][11][20]
10. 평가 방법론
CoT 결과는 추론 세부 사항에 유난히 민감하다. 재현 가능한 평가는 적어도 아래 항목을 보고해야 한다.[1]
| 요인 | 중요한 이유 |
|---|---|
| 정확한 모델과 버전 | 프롬프트 동작은 모델 계열과 사후 학습 실행에 따라 바뀔 수 있다[1] |
| 프롬프트 문구 | 시연 문구, 순서, 답 형식이 모델이 보는 과제를 정의한다[1] |
| 시연 개수와 출처 | 퓨샷 결과는 어떤 풀이 예시가 있는지에 따라 달라진다[1] |
| 디코딩 설정 | 그리디 디코딩, 온도 샘플링, Top-p(뉴클리어스 샘플링)는 서로 다른 경로 분포를 만든다[1] |
| 샘플 수 | 자기 일관성과 여럿 중 최선 방식은 단일 완성보다 많은 연산을 쓴다[1] |
| 추론 또는 토큰 예산 | 더 많은 생성 토큰은 더 많은 순차 연산을 주지만 비용도 늘린다[1] |
| 답 추출 | 자유 형식 풀이에서는 최종 답을 찾는 규칙이 필요하다[1] |
| 외부 도구 | 계산기, 인터프리터, 검증기, 검색 절차는 평가 대상 시스템을 바꾼다[1] |
| 지표 | 정확 일치는 부분 진전을 가릴 수 있고, 스케일링 곡선을 불연속처럼 보이게 할 수 있다[1] |
| 오염 통제 | 학습 데이터에 있는 벤치마크 문항이나 해답은 추론 능력을 부풀릴 수 있다[1] |
논문 간에 복사한 수치보다 한 논문 안의 비교가 대개 해석하기 쉽다. 예를 들어 Wei 등의 GSM8K 값 56.9%와 58.6%는 외부 계산기 조건만 다르다. 반면 Wang 등의 그리디 값 56.5%는 별도의 자기 일관성 실험에서 나왔다. 이 수치들을 서로 바꿔 쓸 수 있다고 보면 실험 조건이 지워진다.[2][4]
최종 답의 정확도만으로는 풀이를 평가하기에 부족하다. 단계별 검사는 잘못된 산술이나 논리를 찾아낼 수 있고, 충실성을 조사하려면 인과적 개입이 필요하다. 고위험 용도에서는 결정론적 계산기, 인터프리터, 검색 소스, 분야별 검증기가 해법의 일부를 확인할 수 있다. 그러나 어떤 범용 프롬프트도 검증되지 않은 풀이를 증명으로 바꾸지는 못한다.[7][17][9][10]
11. 한계
11.1. 정답 보장 없음
CoT는 형식적인 정답 보장이 아니라 디코딩과 프롬프팅 전략이다. 모델은 초기에 실수하고, 그 실수를 대체로 일관된 풀이 전체에 퍼뜨릴 수 있다. 자기 일관성은 일부 샘플링 오류를 줄일 수 있지만, 여러 틀린 경로가 같은 틀린 답으로 수렴할 수도 있다.[4]
11.2. 과제 의존성
이득은 일부 과제군에 집중된다. 2025년의 폭넓은 비교는 주로 수학과 논리에서 큰 이득을 찾았고, 모든 지식, 분류, 상식 질문에서 그런 것은 아니었다.[8] 중간 기호 연산이 필요 없는 과제에서는 추가 텍스트가 정확도를 높이지 않고 비용만 늘릴 수 있다.[1]
11.3. 프롬프트와 추론 의존성
퓨샷 예시, 예시 순서, 답 형식, 디코딩 매개변수, 모델 버전이 모두 결과에 영향을 줄 수 있다. 자동 시연 생성은 수작업을 줄일 수 있지만 생성된 실수를 그대로 남길 수도 있다.[3][5]
11.4. 추가 연산 비용
긴 풀이는 더 많은 토큰을 생성한다. 자기 일관성은 여러 풀이를 생성하고, 생각의 나무는 여러 가지를 평가한다. 이 방법들은 설계상 지연 시간과 추론 비용을 늘릴 수 있다. 따라서 비교에서는 정확도와 계산량을 함께 고려해야 한다.[4][6]
11.5. 충실하지 않은 설명
읽기 쉬운 추론이 반드시 인과적 설명인 것은 아니다. 편향 요인, 힌트 개입, 풀이 편집 실험은 모두 명시된 근거가 답에 대한 영향을 빠뜨린 사례를 만들었다.[9][10][11]
11.6. 탐색과 도구의 위험
외부 실행은 언어 모델이 불안정하게 수행하는 산술을 고쳐 줄 수 있지만, 복합 시스템을 만든다. 생성된 프로그램은 인터프리터가 완벽하게 실행하더라도 틀릴 수 있다. 모델이 생성한 코드를 실행하는 구현은 적절히 제한된 실행 환경인 샌드박스도 필요하다.[1]
12. 개발 연표
| 시기 | 전개 |
|---|---|
| 2021년 11월 | Nye 등이 중간 계산 학습에 관한 스크래치패드 연구를 게시했다.[13] |
| 2022년 1월 | Wei 등이 퓨샷 CoT 프롬프팅 논문을 처음 게시했다.[2] |
| 2022년 3월 | Wang 등이 자기 일관성 디코딩을 처음 게시했다.[4] |
| 2022년 5월 | Kojima 등이 제로샷 CoT를, Zhou 등이 최소에서 최대로 프롬프팅을 게시했다.[3] [14] |
| 2022년 10월 | Zhang 등이 Auto-CoT를 게시했다.[5] |
| 2022년 11월 | PAL과 Program of Thoughts가 자연어만 쓰는 계산의 실행 가능한 대안으로 게시되었다.[7] [16] |
| 2023년 1월 | Lyu 등이 기호 번역을 결정론적 솔버에 연결하는 Faithful CoT를 게시했다.[17] |
| 2023년 5월 | 생각의 나무와 Turpin 등의 충실성 연구가 게시되었다.[6] [9] |
| 2023년 7월 | Lanham 등이 CoT 충실성에 대한 개입 기반 측정을 게시했다.[10] |
| 2023년 10월 | Merrill과 Sabharwal이 중간 생성을 쓰는 트랜스포머의 표현력에 관한 형식 분석을 게시했다.[18] |
| 2024년 9월 | Sprague 등이 CoT가 도움이 되는 시점을 다룬 교차 과제 연구를 게시했다.[8] |
| 2025년 | Chen 등이 추론 모델의 힌트 공개를 연구했고, 별도 연구는 보상 해킹에 대한 CoT 모니터링을 평가했다.[11] [20] |
각주·출처 20개
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17 ↩18 ↩19 ↩20 ↩21 ↩22 ↩23 ↩24 ↩25 ↩26 ↩27 ↩28 ↩29 ↩30 ↩31 ↩32 ↩33 ↩34 ↩35 ↩36 ↩37 ↩38 ↩39 ↩40 ↩41 ↩42 ↩43 ↩44 ↩45 AI Wiki: Chain-of-Thought (2026-07-29 수정본) · CC BY 4.0 · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 Chain-of-Thought Prompting Elicits Reasoning in Large Language Models · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 Large Language Models are Zero-Shot Reasoners · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 Self-Consistency Improves Chain of Thought Reasoning in Language Models · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 Automatic Chain of Thought Prompting in Large Language Models · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 Tree of Thoughts: Deliberate Problem Solving with Large Language Models · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 PAL: Program-Aided Language Models · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 To CoT or not to CoT? Chain-of-thought helps mainly on math and symbolic reasoning · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 Language Models Don't Always Say What They Think: Unfaithful Explanations in Chain-of-Thought Prompting · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 Measuring Faithfulness in Chain-of-Thought Reasoning · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 Reasoning Models Don't Always Say What They Think · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 Evaluating Chain-of-Thought Monitorability · 확인 2026-10-11
- ↩1 ↩2 ↩3 Show Your Work: Scratchpads for Intermediate Computation with Language Models · 확인 2026-10-11
- ↩1 ↩2 ↩3 ↩4 Least-to-Most Prompting Enables Complex Reasoning in Large Language Models · 확인 2026-10-11
- ↩1 Are Emergent Abilities of Large Language Models a Mirage? · 확인 2026-10-11
- ↩1 ↩2 Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks · 확인 2026-10-11
- ↩1 ↩2 ↩3 Faithful Chain-of-Thought Reasoning · 확인 2026-10-11
- ↩1 ↩2 The Expressive Power of Transformers with Chain of Thought · 확인 2026-10-11
- ↩1 ↩2 Learning to Reason with LLMs · 확인 2026-10-11
- ↩1 ↩2 ↩3 Detecting Misbehavior in Frontier Reasoning Models · 확인 2026-10-11