수학 개념 지도
딥러닝과 언어 모델

추론 모델과 테스트 시점 계산(Reasoning models and test-time compute)

답하기 전에 중간 풀이를 길게 쓰도록 학습한 언어 모델⁠(language model)⁠. 풀이를 여러 번 뽑아 다수결하거나 검증기로 고르는 방법, 정답을 기계적으로 확인할 수 있는 문제에서 채점 결과를 보상으로 쓰는 강화 학습(GRPO 등)이 핵심이다. '추론'은 관례적인 이름이며, 적힌 풀이가 실제 계산을 보여 주는지는 논쟁 중이다.

Ai=ri−mean⁡(r1,…,rG)std⁡(r1,…,rG),∇θJ≈1G∑i=1GAi ∇θlog⁡πθ(yi∣x)A_i = \frac{r_i - \operatorname{mean}(r_1, \dots, r_G)}{\operatorname{std}(r_1, \dots, r_G)}, \qquad \nabla_\theta J \approx \frac1G\sum_{i=1}^{G} A_i\,\nabla_\theta \log \pi_\theta(y_i \mid x)

문제 하나를 봅시다. "사과가 6개씩 든 상자 3개가 있고, 그중 2개를 먹었다. 남은 사과는 몇 개인가?" 답만 곧바로 말하라고 하면 언어 모델은 첫 토큰⁠(token)⁠부터 답을 내야 합니다. "3 × 6 = 18, 18 − 2 = 16"처럼 중간 계산을 먼저 쓰게 하면, 뒤의 토큰은 앞에 적힌 중간 결과를 보며 이어 갈 수 있습니다. 2022년 1월 구글의 제이슨 웨이 등은 풀이 과정이 적힌 예제 여덟 개를 질문 앞에 붙이는 것만으로 PaLM 540B의 초등 수학 문장제(GSM8K) 정답률이 17.9%에서 56.9%로 오른다고 보고했습니다. 이것을 생각의 사슬(chain-of-thought) 프롬프팅이라 합니다. 같은 해 5월 고지마 다케시 등은 예제 없이 "단계별로 생각해 봅시다" 한 줄만 붙여도 같은 과제에서 10.4%가 40.7%로 오른다고 보고했습니다(오픈AI의 text-davinci-002 모델).

왜 도움이 될까요? 완전한 설명은 없지만 구조적인 이유 하나는 분명합니다. 트랜스포머⁠(transformer)⁠는 토큰 하나를 만들 때마다 정해진 수의 층만 거치므로, 토큰 하나에 쓸 수 있는 계산에는 상한⁠(upper bound)⁠이 있습니다. 중간 토큰을 적으면 그것이 다음 계산의 입력이 되어 계산을 여러 토큰에 걸쳐 이어 붙일 수 있습니다. 종이에 받아 적으며 긴 곱셈을 하는 것과 닮았습니다. 2023년 윌리엄 메릴과 아시시 사바왈은 이것을 이상화한 모형에서 증명했습니다. 중간 토큰을 입력 길이에 비례하는 만큼 쓰게 하면, 중간 토큰 없이는 풀 수 없다고 믿어지는 문제까지 풀 수 있습니다('믿어진다'는 것은 널리 받아들여지지만 증명되지 않은 복잡도 가설에 기댄다는 뜻입니다). 입력 길이의 다항식⁠(polynomial)⁠만큼 쓰게 하면 다항 시간⁠(polynomial time)⁠에 풀리는 문제를 모두 풀 수 있습니다. 다만 이것은 '그렇게 계산할 수 있다'는 표현력의 결과이지, 학습된 모델이 실제로 그렇게 계산한다는 뜻은 아닙니다.

여러 번 풀고 다수결. 디코딩할 때 온도를 두고 무작위로 뽑으면 풀이마다 최종 답이 달라질 수 있습니다. 2022년 3월 왕쉐즈 등은 풀이를 여러 개 뽑아 가장 많이 나온 최종 답을 고르는 자기 일관성(self-consistency)으로 PaLM 540B의 GSM8K 정답률이 56.5%(탐욕 디코딩⁠(greedy decoding)⁠ 한 번)에서 74.4%(풀이 40개의 다수결)로 오른다고 보고했습니다. 다수결은 왜 도움이 되고, 언제 도움이 안 될까요? 단순한 모형을 세워 봅시다. 한 번 풀 때 맞힐 확률⁠(probability)⁠이 p이고, 틀릴 때는 서로 다른 오답 m가지 가운데 하나를 같은 확률로 낸다고 합시다. 풀이끼리는 서로 독립⁠(independence)⁠이라고 가정합니다. 한 번의 정답률 p = , 오답의 가짓수 m = . 청록 곡선 위의 점을 끌면 풀이 수 N이 바뀌고, 그 N에서의 세 확률이 그림 아래에 나옵니다. p와 m을 바꾸며 청록 곡선의 오른쪽 끝이 1로 올라가는지 0으로 내려가는지 보세요.

가로축은 뽑은 풀이의 수 N(로그 눈금), 세로축은 확률입니다. 회색 점선은 한 번 뽑기(p), 청록 곡선은 N개의 다수결이 정답일 확률(1등이 여럿이면 제비뽑기), 분홍 점선은 N개 가운데 하나라도 맞을 확률 pass@N입니다. 위의 모형으로 정확히 계산한 값입니다.

N개를 뽑으면 정답이 나온 횟수는 이항분포⁠(binomial distribution)⁠ B(N, p)를 따르고, 오답 하나하나가 나온 횟수는 평균⁠(mean)⁠ N(1−p)/mN(1-p)/m 근처에 모입니다. 큰 수의 법칙⁠(law of large numbers)⁠에 따라 N이 커지면 각 비율이 제 기댓값⁠(expected value)⁠에 붙으므로, 결론은 정답의 비율 p와 오답 하나의 비율 (1−p)/m(1-p)/m의 비교로 정해집니다. p>(1−p)/mp > (1-p)/m이면 다수결의 정답률은 1로, p<(1−p)/mp \lt (1-p)/m이면 0으로 갑니다(두 값이 같으면 어느 쪽으로도 가지 않습니다). m = 1, 곧 틀린 풀이가 모두 같은 오답을 내면 기준은 p > 1/2가 됩니다. 1785년 콩도르세가 서로 독립으로 판단하는 배심원들의 다수결에 대해 보인 배심원 정리⁠(jury theorem)⁠가 바로 이것입니다. 오답이 여러 가지로 흩어질수록 기준이 낮아집니다. p = 0.3이라도 오답 다섯 가지에 고루 흩어지면 오답 하나의 비율은 0.7/5 = 0.14이므로 다수결이 결국 이깁니다. 반대로 모델이 같은 착각을 되풀이하면(m이 작으면) 부등호가 뒤집힐 수 있고, 그때는 표본⁠(sample)⁠을 늘릴수록 오히려 나빠집니다. 실제 풀이들은 서로 독립이 아니고 오답도 고르게 흩어지지 않으므로, 이 그림은 경향을 보여 줄 뿐 실제 곡선을 예측하지는 않습니다.

분홍 점선 1−(1−p)N1-(1-p)^N은 N개 가운데 하나라도 맞을 확률(pass@N)입니다. 맞는 답을 알아보는 완벽한 검증기가 있다면 이만큼 얻을 수 있습니다. 코드라면 단위 시험이, 수학이라면 정답과의 비교가 그런 검증기 구실을 합니다. 2024년 브래들리 브라운 등은 같은 문제를 여러 번 뽑을 때 적어도 하나 맞히는 비율이 표본 수의 로그에 대해 거의 직선으로 오르는 경우가 많다고 보고했습니다. 소프트웨어 버그 고치기 과제(SWE-bench Lite)에서 한 번 뽑기로는 15.9%였던 해결률이, 250개 가운데 하나라도 맞는 비율로는 56%였습니다. 그러나 검증기가 없으면 그 가운데 어느 것이 맞는지 고를 수 없습니다. 다수결 곡선과 pass@N 곡선 사이의 간격은 완벽한 검증기가 다수결보다 더 얻어 낼 수 있는 몫의 상한입니다. 풀이 n개 가운데 c개가 맞았을 때 pass@k를 편향 없이 어림하는 식 1−(n−ck)/(nk)1 - \binom{n-c}{k}\big/\binom{n}{k}(2021년 Codex 논문)도 같은 생각입니다. n개 가운데 k개를 중복 없이 골랐는데 모두 오답일 확률을 1에서 뺀 것입니다.

결과 보상⁠(outcome reward)⁠과 과정 보상⁠(process reward)⁠. 검증기를 학습시킬 수도 있습니다. 2021년 칼 코브 등은 초등 수학 문제 약 8,500개로 GSM8K를 만들면서, 풀이가 맞았는지 예측하는 검증 모델로 여러 풀이 가운데 가장 좋은 것을 고르면(best-of-N) 정답률이 오른다고 보고했습니다. 최종 답만 보고 점수를 주는 것을 결과 보상, 풀이의 단계마다 옳은지 점수를 주는 것을 과정 보상이라 합니다. 2022년 딥마인드의 조너선 우에사토 등은 최종 답의 오류율만 보면 두 방식이 비슷하지만, 답은 맞았는데 풀이가 틀린 경우를 줄이려면 과정 감독, 또는 과정 감독을 흉내 내도록 학습한 보상 모델⁠(reward model)⁠이 필요하다고 보고했습니다(그런 경우가 14.0%에서 3.4%로). 2023년 오픈AI의 헌터 라이트먼 등은 풀이 단계 약 80만 개에 사람이 옳고 그름을 매긴 자료(PRM800K)로 과정 보상 모델⁠(process reward model)⁠을 학습시켜, MATH 문제 500개에서 풀이 1,860개 가운데 가장 좋은 것을 고를 때 78.2%를 풀었고 결과 보상 모델이나 다수결보다 높았다고 보고했습니다.

채점 결과를 보상으로. 검증기를 고르는 데만 쓰지 않고 학습 신호로 쓰면 어떨까요? 정답을 기계적으로 확인할 수 있는 문제에서는 보상을 사람이 매길 필요가 없습니다. 맞으면 1, 틀리면 0입니다. 2024년 11월 앨런 AI 연구소의 튈루 3 보고서는 이것을 검증 가능한 보상 강화 학습(RLVR)이라 불렀습니다. 인간 피드백 강화 학습과 틀은 같고, 보상 모델 대신 채점기가 들어갑니다. 채점기는 학습된 보상 모델보다 속이기 어렵지만 허점이 아예 없지는 않아서, 코딩 과제에서 문제를 풀지 않고 시험만 통과하도록 우회하는 행동이 2025년 오픈AI와 앤트로픽의 보고서에 적혔습니다. 목표는 기대 보상 J(θ)=Ey∼πθ[r(y)]J(\theta) = \mathbb E_{y\sim\pi_\theta}[r(y)]이고, 그 기울기⁠(slope)⁠는 다음과 같습니다(정책 기울기⁠(policy gradient)⁠, 1992년 로널드 윌리엄스의 REINFORCE).

∇θJ=Ey∼πθ[(r(y)−b) ∇θlog⁡πθ(y)]\nabla_\theta J = \mathbb E_{y\sim\pi_\theta}\bigl[(r(y) - b)\,\nabla_\theta \log \pi_\theta(y)\bigr]

기준선 b는 답 y에 따라 달라지지 않는 값이면(질문에는 따라도 됩니다) 기댓값을 바꾸지 않습니다. E[∇log⁡π]=∑yπ ∇ππ=∇∑yπ=∇1=0\mathbb E[\nabla \log\pi] = \sum_y \pi\,\frac{\nabla\pi}{\pi} = \nabla\sum_y \pi = \nabla 1 = 0이기 때문입니다. 그러나 분산⁠(variance)⁠은 크게 바꿉니다. 보상이 모두 1 근처라면 b 없이는 모든 답을 한꺼번에 밀어 올리는 잡음 큰 신호가 되니까요. PPO는 b를 따로 학습한 가치망(보통 정책만 한 크기의 신경망⁠(neural network)⁠)으로 어림합니다. 2024년 2월 딥시크의 DeepSeekMath 논문이 제안한 GRPO(group relative policy optimization)는 가치망⁠(value network)⁠을 버립니다. 질문 하나에 답을 G개 뽑아, 그 묶음의 평균 보상을 기준선으로 쓰고 표준편차⁠(standard deviation)⁠로 나눈 값을 이점(advantage) AiA_i로 씁니다(이 페이지 맨 위의 식). 엄밀히 따지면 묶음 평균에는 자기 자신의 보상도 들어 있어서 기울기의 기댓값이 (G−1)/G(G-1)/G배로 줄고(방향은 같습니다), 표준편차로 나누는 일은 기댓값을 조금 바꿉니다(아래에서 다시 봅니다). 아래는 앞의 사과 문제에 대한 답 다섯 가지 가운데 '16'만 맞는 장난감 정책입니다. '10번 갱신'을 몇 번 누르면 초록 막대('16')가 대개 길어지고 나머지가 줄어듭니다. 묶음 크기 G = , 표준편차로 나누기: . 새 묶음 뽑기 이 묶음으로 갱신 10번 갱신 처음으로

위: 지금 정책에서 뽑은 답 G개와 보상(맞으면 1), 이점 A. 칸에 올리면 계산이 나옵니다. 아래: 정책 π가 각 답에 주는 확률(막대)과 처음 정책(테두리). '갱신'은 이점만큼 로짓⁠(logit)⁠을 고치는 정책 기울기 한 걸음(학습률⁠(learning rate)⁠ 1)입니다.

보상이 0과 1뿐이고 G개 가운데 비율 p^\hat p가 맞았다면 표준편차는 p^(1−p^)\sqrt{\hat p(1-\hat p)}이고, 맞은 답의 이점은 (1−p^)/p^\sqrt{(1-\hat p)/\hat p}, 틀린 답은 −p^/(1−p^)-\sqrt{\hat p/(1-\hat p)}입니다. 여덟 개 가운데 하나만 맞으면 그 답은 7≈2.65\sqrt 7 \approx 2.65, 나머지는 각각 −0.38을 받습니다. 드문 성공일수록 크게 밀어 올리는 셈입니다. 묶음이 모두 맞거나 모두 틀리면 이점이 전부 0이라서 그 질문에서는 아무것도 배우지 못합니다. 모델에게 너무 쉽거나 너무 어려운 문제는 학습 신호를 주지 않는다는 뜻이고, 2025년의 DAPO는 이런 묶음을 걸러 내고 다시 뽑습니다. 표준편차로 나누면 거의 다 맞히거나 거의 다 틀리는 질문의 이점이 커지는데, 2025년 리우쯔천 등(Dr. GRPO)은 이것이 질문의 난이도에 따른 치우침을 만든다며 나누기를 뺐습니다. 실제 GRPO 목표는 여기에 두 가지를 더합니다. 한 번에 정책이 너무 멀리 가지 않도록 확률비 πθ/πold\pi_\theta/\pi_{\text{old}}를 [1−ε,1+ε][1-\varepsilon, 1+\varepsilon]로 자르는 PPO식 클리핑과, 출발 모델에서 멀어지지 않게 하는 KL 발산⁠(KL divergence)⁠ 벌점입니다. 계산은 답 전체가 아니라 토큰마다 합니다.

o1과 R1. 2024년 9월 12일 오픈AI는 o1을 발표했습니다. 답하기 전에 긴 생각의 사슬을 쓰도록 대규모 강화 학습으로 학습시켰고, 성능이 두 가지 계산량 모두에 따라 꾸준히 오른다고 밝혔습니다. 하나는 학습 때 쓴 강화 학습 계산량이고, 다른 하나는 답할 때 생각하는 시간(테스트 시점 계산⁠, test-time compute⁠)입니다. 이날 공개된 것은 미리 보기판(o1-preview)이었습니다. 발표 글에 따르면 아직 공개하지 않은 o1은 미국 수학 경시 AIME 2024에서 한 번 풀기로 74%, 표본 64개의 다수결로 83%를 기록했습니다(GPT-4o는 12%). 방법의 세부와 생각의 사슬 원문은 공개하지 않았습니다. 2025년 1월 20일 딥시크는 R1의 가중치⁠(weight)⁠를 MIT 허가로 공개하고 방법을 논문으로 밝혔습니다. 먼저 R1-Zero가 있습니다. 사전학습만 된 DeepSeek-V3-Base에, 사람이 쓴 풀이 없이 GRPO와 규칙 기반 보상(최종 답이 맞는지, 정해진 형식을 지켰는지)만으로 강화 학습을 한 모델입니다. AIME 2024 정답률(한 번 풀기)이 15.6%에서 71.0%로, 다수결로는 86.7%로 올랐습니다. 학습이 진행되면서 답이 길어지고 스스로 되짚는 문장이 나타났다고 논문은 적었습니다. 그러나 R1-Zero의 풀이는 읽기 어렵고 여러 언어가 섞였습니다. 그래서 공개된 R1은 소량의 풀이 예시로 먼저 미세조정⁠(fine-tuning)⁠한 뒤, 강화 학습과 추가 미세조정을 번갈아 거쳤습니다(AIME 2024 79.8%). R1의 풀이로 작은 모델(15억~700억 매개변수⁠(parameter)⁠)을 지도 학습시킨 증류⁠(distillation)⁠ 모델도 함께 공개했습니다. 이 논문은 2025년 9월 『네이처』에 동료 심사를 거쳐 실렸습니다. R1의 바탕인 V3는 전문가 혼합⁠(mixture of experts)⁠ 모델입니다.

테스트 시점 계산. 이제 계산을 학습에 쓸지 답할 때 쓸지 고를 수 있습니다. 답할 때 계산을 늘리는 길은 두 갈래입니다. 여러 답을 나란히 뽑아 고르는 병렬 방식(다수결, best-of-N, 위 그림)과 한 풀이를 더 길게 이어 가며 고치는 순차 방식입니다. 2024년 찰리 스넬 등은 문제의 난이도에 따라 방식을 고르면 best-of-N보다 계산을 4배 넘게 아낄 수 있고, 계산량을 맞추어 비교하면 어떤 문제에서는 작은 모델에 계산을 더 주는 편이 14배 큰 모델보다 낫다고 보고했습니다. 점수는 계산량과 함께 읽어야 합니다. 2024년 12월 발표된 o3의 ARC-AGI-1 준공개(semi-private) 평가 점수는 효율 설정에서 75.7%, 계산을 172배 쓴 설정에서 87.5%였습니다. 규모의 법칙⁠(scaling laws)⁠처럼 로그 축에서 직선으로 보이는 관계가 여기서도 보고되지만, 역시 측정한 범위 안의 경험적 관계입니다. 탐색에 계산을 더 써서 수를 고르는 게임 트리⁠(game tree)⁠ 탐색과 같은 발상이기도 합니다.

그 뒤. 2025년에는 한 모델이 생각을 길게 할지 짧게 할지 고르는 방식이 퍼졌습니다. 앤트로픽의 Claude 3.7 Sonnet(2월)은 확장된 사고를 켜고 끌 수 있게 했습니다. 구글은 제미나이 2.5(3월)를 '생각하는 모델'로 내놓았고, 알리바바의 Qwen3(4월)는 두 모드를 한 모델에 담아 가중치를 공개했습니다. 오픈AI의 GPT-5(8월)는 빠른 모델과 깊이 생각하는 모델 사이를 라우터⁠(router)⁠가 고르는 시스템으로 발표되었습니다. 2025년 7월 국제수학올림피아드(IMO)에서는 구글 딥마인드의 제미나이 딥싱크가 자연어로 여섯 문제 가운데 다섯 문제를 풀어 42점 가운데 35점(금메달 기준)을 받았고, 대회 채점관이 이를 공식 채점했습니다. 오픈AI도 실험 모델이 35점을 받았다고 발표했는데, 이것은 전직 메달리스트 세 명이 채점한 결과였습니다. 형식 증명을 쓰던 2024년의 알파프루프(증명 보조기⁠(proof assistant)⁠ 린)와 달리 둘 다 자연어 풀이였습니다. 2026년 IMO에서는 AFP 보도에 따르면 화웨이와 샤오훙수의 시스템이 대회 주최 측의 채점으로 42점 만점을 받았습니다. 오픈AI, 앤트로픽 등의 모델 네 개도 만점이라고 알려졌지만, 이것은 한 투자자가 AI 채점기로 따로 매긴 결과입니다. 날짜별 흐름은 언어 모델의 발전사에 모아 두었습니다.

무엇이 논쟁인가. 첫째, 적힌 풀이가 실제 계산을 보여 주는가. 2023년 마일스 터핀 등은 객관식 보기의 순서 같은 편향이 답을 바꾸는데도 풀이에는 그 이유가 드러나지 않는 사례를 보고했고, 2025년 앤트로픽 연구진은 답의 힌트를 몰래 넣었을 때 모델이 그 힌트를 썼다고 풀이에서 밝히는 비율이 Claude 3.7 Sonnet 25%, DeepSeek-R1 39%라고 보고했습니다. 둘째, 강화 학습이 새 능력을 만드는가, 원래 모델이 가끔 내던 풀이를 더 자주 내게 할 뿐인가. 2025년 칭화 대학 연구진은 k가 작을 때는 강화 학습한 모델의 pass@k가 높지만 k가 크면(수십~수백 개) 원래 모델이 더 높다고 보고했습니다. 위 그림의 말로 하면, 강화 학습이 한 번의 정답률 p를 올리는 대신 답의 다양성을 줄여 pass@N 곡선의 끝을 깎을 수 있다는 것입니다. 셋째, 복잡도가 커지면 무너지는가. 2025년 6월 애플의 파르신 쇼자이 등은 하노이의 탑⁠(Tower of Hanoi)⁠ 같은 퍼즐에서 복잡도가 어느 선을 넘으면 정답률이 무너진다고 보고했고, 곧바로 나온 반론은 출력 길이 제한과 애초에 풀 수 없는 문제 사례가 그 결과를 만들었다고 지적했습니다. 넷째, 평가 자체. AIME처럼 공개된 문제는 학습 자료에 섞였을 수 있고, 점수는 표본 수와 계산량 설정에 따라 크게 달라집니다. 이 방법이 잘 듣는 곳은 정답을 확인하기 쉬운 영역(수학의 답, 코드)이고, 확인이 어려운 영역에서 얼마나 통하는지는 덜 분명합니다. '추론 모델'은 이런 모델을 부르는 관례적인 이름이지, 사람의 추론과 같은 과정이라는 결론이 아닙니다.

이어지는 곳. 다수결의 계산은 이항분포와 큰 수의 법칙이고, 풀이를 무작위로 뽑는 규칙은 디코딩의 온도입니다. 보상으로 정책을 고치는 틀은 강화 학습에서, 사람의 비교를 보상으로 삼는 앞선 방법과 KL 벌점의 정확한 해는 인간 피드백 강화 학습에서 이어집니다. 기준선이 기댓값은 그대로 두고 흩어짐만 줄인다는 것은 기댓값과 분산의 성질이고, 표본으로 기댓값을 어림하는 일은 몬테카를로 방법⁠(Monte Carlo method)⁠입니다. 답을 확인하기가 찾기보다 쉬운 문제에서 이 방법이 잘 듣는다는 점은 P 대 NP 문제의 직관과 닿아 있고, 가장 엄격한 채점기는 증명 보조기입니다. 계산량과 성능의 경험적 관계는 규모의 법칙에, R1의 바탕 구조는 전문가 혼합에, 2022년부터의 흐름은 언어 모델의 발전사에 있습니다.

관련 인물리처드 서튼

이 개념이 나오는 긴 글

신경망과 기계 학습 배우는 기계 예를 보여 주면 규칙을 스스로 찾는 기계. 1958년의 퍼셉트론에서 오늘의 심층 신경망까지, 그 밑바닥에는 미분과 연쇄법칙이 있다. 언어 모델 다음 단어를 맞히는 기계 다음 낱말을 짐작하는 일만으로 어디까지 갈 수 있을까? 마르코프의 글자 세기에서 섀넌의 추측 게임, 트랜스포머와 규모의 법칙, 사람의 선호까지. 밑바닥에는 확률의 곱셈 규칙과 로그 하나가 있고, 그 수학은 모델이 왜 그럴듯하게 틀리는지도 말해 준다.

이 개념을 언급하는 페이지

이 페이지가 가리키는 개념