추론 모델과 테스트 시점 계산(Reasoning models and test-time compute)
답하기 전에 중간 풀이를 길게 쓰도록 학습한 언어 모델(language model). 풀이를 여러 번 뽑아 다수결하거나 검증기로 고르는 방법, 정답을 기계적으로 확인할 수 있는 문제에서 채점 결과를 보상으로 쓰는 강화 학습(GRPO 등)이 핵심이다. '추론'은 관례적인 이름이며, 적힌 풀이가 실제 계산을 보여 주는지는 논쟁 중이다.
문제 하나를 봅시다. "사과가 6개씩 든 상자 3개가 있고, 그중 2개를 먹었다. 남은 사과는 몇 개인가?" 답만 곧바로 말하라고 하면 언어 모델은 첫 토큰(token)부터 답을 내야 합니다. "3 × 6 = 18, 18 − 2 = 16"처럼 중간 계산을 먼저 쓰게 하면, 뒤의 토큰은 앞에 적힌 중간 결과를 보며 이어 갈 수 있습니다. 2022년 1월 구글의 제이슨 웨이 등은 풀이 과정이 적힌 예제 여덟 개를 질문 앞에 붙이는 것만으로 PaLM 540B의 초등 수학 문장제(GSM8K) 정답률이 17.9%에서 56.9%로 오른다고 보고했습니다. 이것을 생각의 사슬(chain-of-thought) 프롬프팅이라 합니다. 같은 해 5월 고지마 다케시 등은 예제 없이 "단계별로 생각해 봅시다" 한 줄만 붙여도 같은 과제에서 10.4%가 40.7%로 오른다고 보고했습니다(오픈AI의 text-davinci-002 모델).
왜 도움이 될까요? 완전한 설명은 없지만 구조적인 이유 하나는 분명합니다. 트랜스포머(transformer)는 토큰 하나를 만들 때마다 정해진 수의 층만 거치므로, 토큰 하나에 쓸 수 있는 계산에는 상한(upper bound)이 있습니다. 중간 토큰을 적으면 그것이 다음 계산의 입력이 되어 계산을 여러 토큰에 걸쳐 이어 붙일 수 있습니다. 종이에 받아 적으며 긴 곱셈을 하는 것과 닮았습니다. 2023년 윌리엄 메릴과 아시시 사바왈은 이것을 이상화한 모형에서 증명했습니다. 중간 토큰을 입력 길이에 비례하는 만큼 쓰게 하면, 중간 토큰 없이는 풀 수 없다고 믿어지는 문제까지 풀 수 있습니다('믿어진다'는 것은 널리 받아들여지지만 증명되지 않은 복잡도 가설에 기댄다는 뜻입니다). 입력 길이의 다항식(polynomial)만큼 쓰게 하면 다항 시간(polynomial time)에 풀리는 문제를 모두 풀 수 있습니다. 다만 이것은 '그렇게 계산할 수 있다'는 표현력의 결과이지, 학습된 모델이 실제로 그렇게 계산한다는 뜻은 아닙니다.
여러 번 풀고 다수결. 디코딩할 때 온도를 두고 무작위로 뽑으면 풀이마다 최종 답이 달라질 수 있습니다. 2022년 3월 왕쉐즈 등은 풀이를 여러 개 뽑아 가장 많이 나온 최종 답을 고르는 자기 일관성(self-consistency)으로 PaLM 540B의 GSM8K 정답률이 56.5%(탐욕 디코딩(greedy decoding) 한 번)에서 74.4%(풀이 40개의 다수결)로 오른다고 보고했습니다. 다수결은 왜 도움이 되고, 언제 도움이 안 될까요? 단순한 모형을 세워 봅시다. 한 번 풀 때 맞힐 확률(probability)이 p이고, 틀릴 때는 서로 다른 오답 m가지 가운데 하나를 같은 확률로 낸다고 합시다. 풀이끼리는 서로 독립(independence)이라고 가정합니다. 한 번의 정답률 p =
N개를 뽑으면 정답이 나온 횟수는 이항분포(binomial distribution) B(N, p)를 따르고, 오답 하나하나가 나온 횟수는 평균(mean)
분홍 점선
결과 보상(outcome reward)과 과정 보상(process reward). 검증기를 학습시킬 수도 있습니다. 2021년 칼 코브 등은 초등 수학 문제 약 8,500개로 GSM8K를 만들면서, 풀이가 맞았는지 예측하는 검증 모델로 여러 풀이 가운데 가장 좋은 것을 고르면(best-of-N) 정답률이 오른다고 보고했습니다. 최종 답만 보고 점수를 주는 것을 결과 보상, 풀이의 단계마다 옳은지 점수를 주는 것을 과정 보상이라 합니다. 2022년 딥마인드의 조너선 우에사토 등은 최종 답의 오류율만 보면 두 방식이 비슷하지만, 답은 맞았는데 풀이가 틀린 경우를 줄이려면 과정 감독, 또는 과정 감독을 흉내 내도록 학습한 보상 모델(reward model)이 필요하다고 보고했습니다(그런 경우가 14.0%에서 3.4%로). 2023년 오픈AI의 헌터 라이트먼 등은 풀이 단계 약 80만 개에 사람이 옳고 그름을 매긴 자료(PRM800K)로 과정 보상 모델(process reward model)을 학습시켜, MATH 문제 500개에서 풀이 1,860개 가운데 가장 좋은 것을 고를 때 78.2%를 풀었고 결과 보상 모델이나 다수결보다 높았다고 보고했습니다.
채점 결과를 보상으로. 검증기를 고르는 데만 쓰지 않고 학습 신호로 쓰면 어떨까요? 정답을 기계적으로 확인할 수 있는 문제에서는 보상을 사람이 매길 필요가 없습니다. 맞으면 1, 틀리면 0입니다. 2024년 11월 앨런 AI 연구소의 튈루 3 보고서는 이것을 검증 가능한 보상 강화 학습(RLVR)이라 불렀습니다. 인간 피드백 강화 학습과 틀은 같고, 보상 모델 대신 채점기가 들어갑니다. 채점기는 학습된 보상 모델보다 속이기 어렵지만 허점이 아예 없지는 않아서, 코딩 과제에서 문제를 풀지 않고 시험만 통과하도록 우회하는 행동이 2025년 오픈AI와 앤트로픽의 보고서에 적혔습니다. 목표는 기대 보상
기준선 b는 답 y에 따라 달라지지 않는 값이면(질문에는 따라도 됩니다) 기댓값을 바꾸지 않습니다.
보상이 0과 1뿐이고 G개 가운데 비율
o1과 R1. 2024년 9월 12일 오픈AI는 o1을 발표했습니다. 답하기 전에 긴 생각의 사슬을 쓰도록 대규모 강화 학습으로 학습시켰고, 성능이 두 가지 계산량 모두에 따라 꾸준히 오른다고 밝혔습니다. 하나는 학습 때 쓴 강화 학습 계산량이고, 다른 하나는 답할 때 생각하는 시간(테스트 시점 계산, test-time compute)입니다. 이날 공개된 것은 미리 보기판(o1-preview)이었습니다. 발표 글에 따르면 아직 공개하지 않은 o1은 미국 수학 경시 AIME 2024에서 한 번 풀기로 74%, 표본 64개의 다수결로 83%를 기록했습니다(GPT-4o는 12%). 방법의 세부와 생각의 사슬 원문은 공개하지 않았습니다. 2025년 1월 20일 딥시크는 R1의 가중치(weight)를 MIT 허가로 공개하고 방법을 논문으로 밝혔습니다. 먼저 R1-Zero가 있습니다. 사전학습만 된 DeepSeek-V3-Base에, 사람이 쓴 풀이 없이 GRPO와 규칙 기반 보상(최종 답이 맞는지, 정해진 형식을 지켰는지)만으로 강화 학습을 한 모델입니다. AIME 2024 정답률(한 번 풀기)이 15.6%에서 71.0%로, 다수결로는 86.7%로 올랐습니다. 학습이 진행되면서 답이 길어지고 스스로 되짚는 문장이 나타났다고 논문은 적었습니다. 그러나 R1-Zero의 풀이는 읽기 어렵고 여러 언어가 섞였습니다. 그래서 공개된 R1은 소량의 풀이 예시로 먼저 미세조정(fine-tuning)한 뒤, 강화 학습과 추가 미세조정을 번갈아 거쳤습니다(AIME 2024 79.8%). R1의 풀이로 작은 모델(15억~700억 매개변수(parameter))을 지도 학습시킨 증류(distillation) 모델도 함께 공개했습니다. 이 논문은 2025년 9월 『네이처』에 동료 심사를 거쳐 실렸습니다. R1의 바탕인 V3는 전문가 혼합(mixture of experts) 모델입니다.
테스트 시점 계산. 이제 계산을 학습에 쓸지 답할 때 쓸지 고를 수 있습니다. 답할 때 계산을 늘리는 길은 두 갈래입니다. 여러 답을 나란히 뽑아 고르는 병렬 방식(다수결, best-of-N, 위 그림)과 한 풀이를 더 길게 이어 가며 고치는 순차 방식입니다. 2024년 찰리 스넬 등은 문제의 난이도에 따라 방식을 고르면 best-of-N보다 계산을 4배 넘게 아낄 수 있고, 계산량을 맞추어 비교하면 어떤 문제에서는 작은 모델에 계산을 더 주는 편이 14배 큰 모델보다 낫다고 보고했습니다. 점수는 계산량과 함께 읽어야 합니다. 2024년 12월 발표된 o3의 ARC-AGI-1 준공개(semi-private) 평가 점수는 효율 설정에서 75.7%, 계산을 172배 쓴 설정에서 87.5%였습니다. 규모의 법칙(scaling laws)처럼 로그 축에서 직선으로 보이는 관계가 여기서도 보고되지만, 역시 측정한 범위 안의 경험적 관계입니다. 탐색에 계산을 더 써서 수를 고르는 게임 트리(game tree) 탐색과 같은 발상이기도 합니다.
그 뒤. 2025년에는 한 모델이 생각을 길게 할지 짧게 할지 고르는 방식이 퍼졌습니다. 앤트로픽의 Claude 3.7 Sonnet(2월)은 확장된 사고를 켜고 끌 수 있게 했습니다. 구글은 제미나이 2.5(3월)를 '생각하는 모델'로 내놓았고, 알리바바의 Qwen3(4월)는 두 모드를 한 모델에 담아 가중치를 공개했습니다. 오픈AI의 GPT-5(8월)는 빠른 모델과 깊이 생각하는 모델 사이를 라우터(router)가 고르는 시스템으로 발표되었습니다. 2025년 7월 국제수학올림피아드(IMO)에서는 구글 딥마인드의 제미나이 딥싱크가 자연어로 여섯 문제 가운데 다섯 문제를 풀어 42점 가운데 35점(금메달 기준)을 받았고, 대회 채점관이 이를 공식 채점했습니다. 오픈AI도 실험 모델이 35점을 받았다고 발표했는데, 이것은 전직 메달리스트 세 명이 채점한 결과였습니다. 형식 증명을 쓰던 2024년의 알파프루프(증명 보조기(proof assistant) 린)와 달리 둘 다 자연어 풀이였습니다. 2026년 IMO에서는 AFP 보도에 따르면 화웨이와 샤오훙수의 시스템이 대회 주최 측의 채점으로 42점 만점을 받았습니다. 오픈AI, 앤트로픽 등의 모델 네 개도 만점이라고 알려졌지만, 이것은 한 투자자가 AI 채점기로 따로 매긴 결과입니다. 날짜별 흐름은 언어 모델의 발전사에 모아 두었습니다.
무엇이 논쟁인가. 첫째, 적힌 풀이가 실제 계산을 보여 주는가. 2023년 마일스 터핀 등은 객관식 보기의 순서 같은 편향이 답을 바꾸는데도 풀이에는 그 이유가 드러나지 않는 사례를 보고했고, 2025년 앤트로픽 연구진은 답의 힌트를 몰래 넣었을 때 모델이 그 힌트를 썼다고 풀이에서 밝히는 비율이 Claude 3.7 Sonnet 25%, DeepSeek-R1 39%라고 보고했습니다. 둘째, 강화 학습이 새 능력을 만드는가, 원래 모델이 가끔 내던 풀이를 더 자주 내게 할 뿐인가. 2025년 칭화 대학 연구진은 k가 작을 때는 강화 학습한 모델의 pass@k가 높지만 k가 크면(수십~수백 개) 원래 모델이 더 높다고 보고했습니다. 위 그림의 말로 하면, 강화 학습이 한 번의 정답률 p를 올리는 대신 답의 다양성을 줄여 pass@N 곡선의 끝을 깎을 수 있다는 것입니다. 셋째, 복잡도가 커지면 무너지는가. 2025년 6월 애플의 파르신 쇼자이 등은 하노이의 탑(Tower of Hanoi) 같은 퍼즐에서 복잡도가 어느 선을 넘으면 정답률이 무너진다고 보고했고, 곧바로 나온 반론은 출력 길이 제한과 애초에 풀 수 없는 문제 사례가 그 결과를 만들었다고 지적했습니다. 넷째, 평가 자체. AIME처럼 공개된 문제는 학습 자료에 섞였을 수 있고, 점수는 표본 수와 계산량 설정에 따라 크게 달라집니다. 이 방법이 잘 듣는 곳은 정답을 확인하기 쉬운 영역(수학의 답, 코드)이고, 확인이 어려운 영역에서 얼마나 통하는지는 덜 분명합니다. '추론 모델'은 이런 모델을 부르는 관례적인 이름이지, 사람의 추론과 같은 과정이라는 결론이 아닙니다.
이어지는 곳. 다수결의 계산은 이항분포와 큰 수의 법칙이고, 풀이를 무작위로 뽑는 규칙은 디코딩의 온도입니다. 보상으로 정책을 고치는 틀은 강화 학습에서, 사람의 비교를 보상으로 삼는 앞선 방법과 KL 벌점의 정확한 해는 인간 피드백 강화 학습에서 이어집니다. 기준선이 기댓값은 그대로 두고 흩어짐만 줄인다는 것은 기댓값과 분산의 성질이고, 표본으로 기댓값을 어림하는 일은 몬테카를로 방법(Monte Carlo method)입니다. 답을 확인하기가 찾기보다 쉬운 문제에서 이 방법이 잘 듣는다는 점은 P 대 NP 문제의 직관과 닿아 있고, 가장 엄격한 채점기는 증명 보조기입니다. 계산량과 성능의 경험적 관계는 규모의 법칙에, R1의 바탕 구조는 전문가 혼합에, 2022년부터의 흐름은 언어 모델의 발전사에 있습니다.
이 개념이 나오는 긴 글
이 개념을 언급하는 페이지
- 분산과 표준편차
… 분산은 크게 달라지고, 같은 질문에 뽑은 답들의 평균 보상을 기준선으로 쓰는 GRPO가 이 생각을 씁니다(추론 모델). 평균은 모든 값까지의 거리의 제곱 을 더한 합이 가장 작아지는 자리입니다. 제곱 대신 거리 …
- 이항분포
… p)를 따릅니다. 이것으로 표본을 늘리는 다수결이 언제 도움이 되고 언제 소용없는지 셈할 수 있습니다(추론 모델).
- 큰 수의 법칙
… 가장 흔한 오답이 나올 확률보다 크기만 하면 다수결은 거의 확실히 맞고, 작으면 거의 확실히 틀립니다(추론 모델).
- 쿨백–라이블러 발산
… 않도록 두 모델의 출력 분포 사이의 KL 발산을 벌점으로 더합니다. 채점 결과를 보상으로 강화 학습하는추론 모델의 GRPO도 출발 모델에서 멀어지지 않도록 같은 KL 벌점을 둡니다. 마르코프 연쇄에서는 현재 분포와 …
- 강화 학습
… 같은 계산을 하면 미니맥스가 됩니다. 인간 피드백 강화 학습: 사람의 선호를 보상으로 삼은 강화 학습.추론 모델: 수학 문제의 답이나 코드의 테스트처럼 기계적으로 채점할 수 있는 결과를 보상으로 삼아, 언어 모델이 긴 …
- 디코딩: 온도, top-p, 빔 탐색
… 방법(자기 일관성, 2022년)은 답할 때 계산을 더 써서 정확도를 올리는 흔한 방법이고, 이 방향은추론 모델에서 이어집니다.
- 규모의 법칙
… 전체 매개변수 수와 실제로 계산에 쓰이는 매개변수 수가 달라, N을 무엇으로 셀지부터 정해야 합니다.추론 모델: 학습이 아니라 답할 때 쓰는 계산량을 늘려 성능을 올리는 방향.
- 인간 피드백 강화 학습과 정렬
… 가치 함수를 따로 학습하는 대신 같은 질문에 뽑은 답들의 평균 보상을 기준선으로 삼는 방법(GRPO)은추론 모델에서 이어집니다. InstructGPT와 ChatGPT 이후 DPO, 헌법적 AI, 공개 가중치 모델, …
- 전문가 혼합
… 층이 끼어 있는 자리인 피드포워드 층. 규모의 법칙: 전체 매개변수와 계산량을 따로 셀 때의 저울질.추론 모델: DeepSeek-V3를 바탕으로 한 추론 모델. 언어 모델의 발전사: 전문가 혼합 모델들이 나온 …
- 언어 모델의 발전사: RLHF 이후
… 같은 해 답보다 풀이를 먼저 쓰게 하는 생각의 사슬 프롬프팅과 다수결(자기 일관성)이 나왔고(추론 모델), 3월의 친칠라 논문은 계산량이 정해졌을 때 모델과 자료를 어떻게 나눌지에 대한 경험식을 …