언어 모델의 발전사: RLHF 이후(A history of language models after RLHF (2022–2026))
2022년 InstructGPT와 ChatGPT 이후 2026년까지 언어 모델(language model)에 일어난 일을 날짜순으로 정리한 길잡이. 선호 학습(RLHF, DPO), 공개 가중치(open weights) 모델, 전문가 혼합(mixture of experts), 긴 문맥, 멀티모달(multimodal), 도구와 에이전트(agent), 추론 모델, 증류(distillation)와 효율화가 각각 어느 개념 페이지로 이어지는지 보여 준다.
2022년 3월 오픈AI는 InstructGPT 논문에서 사람이 두 답을 비교한 기록으로 언어 모델을 조정하는 방법(인간 피드백 강화 학습(reinforcement learning))을 보고했고, 같은 해 11월 30일 그렇게 조정한 모델로 ChatGPT를 공개했습니다. 이 페이지는 그 뒤 2026년 9월까지를 날짜순으로 정리합니다. 읽기 전에 약속 하나를 해 둡니다. 여기 나오는 사건(event)은 세 종류입니다. 동료 심사를 거쳤거나 재현할 수 있는 연구, 회사의 발표, 그리고 벤치마크 점수입니다. 회사가 밝힌 숫자는 회사가 밝힌 값일 뿐 독립적으로 확인된 것은 적고, 벤치마크 점수는 표본(sample) 수, 계산량, 채점 방식에 따라 크게 달라집니다. 날짜는 논문이면 arXiv에 처음 올라온 날, 발표면 그 회사가 발표한 날입니다.
아래 연표에서 줄 하나가 흐름 하나입니다. 점에 올리면 무슨 일인지 나오고, 누르면 단계가 그 사건으로 넘어가 설명과 관련 페이지가 나옵니다. 흐름:
2022: 지시를 따르는 모델. 다음 토큰(token) 예측으로 학습한 모델은 질문에 답하기보다 글을 이어 씁니다. 두 가지 손질이 이것을 바꿨습니다. 하나는 여러 과제를 지시문 형태로 모아 미세조정(fine-tuning)하는 지시 조정입니다(2021년 구글의 FLAN, 2022년 10월의 Flan-T5). 다른 하나가 InstructGPT의 세 단계, 곧 지도 미세조정, 로지스틱 회귀(logistic regression)와 같은 손실로 학습한 보상 모델(reward model), KL 발산(KL divergence) 벌점을 둔 강화 학습입니다. 논문은 매개변수(parameter) 13억 개의 InstructGPT의 답이 1,750억 개의 GPT-3보다 더 자주 선호되었다고 보고했습니다. 같은 해 답보다 풀이를 먼저 쓰게 하는 생각의 사슬(chain of thought) 프롬프팅과 다수결(자기 일관성, self-consistency)이 나왔고(추론 모델), 3월의 친칠라 논문은 계산량이 정해졌을 때 모델과 자료를 어떻게 나눌지에 대한 경험식을 내놓았습니다(규모의 법칙, scaling laws). 12월 앤트로픽의 '헌법적 AI(Constitutional AI)'는 원칙 목록을 받은 AI가 사람 대신 비교하는 방법(RLAIF, AI 피드백 강화 학습)을 보고했습니다.
효율 쪽에서는 세 갈래가 이때 시작됩니다. 5월의 FlashAttention은 어텐션(attention)을 근사 없이, GPU 메모리를 덜 읽고 쓰는 순서로 계산합니다. 8월의 LLM.int8()과 10월의 GPTQ는 가중치(weight)를 8비트, 4비트 정수(integer)로 줄이는 양자화입니다. 수를 적은 비트로 적으면 오차가 생기므로, 그 오차가 출력에 덜 영향을 주도록 나누는 방법이 핵심이고, 이것은 율-왜곡 이론이 다루는 저울질입니다. 11월의 추측 디코딩(speculative decoding)은 작은 모델 q가 토큰 몇 개를 미리 쓰고 큰 모델 p가 그것을 한 번에 검사합니다. 초안 토큰 x를 확률(probability)
2023: 공개 가중치와 선호 학습의 단순화. 2월 메타가 연구용으로 공개한 LLaMA의 가중치가 곧 유출되어 퍼졌고, 3월 스탠퍼드의 알파카는 큰 모델(text-davinci-003)이 만든 지시문 5.2만 개로 LLaMA 7B를 미세조정했습니다. 큰 모델의 출력으로 작은 모델을 가르치는 방식은 2015년 힌턴 등의 지식 증류(큰 모델의 출력 확률을 작은 모델의 학습 목표로 삼는 것)와 같은 계열이고, 뒤에 R1의 증류 모델로 이어집니다. 7월의 Llama 2는 상업적 사용을 허용했고(월 사용자 7억 명이 넘는 서비스는 별도 허가), 9월의 Mistral 7B는 아파치 2.0으로, 12월의 Mixtral 8x7B는 전문가 혼합으로 나왔습니다. '공개 가중치'는 '오픈 소스'와 다릅니다. 가중치는 받을 수 있어도 학습 자료와 학습 코드는 대개 공개되지 않고, 허가 조건도 제각각입니다. 5월의 DPO는 RLHF의 KL 벌점 문제에 정확한 해가 있다는 데서 출발해, 보상 모델과 강화 학습 없이 선호 자료로 정책을 직접 학습하게 했습니다(자세한 계산은 인간 피드백 강화 학습). 같은 달 QLoRA는 4비트로 얼린 모델에 작은 저계수 행렬(matrix)만 더해 학습하는 방법으로 큰 모델의 미세조정을 GPU 한 장에 올렸습니다. 미세조정에 따른 가중치 변화가 낮은 계수의 행렬로 잘 어림된다는 LoRA(2021)의 가정은 특잇값 분해(singular value decomposition)의 언어로 이해할 수 있습니다.
3월의 GPT-4는 이미지를 입력으로 받았지만, 기술 보고서는 구조, 크기, 자료, 계산량을 밝히지 않았습니다. 이때부터 가장 큰 모델들의 내부는 대체로 공개되지 않습니다. 문맥 길이도 늘었습니다. 5월 앤트로픽은 10만 토큰을, 11월 오픈AI는 12.8만 토큰을 발표했고, 6월의 위치 보간(position interpolation) 논문은 RoPE를 쓰는 모델의 위치 번호를 줄여 넣는 간단한 방법으로 문맥을 늘렸습니다(위치 인코딩(positional encoding)). 그러나 넣을 수 있다고 잘 쓰는 것은 아닙니다. 7월 리우 등은 정답이 든 문서가 긴 입력의 가운데 있을 때 성능이 가장 낮다고 보고했습니다(검색 증강 생성, retrieval-augmented generation). 도구 사용도 이때 제도화되었습니다. 2022년 10월의 ReAct와 2023년 2월의 Toolformer가 연구로 보였고, 6월 오픈AI API의 함수(function) 호출은 모델이 정해진 형식으로 도구의 인자를 내놓게 했습니다. 12월에는 글·이미지·음성·영상을 처음부터 함께 학습했다는 구글의 제미나이 1.0과, 어텐션 대신 입력에 따라 바뀌는 선형 순환을 쓰는 Mamba(상태 공간 모형(state space model))가 나왔습니다.
2024: 긴 문맥, 실시간 멀티모달, 그리고 o1. 2월 제미나이 1.5 Pro가 100만 토큰 문맥을 발표했고, 같은 달 DeepSeekMath 논문이 GRPO를 제안했습니다. 5월의 GPT-4o는 글, 음성, 이미지를 한 모델로 실시간 처리한다고 발표되었습니다. 공개 가중치 쪽에서는 4월 Llama 3(매개변수 80억 개 모델을 15조 토큰 넘게 학습해, 친칠라식 최적보다 훨씬 많은 자료를 먹였습니다)과 7월 매개변수 4,050억 개의 Llama 3.1이 나왔습니다. 7월 구글 딥마인드의 알파프루프와 알파지오메트리 2는 그해 국제수학올림피아드 문제로 42점 가운데 28점(은메달 기준)을 받았습니다. 알파프루프는 증명 보조기(proof assistant) 린으로 형식 증명을 썼는데, 문제를 린으로 옮기는 일은 사람이 했고 어떤 문제에는 대회 시간보다 훨씬 긴 사흘 가까이 걸렸습니다. 9월 오픈AI는 답하기 전에 긴 생각의 사슬을 쓰도록 강화 학습으로 가르쳤다는 o1을 발표했고, 11월 튈루 3 보고서는 채점 결과를 보상으로 쓰는 학습에 RLVR이라는 이름을 붙였습니다(추론 모델). 10월 앤트로픽은 화면을 보고 마우스와 키보드를 조작하는 '컴퓨터 사용'을, 11월에는 모델과 외부 도구를 잇는 공개 규약 MCP를 내놓았습니다. 12월에는 o3가 발표되었고, 딥시크는 전체 6,710억·토큰당 370억 매개변수의 전문가 혼합 모델 DeepSeek-V3를 공개하며 최종 학습에 H800 GPU 278.8만 시간(시간당 2달러로 치면 약 558만 달러)이 들었다고 밝혔습니다. 보고서 스스로 적었듯 이 숫자는 앞선 연구와 실험 비용을 뺀 최종 학습 비용입니다.
2025: 추론 모델의 확산과 에이전트. 1월 20일 딥시크가 R1을 MIT 허가로 공개하고 방법을 밝히면서, 검증 가능한 보상(verifiable reward)과 GRPO로 긴 풀이를 학습시키는 방법이 널리 재현되었습니다. 이 논문은 9월 『네이처』에 동료 심사를 거쳐 실렸습니다. 한 모델이 생각의 길이를 고르는 방식이 퍼졌고(2월 Claude 3.7 Sonnet, 3월 제미나이 2.5, 4월 Qwen3, 8월 GPT-5), 7월 국제수학올림피아드에서는 제미나이 딥싱크가 자연어 풀이로 공식 채점을 받아 금메달 기준(35/42)에 이르렀습니다. 에이전트 쪽에서는 1월 브라우저를 조작하는 오픈AI의 Operator가 나왔습니다. 2월에는 여러 웹 문서를 찾아 보고서를 쓰는 오픈AI의 Deep Research와 터미널에서 코드를 고치는 앤트로픽의 Claude Code가 나왔고, 12월 MCP는 리눅스 재단 산하의 새 재단으로 넘어갔습니다. 가장 큰 공개 가중치 모델들은 대부분 전문가 혼합이었습니다. 4월 메타의 Llama 4는 대화용으로 따로 최적화(optimization)한 실험판의 LMArena 점수를 발표에 쓴 일로 논란이 되었고, LMArena는 규정을 고쳤습니다. 8월 오픈AI는 GPT-2 이후 처음으로 언어 모델의 가중치를 공개했고(gpt-oss), 7월 문샷의 Kimi K2는 전체 매개변수 1조 개 규모였습니다. 제도 쪽에서는 8월 2일부터 EU 인공지능법의 범용 AI 모델 제공자 의무가 적용되기 시작했습니다.
2026년 9월까지. 문맥 100만 토큰이 최상위 모델에서 흔해졌습니다(2월 Claude Opus 4.6은 베타로, 4월 DeepSeek-V4 미리 보기). 공개 가중치 전문가 혼합 모델의 규모는 더 커져서, 딥시크가 4월 공개한 V4-Pro는 전체 1.6조·활성 490억 매개변수, 문샷이 7월 공개한 Kimi K3는 전체 2.8조·활성 1,040억 매개변수(전문가 896개 가운데 16개)라고 밝혔습니다. 모델을 공개할지 자체가 쟁점이 된 일도 있습니다. 4월 앤트로픽은 소프트웨어 보안 취약점을 찾고 악용하는 능력이 너무 강하다는 이유로 Claude Mythos Preview를 일반에 공개하지 않고 방어 목적의 협력 기관에만 제공한다고 발표했습니다. 7월 국제수학올림피아드에서는 AFP 보도에 따르면 화웨이와 샤오훙수의 시스템이 대회 주최 측의 채점으로 42점 만점을 받았습니다. 다른 모델 네 개의 만점 소식도 돌았지만, 그것은 한 투자자가 AI 채점기로 따로 매긴 결과였습니다. 7월 24일 EU 관보에 실린 디지털 옴니버스 규정은 고위험 AI 시스템 의무의 적용 시점을 미뤘습니다(독립형 시스템은 2027년 12월, 제품에 내장된 시스템은 2028년 8월). 이 해의 사건들은 대부분 회사 발표이고, 독립적인 평가가 쌓이려면 시간이 걸립니다.
무엇이 그대로인가. 4년 동안 이름은 많이 바뀌었지만 수학의 부품은 몇 개 되지 않습니다. 선호를 점수로 바꾸는 브래들리–테리 모형(Bradley–Terry model)과 로지스틱 회귀, 출발점에서 멀어지지 않게 하는 KL 발산, 점수를 확률로 바꾸는 소프트맥스(softmax), 그것으로 전문가를 고르는 희소 라우팅, 벡터(vector)의 방향으로 글을 찾는 코사인 유사도(cosine similarity), 여러 번 뽑아 고르는 표본과 검증, 그리고 모든 것의 바탕인 다음 토큰 예측과 확률적 경사 하강법(stochastic gradient descent)입니다. 조심할 것도 그대로입니다. 벤치마크는 금방 포화되고, 공개된 문제는 학습 자료에 섞이며(오염), 회사가 고른 설정의 점수는 다른 설정에서 재현되지 않을 수 있습니다. 규모를 키우면 계속 좋아질지, 적힌 풀이가 실제 계산을 보여 주는지, 이 모델들이 '이해'하는지는 모두 열린 질문입니다.
이어지는 곳. 출발점인 선호 학습의 수학은 인간 피드백 강화 학습에, 긴 풀이와 검증 가능한 보상으로 가르치는 방법은 추론 모델에, 매개변수와 계산을 떼어 놓는 구조는 전문가 혼합에, 찾아서 답하는 방법과 환각(hallucination)은 검색 증강 생성에 있습니다. 문맥을 늘려 온 방법은 위치 인코딩에서, 어텐션을 대신하려는 선형 순환은 상태 공간 모형에서 이어집니다. 모든 모델의 뼈대인 트랜스포머(transformer)와 어텐션, 입력을 자르는 토큰화, 글을 뽑는 디코딩, 크기와 성능의 경험식인 규모의 법칙은 이 연표의 모든 줄에 걸쳐 있습니다. 2022년 이전의 이야기는 인공지능(artificial intelligence)과 언어 모델에서 시작합니다.
이 개념이 나오는 긴 글
이 개념을 언급하는 페이지
- 신경망
… 2022년 이후 이 뼈대 위에서 일어난 일, 곧 선호 학습, 전문가 혼합, 긴 문맥, 추론 모델은언어 모델의 발전사에 날짜순으로 정리되어 있습니다.
- 율–왜곡 이론
… 4비트 정수로 줄이는 양자화도, 적은 비트를 출력이 덜 망가지는 쪽으로 나누는 이 저울질의 한 예입니다(언어 모델의 발전사).
- 기계 학습
… 더 오래된 질문은 튜링 기계에서 시작합니다. 2022년 이후 큰 언어 모델에서 일어난 일은언어 모델의 발전사에 날짜순으로 모여 있습니다.
- 인공지능
… 아주 긴 글을 읽는 모델, 답하기 전에 풀이를 길게 적어 보는 추론 모델이 차례로 나왔습니다. 그 과정은언어 모델의 발전사에 날짜순으로 정리되어 있습니다. 같은 시기에 잡음에서 그림을 되살리는 확산 모델이 그림 생성의 주류가 …
- 언어 모델과 다음 토큰 예측
… 이후 언어 모델에 일어난 일, 곧 선호 학습과 공개 가중치 모델, 긴 문맥, 검색과 도구, 추론 모델은언어 모델의 발전사에 날짜순으로 정리되어 있습니다.
- 인간 피드백 강화 학습과 정렬
… ChatGPT 이후 DPO, 헌법적 AI, 공개 가중치 모델, 추론 모델까지 무엇이 언제 나왔는지는언어 모델의 발전사에 날짜순으로 모아 두었습니다.
- 위치 인코딩의 변천
… 필요한 부분만 찾아 넣는 검색 증강 생성이 있습니다. 이 기법들이 언제 어느 모델에 들어갔는지는언어 모델의 발전사에서 이어집니다.
- 상태 공간 모형과 선형 순환
… 할 수 없는지는 유한 오토마톤과 비둘기집 원리가 알려 주고, 하이브리드 모델이 어디쯤 놓이는지는언어 모델의 발전사에서 이어집니다.
- 추론 모델과 테스트 시점 계산
… 네 개도 만점이라고 알려졌지만, 이것은 한 투자자가 AI 채점기로 따로 매긴 결과입니다. 날짜별 흐름은언어 모델의 발전사에 모아 두었습니다. 무엇이 논쟁인가. 첫째, 적힌 풀이가 실제 계산을 보여 주는가. 2023년 마일스 …
- 전문가 혼합
… 매개변수와 계산량을 따로 셀 때의 저울질. 추론 모델: DeepSeek-V3를 바탕으로 한 추론 모델.언어 모델의 발전사: 전문가 혼합 모델들이 나온 순서. 힌턴: 1991년 논문의 저자 가운데 한 사람.
- 검색 증강 생성
… 창, 그 창을 길게 늘리는 방법은 위치 인코딩에 있습니다. 긴 문맥과 도구 사용이 발전해 온 순서는언어 모델의 발전사에서 볼 수 있습니다.