인간 피드백 강화 학습과 정렬(Reinforcement learning from human feedback and alignment)
사람이 두 답 가운데 나은 쪽을 고른 기록으로 보상 모델(reward model)을 학습하고(브래들리–테리 모형, Bradley–Terry model), 원래 모델에서 너무 멀어지지 않게 KL 벌점을 두며 언어 모델(language model)을 그 보상 쪽으로 조정하는 방법.
다음 토큰(token)을 예측하도록 학습한 언어 모델은 학습 자료의 분포를 흉내 냅니다. 질문에 답하는 대신 질문을 이어 쓰기도 하고, 틀린 말도 자료에 흔하면 그럴듯하게 씁니다. 원하는 행동을 식으로 적기는 어렵지만, 사람은 두 답을 나란히 보면 어느 쪽이 나은지 꽤 쉽게 고릅니다. 인간 피드백 강화 학습(RLHF)은 이 비교를 학습 신호로 바꾸는 방법입니다. 흔히 세 단계로 이루어집니다.
- 지도 미세조정(fine-tuning). 사람이 쓴 모범 답안으로 모델을 조금 더 학습시킵니다(같은 다음 토큰 예측입니다).
- 보상 모델. 한 질문 x에 대한 두 답 가운데 사람이 고른 쪽을 맞히도록, 답 y에 점수 r(x, y)를 매기는 모델을 학습시킵니다.
- 강화 학습. 언어 모델이 보상 모델의 점수가 높은 답을 쓰도록 강화 학습으로 조정하되, 원래 모델에서 너무 멀어지지 않게 벌점을 둡니다.
이 틀은 2017년 폴 크리스티아노 등이 사람의 비교만으로 시뮬레이션 속 로봇 과제와 아타리 게임을 학습시킨 연구에서 시작해, 2020년 글 요약을 거쳐, 2022년 오픈AI의 InstructGPT로 언어 모델에 자리 잡았습니다.
비교를 점수로: 브래들리–테리 모형. 답마다 보이지 않는 점수 r이 있고, A가 B보다 선호될 확률(probability)이 다음과 같다고 가정합니다.
σ는 로지스틱 회귀(logistic regression)의 시그모이드 함수입니다. 1952년 랠프 브래들리와 밀턴 테리가 짝 비교(paired comparison) 실험을 분석하려고 제안했고, 에른스트 체르멜로가 1929년 체스 대회 기록으로 선수들의 실력을 매기며 같은 모형을 먼저 썼습니다. 오늘날 흔히 쓰는 체스 엘로 점수의 로지스틱 판도 같은 꼴입니다(밑이 10이고, 400점 차이가 기대 승산 10배). 점수는 차이만 의미가 있어서, 모든 점수에 같은 수를 더해도 확률은 그대로입니다. 비교 기록이 주어지면 그 기록이 나올 확률을 가장 크게 하는 점수를 고릅니다(최대 가능도(likelihood)). 비교 하나(이긴 답 w, 진 답 l)는 '두 점수의 차이'를 입력으로 하는 로지스틱 회귀의 표본(sample) 하나이므로, 최소화할 손실은
아래 표의 칸 (i, j)는 사람들이 답 i를 답 j보다 고른 횟수입니다. 칸을 누르면 그 비교가 한 번 더해지고, 오른쪽 점수가 최대 가능도로 다시 맞춰집니다.
A의 행(‘A 승’) 칸을 여러 번 눌러 보세요. A의 점수가 올라가고 다른 답들은 내려가지만, 점수는 유한한 값에 머뭅니다. B, C, D가 A를 이긴 기록이 한 번씩이라도 남아 있기 때문입니다. 만약 A가 한 번도 지지 않았다면, 가능도는 A의 점수를 올릴수록 계속 커져서 최대점이 없습니다. 일반적으로 어떤 답들의 무리가 나머지에게 한 번도 지지 않았으면 이런 일이 생깁니다. 그래서 이 그림은 만일에 대비해 점수의 제곱합에 아주 작은 벌점(
KL 벌점과 그 정확한 해. 셋째 단계의 목표는 보통 이 페이지 맨 위의 식입니다. π는 학습하는 모델(정책),
이유는 한 줄입니다. 목표를 β로 나눠 정리하면
β가 크면 π*는
DPO: 보상 모델 없이. 위의 해를 거꾸로 풀면 보상을 정책으로 나타낼 수 있습니다.
이것을 브래들리–테리 확률에 넣으면, 같은 질문 x에 대한 두 답의 점수 차이에서 계산하기 어려운
그러니 보상 모델을 따로 학습시키고 강화 학습을 돌리는 대신, 선호 자료에서 이 확률의 가능도를 π에 대해 직접 최대화하면 됩니다. 2023년 라파엘 라파일로프 등이 제안한 직접 선호 최적화(DPO)입니다. '정확한 재매개변수화(reparameterization)'라는 말이 어디까지 참인지 분명히 해 둡시다. 선호가 브래들리–테리 모형을 따르고, 목표가 위의 KL 벌점 꼴이며, π가 모든 분포를 나타낼 수 있고, 자료가 충분하다면 두 방법이 도달하는 최적 정책은 같습니다. 실제로는 자료가 유한하고 모델의 표현력과 최적화가 불완전해서 두 방법의 결과가 다를 수 있으며, 어느 쪽이 나은지에 대한 실험 결과는 엇갈립니다.
강화 학습의 용어로. 질문과 지금까지 쓴 토큰이 상태, 다음 토큰이 행동, π가 정책이고, 보상은 답을 다 쓴 뒤 한 번 받습니다. InstructGPT는 정책 기울기(policy gradient) 방법의 하나인 PPO(2017년 존 슐먼 등)로 이 목표를 최적화했습니다. 한 번의 갱신으로 정책이 너무 크게 바뀌지 않도록 갱신 폭을 잘라 두는 방법입니다. 기울기(slope)는 뽑은 답 몇 개로 추정하므로 확률적 경사 하강법(stochastic gradient descent)처럼 잡음이 섞입니다.
한계. RLHF가 최적화하는 것은 '평가자가 고르는 답'이지 '참인 답'이 아닙니다. 평가자가 자신 있어 보이는 답이나 자기 의견에 맞장구치는 답을 좋아하면 모델도 그쪽으로 기웁니다. 이런 아첨 경향은 여러 모델에서 측정되었습니다(2023년 므리난크 샤르마 등). 선호가 점수 하나로 요약된다는 브래들리–테리 가정도 근사입니다. 사람마다 선호가 다르고, 가위바위보처럼 순환하는 선호(A ≻ B, B ≻ C, C ≻ A)는 어떤 점수로도 나타낼 수 없습니다. 사람 대신 원칙 목록을 받은 AI가 비교하게 하는 방법(2022년 '헌법적 AI(Constitutional AI)')처럼 비교의 출처를 바꾸는 변형도 쓰입니다. '정렬'이라는 말은 모델의 행동을 사람의 의도에 맞추는 일 전체를 가리키고, RLHF는 그 가운데 널리 쓰이는 한 방법일 뿐입니다.
이어지는 곳. 보상 모델의 손실은 로지스틱 회귀의 교차 엔트로피(cross-entropy) 그대로이고 그 원리는 최대 가능도입니다. 벌점 항은 KL 발산이며, 최적 정책이 지수 꼴인 까닭은 최대 엔트로피 원리(principle of maximum entropy)의 깁스 분포와 같은 계산에 있습니다. 같은 꼴은 소프트맥스(softmax)와 디코딩의 온도에도 나옵니다. 상태·행동·정책·보상의 틀과 정책 기울기는 강화 학습에서 다룹니다. 대리 보상에 지나치게 맞추는 것은 학습 자료에 지나치게 맞추는 과적합과 닮았고, KL 벌점이 정책을 출발점 가까이 붙잡아 두는 것은 정규화가 가중치(weight)를 0 가까이 붙잡아 두는 것과 같은 구실을 합니다. 출발점이 되는 모델이 무엇을 배웠는지는 언어 모델과 규모의 법칙(scaling laws)에서 볼 수 있습니다. 사람의 비교 대신 정답 채점기를 보상으로 쓰고, 가치 함수(function)를 따로 학습하는 대신 같은 질문에 뽑은 답들의 평균 보상을 기준선으로 삼는 방법(GRPO)은 추론 모델에서 이어집니다. InstructGPT와 ChatGPT 이후 DPO, 헌법적 AI, 공개 가중치(open weights) 모델, 추론 모델까지 무엇이 언제 나왔는지는 언어 모델의 발전사에 날짜순으로 모아 두었습니다.
이 개념이 나오는 긴 글
이 개념 위에 세워진 것
이 개념을 언급하는 페이지
- 쿨백–라이블러 발산
… 표를 빈도가 다른 글에 쓸 때 손해를 보는 것도 같은 이치입니다. 언어 모델을 사람의 선호 쪽으로 조정하는RLHF는 조정된 모델이 원래 모델에서 너무 멀어지지 않도록 두 모델의 출력 분포 사이의 KL 발산을 벌점으로 …
- 라그랑주 승수법
… x_i} 라는 지수 모양이 나오는데(최대 엔트로피 원리), 이것이 소프트맥스의 모양입니다.인간 피드백 강화 학습에서 보상 r을 키우되 원래 모형 \pi_{\text{ref}} 와의 KL 발산에 벌점 β를 매기는 …
- 인공지능
… 이것은 측정한 범위 안에서 맞는 경험 법칙이지 증명된 정리가 아닙니다. 사람의 선호로 답을 다듬는인간 피드백 강화 학습을 거친 대화형 모델 ChatGPT가 2022년 11월에 공개되면서 언어 모델은 연구실 밖으로 나왔습니다. …
- 강화 학습
… 자기 대국 강화 학습으로 다듬고 몬테카를로 트리 탐색과 엮었습니다. 언어 모델을 사람의 선호에 맞추는인간 피드백 강화 학습도 이 틀을 씁니다. 서튼과 바토는 2024년도 튜링상을 받았습니다. 한계. 강화 학습은 대개 아주 많은 …
- 언어 모델과 다음 토큰 예측
… 목표에 들어 있지 않습니다. 대화에 쓰는 모델은 여기에 사람의 선호로 다듬는 단계를 더합니다(인간 피드백 강화 학습). 큰 모델이 이 단순한 목표만으로 번역, 요약, 코드 작성 같은 일을 상당히 해낸다는 것은 관찰된 …
- 디코딩: 온도, top-p, 빔 탐색
… 주는지는 과제마다 실험으로 정합니다. 이어지는 곳. 온도가 있는 소프트맥스는 어텐션의 가중치에도,인간 피드백 강화 학습의 최적 정책 \pi^\ast \propto \pi_{\text{ref}}\,e^{r/\beta} 에도 …
- 규모의 법칙
… 둘 다 자료가 있는 곳에서 잘 맞는다는 사실이 자료가 없는 곳에서도 맞는다는 보장이 되지 못합니다.인간 피드백 강화 학습: 보상 모델을 지나치게 최적화할 때의 경험 법칙. 전문가 혼합: 토큰마다 전문가 몇 개만 쓰는 …
- 추론 모델과 테스트 시점 계산
… 11월 앨런 AI 연구소의 튈루 3 보고서는 이것을 검증 가능한 보상 강화 학습(RLVR)이라 불렀습니다.인간 피드백 강화 학습과 틀은 같고, 보상 모델 대신 채점기가 들어갑니다. 채점기는 학습된 보상 모델보다 속이기 어렵지만 허점이 …
- 언어 모델의 발전사: RLHF 이후
… 3월 오픈AI는 InstructGPT 논문에서 사람이 두 답을 비교한 기록으로 언어 모델을 조정하는 방법(인간 피드백 강화 학습)을 보고했고, 같은 해 11월 30일 그렇게 조정한 모델로 ChatGPT를 공개했습니다. 이 페이지는 그 …
- 굿하트의 법칙
… 벌점을 걸기가 그런 예입니다. 기계 학습의 과적합은 학습 오차라는 대리 지표를 너무 잘 줄인 결과이고,인간 피드백 강화 학습에서 KL 발산 벌점을 거는 것도 보상 모델이라는 대리 지표를 너무 세게 최적화하지 않으려는 …