규모의 법칙(Neural scaling laws)
언어 모델(language model)의 시험 손실이 매개변수(parameter) 수·자료 양·계산량의 거듭제곱으로 줄어든다는 경험적 관계. 측정한 범위 안에서 맞춘 곡선이며, 이론에서 유도된 법칙은 아니다.
언어 모델을 열 배 크게 만들면 얼마나 좋아질까요? 큰 모델 하나를 학습시키는 데 몇 달과 막대한 돈이 드니, 미리 알 수 있다면 쓸모가 큽니다. 2020년 오픈AI의 재러드 캐플런 등은 트랜스포머(transformer) 언어 모델을 크기를 바꿔 가며 여럿 학습시켜 이 물음에 답하려 했습니다. 모델의 크기는 매개변수 수 N으로 잽니다. 매개변수는 학습으로 값이 정해지는 수들이고, 모델이 배운 것은 모두 이 수들에 담깁니다.
성적은 손실로 잽니다. 언어 모델은 글을 잘게 자른 조각(토큰(token), 대개 낱말이나 낱말의 일부)을 하나씩 보며 다음 토큰을 확률(probability)로 맞히는데, 손실은 모델이 정답 토큰을 얼마나 잘못 맞혔는지를 잰 점수로, 낮을수록 좋습니다. 정확히는 정답 토큰에 준 확률의 로그에 음수를 붙여 평균(mean)한 값(토큰당 교차 엔트로피(cross-entropy))이고, 자연로그(natural logarithm)를 쓰므로 단위를 나트라 부릅니다. 손실 2.3나트는 대략 정답에 평균 10분의 1쯤의 확률을 준 셈이고, 손실 0.69나트는 2분의 1쯤입니다. 캐플런 등은 학습에 쓰지 않은 글에서 잰 손실을 N에 대해 그렸습니다.
그래프의 두 축은 로그 눈금이었습니다. 로그 눈금에서는 1, 10, 100, 1000이 같은 간격으로 놓입니다. 그렇게 그리자 점들이 거의 한 직선 위에 놓였습니다. 로그–로그 그래프에서 직선이 되는 관계를 거듭제곱 법칙(power law)이라 합니다. 작은 예로 y = 100/x를 보면, x가 1, 10, 100일 때 y는 100, 10, 1입니다. x가 한 눈금(10배) 오른쪽으로 갈 때마다 y는 늘 한 눈금(10분의 1) 내려가니, 로그 눈금에서는 일정한 기울기(slope)로 내려가는 직선이 됩니다. y가 x의 거듭제곱(여기서는 x의 −1제곱)에 비례하면 언제나 이렇게 직선이 됩니다. 캐플런 등이 맞춘 식은 다음과 같습니다.
어디까지 믿을 수 있나. 이 식을 끝까지 믿으면 N → ∞에서 손실이 0으로 갑니다. 그러나 글에는 어떤 모델로도 줄일 수 없는 불확실성이 있습니다. '오늘 점심으로 ___을 먹었다'의 빈칸은 완벽한 모델도 확실히 맞힐 수 없습니다. 이 줄일 수 없는 몫을 글의 엔트로피(entropy)라 합니다. 손실은 이 엔트로피에 모델의 오차(모델의 확률이 실제 글의 확률과 다른 만큼)를 더한 값이라서, 엔트로피 아래로는 내려갈 수 없습니다(언어 모델 참고). 그러니 이 직선은 어딘가에서 꺾여야 하고, 논문 스스로도 그렇게 적었습니다. 또 이 관계는 특정한 자료(WebText2), 글을 토큰으로 자르는 규칙(토크나이저, tokenizer), 모델 구조, 학습 설정에서 잰 것입니다. 지수와 상수는 그 조건과 함께 읽어야 하고, 조건이 바뀌면 값도 바뀝니다.
계산량이 정해져 있다면. 쓸 수 있는 컴퓨터와 시간이 정해져 있다면, 모델을 키울까요, 자료를 더 먹일까요? 먼저 계산량을 셉니다. 단위는 FLOP으로, 실수(real number)의 덧셈이나 곱셈 한 번입니다. 트랜스포머를 학습시킬 때 토큰 하나마다 답을 계산하는 데(앞으로) 약 2N번, 매개변수를 고칠 방향을 계산하는 데(거꾸로) 약 4N번의 연산이 듭니다. 학습 토큰 수를 D라 하면 학습 계산량은 대략
E는 모델을 한없이 키우고 자료를 한없이 주어도 남는 손실, 둘째 항은 모델이 유한해서, 셋째 항은 자료가 유한해서 생기는 몫입니다. 계산량 C를 고정하면
가장 낮은 점에서는 곡선이 잠깐 평평합니다. N을 조금 늘리면 셋째 항(자료 부족)이 커지고 둘째 항(모델 부족)이 작아지는데, 최저점은 이 둘의 변화가 꼭 맞비기는 곳입니다. 이 조건을 풀면 최적의 N과 D가 다음 꼴로 나옵니다.
미분(differentiation)으로 풀어 보기
평평하다는 것은 N에 대한 기울기(도함수, derivative function)가 0이라는 뜻입니다. E는 상수이므로 빼고,최적의 N과 D가 모두 C의 거듭제곱이고, 두 지수의 합은 1입니다(N과 D를 곱하면 C/6이어야 하니 당연합니다). 호프만 등의 요지는 두 지수가 모두 0.5 가까이라는 것이었습니다. 계산량을 늘릴 때 모델과 자료를 거의 같은 비율로 늘려야 한다는 뜻입니다. 계산량이 100배가 되면 모델도 자료도 약 10배씩입니다.
캐플런 등(2020)은 모델을 훨씬 빨리 키우라고 권했습니다(
호프만 등은 이 결론에 따라 고퍼(매개변수 2,800억 개, 3,000억 토큰)와 비슷한 계산량으로 매개변수 700억 개의 친칠라를 1.4조 토큰으로 학습시켰고, 친칠라가 여러 평가에서 고퍼보다 나았습니다. 여기서 '매개변수 하나당 토큰 약 20개'라는 어림셈이 퍼졌습니다.
그런데 상수를 '2022년 발표값'으로 두고 고퍼의 계산량(
무엇을 최적화(optimization)하는가. 친칠라식 최적은 '학습 계산량이 정해졌을 때 손실을 가장 낮추는' 선택일 뿐입니다. 학습이 끝난 모델이 답을 낼 때도 계산이 들고(추론 비용), 이 비용은 모델이 클수록 큽니다. 모델을 오래 많은 사람에게 서비스하면 추론 비용이 학습 비용보다 커질 수 있으므로, 작은 모델에 자료를 훨씬 많이 먹이는 편이 이득일 수 있습니다. 2024년 공개된 라마 3의 매개변수 80억 개 모델은 15조 개가 넘는 토큰으로 학습해 매개변수당 약 1,900개였습니다. 또 좋은 글 자료는 유한해서, 같은 자료를 되풀이해 학습하면 어떻게 되는지도 따로 측정되었습니다. 2023년 니클라스 무에니호프 등은 네 번쯤 되풀이하는 것은 새 자료와 거의 차이가 없지만 그보다 많이 되풀이하면 효과가 빠르게 줄어든다고 보고했습니다.
손실과 능력. 규모의 법칙(scaling laws)이 예측하는 것은 평균 손실입니다. 특정 과제의 정답률은 손실과 단순하게 이어지지 않아서, 어떤 과제는 모델이 어느 크기를 넘을 때 갑자기 풀리는 것처럼 보였습니다('창발(emergence)'이라 불렸습니다). 그러나 2023년 라일런 셰퍼 등은 이런 급격한 도약 가운데 상당수가 맞음/틀림처럼 불연속인 채점 방식에서 생기며, 연속적인 척도로 재면 매끄럽게 나아진다고 보고했습니다. 어느 쪽 설명이 얼마나 맞는지는 과제마다 다르고, 아직 논쟁 중입니다.
왜 거듭제곱인가. 확립된 답은 없습니다. 몇 가지 설명이 제안되었습니다. 자료가 실제로 놓인 공간의 차원이 지수를 정한다는 모형, 배워야 할 작은 기술들의 빈도가 지프의 법칙처럼 거듭제곱으로 분포해서 모델이 커질수록 더 드문 기술을 하나씩 익힌다는 모형 등입니다. 이들은 관찰을 재현하는 모형이지 증명된 원인이 아닙니다. 실무에서는 작은 모델 여럿으로 곡선을 맞춘 뒤 큰 모델의 손실을 미리 가늠하는 데 쓰고, 이 예측이 꽤 맞아 왔다는 것이 이 법칙이 널리 쓰이는 이유입니다. 예를 들어 GPT-4 기술 보고서(2023)는 계산량이 1만분의 1 이하인 모델들로 최종 손실을 미리 맞혔다고 적었습니다. 직선 하나를 맞출 때는 로그를 취한 뒤 최소제곱 회귀(least-squares regression)를 하면 되지만, E가 있는 식은 로그를 취해도 직선이 되지 않습니다. 그래서 상수를 조금씩 바꿔 가며 측정값과의 차이를 줄이는 반복 계산(비선형 최적화)으로 맞춥니다.
이어지는 곳.
- 로그: 로그 축에서 곱셈이 덧셈이 되고 거듭제곱이 직선이 되는 까닭.
- 지프의 법칙: 같은 모양의 경험 법칙.
- 언어 모델과 엔트로피: 손실은 언어 모델의 교차 엔트로피이고, 그 바닥은 글의 엔트로피입니다.
- 트랜스포머: N과 계산량을 세는 방법.
- 라그랑주 승수법과 최적화: 제약 아래에서 최적점을 찾는 일반적인 방법.
- 과적합(overfitting): 맞춘 곡선을 측정한 범위 밖에 쓰는 위험과 닮았습니다. 둘 다 자료가 있는 곳에서 잘 맞는다는 사실이 자료가 없는 곳에서도 맞는다는 보장이 되지 못합니다.
- 인간 피드백 강화 학습(reinforcement learning): 보상 모델(reward model)을 지나치게 최적화할 때의 경험 법칙.
- 전문가 혼합(mixture of experts): 토큰마다 전문가 몇 개만 쓰는 모델에서는 전체 매개변수 수와 실제로 계산에 쓰이는 매개변수 수가 달라, N을 무엇으로 셀지부터 정해야 합니다.
- 추론 모델: 학습이 아니라 답할 때 쓰는 계산량을 늘려 성능을 올리는 방향.
이 개념이 나오는 긴 글
이 개념을 언급하는 페이지
- 지프의 법칙
… 않도록 일부러 덜 뽑기도 합니다. 언어 모델의 시험 손실이 매개변수 수나 자료 양의 거듭제곱으로 줄어든다는규모의 법칙도 로그–로그 그래프에서 직선으로 보이는 멱법칙이지만, 측정한 범위 안에서 맞춘 경험식입니다.
- 확률적 경사 하강법과 Adam
… 가장 큰 모형은 한 걸음에 약 320만 토큰을 썼습니다. 배치 크기와 학습률, 학습량 사이의 관계는규모의 법칙연구에서 실험으로 잽니다.
- 인공지능
… 거듭제곱 꼴로 준다는 것은 이를테면 크기를 10배 할 때마다 손실이 늘 같은 비율만큼 준다는 뜻입니다(규모의 법칙). 이것은 측정한 범위 안에서 맞는 경험 법칙이지 증명된 정리가 아닙니다. 사람의 선호로 답을 다듬는 …
- 트랜스포머
… 점수 계산은 뺀 어림입니다). 학습에서는 역전파가 그 두 배쯤 더 들어 토큰당 약 6N번이 되고, 이것이규모의 법칙에서 쓰는 학습 계산량 C \approx 6ND (D는 학습 토큰 수)입니다. 트랜스포머가 ⟦순환 …
- 언어 모델과 다음 토큰 예측
… 왜 그런지, 어디까지 가능한지에 대해 합의된 이론은 아직 없습니다. 모델 크기와 손실 사이의 경험적 관계는규모의 법칙에서 다룹니다. 1913년 안드레이 마르코프는 푸시킨의 『예브게니 오네긴』에서 모음과 자음이 이어지는 …
- 인간 피드백 강화 학습과 정렬
… 0 가까이 붙잡아 두는 것과 같은 구실을 합니다. 출발점이 되는 모델이 무엇을 배웠는지는 언어 모델과규모의 법칙에서 볼 수 있습니다. 사람의 비교 대신 정답 채점기를 보상으로 쓰고, 가치 함수를 따로 학습하는 대신 …
- 추론 모델과 테스트 시점 계산
… 평가 점수는 효율 설정에서 75.7%, 계산을 172배 쓴 설정에서 87.5%였습니다.규모의 법칙처럼 로그 축에서 직선으로 보이는 관계가 여기서도 보고되지만, 역시 측정한 범위 안의 경험적 관계입니다. …
- 전문가 혼합
… 것은 코시–슈바르츠 부등식에서 나옵니다. 트랜스포머: 전문가 층이 끼어 있는 자리인 피드포워드 층.규모의 법칙: 전체 매개변수와 계산량을 따로 셀 때의 저울질. 추론 모델: DeepSeek-V3를 바탕으로 한 …
- 언어 모델의 발전사: RLHF 이후
… 3월의 친칠라 논문은 계산량이 정해졌을 때 모델과 자료를 어떻게 나눌지에 대한 경험식을 내놓았습니다(규모의 법칙). 12월 앤트로픽의 '헌법적 AI'는 원칙 목록을 받은 AI가 사람 대신 비교하는 방법(RLAIF, …
- 프랙털 차원
… 차원을 가집니다(혼돈). 두 축 모두 로그 눈금에서 직선이 되는 거듭제곱 관계는 지프의 법칙과규모의 법칙에도 나오니, 그 지수를 읽는 법은 여기서 익힌 것과 같습니다. 해안선을 재는 이야기에서 출발해 측정 …