정규화: 릿지와 라소(Regularization: ridge and lasso)
손실에 계수의 크기에 대한 벌점을 더해 계수를 0 쪽으로 당기는 방법. 제곱합 벌점(릿지)은 모든 계수를 비율로 줄이고, 절댓값(absolute value) 합 벌점(라소, lasso)은 일부 계수를 정확히 0으로 만들어 특성을 고른다.
설명 변수(특성)가 자료에 비해 많거나 서로 강하게 얽혀 있으면 최소제곱 회귀(least-squares regression)의 계수는 자료의 잡음까지 따라가느라 크게 흔들립니다(과적합, overfitting). 정규화는 손실에 계수의 크기에 대한 벌점을 더해 계수를 0 쪽으로 당깁니다. 벌점으로 계수의 제곱합을 쓰면 릿지 회귀(ridge regression), 절댓값의 합을 쓰면 라소입니다. 두 벌점은 각각 L2 노름(norm)의 제곱과 L1 노름입니다. 여기서 정규화는 영어 regularization의 번역이고, 자료의 크기를 맞추는 정규화(normalization)와는 다른 말이라 '규제'라고도 부릅니다.
λ ≥ 0이 벌점의 세기입니다. 가장 단순한 경우부터 봅시다. 특성들이 서로 수직이고 길이가 1이면(
λ = 1이라 하면
계수가 둘이면 이 차이를 그림으로 볼 수 있습니다. 최소제곱 손실
라소의 답이 자꾸 축 위로 가는 까닭은 마름모의 꼭짓점(vertex)에 있습니다. 꼭짓점은 축 위에 있고, 비스듬히 누운 타원은 변보다 꼭짓점에 먼저 닿기 쉽습니다. 꼭짓점에서는 한 계수가 정확히 0입니다. 원에는 꼭짓점이 없어서 닿는 점이 정확히 축 위에 오는 것은 특별한 경우뿐입니다. 미분(differentiation)으로도 말할 수 있습니다. 벌점
이번에는 자료 50개와 특성 6개로 된 문제입니다. 참 계수는 (3, −2, 0, 1.5, 0, 0)이고, 특성들은 평균(mean) 0, 분산(variance) 1로 맞췄습니다.
릿지의 계수들은 모두 함께 매끄럽게 줄어들 뿐 0이 되지 않습니다. 라소의 계수들은 하나씩 정확히 0이 되고, λ가
정규화가 돕는 이유는 셋입니다. 첫째, 계수를 당기면 편향이 조금 생기는 대신 분산이 크게 줄어듭니다(편향–분산 분해, bias–variance decomposition). 둘째, 계산이 안정됩니다. 릿지의 답은
실제로 쓸 때는 몇 가지를 지킵니다. 벌점은 계수의 크기에 매기므로 특성의 단위에 따라 결과가 바뀝니다. 키를 미터 대신 센티미터로 재면 그 계수는 100분의 1이 되어 벌점을 거의 받지 않습니다. 그래서 먼저 특성마다 평균 0, 분산 1로 맞춥니다. 절편에는 벌점을 주지 않습니다. λ는 교차 검증(cross-validation)으로 고릅니다. 라소의 벌점은 0에서 미분할 수 없지만 여전히 볼록 함수(convex function)라서, 다른 좌표를 고정하고 한 좌표씩 차례로 푸는 좌표 하강법(coordinate descent)으로 빠르게 풀립니다. 이 페이지의 라소 그림도 그렇게 계산했습니다.
제곱 벌점의 뿌리는 1940년대부터 소련의 안드레이 티호노프가 연구한 '불량 조건 문제(ill-posed problem)', 곧 자료의 작은 잡음이 답을 크게 흔드는 역문제(inverse problem)에 있습니다. 통계학(statistics)에서는 1970년 호얼과 케너드가 서로 상관된 설명 변수 문제를 풀려고 릿지 회귀를 제안했고, 1996년 로버트 팁시라니가 라소를 발표했습니다. 2000년대 중반 캉데스, 롬버그, 타오와 도노호는 L1 노름을 최소화하면 희소한 신호를 측정값이 훨씬 적어도 정확히 복원할 수 있는 조건을 증명했고(압축 센싱, compressed sensing), 이 생각은 MRI 촬영 시간을 줄이는 데에도 쓰입니다. 신경망(neural network)에서는 제곱 벌점을 가중치 감쇠라 부릅니다.
이어지는 곳. 두 영역의 모양이 다른 까닭은 Lp 노름(Lp norm)의 단위원(unit circle)이 p = 2에서 원, p = 1에서 마름모이기 때문이고, p < 1이면 더 뾰족해지지만 볼록성을 잃습니다. 벌점과 제약의 대응은 라그랑주 승수법과 볼록 최적화(optimization)의 쌍대성(duality)으로 정확해집니다. 두 무리가 완전히 갈려 답이 없던 로지스틱 회귀(logistic regression)도 벌점을 붙이면 답이 하나로 정해집니다. 서포트 벡터 머신(support vector machine)이 최소화하는
이 개념이 나오는 긴 글
이 개념을 언급하는 페이지
- 최소제곱 회귀
… 계수 자체에 벌점을 더하기도 합니다. 오차 제곱 합에 계수들의 절댓값 합을 더한 것을 최소로 하는 방법을라소(LASSO)라 하는데, 기여가 작은 변수들의 계수를 정확히 0으로 만드는 경향이 있어서 변수를 골라 주는 …
- Lp 노름
… 나와 있습니다. 회귀에서 오차 제곱합에 계수들의 절댓값 합(L1 크기)을 벌점으로 더해 함께 줄이는 방법을라소라고 합니다. 답이 되는 곳에서는 오차가 같은 계수들을 이은 등고선이 L1 크기가 일정한 마름모에 바깥에서 …
- 과적합
… 계수가 커지는 것에 벌점을 줄 수도 있습니다. 오차 제곱합에 λ × (계수 제곱합)을 더한 값을 줄이는릿지 회귀입니다. \log_{10}\lambda = (λ = , 계수의 크기 ). d = 11로 둔 채 λ를 키우면 …
- 최대가능도법
… 정규분포 사전 분포를 두고 사후 분포에서 가장 높은 곳을 고르면, 손실에 계수 제곱합의 벌점을 더하는 릿지정규화와 같은 답이 나옵니다. 이어지는 곳. 가능도를 가장 크게 하는 모수를 찾는 일은 최적화이고, 모수가 …
- 기계 학습
… 신경망, 그 학습은 경사 하강법과 역전파, 일반화의 함정은 과적합, 편향–분산 분해,정규화, 교차 검증, 차원의 저주에서 다룹니다. 거리로 배우는 방법은 최근접 이웃 분류, ⟦k-평균 …
- 로지스틱 회귀
… 그림의 끝(노랑이 오른쪽이면 6, 왼쪽이면 −2)까지만 옮깁니다. 실제로는 w가 커지는 데 벌점을 주는정규화로 답을 하나로 정합니다. S자 곡선에 '로지스틱'이라는 이름을 붙인 사람은 벨기에의 수학자 피에르프랑수아 …
- 소프트맥스와 교차 엔트로피
… 정답 점수와 나머지 점수의 차이가 한없이 벌어지려 하는데, 로지스틱 회귀의 완전 분리와 같은 현상이며정규화가 이를 막습니다. 이 식의 뿌리는 물리학에 있습니다. 온도 T에서 에너지가 E_k 인 상태에 있을 확률은 …
- 편향–분산 분해
… 작습니다. 원점 대신 미리 정한 아무 점 쪽으로 당겨도 됩니다. 계수를 일부러 0 쪽으로 당기는정규화는 이 생각을 실용으로 옮긴 것입니다. 그림의 U자 모양도 법칙은 아닙니다. 매개변수가 자료보다 훨씬 많은 …
- 교차 검증과 일반화
… 소개되었고, 1974년과 1975년에 머빈 스톤과 시모어 가이서가 체계적으로 정리했습니다. 이어지는 곳.정규화의 λ와 서포트 벡터 머신의 C처럼 학습이 스스로 정하지 못하는 손잡이(초매개변수)는 대개 교차 …
- 결정 트리와 랜덤 포레스트
… 있습니다. 질문이 좌표의 순서만 보므로 특성에 로그를 씌우거나 단위를 바꿔도 나무가 그대로이고, 그래서정규화와 달리 크기를 맞출 필요가 없습니다. 숫자와 범주가 섞인 자료도 다루기 쉽고, 얕은 나무는 사람이 읽을 …
- 서포트 벡터 머신과 커널
… w\cdot\vec x + b ), 이 문제는 힌지 손실 \max(0, 1 - yf) 의 합에 C를 곱하고정규화벌점 \tfrac12\lVert\vec w\rVert^2 을 더한 것을 줄이는 문제와 같습니다. C가 크면 …
- 볼록 함수와 볼록 최적화
… 낸 볼록 다면체), 최소제곱법, 로지스틱 회귀의 손실, 계수의 절댓값 합에 벌점을 매기는 라소 같은정규화, 서포트 벡터 머신이 모두 여기에 듭니다. 국소 최적이 곧 전역 최적이라 답을 믿을 수 있고, …
- 라그랑주 승수법
… 조건 없이 기울기가 0인 곳을 찾는 기본형은 최적화에, 제약을 벌점으로 바꿔 손실에 더하는 방법은정규화에 있습니다. 라소 같은 정규화는 '계수의 크기가 t 이하'라는 제약 문제와, 승수를 벌점의 세기로 삼은 …
- 확률적 경사 하강법과 Adam
… 이룹니다. 학습 데이터의 손실을 끝까지 줄이면 과적합이 생길 수 있어 검증 오차를 보며 멈추거나정규화를 더합니다. 많은 대형 언어 모델은 AdamW로 학습합니다. AdamW는 걸음마다 가중치를 조금씩 0 …
- 인공지능
… 따라 흔들려서 생기는 몫으로 나누는 편향–분산 분해, 모델이 지나치게 복잡해지지 않게 벌점을 주는정규화, 자료 일부를 떼어 두고 시험하는 교차 검증이 이 통계의 질문을 다룹니다. 무엇을 계산할 수 있는가. …
- 합성곱 신경망
… 확률로 바꾸는 마지막 층은 소프트맥스이고, 망이 커질수록 학습 자료에만 맞아 버릴 위험은 과적합과정규화에서 다룹니다. 같은 무늬를 어디서나 찾는 대신, 멀리 떨어진 칸끼리 직접 참고하게 하는 방법은 …
- 인간 피드백 강화 학습과 정렬
… 그림은 만일에 대비해 점수의 제곱합에 아주 작은 벌점( 0.01\sum_i r_i^2 )을 더해 맞춥니다(정규화). 실제 보상 모델에서는 점수가 이런 표가 아니라 신경망 r_\theta(x, y) 의 출력이고, 같은 …
- 최소 기술 길이
… 재는 이야기는 긴 글 「압축하는 것이 이해하는 것이다」 에 있습니다. 가설을 적는 길이를 사전확률로 읽으면규제의 벌점은 사전확률에 음의 로그를 씌운 것이 됩니다. 릿지는 계수에 정규분포를, 라소는 라플라스 분포를 …
- 역문제와 잘 놓인 문제
… v_i 특잇값이 큰 방향은 거의 그대로 믿고, 작은 방향은 부드럽게 눌러 버립니다. 통계의릿지 회귀와 같은 식이고, 잡음과 답에 각각 평균 0인 정규분포를 가정한 베이즈 추정의 최빈값과도 같습니다(λ …
- 라돈 변환과 CT
… 잡음과 흐림을 만나는 방식은 역문제 페이지의 조건수와 정규화로, 적은 측정으로 단면을 되살리는 방법은라소와 L1 노름으로 이어집니다.