편향–분산 분해(Bias–variance decomposition)
새 자료에서의 제곱 오차의 기댓값(expected value)은 잡음(σ²) + 편향의 제곱 + 분산(variance)으로 정확히 나뉜다. 모형이 단순하면 늘 같은 쪽으로 빗나가고(편향), 복잡하면 표본(sample)마다 크게 흔들린다(분산).
실험을 통째로 여러 번 되풀이한다고 상상해 봅시다. 같은 x 자리 15곳에서
x₀ =
지금은 잡음
왜 정확히 나뉘는지는 한 줄로 보입니다.
차수를 올려 보세요. 편향²은 d = 1에서 약 0.278이다가 d = 3에서 약 0.015, d = 5에서 약 0.0001로 거의 0이 됩니다. 분산은 거꾸로 차수와 함께 커집니다. 여기에는 깔끔한 정리가 있습니다. x 자리를 고정하고 최소제곱으로 맞추면, 자료가 있는 n곳에서 잰 예측의 분산을 평균한 값이 정확히
입니다. 계수 하나를 늘릴 때마다 분산이
흔한 오해는 편향이 없는 추정이 가장 좋다는 생각입니다. 추정값의 평균제곱오차(mean squared error)도 편향² + 분산이라서, 편향을 조금 들여 분산을 크게 줄이면 이깁니다. 정규분포(normal distribution) 표본의 분산을 추정할 때 편차 제곱합을 n − 1로 나누면 편향이 없지만, 평균제곱오차는 n + 1로 나눌 때 가장 작습니다. 더 극적인 예는 1956년 찰스 스타인이 존재를 보이고 1961년 제임스와 스타인이 구체적인 식을 내놓은 추정량입니다. 서로 독립이고 분산이 같으며 그 분산을 아는 정규분포 셋 이상의 평균을, 분포마다 관측값 하나씩으로 한꺼번에 추정한다고 합시다. 이때 관측값들을 정해진 규칙에 따라 모두 원점 쪽으로 당긴 값은, 참 평균이 무엇이든 관측값을 그대로 쓸 때보다 전체 평균제곱오차가 작습니다. 원점 대신 미리 정한 아무 점 쪽으로 당겨도 됩니다. 계수를 일부러 0 쪽으로 당기는 정규화는 이 생각을 실용으로 옮긴 것입니다. 그림의 U자 모양도 법칙은 아닙니다. 매개변수(parameter)가 자료보다 훨씬 많은 모형에서는 오차가 다시 내려가는 이중 하강(double descent)이 여러 실험에서 관찰되었습니다(과적합(overfitting)). 또 0과 1로 맞히고 틀리는 분류의 오차는 이렇게 깔끔하게 더해지는 조각으로 나뉘지 않습니다.
분산은 평균을 내서 줄일 수 있습니다. 분산이 v인 모형 B개의 예측을 평균하면, 모형들이 서로 독립일 때는 분산이 v/B가 되고, 어느 두 모형의 상관계수(correlation coefficient)도 ρ이면
이어지는 곳. 과적합은 대개 분산이, 과소적합(underfitting)은 편향이 지나친 상태입니다. 실제로는 f를 모르므로 세 조각을 따로 잴 수 없고, 합만 교차 검증(cross-validation)으로 어림합니다. 최근접 이웃(nearest neighbor) 회귀에서 이웃 k개의 y를 평균하면 x 자리가 고정일 때 분산이 정확히
이 개념이 나오는 긴 글
이 개념을 언급하는 페이지
- 분산과 표준편차
… 오차의 기댓값도 잡음, 편향의 제곱, 그리고 표본에 따라 예측이 흔들리는 정도인 분산으로 정확히 나뉩니다(편향–분산 분해). 기댓값은 그대로 두고 분산만 줄이는 요령도 있습니다. 언어 모델을 채점 결과로 강화 학습할 때 …
- 최근접 이웃 분류
… 표본이 바뀔 때마다 경계가 크게 흔들리고(분산), 크면 무리의 모양을 한쪽으로 뭉개는(편향) 이 모습이편향–분산 분해의 전형적인 예이고, 실제로는 k를 교차 검증으로 고릅니다. k에 따른 정확도. 회색은 예로 쓴 점 …
- 과적합
… 여러 번 눌러 보면 d가 큰 곡선일수록 모양이 크게 바뀝니다. 가장 좋은 복잡도는 이 둘의 절충이고(편향–분산 분해), 학습 데이터만 봐서는 알 수 없으므로 따로 떼어 둔 데이터로 잽니다. 자료가 적으면 여러 조각으로 …
- 통계학
… 모형이 자료를 얼마나 잘 설명하는지는 쿨백–라이블러 발산과 엔트로피 같은 정보의 양으로도 잽니다.편향–분산 분해는 모형이 복잡할수록 표본마다 크게 흔들린다는 것을, 교차 검증은 떼어 둔 자료로 새 자료에서의 오차를 …
- 기계 학습
… 키워야, 투표하는 이웃들이 여전히 가까이에 있습니다. 규칙의 모임을 고르는 것은 이렇게 저울질입니다(편향–분산 분해). 너무 단순하면 참모양을 따라가지 못하고(과소적합), 너무 유연하면 잡음을 외웁니다(과적합). 그래서 …
- 정규화: 릿지와 라소
… 정규화가 돕는 이유는 셋입니다. 첫째, 계수를 당기면 편향이 조금 생기는 대신 분산이 크게 줄어듭니다(편향–분산 분해). 둘째, 계산이 안정됩니다. 릿지의 답은 (X^{\mathsf T}X + \lambda …
- 교차 검증과 일반화
… 수 없는 방향에 내린 정사영이라 그 제곱 길이의 기댓값이 \sigma^2(n-p) 이기 때문입니다(편향–분산 분해). 둘의 차이 2p\sigma^2/n 를 학습 오차에 더해 주는 것이 맬로스의 C_p 와 아카이케 정보 …
- 결정 트리와 랜덤 포레스트
… 있어, 숨은 규칙 그대로 답해도 90.1%입니다). 깊은 나무는 편향이 작고 분산이 큰 모형의 대표입니다(편향–분산 분해). 자료가 조금만 바뀌어도 첫 질문이 바뀌고, 그 아래가 통째로 달라집니다. 그래서 깊이나 잎의 최소 …
- 인공지능
… 틀리는 과적합, 오차를 모델이 너무 단순해서 생기는 몫과 자료에 따라 흔들려서 생기는 몫으로 나누는편향–분산 분해, 모델이 지나치게 복잡해지지 않게 벌점을 주는 정규화, 자료 일부를 떼어 두고 시험하는 ⟦교차 …
- 최소 기술 길이
… 둘이 왜 과적합을 억누르는지가 이 원리로 설명됩니다. 모형의 값과 잔차의 값을 맞바꾸는 저울질은편향–분산 분해가 오차의 말로 하는 이야기와 닮았습니다. 부호 길이의 바탕인 엔트로피와 KL 발산은 잘못된 모형을 …
- 역문제와 잘 놓인 문제
… 줄이는 대신 답을 한쪽으로 끌어당기는 치우침(편향)을 들여오는데, 제곱 오차로 재면 그 맞바꿈을편향–분산 분해가 정확히 적어 줍니다. '답은 작다' 대신 '답은 드물다(0이 아닌 성분이 적다)'를 믿으면 라소와 …