과적합(Overfitting)
학습 데이터(training set)에는 꼭 맞지만 새 데이터에는 틀리는 현상. 모형이 잡음까지 외워 버린 것으로, 따로 떼어 둔 검증 데이터(validation set)와 규제로 막는다.
학습 오차(오차 제곱 평균(mean)의 제곱근)는
검증 오차는 대개 U자를 그립니다. 흔히 학습 오차가 0이면 가장 좋은 모형이라고 생각하지만, 이 그림에서도 학습 오차가 0인 d = 11의 검증 오차는 대개 낮은 차수보다 훨씬 큽니다. 모형이 단순하면 표본(sample)을 아무리 바꿔도 같은 쪽으로 틀리고(편향), 복잡하면 표본이 바뀔 때마다 답이 크게 흔들립니다(분산(variance)). '새 표본'을 여러 번 눌러 보면 d가 큰 곡선일수록 모양이 크게 바뀝니다. 가장 좋은 복잡도는 이 둘의 절충이고(편향–분산 분해, bias–variance decomposition), 학습 데이터만 봐서는 알 수 없으므로 따로 떼어 둔 데이터로 잽니다. 자료가 적으면 여러 조각으로 나눠 번갈아 떼어 두는 교차 검증(cross-validation)을 씁니다. 모형을 다 고른 뒤의 최종 성능은 한 번도 들여다보지 않은 시험 데이터(test set)로 재야 정직합니다.
차수를 줄이는 대신 계수가 커지는 것에 벌점을 줄 수도 있습니다. 오차 제곱합에 λ × (계수 제곱합)을 더한 값을 줄이는 릿지 회귀(ridge regression)입니다.
과적합은 여러 모습으로 나타납니다. 최근접 이웃 분류(k-nearest neighbors classification)에서 k = 1이면 예로 쓴 점은 모두 맞히지만 새 점에서는 못합니다. n-그램(n-gram) 언어 모델(language model)에서 n을 키우면 학습 문장은 통째로 외우지만 새 문장은 처음 보는 조합투성이가 됩니다. 특성의 수가 자료의 수에 가까워지면 우연히 맞아떨어지는 규칙을 찾기 쉬워지는데, 이것도 차원의 저주(curse of dimensionality)의 한 얼굴입니다.
이어지는 곳. '같은 것을 설명한다면 더 단순한 설명을 고르라'는 원칙을 14세기 영국의 철학자 오컴의 윌리엄의 이름을 따 오컴의 면도날(Occam's razor)이라 합니다. 이 원칙은 콜모고로프 복잡도(데이터를 출력하는 가장 짧은 프로그램의 길이)와 최소 기술 길이(minimum description length) 원리로 수학이 됩니다. 최소 기술 길이 원리는 '모형을 적는 길이 + 그 모형으로 데이터를 적는 길이'가 가장 짧은 모형을 고르라는 것입니다. 무작위 잡음은 규칙이 없어서 거의 언제나 어떤 모형으로도 줄여 적을 수 없으므로, 잡음까지 담은 복잡한 모형은 모형 자체가 길어질 뿐 전체 길이를 줄이지 못합니다. 검증 오차는 표본 평균이라 큰 수의 법칙(law of large numbers)에 따라 검증 데이터가 많을수록 믿을 만하지만, 같은 검증 데이터로 모형을 너무 여러 번 고르면 검증 데이터에도 과적합합니다. 한편 매개변수(parameter)가 자료보다 훨씬 많은 신경망이 의외로 잘 일반화하는 현상은 아직 활발히 연구되고 있습니다. 그 가운데 하나가 이중 하강입니다. 매개변수를 늘리면 검증 오차가 위의 U자처럼 올라가 매개변수 수가 자료 수와 비슷할 때 가장 나빠졌다가, 그보다 더 늘리면 다시 내려가는 현상이 여러 모형에서 관찰됩니다.
이 개념이 나오는 긴 글
이 개념 위에 세워진 것
이 개념을 언급하는 페이지
- 최소제곱 회귀
… 벌점을 주는 까닭은 직선 대신 고차 다항식처럼 유연한 모형을 쓸 때 데이터에 섞인 잡음까지 외워 버리는과적합을 막기 위해서입니다. 예측할 값이 수가 아니라 예/아니오라면 직선을 그대로 맞추는 대신, 직선의 값을 …
- 최근접 이웃 분류
… 뽑은 (그림에는 없는) 시험용 점 600개로 재면 훨씬 못합니다. 예에 섞인 우연까지 외워 버린 것, 곧과적합입니다. 지금 k에서 훈련 정확도는 , 시험 정확도는 입니다. k를 키우면 경계가 매끈해지고 시험 정확도가 …
- 차원의 저주
… 높을수록 자료가 훨씬 많이 필요합니다. 자료에 비해 변수가 많으면 모형이 우연한 무늬까지 맞추기 쉬워과적합의 위험도 커집니다.
- 경사 하강법
… 줄이는 것이 늘 좋지는 않아서, 따로 떼어 둔 검증 데이터의 오차가 오르기 시작하면 멈추는 조기 종료로과적합을 막기도 합니다. η를 한없이 작게 하면 경로는 미분방정식 \dot{\vec x} = -\nabla …
- 신경망
… 가중치로 훨씬 많은 것을 표현하는 경우가 많습니다. 가중치가 자료보다 훨씬 많으면 잡음까지 외울 수 있어과적합을 조심해야 합니다. 이어지는 곳. '신경망'이라는 이름은 1943년 맥컬러와 피츠가 뇌의 …
- 콜모고로프 복잡도
… 이 생각을 학습에 옮긴 것입니다. 데이터를 통째로 외운 모형은 모형 자체가 길어지므로, 이 원리는과적합을 막습니다. 설명이 같다면 가정이 적은 쪽을 택하라는 오컴의 면도날(14세기 영국 철학자 오컴의 윌리엄의 …
- 다항식
… 최소제곱 회귀가 됩니다. 여기서도 차수를 너무 높이면 룽게의 그림처럼 곡선이 점 사이에서 크게 출렁이는과적합이 일어나서, 알맞은 차수는 흔히 교차 검증으로 고릅니다. 어느 경우든 계수를 구하는 일은 …
- 최대가능도법
… 많으면 모형을 자료에 꼭 맞춰 가능도를 얼마든지 키울 수 있고, 그렇게 고른 모형은 잡음까지 외웁니다(과적합). 계수에 평균 0인 정규분포 사전 분포를 두고 사후 분포에서 가장 높은 곳을 고르면, 손실에 계수 …
- 기계 학습
… 이것을 일반화라 합니다. 학습 데이터에서의 성적은 이 목표의 어림일 뿐이고, 둘 사이가 벌어지는 것이과적합입니다. 가장 단순한 예로 봅시다. 수 하나로 나타낸 예들이 파랑과 노랑 두 무리에서 나오는데, 두 무리의 …
- 편향–분산 분해
… 매개변수가 자료보다 훨씬 많은 모형에서는 오차가 다시 내려가는 이중 하강이 여러 실험에서 관찰되었습니다(과적합). 또 0과 1로 맞히고 틀리는 분류의 오차는 이렇게 깔끔하게 더해지는 조각으로 나뉘지 않습니다. 분산은 …
- 정규화: 릿지와 라소
… 많거나 서로 강하게 얽혀 있으면 최소제곱 회귀의 계수는 자료의 잡음까지 따라가느라 크게 흔들립니다(과적합). 정규화는 손실에 계수의 크기에 대한 벌점을 더해 계수를 0 쪽으로 당깁니다. 벌점으로 계수의 제곱합을 …
- 교차 검증과 일반화
… 합니다. 차수를 몇으로 할까요? 학습 오차는 차수를 올릴수록 줄어들 뿐 늘지 않으니 잣대가 되지 못합니다(과적합). 몇 개를 떼어 두고 나머지로 맞춘 뒤 떼어 둔 점에서 오차를 재면 되지만, 20개에서 5개를 떼면 …
- 결정 트리와 랜덤 포레스트
… 시험 정확도가 약 74%로 떨어집니다. 잡음으로 뒤집힌 점 하나하나에까지 작은 방을 만들어 준 결과입니다(과적합). 시험 자료도 점마다 10% 확률로 뒤집었으므로 어떤 모형도 기대 정확도가 90%를 넘을 수 …
- 서포트 벡터 머신과 커널
… 되고, 서포트 벡터가 거의 모든 점으로 늘어납니다. 학습 자료는 다 맞히지만 새 점에서는 믿기 어려운과적합입니다. γ와 C는 교차 검증으로 고릅니다. 가우스 커널의 f는 \sum_i \alpha_i y_i …
- 확률적 경사 하강법과 Adam
… θ는 한 걸음이 지금 자리에만 달린 마르코프 연쇄를 이룹니다. 학습 데이터의 손실을 끝까지 줄이면과적합이 생길 수 있어 검증 오차를 보며 멈추거나 정규화를 더합니다. 많은 대형 언어 모델은 AdamW로 …
- 인공지능
… 분포의 엔트로피)뿐이기 때문입니다. 처음 보는 자료에서도 맞힐까. 학습 자료는 맞히지만 새 자료에서 틀리는과적합, 오차를 모델이 너무 단순해서 생기는 몫과 자료에 따라 흔들려서 생기는 몫으로 나누는 ⟦편향–분산 …
- 합성곱 신경망
… 여러 범주의 확률로 바꾸는 마지막 층은 소프트맥스이고, 망이 커질수록 학습 자료에만 맞아 버릴 위험은과적합과 정규화에서 다룹니다. 같은 무늬를 어디서나 찾는 대신, 멀리 떨어진 칸끼리 직접 참고하게 하는 …
- 언어 모델과 다음 토큰 예측
… 문장으로 시험하면 트라이그램이 가장 좋아 보입니다. 이미 본 글로 모델을 평가하면 안 되는 까닭입니다(과적합). 비슷한 낱말끼리 통계를 나눠 쓰게 한 신경망 언어 모델(2003년 요슈아 벤지오 등)과 ⟦단어 …
- 규모의 법칙
… N과 계산량을 세는 방법. 라그랑주 승수법과 최적화: 제약 아래에서 최적점을 찾는 일반적인 방법.과적합: 맞춘 곡선을 측정한 범위 밖에 쓰는 위험과 닮았습니다. 둘 다 자료가 있는 곳에서 잘 맞는다는 사실이 …
- 인간 피드백 강화 학습과 정렬
… 정책 기울기는 강화 학습에서 다룹니다. 대리 보상에 지나치게 맞추는 것은 학습 자료에 지나치게 맞추는과적합과 닮았고, KL 벌점이 정책을 출발점 가까이 붙잡아 두는 것은 정규화가 가중치를 0 가까이 붙잡아 …
- 최소 기술 길이
… '짧음'을 '사전확률'로 바꿔 읽을 수 있다고 말할 뿐입니다. 짧게 적히는 가설을 더 믿어야 한다는 것은과적합을 피하려는 선택이자, 우리 세계가 지금까지 대체로 그래 왔다는 관찰입니다. 무엇이 짧은지는 어떤 …
- 역문제와 잘 놓인 문제
… 작은 특잇값에서는 0에 가깝습니다. 선형 모형에서는 이 계산이 정확하고, 신경망 학습에서 조기 종료가과적합을 줄이는 까닭도 흔히 이 그림으로 설명합니다. 이어지는 곳. 세레스의 궤도, 흐린 사진, CT, 압축 …
- 굿하트의 법칙
… 나누기(교차 검증), 원래 상태에서 너무 멀어지지 않게 벌점을 걸기가 그런 예입니다. 기계 학습의과적합은 학습 오차라는 대리 지표를 너무 잘 줄인 결과이고, 인간 피드백 강화 학습에서 KL 발산 벌점을 …