최대가능도법(Maximum likelihood)
관찰한 자료를 가장 그럴듯하게 만드는 모수(parameter)를 고르는 추정법. 모수를 고정하고 자료의 확률(probability)을 묻는 대신, 자료를 고정한 채 그 확률을 모수의 함수(가능도, likelihood)로 읽어 가장 큰 곳을 찾는다.
동전을 10번 던졌더니 앞면이 7번 나왔습니다. 이 동전의 앞면 확률 p를 얼마로 짐작해야 할까요? 대부분 0.7이라고 답할 것입니다. 이렇게 모형을 정하는 수, 여기서는 앞면 확률 p를 모수라 부릅니다. 최대가능도법은 이 직감에 이유를 붙이고, 직감이 닿지 않는 복잡한 모형에서도 같은 방식으로 답을 내는 방법입니다. 이유는 이렇습니다. p가 0.7이라면 10번 중 7번 앞면은 꽤 흔한 일(확률 약 0.267)이고, p가 0.5라면 그보다 드문 일(약 0.117)입니다. 실제로 일어난 일을 가장 흔한 일로 만드는 p를 고르자는 것입니다.
확률과 가능도. 두 계산에 쓴 식은 같습니다. 앞면 확률이 p인 동전을 n번 던져 앞면이 k번 나올 확률은 이항분포(binomial distribution)의 식
입니다. 이 식은 두 방향으로 읽을 수 있습니다. p를 고정하고 k를 바꾸면, 일어날 수 있는 결과 0, 1, …, n에 확률을 나눠 주는 분포가 됩니다. k에 대해 모두 더하면 정확히 1입니다. 거꾸로 이미 관찰한 k를 고정하고 p를 바꾸면, 여러 가설 p가 이 자료를 얼마나 잘 설명하는지 매기는 점수가 됩니다. 이것을 가능도 함수(function) L(p)라 부릅니다. 확률은 '가설이 이렇다면 무엇이 일어날까'를 묻고, 가능도는 '이것이 일어났다면 어느 가설이 그럴듯한가'를 묻습니다. 그래서 'p = 0.7에서 가능도가 0.267'이라는 말은 'p가 0.7일 확률이 0.267'이라는 뜻이 아닙니다. 가능도는 p에 대한 분포가 아니어서, 곡선 아래 넓이(area)가 1이 되지도 않습니다.
던진 횟수 n =
왼쪽은 p를 고정했을 때 결과마다의 확률(파란 막대, 합이 1), 오른쪽은 결과 k를 고정했을 때 p마다의 가능도입니다. 왼쪽 노란 막대의 높이와 오른쪽 노란 점의 높이는 같은 수입니다.
가장 큰 곳 찾기. 곱은 다루기 어려우니 로그를 취합니다. 로그는 늘 증가하는 함수라서 L이 가장 큰 곳과 log L이 가장 큰 곳은 같습니다.
미분(differentiation)해서 0이 되는 곳을 찾으면(최적화, optimization) 직감대로 앞면의 비율이 나옵니다. log L은 위로 볼록한 곡선이라, 기울기(slope)가 0인 곳이 곧 가장 높은 곳입니다. 로그를 쓰는 데는 계산의 이유도 있습니다. 서로 독립(independence)인 관측 n개의 가능도는 관측 하나하나의 확률의 곱이라서, 관측이 많으면 아주 작은 수가 됩니다. 동전을 1만 번 던져 앞면이 7천 번 나온 특정한 앞뒤 순서 하나의 확률은 p = 0.7에서도 약
최소제곱(least squares)과 같은 답. 측정값
입니다. 이것을 가장 크게 하는 것은 오차 제곱의 합을 가장 작게 하는 것, 곧 최소제곱법(method of least squares)과 똑같습니다. 가우스는 1809년 이 관계를 거꾸로 이용했습니다. 여러 관측의 평균(mean)이 가장 그럴듯한 값이 되려면 오차의 분포가 어떤 모양이어야 하는지 물어 정규분포를 얻었고, 그것으로 최소제곱법을 정당화했습니다. 한편 같은 계산에서 분산(variance) σ²의 최대가능도 추정값은 잔차(residual) 제곱의 평균, 곧 n으로 나눈 값인데, 이것은 평균적으로 참값보다 조금 작습니다(편향). 교과서의 표본분산이 n 대신 n − 1로 나누는 까닭입니다. 최대가능도가 언제나 가장 좋은 답은 아니라는 작은 예입니다.
교차 엔트로피(cross-entropy)와 같은 답. 사진을 보고 고양이인지 개인지 답하는 분류기는 각 답에 확률
역사. 가장 그럴듯한 값을 고른다는 생각은 18세기에도 있었습니다. 1778년 다니엘 베르누이는 천문 관측값 여러 개에서 하나를 고를 때 관측들이 함께 나올 확률을 가장 크게 하는 값을 고르자고 제안했습니다. 이를 이론으로 세운 사람은 로널드 피셔입니다. 케임브리지를 졸업하던 1912년에 낸 첫 논문에서 자료가 나올 확률을 가장 크게 하는 모수를 고르는 '절대 기준'을 제안했고, 1921년 이 양이 확률과 다르다는 점을 분명히 하려고 '가능도'라는 이름을 붙였으며, 1922년 「이론 통계학(statistics)의 수학적 기초(basics)」에서 좋은 추정이 갖춰야 할 성질들을 정리했습니다. 그는 표본(sample)이 커지면 최대가능도 추정값이 참값 둘레의 정규분포로 모이고, 그 흩어짐이 편향 없는 추정이 가질 수 있는 가장 작은 값에 다가간다고 논증했습니다. 동전이라면 그 표준편차(standard deviation)는 약
조심할 점. 자료가 적으면 최대가능도는 대담해집니다. 동전을 한 번 던져 앞면이 나오면
이어지는 곳. 가능도를 가장 크게 하는 모수를 찾는 일은 최적화이고, 모수가 많으면 경사 하강법으로 풉니다. 숨은 상태가 있는 모형에서는 가능도를 직접 최대화하기 어려워 숨은 값을 번갈아 짐작하는 방법(EM 알고리즘(algorithm))을 쓰는데, 은닉 마르코프 모델(hidden Markov model)의 학습이 그 예입니다. 두 가설의 가능도의 비는 베이즈 정리(Bayes' theorem)에서 증거의 무게(weight of evidence)가 되고, 참인 가설 아래에서 잰 그 로그의 평균이 쿨백–라이블러 발산입니다. 추정 전반은 통계학에서, 자료에서 규칙을 배우는 넓은 틀은 기계 학습(machine learning)에서 이어집니다.
이 개념이 나오는 긴 글
이 개념 위에 세워진 것
이 개념을 언급하는 페이지
- 쿨백–라이블러 발산
… 자료의 경험 분포(자료에서 센 빈도)로 두면, 모형이 실제 자료에 매기는 확률(가능도)을 가장 크게 하는최대가능도법과도 같습니다. 언어 모형의 성능도 실제 글에 대한 교차 엔트로피 H로 재거나, 그것을 2^H 로 바꾼 …
- 통로 부호화 정리
… 가까운 부호어로 읽습니다. 메시지가 모두 같은 확률로 나온다면 이것이 이 통로에서 가장 좋은 해독, 곧최대가능도해독입니다. 받은 비트열이 나왔을 확률이 가장 큰 부호어를 고르는 해독인데, q가 1/2보다 작으면 뒤집힌 …
- 통계학
… 농업 시험장의 피셔는 밭마다 흙이 달라 비료의 효과가 가려지는 문제와 씨름했습니다. 그 과정에서최대가능도법(지금 본 자료가 나올 확률을 가장 크게 만드는 값을 답으로 고르는 방법), 분산분석(자료의 흩어짐을 …
- 확률변수
… 주는 양이 상호 정보량입니다. 자료를 보고 확률변수의 분포를 거꾸로 짐작하는 것이 통계학, 특히최대가능도법의 일입니다.
- 기계 학습
… 보면 손실을 줄이는 것은 대개 자료의 가능도를 키우는 것이어서, 분류기가 줄이는 교차 엔트로피 손실은최대가능도법과 같습니다(쿨백–라이블러 발산). 베이즈 정리로 믿음을 고쳐 가는 방법, 거리로 이웃을 찾는 …
- 로지스틱 회귀
… 누르면 답이 바뀝니다. 점에 마우스를 올리면 그 점의 확률과 손실이 뜹니다. 어떤 w, b가 좋은지는최대가능도로 정합니다. 모형이 옳다면 점 i의 답이 실제로 나온 대로 나올 확률은 y_i = 1 이면 p_i , …
- 소프트맥스와 교차 엔트로피
… 같습니다. 자료 전체에서 평균한 교차 엔트로피는 로그 가능도의 부호를 바꾼 것이어서, 이를 줄이는 것은최대가능도추정이기도 합니다. 로그의 밑을 2로 하면 단위가 비트, e로 하면 내트(nat)입니다. 지금 모형의 …
- EM 알고리즘과 가우스 혼합
… N(x \mid \mu_2, \sigma_2^2) 모수 여섯 개(비율은 합이 1이니 사실 다섯 개)를최대가능도로 정하고 싶은데, 로그 가능도 \sum_i \log p(x_i) 는 로그 안에 합이 있어서 미분해 0으로 …
- 인공지능
… 0에 가까울수록 한없이 커집니다. 이 손실을 줄이는 것은 학습 자료가 나올 확률(가능도)을 키우는 것(최대가능도법)과 같습니다. 또 학습 자료가 보여 주는 분포와 모델 분포가 얼마나 다른지를 재는 ⟦쿨백–라이블러 …
- 확산 모델
… 돌리기가 왜 불안정한지 알려 줍니다. 학습 목표가 가능도의 하한에서 나오는 과정은 쿨백–라이블러 발산과최대가능도법에, 잡음 수준마다 점수를 맞히는 신경망의 학습은 확률적 경사 하강법에 있습니다. 그림을 작은 잠재 …
- 오토인코더와 잠재 공간
… 로그 가능도에 대한 하한(증거 하한, ELBO)의 부호를 바꾼 것입니다. 그래서 이 손실을 줄이는 것은최대가능도법을 어림하는 일이 됩니다. 뽑기가 끼어 있으면 미분할 수 없을 것 같지만, z = \mu + …
- 언어 모델과 다음 토큰 예측
… 모델 q의 학습 목표는 실제 글의 토큰마다 모델이 준 확률의 로그를 더한 값을 가장 크게 하는 것, 곧최대 가능도입니다. 부호를 바꾸고 토큰 수 N으로 나누면 토큰당 평균 '놀람' -\frac1N\sum_t \log_2 …
- 인간 피드백 강화 학습과 정렬
… 더해도 확률은 그대로입니다. 비교 기록이 주어지면 그 기록이 나올 확률을 가장 크게 하는 점수를 고릅니다(최대 가능도). 비교 하나(이긴 답 w, 진 답 l)는 '두 점수의 차이'를 입력으로 하는 로지스틱 회귀의 표본 …
- 최소 기술 길이
… 둘째 항만 보면 무슨 일이 생기는지가 이 원리의 요점입니다. 자료의 확률을 가장 크게 만드는 가설을 고르는최대가능도 추정이 바로 그렇게 합니다. 앞면 비율을 그대로 앞면 확률로 쓰는 '치우친 동전'은 자료에 공정한 동전보다 늘 …