베이즈 정리(Bayes' theorem)
결과(양성)에서 원인(병)의 확률(probability)을 거꾸로 구하는 공식. 드문 원인은 정확한 검사로도 쉽게 뒤집히지 않는다.
어떤 병에 걸린 사람이
사람 수로 세면 착각이 사라집니다. 1000명 중 양성은 진짜 환자
이 계산은 조건부 확률(conditional probability)의 방향을 뒤집은 것입니다. 우리가 아는 것은 "병이 있을 때 양성일 확률"인데, 알고 싶은 것은 "양성일 때 병이 있을 확률"입니다. 둘을 잇는 다리가 양성인 사람 전체의 수
증거를 보기 전의 확률(여기서는 기저율)을 사전확률(prior probability), 증거를 본 뒤 고친 확률(양성일 때 병이 있을 확률)을 사후확률(posterior probability)이라고 합니다. 양성이 나온 사람에게 다른 검사를 한 번 더 하면, 이번에는 방금 구한 사후확률이 새 사전확률이 됩니다. 두 번 연속 양성이면 병이 있을 확률은 훨씬 높아집니다. 이 갱신을 되풀이하면 참인 가설의 확률이 1에 다가가는데, 여기에는 세 조건이 붙습니다. 병이 있는지 없는지가 정해지면 검사 결과들이 서로 독립(independence)이어야 하고(조건부 독립), 각 검사가 두 가설 아래서 실제로 다른 확률로 양성을 내야 하며, 참인 가설의 사전확률이 0이 아니어야 합니다. 사전확률이 0이면 어떤 증거를 곱해도 0이기 때문입니다. 증거가 많아질수록 우연한 오류들이 평균(mean)에 묻힌다는 점에서 큰 수의 법칙(law of large numbers)과 같은 이야기입니다. 같은 검사를 같은 사람에게 되풀이하면 오류가 같은 방향으로 되풀이될 수 있어서, 첫 번째 조건이 깨지기 쉽습니다.
확률을 "증거에 따라 갱신되는 믿음"으로 읽는 이 관점을 베이즈 통계(Bayesian statistics)라고 부르며, 오늘날 통계학(statistics)과 기계 학습(machine learning)의 큰 기둥입니다. 관측 하나가 두 가설 가운데 한쪽으로 믿음을 평균적으로 얼마나 밀어 주는지도 잴 수 있습니다. 가설 H₁이 참일 때 관측 하나가 두 가설의 확률 비(H₁의 확률 ÷ H₂의 확률)의 로그를 H₁ 쪽으로 평균 얼마만큼 옮기는지가 두 가설이 예측하는 분포 사이의 쿨백–라이블러 발산(Kullback–Leibler divergence)입니다. 두 가설이 예측하는 결과가 비슷할수록 이 값이 작아서 가려내는 데 관측이 많이 듭니다.
이 정리는 영국의 장로교 목사이자 수학자 토머스 베이즈의 이름을 땁니다. 그의 글은 그가 죽은(1761년) 뒤인 1763년 친구 리처드 프라이스가 정리해 발표했습니다. 오늘날 쓰는 일반적인 꼴로 정리하고 천문학과 인구 통계에 널리 쓴 사람은 라플라스입니다.
분모
이 개념이 나오는 긴 글
이 개념 위에 세워진 것
이 개념을 언급하는 페이지
- 확률
… 르베그의 측도 이론 위에 올려놓을 수 있었습니다. 관측 하나가 들어올 때마다 확률을 고쳐 쓰는 규칙이베이즈 정리입니다. 확률을 읽는 방법은 두 가지입니다. 하나는 '같은 시도를 아주 많이 되풀이할 때 그 일이 일어나는 …
- 조건부 확률
… 구름이 낄 확률'은 1에 가까워도 '구름이 끼면 비가 올 확률'은 훨씬 작습니다. 두 방향을 잇는 공식이베이즈 정리입니다. 두 기둥의 높이가 같으면( p = q ) B를 알든 모르든 A의 비율이 변하지 않습니다. 이것이 …
- 큰 수의 법칙
… 데이터를 보기 전에 가진 믿음(사전 믿음)의 영향이 관측이 쌓일수록 줄어드는 것도 같은 원리입니다.베이즈 정리로 믿음을 계속 고치면, 동전이 공정한지를 두고 처음 믿음이 달랐던 두 사람도 같은 던지기 결과를 충분히 …
- 마르코프 연쇄
… 이렇다면 내일은'이라는 조건부 확률입니다. 거꾸로 '내일 비가 왔다면 오늘은 어땠을까'를 묻는 것은베이즈 정리의 몫입니다. 한 번 들어가면 나오지 못하는 상태가 있는 연쇄의 대표적인 예가 도박꾼의 파산입니다. …
- 심슨의 역설
… 만들었습니다. 이어지는 곳. 부분마다의 확률을 부분의 비율을 무게로 삼아 합치는 규칙(전확률 공식)은베이즈 정리의 분모를 계산할 때 쓰는 바로 그 식입니다. 검사가 양성일 전체 확률을 '병이 있는 사람'과 '없는 …
- 교란 변수
… 1980년대에 발전시킨 베이즈 네트워크, 곧 변수들 사이의 조건부 확률 관계를 화살표 그래프로 나타내고베이즈 정리로 계산하는 틀입니다.
- 무작위 대조 시험
… 없다는 가정 아래서 계산한 데이터의 확률이지, 데이터를 본 뒤 그 가정이 참일 확률이 아닙니다. 둘은베이즈 정리에서 조건의 방향이 뒤바뀐 두 확률만큼 다릅니다. p값이 작다고 효과가 크다는 뜻도 아닙니다. 환자가 아주 …
- 최근접 이웃 분류
… 좋은 분류기란 각 점에서 노랑일 참 확률을 안다고 치고 더 확률이 높은 쪽을 고르는 분류기로, 그 확률을베이즈 정리로 계산하므로 베이즈 분류기라 부릅니다. 그보다 오류가 적은 분류기는 있을 수 없습니다. k = 1이라도 …
- n-그램 언어 모델
… 필요합니다. 이어지는 곳. 맞춤법 교정과 음성 인식은 '들린 소리가 이러할 때 원래 문장은 무엇인가'를베이즈 정리로 뒤집어 풉니다. 이때 소리를 듣기 전에 그 문장이 나올 확률(사전 확률)을 n-그램이 줍니다. 겉으로 …
- 은닉 마르코프 모델
… 모든 날씨열에 걸친 관측열 자체의 확률을 같은 격자로 구합니다( P(o_{1:T}) = ). 이 값으로베이즈 정리를 쓰면 '관측을 보았을 때 셋째 날이 더웠을 확률'처럼 관측을 본 뒤에 고친 확률(사후 확률)도 …
- 쿨백–라이블러 발산
… 속도로 쉬워집니다. 가설이 참일 확률과 거짓일 확률의 비를 오즈라 합니다(확률 0.8이면 오즈는 4).베이즈 정리를 오즈의 로그로 쓰면 '관측 뒤의 로그 오즈 = 관측 전의 로그 오즈 + 증거의 합'이 되니, 튜링의 …
- 산술 부호화
… 원리⟧가 말해 줍니다. 적응 모형이 글자를 볼 때마다 확률을 고쳐 가는 과정은 새 증거를 볼 때마다베이즈 정리로 믿음을 갱신하는 것과 같은 모양입니다. 실제로 '나온 횟수 + 1' 규칙은, 세 글자의 확률에 대해 …
- 통계학
… 본 뒤의 믿음)에서 표본을 뽑는 계산도 가능해졌습니다. 덕분에 18세기 토머스 베이즈의 이름이 붙은베이즈 추론이 되살아났습니다. 주디아 펄의 인과 그래프는 실험 없이도 인과를 말할 수 있는 조건을 따졌습니다. 이 …
- 최대가능도법
… 앞면이 나오면 \hat p = 1 , 곧 뒷면은 절대 나오지 않는다고 답합니다. 미리 가진 믿음을 섞는베이즈 추론은 이 극단을 누그러뜨립니다. 어떤 p도 똑같이 그럴듯하다는 평평한 사전 분포에서 출발하면, 사후 분포의 …
- 기계 학습
… 것이어서, 분류기가 줄이는 교차 엔트로피 손실은 최대가능도법과 같습니다(쿨백–라이블러 발산).베이즈 정리로 믿음을 고쳐 가는 방법, 거리로 이웃을 찾는 방법, 짧은 설명을 고르는 방법(콜모고로프 복잡도)도 …
- 로지스틱 회귀
… 가르는 분류는 그 확률에 문턱(보통 1/2)을 두어 얻습니다. 왜 하필 시그모이드일까요? 한 가지 답은베이즈 정리에서 나옵니다. 합격자의 x는 평균 \mu_1 , 불합격자의 x는 평균 \mu_0 인 정규분포를 따르고 …
- 정규화: 릿지와 라소
… 배로 줄어드니, 자료가 적게 퍼진 방향(주성분 분석의 작은 주성분)일수록 많이 줄어듭니다. 셋째,베이즈 정리로 읽을 수 있습니다. 잡음이 분산 \sigma^2 인 정규분포이고, 계수마다 평균 0, 분산 …
- EM 알고리즘과 가우스 혼합
… 이름표를 안다면 무리마다 평균, 표준편차, 비율을 구하면 그것이 최대가능도의 답입니다. 모수를 안다면베이즈 정리로 점마다 어느 무리에서 왔을 확률을 계산할 수 있습니다. EM 알고리즘은 이 둘을 번갈아 합니다. E …
- 인공지능
… 보고(조건부 독립), 그 덕분에 큰 문제의 확률 계산을 작은 조각으로 나눌 수 있습니다. 이렇게 해서베이즈 정리를 변수가 많은 문제에도 쓸 수 있게 되었습니다. 음성 인식은 은닉 마르코프 모델으로, 기계 번역과 …
- 전문가 혼합
… / \sum_j g_j p_j 를 계산합니다. 이것은 답 y를 본 뒤에 고쳐 쓴 확률(사후 확률)로,베이즈 정리로 구한 것입니다. 계층적 전문가 혼합은 가지마다 부드럽게 갈라지는 결정 트리로 볼 수도 있습니다. …
- 검색 증강 생성
… 소프트맥스와 교차 엔트로피에 있습니다. 문서를 보이지 않는 변수로 두고 더하는 계산은 조건부 확률과베이즈 정리의 일이고, 찾은 글이 들어가는 자리는 트랜스포머의 문맥 창, 그 창을 길게 늘리는 방법은 ⟦위치 …
- 최소 기술 길이
… 둘째, 그렇게 읽으면 두 부분 부호는 베이즈 추론이 됩니다. L(H) = -\log_2 P(H) 로 두고베이즈 정리에 로그를 씌우면 -\log_2 P(H \mid D) = L(H) + L(D \mid H) + \log_2 …
- 역문제와 잘 놓인 문제
… 눌러 버립니다. 통계의 릿지 회귀와 같은 식이고, 잡음과 답에 각각 평균 0인 정규분포를 가정한베이즈추정의 최빈값과도 같습니다(λ = 잡음의 분산 ÷ 사전 분포의 분산). 벌점은 '답은 대개 작다'는 믿음을 …