수학 개념 지도
확률과 통계(Probability and statistics)

베이즈 정리(Bayes' theorem)

결과(양성)에서 원인(병)의 확률⁠(probability)⁠을 거꾸로 구하는 공식. 드문 원인은 정확한 검사로도 쉽게 뒤집히지 않는다.

P(병∣+)=P(+∣병) P(병)P(+)P(\text{병} \mid +) = \frac{P(+ \mid \text{병})\,P(\text{병})}{P(+)}
먼저 보면 좋은 개념조건부 확률

어떤 병에 걸린 사람이 이고, 검사는 병이 있으면 의 확률로 양성(민감도⁠, sensitivity⁠), 병이 없으면 의 확률로 음성(특이도⁠, specificity⁠)을 냅니다. 검사가 양성이라면 정말 병에 걸렸을 확률은 얼마일까요? 직관은 대개 "90%쯤"이라고 답합니다.

1000명을 점 하나씩으로 그렸습니다. 빨강: 병 있음·양성, 짙은 빨강: 병 있음·음성, 주황: 병 없음·양성(거짓 양성), 회색: 병 없음·음성. 양성인 사람은 크게 그렸습니다.

사람 수로 세면 착각이 사라집니다. 1000명 중 양성은 진짜 환자 명과 건강한데 양성이 나온 명입니다. 그러니 양성인 사람 중 환자의 비율은 에 불과합니다. 병이 드물면 건강한 사람이 워낙 많아서, 작은 오류율로도 거짓 양성이 진짜 양성을 압도합니다. 검사 전에 이미 알고 있던 병의 흔한 정도(유병률)를 기저율⁠(base rate)⁠이라고 하고, 검사의 정확도만 보고 기저율을 잊어서 생기는 이 착각을 기저율 무시라고 합니다.

이 계산은 조건부 확률⁠(conditional probability)⁠의 방향을 뒤집은 것입니다. 우리가 아는 것은 "병이 있을 때 양성일 확률"인데, 알고 싶은 것은 "양성일 때 병이 있을 확률"입니다. 둘을 잇는 다리가 양성인 사람 전체의 수 P(+)P(+)입니다. 격자에서 보면 양성(큰 점)이라는 집합⁠(set)⁠으로 표본공간⁠(sample space)⁠을 좁히고, 그 안에서 빨간 점이 차지하는 몫을 센 것입니다.

증거를 보기 전의 확률(여기서는 기저율)을 사전확률⁠(prior probability)⁠, 증거를 본 뒤 고친 확률(양성일 때 병이 있을 확률)을 사후확률⁠(posterior probability)⁠이라고 합니다. 양성이 나온 사람에게 다른 검사를 한 번 더 하면, 이번에는 방금 구한 사후확률이 새 사전확률이 됩니다. 두 번 연속 양성이면 병이 있을 확률은 훨씬 높아집니다. 이 갱신을 되풀이하면 참인 가설의 확률이 1에 다가가는데, 여기에는 세 조건이 붙습니다. 병이 있는지 없는지가 정해지면 검사 결과들이 서로 독립⁠(independence)⁠이어야 하고(조건부 독립), 각 검사가 두 가설 아래서 실제로 다른 확률로 양성을 내야 하며, 참인 가설의 사전확률이 0이 아니어야 합니다. 사전확률이 0이면 어떤 증거를 곱해도 0이기 때문입니다. 증거가 많아질수록 우연한 오류들이 평균⁠(mean)⁠에 묻힌다는 점에서 큰 수의 법칙⁠(law of large numbers)⁠과 같은 이야기입니다. 같은 검사를 같은 사람에게 되풀이하면 오류가 같은 방향으로 되풀이될 수 있어서, 첫 번째 조건이 깨지기 쉽습니다.

확률을 "증거에 따라 갱신되는 믿음"으로 읽는 이 관점을 베이즈 통계⁠(Bayesian statistics)⁠라고 부르며, 오늘날 통계학⁠(statistics)⁠과 기계 학습⁠(machine learning)⁠의 큰 기둥입니다. 관측 하나가 두 가설 가운데 한쪽으로 믿음을 평균적으로 얼마나 밀어 주는지도 잴 수 있습니다. 가설 H₁이 참일 때 관측 하나가 두 가설의 확률 비(H₁의 확률 ÷ H₂의 확률)의 로그를 H₁ 쪽으로 평균 얼마만큼 옮기는지가 두 가설이 예측하는 분포 사이의 쿨백–라이블러 발산⁠(Kullback–Leibler divergence)⁠입니다. 두 가설이 예측하는 결과가 비슷할수록 이 값이 작아서 가려내는 데 관측이 많이 듭니다.

이 정리는 영국의 장로교 목사이자 수학자 토머스 베이즈의 이름을 땁니다. 그의 글은 그가 죽은(1761년) 뒤인 1763년 친구 리처드 프라이스가 정리해 발표했습니다. 오늘날 쓰는 일반적인 꼴로 정리하고 천문학과 인구 통계에 널리 쓴 사람은 라플라스입니다.

분모 P(+)P(+)는 '병이 있으면서 양성'과 '병이 없으면서 양성'의 확률을 더한 것입니다. 이렇게 전체 확률을 부분들로 나누어 더하는 식(전체 확률의 법칙⁠, law of total probability⁠)은 편리하지만, 부분의 비율이 집단마다 다르면 심슨의 역설⁠(Simpson's paradox)⁠ 같은 함정이 생깁니다. 입력마다 여러 '전문가' 모형을 섞는 전문가 혼합⁠(mixture of experts)⁠을 EM 알고리즘⁠(algorithm)⁠으로 학습할 때 '이 자료점은 전문가 i가 맡았을 확률'을 구하는 계산도, 게이트 값을 사전 확률로 삼은 베이즈 정리입니다.

이 개념이 나오는 긴 글

확률 도박판에서 온 편지 1654년, 도중에 멈춘 내기의 판돈을 어떻게 나눌까? 두 수학자가 주고받은 편지에서 확률론이 태어났다. 통계와 인과 담배와 폐암 상관관계는 인과관계가 아니라고들 한다. 그렇다면 담배가 폐암을 일으킨다는 것은 어떻게 알게 되었을까? 계산언어학 말을 세는 기계 문법은 규칙일까, 확률일까? 파니니의 문법에서 촘스키의 위계, 섀넌의 영어 엔트로피, 오늘날의 언어 모델까지. 정보 이론과 압축 짧게 보내기 모스 부호는 왜 E를 점 하나로 보낼까? 섀넌의 엔트로피가 정한 압축의 한계와, 허프만 부호에서 JPEG까지 그 한계에 다가간 방법들. 통신과 잡음 잡음 너머로 대서양 바닥의 케이블은 왜 신호를 뭉갰을까? 잡음이 있어도 오류 없이 보낼 수 있다는 섀넌의 정리와, 그 한계를 50년 동안 쫓은 부호들. 신경망과 기계 학습 배우는 기계 예를 보여 주면 규칙을 스스로 찾는 기계. 1958년의 퍼셉트론에서 오늘의 심층 신경망까지, 그 밑바닥에는 미분과 연쇄법칙이 있다. 언어 모델 다음 단어를 맞히는 기계 다음 낱말을 짐작하는 일만으로 어디까지 갈 수 있을까? 마르코프의 글자 세기에서 섀넌의 추측 게임, 트랜스포머와 규모의 법칙, 사람의 선호까지. 밑바닥에는 확률의 곱셈 규칙과 로그 하나가 있고, 그 수학은 모델이 왜 그럴듯하게 틀리는지도 말해 준다. 역문제 거꾸로 푸는 문제는 왜 어려운가 원인에서 결과를 계산하기는 쉽다. 흐린 사진, CT, 블랙홀 사진은 왜 결과에서 원인을 되찾기 어려웠을까? 작은 특잇값이 잡음을 키우는 벽과, 정규화·릿지 회귀·베이즈 사전확률이 사실은 같은 처방이라는 이야기. 반환과 동적 계획법 같은 계산, 다른 덧셈 가장 짧은 길, 길의 가짓수, 가장 그럴듯한 해석, 갈 수 있는지 없는지. 따로 태어난 알고리즘들이 사실은 한 계산이고, 달라지는 것은 더하기와 곱하기 자리에 무엇을 넣느냐뿐이다. 그렇게 바꿔 넣어도 되는 까닭은 분배법칙 하나다. 압축과 과학 압축하는 것이 이해하는 것이다 튀코 브라헤가 20년 동안 적은 행성의 위치를 케플러는 법칙 세 줄로 줄였다. 짧게 적는 일과 이해하는 일은 정말 같은 일일까? 오컴의 면도날을 비트로 재는 법, 과적합을 압축의 실패로 읽는 법, 그리고 그 말이 정리인 곳과 철학인 곳.

이 개념 위에 세워진 것

이 개념을 언급하는 페이지

이 페이지가 가리키는 개념