수학 개념 지도
확률과 통계(Probability and statistics)

조건부 확률(Conditional probability)

B가 일어났다는 것을 알 때 A의 확률⁠(probability)⁠. 표본공간⁠(sample space)⁠을 B로 좁히고 그 안에서 A가 차지하는 몫을 다시 잰다.

P(A∣B)=P(A∩B)P(B)P(A \mid B) = \frac{P(A \cap B)}{P(B)}
먼저 보면 좋은 개념확률

"B가 일어났다"는 정보는 가능성의 세계를 줄입니다. 이제 B 바깥은 신경 쓸 필요가 없으니 B가 새 표본공간이 되고, A의 확률은 그 안에서 A가 차지하는 몫으로 바뀝니다. 아래 정사각형의 왼쪽 기둥이 B(폭 P(B)=P(B) = )이고, 색칠한 부분이 A입니다.

기둥의 폭이 P(B), 기둥 안 A의 높이가 조건부 확률입니다. 위쪽 초록 점은 B 기둥의 폭을, 보라 점과 노란 점은 두 기둥 안 A의 높이를 바꿉니다.

B 기둥 안에서 A의 높이가 P(A∣B)=P(A\mid B) = , B 바깥 기둥에서의 높이가 P(A∣Bc)=P(A\mid B^c) = 입니다. 전체에서 A의 넓이⁠(area)⁠는 두 직사각형의 합 P(A)=P(A) = (가로 점선)입니다. 넓이 P(A∩B)P(A\cap B)를 기둥 폭 P(B)P(B)로 나눈 것이 조건부 확률의 정의입니다. 0으로는 나눌 수 없으니 이 정의는 P(B)>0P(B) > 0일 때만 씁니다. 같은 넓이를 거꾸로 A 쪽에서 재면 P(B∣A)=P(B\mid A) = 입니다. 분자는 같고 분모만 P(B)P(B)에서 P(A)P(A)로 바뀌므로, 두 값은 보통 다릅니다. 흔히 둘을 같은 것으로 읽지만, '비가 오면 구름이 낄 확률'은 1에 가까워도 '구름이 끼면 비가 올 확률'은 훨씬 작습니다. 두 방향을 잇는 공식이 베이즈 정리⁠(Bayes' theorem)⁠입니다.

두 기둥의 높이가 같으면(p=qp = q) B를 알든 모르든 A의 비율이 변하지 않습니다. 이것이 독립입니다. 지금은 . 독립⁠(independence)⁠이면 P(A∩B)=P(A∣B)P(B)=P(A)P(B)P(A\cap B) = P(A\mid B)P(B) = P(A)P(B)로 곱이 되고, 거꾸로 이 곱셈 공식이 성립하면 독립입니다. 그래서 보통은 P(B)=0P(B) = 0일 때도 쓸 수 있는 이 곱셈 공식을 독립의 정의로 삼습니다. 독립은 '겹치지 않는다'와 다릅니다. 확률이 0보다 큰 두 사건⁠(event)⁠이 겹치지 않으면, B가 일어났다는 것만으로 A가 일어나지 않았음을 알게 되니 오히려 강하게 얽혀 있는 것입니다.

그림의 가로 점선이 보여 주는 계산, 곧 P(A)=P(A∣B)P(B)+P(A∣Bc)P(Bc)P(A) = P(A\mid B)P(B) + P(A\mid B^c)P(B^c)를 전체 확률의 법칙⁠(law of total probability)⁠이라고 합니다. 두 기둥 안의 비율을 기둥 폭으로 가중해 평균⁠(mean)⁠한 것입니다.

날씨가 오늘 맑으면 내일 맑을 확률이 0.8, 오늘 비가 오면 내일 맑을 확률이 0.4인 것처럼, "지금 상태만 알면 다음 상태의 확률이 정해진다"는 조건부 확률을 사슬처럼 이어 간 것이 마르코프 연쇄⁠(Markov chain)⁠입니다. 이런 조건부 확률들을 '지금 상태'를 행, '다음 상태'를 열로 하는 표로 모으면 행렬⁠(matrix)⁠이 되고, 여러 날 뒤의 확률은 그 행렬을 거듭 곱해 얻습니다. 문장도 조건부 확률의 곱으로 쪼개집니다. P(w1w2w3)=P(w1) P(w2∣w1) P(w3∣w1w2)P(w_1 w_2 w_3) = P(w_1)\,P(w_2 \mid w_1)\,P(w_3 \mid w_1 w_2)처럼, 앞의 단어들이 주어졌을 때 다음 단어의 조건부 확률을 내놓는 것이 언어 모델⁠(language model)⁠입니다.

B가 일어났는지 아닌지를 알고 나면 A가 일어날지에 대한 불확실성이 평균적으로 얼마나 줄어드는지도 잴 수 있습니다. 불확실성은 엔트로피⁠(entropy)⁠로 재고, B의 결과를 안 뒤에 남은 불확실성의 평균이 조건부 엔트로피⁠(conditional entropy)⁠입니다. 어느 한 결과를 듣고 오히려 헷갈릴 수는 있지만, 평균으로는 결코 늘지 않습니다. A와 B가 독립이면 B를 알아도 불확실성은 조금도 줄지 않습니다. 줄어든 양이 곧 B가 A에 대해 알려 주는 정보의 양, 상호 정보량⁠(mutual information)⁠입니다.

전체 확률의 법칙에서 무게 P(B)P(B)가 비교하는 대상마다 다르면 함정이 생깁니다. 치료법 X가 가벼운 환자 사이에서도, 무거운 환자 사이에서도 치료법 Y보다 성공률이 높은데, X는 주로 무거운 환자에게, Y는 주로 가벼운 환자에게 쓰였다면 전체 성공률은 Y가 더 높게 나올 수 있습니다. 부분마다의 비교와 전체 비교가 뒤집히는 이 현상이 심슨의 역설⁠(Simpson's paradox)⁠입니다.

조건부 확률은 분류에도 쓰입니다. 분류할 새 데이터 점이 들어오면 그 근처에 있는 이미 답을 아는 점들의 다수결로 답을 정하는 방법이 있는데, 이것은 '이 근처라는 조건 아래서는 어느 쪽일 확률이 높은가'를 이웃들의 비율로 어림하는 일입니다(최근접 이웃 분류⁠, k-nearest neighbors classification⁠).

x마다 조건부 확률 P(y∣x)P(y \mid x)를 정해 둔 표는 x에서 y로 가는 '확률적 함수⁠(function)⁠'로 볼 수 있고, 전체 확률의 법칙 P(z∣x)=∑yP(z∣y) P(y∣x)P(z \mid x) = \sum_y P(z \mid y)\,P(y \mid x)(y가 주어지면 z가 x와 무관할 때)는 이런 함수 둘을 이어 붙이는 합성입니다. 확률적 함수를 합성과 '독립으로 나란히 놓기'라는 두 연산으로 다루는 틀이 모노이드⁠(monoid)⁠ 범주⁠(category)⁠의 한 종류인 마르코프 범주입니다.

이 개념이 나오는 긴 글

확률 도박판에서 온 편지 1654년, 도중에 멈춘 내기의 판돈을 어떻게 나눌까? 두 수학자가 주고받은 편지에서 확률론이 태어났다. 통계와 인과 담배와 폐암 상관관계는 인과관계가 아니라고들 한다. 그렇다면 담배가 폐암을 일으킨다는 것은 어떻게 알게 되었을까? 계산언어학 말을 세는 기계 문법은 규칙일까, 확률일까? 파니니의 문법에서 촘스키의 위계, 섀넌의 영어 엔트로피, 오늘날의 언어 모델까지. 언어 모델 다음 단어를 맞히는 기계 다음 낱말을 짐작하는 일만으로 어디까지 갈 수 있을까? 마르코프의 글자 세기에서 섀넌의 추측 게임, 트랜스포머와 규모의 법칙, 사람의 선호까지. 밑바닥에는 확률의 곱셈 규칙과 로그 하나가 있고, 그 수학은 모델이 왜 그럴듯하게 틀리는지도 말해 준다. 반환과 동적 계획법 같은 계산, 다른 덧셈 가장 짧은 길, 길의 가짓수, 가장 그럴듯한 해석, 갈 수 있는지 없는지. 따로 태어난 알고리즘들이 사실은 한 계산이고, 달라지는 것은 더하기와 곱하기 자리에 무엇을 넣느냐뿐이다. 그렇게 바꿔 넣어도 되는 까닭은 분배법칙 하나다.

이 개념 위에 세워진 것

이 개념을 언급하는 페이지

이 페이지가 가리키는 개념