수학 개념 지도
확률과 통계(Probability and statistics)

확률변수(Random variable)

우연한 실험의 결과 하나하나에 수를 하나씩 붙이는 규칙(함수⁠, function⁠). 결과는 우연이지만 규칙은 정해져 있으므로, 그 수가 각 값을 가질 확률⁠(probability)⁠, 곧 분포와 기댓값⁠(expected value)⁠을 계산할 수 있다.

X:Ω→R,P(X=x)=P({ω∈Ω:X(ω)=x})X : \Omega \to \mathbb{R}, \qquad P(X = x) = P\bigl(\{\omega \in \Omega : X(\omega) = x\}\bigr)
먼저 보면 좋은 개념확률함수

주사위 두 개를 던지면 결과는 (첫째 눈, 둘째 눈)의 짝 36가지 가운데 하나입니다. 이 36가지 결과의 모임이 표본공간⁠(sample space)⁠ Ω입니다. 그런데 우리가 궁금한 것은 대개 짝 자체가 아니라 거기서 나오는 수, 예컨대 두 눈의 합입니다. 결과 하나하나에 수를 하나씩 붙이는 이런 규칙을 확률변수라 합니다. (3, 5)에는 8을, (6, 6)에는 12를 붙이는 식입니다. 이름과 달리 확률변수는 무작위하지도 않고 변수도 아닙니다. 표본공간에서 실수⁠(real number)⁠로 가는, 미리 정해진 함수일 뿐입니다. 우연한 것은 어떤 결과가 나오느냐이고, 결과가 정해지면 거기 붙은 수도 따라 정해지니 그 수가 우연한 값처럼 보이는 것입니다.

같은 36가지 결과에 다른 규칙을 붙여 볼 수 있습니다. 규칙을 로 고르면 입니다. 왼쪽 표의 칸마다 그 결과에 붙은 수가 적혀 있습니다. k = 일 때 X = k가 되는 결과들이 노랗게 칠해집니다. 칸을 누르면 k가 그 칸의 값으로 바뀝니다.

'X = k'는 X가 k가 되게 하는 결과들의 모임, 곧 하나의 사건입니다. 그래서 그 확률은 칸을 세는 보통의 확률 계산입니다. 합이 7인 결과는 (1, 6), (2, 5), …, (6, 1)의 여섯 칸이라 P(X=7)=6/36=1/6P(X = 7) = 6/36 = 1/6입니다. 가능한 값마다 이 확률을 적은 표, 오른쪽 막대그림이 X의 확률분포입니다. 막대 높이를 모두 더하면 언제나 1입니다. 모든 칸이 어느 한 값에 꼭 한 번씩 들어가기 때문입니다.

분포와 확률변수는 다릅니다. '첫째 눈'과 '둘째 눈'은 분포가 똑같지만(1부터 6까지 1/6씩) 같은 확률변수가 아닙니다. 결과 (2, 5)에서 하나는 2를, 다른 하나는 5를 내니까요. 분포는 확률변수가 어떤 값을 얼마나 자주 내는지만 알려 줄 뿐, 어느 결과에서 어떤 값을 내는지는 잊어버립니다. 확률변수로 새 확률변수를 만들 수도 있습니다. X가 합이면 X2X^2이나 2X+12X + 1도 칸마다 수를 하나씩 붙이는 규칙이니 확률변수입니다.

기댓값은 두 가지로 더할 수 있습니다. 칸마다 붙은 수에 그 칸의 확률(1/36)을 곱해 36칸을 모두 더해도 되고, 값마다 그 값의 확률을 곱해 더해도 됩니다. 같은 칸들을 묶는 방법만 다를 뿐 합은 같습니다.

E[X]=∑ω∈ΩX(ω) P(ω)=∑xx P(X=x)E[X] = \sum_{\omega \in \Omega} X(\omega)\,P(\omega) = \sum_{x} x\,P(X = x)

지금 규칙의 기댓값은 입니다. 첫째 방법에서 곧바로 E[X+Y]=E[X]+E[Y]E[X + Y] = E[X] + E[Y]가 나옵니다. 칸마다 두 수를 더해 확률을 곱하나, 따로 곱해 더하나 같기 때문입니다. 그래서 합의 기댓값은 분포를 몰라도 3.5 + 3.5 = 7입니다. 특히 쓸모 있는 것은 사건⁠(event)⁠ A가 일어나면 1, 아니면 0을 붙이는 지시 변수입니다. 그 기댓값은 1⋅P(A)+0⋅P(not A)=P(A)1 \cdot P(A) + 0 \cdot P(\text{not } A) = P(A)입니다. '6이 나온 주사위의 수'는 첫째가 6이면 1인 지시 변수⁠(indicator variable)⁠와 둘째가 6이면 1인 지시 변수의 합이므로 기댓값이 1/6 + 1/6 = 1/3입니다. 그림에서 규칙을 바꿔 확인해 보세요. 같은 방법으로 동전 n개의 앞면 수는 지시 변수 n개의 합이라 기댓값이 np이고(이항분포⁠(binomial distribution)⁠), 모자를 무작위로 돌려받을 때 제 모자를 받는 사람 수의 기댓값은 n과 상관없이 1입니다(교란순열⁠, derangement⁠). 값이 기댓값에서 얼마나 흩어지는지는 분산⁠(variance)⁠ E[(X−E[X])2]E[(X - E[X])^2]이 잽니다.

독립⁠(independence)⁠. 두 확률변수 X, Y가 서로 독립이라는 것은 모든 값 x, y에 대해 P(X=x and Y=y)=P(X=x) P(Y=y)P(X = x \text{ and } Y = y) = P(X = x)\,P(Y = y)라는 뜻입니다. 한쪽의 값을 알아도 다른 쪽의 분포가 바뀌지 않는다는 말입니다. 첫째 눈과 둘째 눈은 독립이지만, 첫째 눈과 합은 독립이 아닙니다. 합이 12라는 것을 알면 첫째 눈은 6일 수밖에 없습니다.

이산과 연속. 지금까지처럼 값을 하나하나 늘어놓을 수 있는 확률변수를 이산 확률변수라 합니다. 버스가 10분마다 오는 정류장에 아무 때나 도착해 기다리는 시간 X는 다릅니다. 0분과 10분 사이의 어떤 값이든 될 수 있고, 값이 셀 수 없이 많습니다. 이때는 '꼭 3분'일 확률이 0입니다. 그렇다고 3분이 불가능한 것은 아닙니다. 확률이 0인 것과 일어날 수 없는 것은 다릅니다(측도 0⁠, measure zero⁠). 그래서 연속 확률변수는 값 하나 대신 구간의 확률로 말합니다. 도착 시각이 고르게 퍼져 있다면 2분에서 5분 사이를 기다릴 확률은 3/10입니다. 일반적으로는 곡선 f(x)를 두고 구간 위의 넓이⁠(area)⁠를 확률로 삼습니다.

P(a≤X≤b)=∫abf(x) dxP(a \le X \le b) = \int_a^b f(x)\,dx

이 f를 확률밀도함수라 합니다. 기다리는 시간이라면 0과 10 사이에서 높이 1/10인 평평한 선이고, 사람의 키라면 종 모양의 정규분포⁠(normal distribution)⁠ 곡선에 가깝습니다. 밀도의 높이는 확률이 아닙니다. 0과 0.5 사이에서 고르게 뽑는 수의 밀도는 높이가 2입니다. 높이에 폭을 곱한 넓이가 확률입니다(적분⁠, integral⁠). 기댓값도 합 대신 적분 ∫xf(x) dx\int x f(x)\,dx가 됩니다. 이산이든 연속이든 함께 쓸 수 있는 도구는 누적분포함수⁠(cumulative distribution function)⁠ F(x)=P(X≤x)F(x) = P(X \le x)입니다.

정확한 정의. 1933년 안드레이 콜모고로프는 『확률론의 기초⁠(basics)⁠ 개념』에서 확률을 사건에 몫을 매기는 측도⁠(measure)⁠로, 확률변수를 표본공간 위의 함수로 정의했습니다(모스크바 수학 학파). 한 가지 조건이 붙습니다. 모든 x에 대해 'X ≤ x인 결과들의 모임'이 확률을 매길 수 있는 사건이어야 합니다. 결과가 유한 개라면 모든 부분집합⁠(subset)⁠에 확률을 매길 수 있으니 아무 함수나 됩니다. 그러나 [0, 1] 구간의 점처럼 결과가 셀 수 없이 많으면 길이를 매길 수 없는 이상한 집합⁠(set)⁠이 있어서 이 조건이 필요하고, 이 조건을 가측성⁠(measurability)⁠이라 부릅니다. 그러면 기댓값은 표본공간 위에서 X를 르베그 적분⁠(Lebesgue integral)⁠한 값이 되어, 이산과 연속이 하나의 식으로 묶입니다.

역사. 1654년 파스칼과 페르마가 편지로 푼 판돈 나누기 문제는 앞으로 받을 돈이라는 확률변수의 기댓값을 묻는 문제였고, 1657년 크리스티안 하위헌스는 『주사위 놀이의 계산에 관하여』에서 내기의 '값'을 기댓값으로 정의했습니다. 확률변수를 이론의 한가운데 놓은 것은 19세기 페테르부르크의 파프누티 체비쇼프였습니다. 그는 1867년, 분산 σ²이 유한한 어떤 확률변수든 기댓값에서 kσ 이상 벗어날 확률이 1/k21/k^2을 넘지 않는다는 부등식으로 큰 수의 법칙⁠(law of large numbers)⁠을 짧게 증명했습니다(같은 부등식을 프랑스의 비에네메가 1853년에 먼저 적었습니다). 이유는 짧습니다. 멀리 벗어난 값은 (X−E[X])2(X - E[X])^2이 k2σ2k^2\sigma^2 이상이라, 그런 값이 많으면 평균⁠(mean)⁠인 분산이 σ²을 넘어 버립니다. 분포를 전혀 몰라도 기댓값에서 표준편차⁠(standard deviation)⁠의 두 배 안에 적어도 75%가 들어간다는 뜻입니다(정규분포라면 약 95%). 그의 제자 안드레이 마르코프와 알렉산드르 랴푸노프는 서로 기대는 확률변수들의 열(마르코프 연쇄⁠, Markov chain⁠)과 중심극한정리⁠(central limit theorem)⁠의 일반적인 증명으로 이 길을 넓혔습니다.

이어지는 곳. 확률변수 여러 개를 더하면 무작위 행보⁠(random walk)⁠가 되고, 많이 더해 평균을 내면 큰 수의 법칙과 중심극한정리가 그 모양을 알려 줍니다. 확률변수 하나가 담은 불확실성의 양이 엔트로피⁠(entropy)⁠이고, 두 확률변수가 서로에 대해 알려 주는 양이 상호 정보량⁠(mutual information)⁠입니다. 자료를 보고 확률변수의 분포를 거꾸로 짐작하는 것이 통계학⁠(statistics)⁠, 특히 최대가능도법⁠(maximum likelihood)⁠의 일입니다.

이 개념이 나오는 큰 생각무작위성표현 바꾸기

이 개념이 나오는 긴 글

통신과 잡음 잡음 너머로 대서양 바닥의 케이블은 왜 신호를 뭉갰을까? 잡음이 있어도 오류 없이 보낼 수 있다는 섀넌의 정리와, 그 한계를 50년 동안 쫓은 부호들.

이 개념을 언급하는 페이지

이 페이지가 가리키는 개념