확률변수(Random variable)
우연한 실험의 결과 하나하나에 수를 하나씩 붙이는 규칙(함수, function). 결과는 우연이지만 규칙은 정해져 있으므로, 그 수가 각 값을 가질 확률(probability), 곧 분포와 기댓값(expected value)을 계산할 수 있다.
주사위 두 개를 던지면 결과는 (첫째 눈, 둘째 눈)의 짝 36가지 가운데 하나입니다. 이 36가지 결과의 모임이 표본공간(sample space) Ω입니다. 그런데 우리가 궁금한 것은 대개 짝 자체가 아니라 거기서 나오는 수, 예컨대 두 눈의 합입니다. 결과 하나하나에 수를 하나씩 붙이는 이런 규칙을 확률변수라 합니다. (3, 5)에는 8을, (6, 6)에는 12를 붙이는 식입니다. 이름과 달리 확률변수는 무작위하지도 않고 변수도 아닙니다. 표본공간에서 실수(real number)로 가는, 미리 정해진 함수일 뿐입니다. 우연한 것은 어떤 결과가 나오느냐이고, 결과가 정해지면 거기 붙은 수도 따라 정해지니 그 수가 우연한 값처럼 보이는 것입니다.
같은 36가지 결과에 다른 규칙을 붙여 볼 수 있습니다. 규칙을
분포와 확률변수는 다릅니다. '첫째 눈'과 '둘째 눈'은 분포가 똑같지만(1부터 6까지 1/6씩) 같은 확률변수가 아닙니다. 결과 (2, 5)에서 하나는 2를, 다른 하나는 5를 내니까요. 분포는 확률변수가 어떤 값을 얼마나 자주 내는지만 알려 줄 뿐, 어느 결과에서 어떤 값을 내는지는 잊어버립니다. 확률변수로 새 확률변수를 만들 수도 있습니다. X가 합이면
기댓값은 두 가지로 더할 수 있습니다. 칸마다 붙은 수에 그 칸의 확률(1/36)을 곱해 36칸을 모두 더해도 되고, 값마다 그 값의 확률을 곱해 더해도 됩니다. 같은 칸들을 묶는 방법만 다를 뿐 합은 같습니다.
지금 규칙의 기댓값은
독립(independence). 두 확률변수 X, Y가 서로 독립이라는 것은 모든 값 x, y에 대해
이산과 연속. 지금까지처럼 값을 하나하나 늘어놓을 수 있는 확률변수를 이산 확률변수라 합니다. 버스가 10분마다 오는 정류장에 아무 때나 도착해 기다리는 시간 X는 다릅니다. 0분과 10분 사이의 어떤 값이든 될 수 있고, 값이 셀 수 없이 많습니다. 이때는 '꼭 3분'일 확률이 0입니다. 그렇다고 3분이 불가능한 것은 아닙니다. 확률이 0인 것과 일어날 수 없는 것은 다릅니다(측도 0, measure zero). 그래서 연속 확률변수는 값 하나 대신 구간의 확률로 말합니다. 도착 시각이 고르게 퍼져 있다면 2분에서 5분 사이를 기다릴 확률은 3/10입니다. 일반적으로는 곡선 f(x)를 두고 구간 위의 넓이(area)를 확률로 삼습니다.
이 f를 확률밀도함수라 합니다. 기다리는 시간이라면 0과 10 사이에서 높이 1/10인 평평한 선이고, 사람의 키라면 종 모양의 정규분포(normal distribution) 곡선에 가깝습니다. 밀도의 높이는 확률이 아닙니다. 0과 0.5 사이에서 고르게 뽑는 수의 밀도는 높이가 2입니다. 높이에 폭을 곱한 넓이가 확률입니다(적분, integral). 기댓값도 합 대신 적분
정확한 정의. 1933년 안드레이 콜모고로프는 『확률론의 기초(basics) 개념』에서 확률을 사건에 몫을 매기는 측도(measure)로, 확률변수를 표본공간 위의 함수로 정의했습니다(모스크바 수학 학파). 한 가지 조건이 붙습니다. 모든 x에 대해 'X ≤ x인 결과들의 모임'이 확률을 매길 수 있는 사건이어야 합니다. 결과가 유한 개라면 모든 부분집합(subset)에 확률을 매길 수 있으니 아무 함수나 됩니다. 그러나 [0, 1] 구간의 점처럼 결과가 셀 수 없이 많으면 길이를 매길 수 없는 이상한 집합(set)이 있어서 이 조건이 필요하고, 이 조건을 가측성(measurability)이라 부릅니다. 그러면 기댓값은 표본공간 위에서 X를 르베그 적분(Lebesgue integral)한 값이 되어, 이산과 연속이 하나의 식으로 묶입니다.
역사. 1654년 파스칼과 페르마가 편지로 푼 판돈 나누기 문제는 앞으로 받을 돈이라는 확률변수의 기댓값을 묻는 문제였고, 1657년 크리스티안 하위헌스는 『주사위 놀이의 계산에 관하여』에서 내기의 '값'을 기댓값으로 정의했습니다. 확률변수를 이론의 한가운데 놓은 것은 19세기 페테르부르크의 파프누티 체비쇼프였습니다. 그는 1867년, 분산 σ²이 유한한 어떤 확률변수든 기댓값에서 kσ 이상 벗어날 확률이
이어지는 곳. 확률변수 여러 개를 더하면 무작위 행보(random walk)가 되고, 많이 더해 평균을 내면 큰 수의 법칙과 중심극한정리가 그 모양을 알려 줍니다. 확률변수 하나가 담은 불확실성의 양이 엔트로피(entropy)이고, 두 확률변수가 서로에 대해 알려 주는 양이 상호 정보량(mutual information)입니다. 자료를 보고 확률변수의 분포를 거꾸로 짐작하는 것이 통계학(statistics), 특히 최대가능도법(maximum likelihood)의 일입니다.
이 개념이 나오는 긴 글
이 개념을 언급하는 페이지
- 정적분
… 정적분은 확률의 언어이기도 합니다. 키나 대기 시간처럼 값이 한 구간 안의 어떤 실수든 될 수 있는확률변수는 확률을 곡선(확률밀도)으로 나타냅니다. 이때 값이 a와 b 사이에 들 확률은 그 곡선 아래 a부터 …
- 피타고라스 정리
… 코사인 법칙이 됩니다. 확률에도 같은 식이 나타납니다. 주사위 눈처럼 값이 우연에 따라 정해지는 양을확률변수라 합니다. 한쪽의 결과가 다른 쪽의 확률을 바꾸지 않는(독립인) 두 확률변수를 더해 봅시다. 흩어진 …
- 분산과 표준편차
… 먼 값에 더 큰 벌점을 줍니다. 제곱을 쓰는 더 깊은 이유는 기하학입니다. 무작위로 값이 정해지는 수를확률변수라고 합니다(주사위의 눈, 내일의 기온). 서로 독립인 두 확률변수 X, Y를 더하면 분산이 그냥 …
- 중심극한정리
… 막대가 몇 개인지)은 더하는 동안 지워집니다. 정확히 말하면, 서로 독립이고 분포가 같으며 분산이 유한한확률변수n개의 평균을 위처럼 표준화하면, n이 커질수록 그 분포가 표준정규분포(μ = 0, σ = 1인 …
- 칸토어 함수
… 는 그 점이 x 이하일 확률(누적 확률)입니다. 흔히 누적 확률이 끊김 없이(연속으로) 오르는확률변수라면 확률 밀도가 있다고 생각합니다. 확률 밀도는 구간에 들어갈 확률이 그 구간 위에서 밀도 곡선 아래 …
- 생성함수
… 중심극한정리가 말하는 현상입니다. 0, 1, 2, … 가운데 값을 갖고 서로 영향을 주지 않는(독립인)확률변수들을 더하는 일은, 각 분포의 생성함수를 곱하는 일이 됩니다. 두 생성함수를 곱하면 x^m 의 계수는 …
- 확률적 방법
… 합니다. 어느 것인지는 몰라도 됩니다. 가장 많이 쓰는 도구는 평균입니다. 무작위로 정해지는 수, 곧확률변수X의 기댓값이 E이면 X ≤ E인 경우와 X ≥ E인 경우가 반드시 둘 다 (0보다 큰 확률로) …
- 르베그 적분과 측도
… 확률. 1933년 콜모고로프는 확률을 전체의 측도가 1인 측도로 정의했습니다. 사건은 가측 집합이고,확률변수는 가측 함수이며, 기댓값은 르베그 적분입니다. 동전을 무한히 던지는 실험이나 [0, 1]에서 고른 …
- 통계학
… 표본을 다시 뽑으면 \hat p 도 달라집니다. 이처럼 뽑을 때마다 우연에 따라 값이 달라지는 양을확률변수라 합니다. 그러면 \hat p 는 참값 p 둘레에서 얼마나 흔들릴까요? 사람을 무작위로 뽑았다고 합시다. …
- 교차 검증과 일반화
… 교차 검증이 재는 오차는 편향–분산 분해의 세 조각을 합한 것이고, 그 어림 자체도 분산을 가진확률 변수라는 점을 잊지 않아야 합니다.
- 볼록 함수와 볼록 최적화
… 옌센 부등식. 현의 조건을 점 여러 개로 늘린 것이 1906년 덴마크의 요한 옌센이 발표한 부등식입니다.확률변수X가 값 x_i 를 확률 p_i 로 가지면, 볼록 함수 f에 대해 f\bigl(\mathbb …