수학 개념 지도
확률과 통계(Probability and statistics)

확률(Probability)

일어날 수 있는 모든 결과의 집합(표본공간⁠, sample space⁠) 가운데 어떤 사건⁠(event)⁠이 차지하는 몫. 넓이⁠(area)⁠의 비율로 보면 가장 쉽다.

P(A)=∣A∣∣Ω∣,P(A∪B)=P(A)+P(B)−P(A∩B)P(A) = \frac{|A|}{|\Omega|}, \qquad P(A \cup B) = P(A) + P(B) - P(A \cap B)
먼저 보면 좋은 개념집합

확률의 무대는 표본공간 Ω\Omega, 곧 일어날 수 있는 모든 결과의 집합⁠(set)⁠입니다. 사건은 그 부분집합⁠(subset)⁠이고, 확률은 사건이 표본공간에서 차지하는 몫입니다. 주사위를 한 번 던지면 표본공간은 {1, 2, 3, 4, 5, 6}이고, "짝수가 나온다"는 사건은 부분집합 {2, 4, 6}입니다. 여섯 눈이 똑같이 나오기 쉽다면, 그 확률은 6개 가운데 3개를 차지하므로 1/2입니다. 위 공식 ∣A∣/∣Ω∣|A|/|\Omega|처럼 개수로 세는 방법은 이렇게 결과가 유한하고 모두 똑같이 그럴듯할 때만 쓸 수 있습니다. 조작된 주사위라면 눈마다 다른 무게를 주어야 합니다.

아래 정사각형(넓이 1)을 표본공간으로 삼고 점이 어디에나 고르게 떨어진다고 하면, 사건의 확률은 곧 그 영역의 넓이입니다. 사각형 모서리를 끌어 사건 A, B를 바꿔 보세요.

노랑 A, 초록 B, 보라가 둘이 겹친 A∩B입니다. 점들은 정사각형에 무작위로 떨어뜨린 결과입니다.

지금 P(A)=P(A) = , P(B)=P(B) = , 겹친 부분 P(A∩B)=P(A\cap B) = 입니다. 둘 중 하나라도 일어날 확률 P(A∪B)P(A\cup B)는 두 넓이를 더하고 두 번 센 겹친 부분을 한 번 빼서 입니다. 집합의 연산⁠(set operations)⁠을 넓이로 옮긴 것이고, 사건이 셋 이상이면 포함배제 원리⁠(inclusion–exclusion principle)⁠가 됩니다.

넓이를 모르더라도 점을 무작위로 개 뿌려서 A∪B에 떨어진 비율을 세면 처럼 참값에 가까운 추정을 얻습니다. 다시 뽑기 점이 많아질수록 이 비율이 참값 근처에 있을 확률이 1에 다가간다는 것이 큰 수의 법칙⁠(law of large numbers)⁠이고(오차의 전형적인 크기는 점 개수의 제곱근에 반비례해 줄어듭니다), 이 방식으로 넓이나 적분⁠(integral)⁠을 계산하는 것이 몬테카를로 방법⁠(Monte Carlo method)⁠입니다.

결과가 연속적이면(과녁의 한 점, 대기 시간) 확률은 개수의 비가 아니라 넓이, 곧 적분입니다. 어떤 사건이 일어났다는 정보를 알면 표본공간 자체가 좁아지는데, 그것이 조건부 확률⁠(conditional probability)⁠입니다.

확률을 수학으로 다루는 전통은 흔히 1654년 파스칼과 페르마가 주고받은 편지에서 시작되었다고 봅니다. 도박이 중간에 멈췄을 때 판돈을 어떻게 나눌지를 두고, 두 사람은 앞으로 일어날 수 있는 경우를 모두 세어 답을 냈습니다. 그보다 앞서 카르다노도 주사위의 경우를 세는 글을 썼지만, 그 글은 1663년에야 출판되었습니다. 확률을 넓이처럼 다루는 오늘날의 틀은 1933년 콜모고로프가 세웠습니다. 그는 확률을 세 가지 공리⁠(axiom)⁠로 정했습니다. 모든 사건의 확률은 0 이상이고, 표본공간 전체의 확률은 1이며, 서로 겹치지 않는 사건들의 확률은 더해진다는 것입니다(사건이 무한히 많아도 번호를 붙일 수 있으면 마찬가지). 이 규칙들은 넓이나 길이가 따르는 규칙과 똑같아서, 확률을 르베그의 측도⁠(measure)⁠ 이론 위에 올려놓을 수 있었습니다.

관측 하나가 들어올 때마다 확률을 고쳐 쓰는 규칙이 베이즈 정리⁠(Bayes' theorem)⁠입니다. 확률을 읽는 방법은 두 가지입니다. 하나는 '같은 시도를 아주 많이 되풀이할 때 그 일이 일어나는 비율(빈도)'이고, 다른 하나는 '아직 모르는 일에 대해 가진 믿음의 정도'입니다. 내일 비가 올 확률처럼 되풀이할 수 없는 일에도 확률을 말할 수 있는 것은 두 번째 읽기 덕분이고, 베이즈 정리는 그 믿음을 증거에 맞춰 고치는 방법을 줍니다.

확률의 직관이 얼마나 쉽게 틀리는지는 생일 문제⁠(birthday problem)⁠가 잘 보여 줍니다. 23명만 모여도 생일이 같은 두 사람이 있을 확률이 절반을 넘습니다.

확률은 무엇인가가 존재한다는 증명에도 쓰입니다. 무작위로 고른 대상이 어떤 성질을 가질 확률이 0보다 크면, 그 성질을 가진 대상이 적어도 하나는 실제로 있어야 합니다. 하나도 없다면 확률은 0일 테니까요. 1947년 에르되시는 이 논법을 사람들 사이의 관계에 썼습니다. n명의 모든 두 사람 사이를 동전을 던져 '서로 안다' 또는 '서로 모른다'로 정하면, k가 3 이상이고 n이 2k/22^{k/2} 이하일 때 '서로 다 아는 k명'도 '서로 다 모르는 k명'도 없을 확률이 0보다 큽니다. 그러니 그런 관계망이 실제로 있고, 이것이 램지 수⁠(Ramsey number)⁠의 아래쪽 한계가 됩니다. 이렇게 예를 직접 만들지 않고 존재만 보이는 방법이 확률적 방법⁠(probabilistic method)⁠입니다.

확률이 0이라고 해서 불가능한 것은 아닙니다. 0과 1 사이에서 실수⁠(real number)⁠ 하나를 고르게 무작위로 고를 때, 그 수가 유리수⁠(rational number)⁠일 확률은 0입니다. 유리수는 하나, 둘, 셋 하고 번호를 붙일 수 있어서(가산 집합⁠(countable set)⁠) 첫째 유리수를 길이 ε/2인 구간으로, 둘째를 ε/4, 셋째를 ε/8인 구간으로 덮어 가면 모든 유리수를 길이의 합이 ε 이하인 구간들로 덮을 수 있습니다. ε은 얼마든지 작게 잡을 수 있으니 유리수들이 차지하는 '길이'는 0입니다(측도 0⁠, measure zero⁠). 그래도 1/2 같은 유리수가 뽑히는 것이 불가능한 일은 아닙니다. 1/2도 표본공간 [0, 1]에 들어 있는 결과이기 때문입니다. 사실 어느 한 수가 정확히 뽑힐 확률은 모두 0이지만, 한 번 뽑으면 어떤 수는 반드시 나옵니다. 연속적인 표본공간에서 '확률 0'은 '일어날 수 없다'가 아니라 '차지하는 몫이 없다'는 뜻입니다.

확률이 꼭 '진짜 우연'에서만 나오는 것은 아닙니다. 다음 상태가 지금 상태에 따라 규칙대로 정확히 정해지는 운동(결정론적 운동)도, 처음 상태의 아주 작은 차이가 빠르게 커지는 경우에는 처음 상태를 정확히 모르는 한 결과를 확률로밖에 말할 수 없습니다(혼돈⁠, chaos⁠). 대기의 움직임이 그런 경우이고, 일기 예보가 "비 올 확률 60%"처럼 확률로 나오는 이유입니다.

두 사건이 함께 일어난다고 해서 하나가 다른 하나를 일으킨 것은 아닙니다. 둘 다에 영향을 주는 제3의 요인, 곧 교란 변수⁠(confounding variable)⁠가 있을 수 있습니다. 원인 후보를 동전으로 정해 그런 요인과의 연결을 끊는 대표적인 방법이 무작위 대조 시험⁠(randomized controlled trial)⁠입니다.

가능한 결과마다 확률을 얼마씩 나누어 주었는지를 적은 것을 확률분포라고 합니다. 공정한 주사위의 분포는 여섯 눈에 1/6씩을 준 것입니다. 분포 하나가 얼마나 예측하기 어려운지는 정보 엔트로피⁠(information entropy)⁠라는 수 하나로 잴 수 있습니다. 공정한 동전은 1비트, 늘 앞면만 나오는 동전은 0비트입니다. 두 분포가 얼마나 다른지 잴 때는, 확률을 흙더미처럼 보고 한 분포의 모양에서 다른 분포의 모양으로 옮겨 쌓는 데 드는 최소 비용(옮긴 양 × 옮긴 거리의 합)을 쓸 수도 있습니다(최적 수송⁠, optimal transport⁠).

이 개념이 나오는 큰 생각무작위성

이 개념이 나오는 긴 글

미분에서 회전까지 · 2편 · 적분 거리를 되찾기 속도계 기록만 남았다. 차가 어디까지 갔는지 되찾을 수 있을까? 확률 도박판에서 온 편지 1654년, 도중에 멈춘 내기의 판돈을 어떻게 나눌까? 두 수학자가 주고받은 편지에서 확률론이 태어났다. 소수 소수를 세는 사람들 소수는 제멋대로 흩어져 있는 것 같다. 그런데 멀리서 세어 보면 로그가 보인다. 정수론과 암호 나머지로 지키는 비밀 한 번도 만난 적 없는 두 사람이 모두가 엿듣는 통신망에서 비밀 열쇠를 맞출 수 있을까? 답은 시계의 산수와 1640년 페르마의 정리에 있다. 집합론 무한에도 크기가 있다 자연수와 짝수는 어느 쪽이 많을까? 칸토어는 무한을 세는 법을 찾았고, 무한이 하나가 아님을 보였다. 최소제곱과 선형대수 잃어버린 소행성 1801년, 발견 몇 주 만에 태양 뒤로 사라진 세레스. 스물네 살의 가우스는 흩어진 관측값에서 궤도를 되찾았다. 그래프 이론 일곱 다리의 도시 쾨니히스베르크의 일곱 다리를 한 번씩만 건너 산책할 수 있을까? 오일러는 지도를 지우고 점과 선만 남겼다. 혼돈 나비의 날갯짓 방정식이 정해져 있으면 미래도 정해질까? 소수점 아래 몇 자리를 버린 계산이 날씨 예보의 한계를 드러냈다. 통계와 인과 담배와 폐암 상관관계는 인과관계가 아니라고들 한다. 그렇다면 담배가 폐암을 일으킨다는 것은 어떻게 알게 되었을까? 거리와 유사도 까마귀와 택시 까마귀는 곧장 날고 택시는 블록을 돌아간다. '얼마나 먼가'에는 답이 하나가 아니고, 어떤 거리를 고르느냐가 통계와 기계 학습의 답을 바꾼다. 계산언어학 말을 세는 기계 문법은 규칙일까, 확률일까? 파니니의 문법에서 촘스키의 위계, 섀넌의 영어 엔트로피, 오늘날의 언어 모델까지. 조합론 세지 않고 세기 시의 운율을 세던 인도의 운율학자부터 오일러의 생성함수까지. 하나하나 늘어놓지 않고 경우의 수를 세는 법은 어떻게 자라났을까? 매칭과 흐름 짝을 찾는 알고리즘 의대 졸업생과 병원, 신장 기증자와 환자, 철도와 화물. 누구를 누구와 이을지 정하는 수학은 냉전의 철도 지도에서 노벨 경제학상까지 이어진다. 램지 이론 완전한 무질서는 없다 여섯 명이 모이면 서로 아는 세 사람이나 서로 모르는 세 사람이 반드시 있다. 충분히 크면 어디에나 질서가 숨어 있다는 이론과, 그것을 동전 던지기로 증명한 에르되시. 정보 이론과 압축 짧게 보내기 모스 부호는 왜 E를 점 하나로 보낼까? 섀넌의 엔트로피가 정한 압축의 한계와, 허프만 부호에서 JPEG까지 그 한계에 다가간 방법들. 신경망과 기계 학습 배우는 기계 예를 보여 주면 규칙을 스스로 찾는 기계. 1958년의 퍼셉트론에서 오늘의 심층 신경망까지, 그 밑바닥에는 미분과 연쇄법칙이 있다. 언어 모델 다음 단어를 맞히는 기계 다음 낱말을 짐작하는 일만으로 어디까지 갈 수 있을까? 마르코프의 글자 세기에서 섀넌의 추측 게임, 트랜스포머와 규모의 법칙, 사람의 선호까지. 밑바닥에는 확률의 곱셈 규칙과 로그 하나가 있고, 그 수학은 모델이 왜 그럴듯하게 틀리는지도 말해 준다. 측정의 수학 재는 순간 바뀐다 해안선의 길이는 자에 따라, 평균은 누구에게 묻느냐에 따라, 지표는 목표가 되는 순간 달라진다. 리처드슨의 국경과 프랙털 차원, 스티븐스의 척도, 버스 정류장과 타율의 역설, 스피어먼의 요인, 굿하트의 법칙과 보상 해킹을 한 줄로 꿴다.

이 개념 위에 세워진 것

이 개념을 언급하는 페이지

이 페이지가 가리키는 개념