수학 개념 지도
확률과 통계(Probability and statistics)

큰 수의 법칙(Law of large numbers)

같은 실험을 서로 독립⁠(independence)⁠으로 많이 반복하면, 기댓값⁠(expected value)⁠이 있는 한 결과의 평균⁠(mean)⁠은 기댓값에 가까워진다. 분산⁠(variance)⁠이 유한하면 흔들림의 폭은 반복 횟수의 제곱근에 반비례해 줄어든다.

Xˉn=X1+⋯+Xnn  ⟶  E[X]\bar X_n = \frac{X_1 + \cdots + X_n}{n} \;\longrightarrow\; \mathbb{E}[X]
먼저 보면 좋은 개념기댓값극한

하나를 던질 때마다 지금까지 나온 값의 평균을 기록해 봅시다. 선 하나가 한 사람의 실험이고, 모두 24명이 n=n = 번씩 던졌습니다. 처음 몇 번은 평균이 크게 흔들리지만, 횟수가 늘수록 모든 선이 기댓값 를 향해 모여듭니다. 다시 던지기

가로축은 던진 횟수, 세로축은 지금까지의 평균입니다. 점선 깔때기는 기댓값 ± 2σ/√n 입니다.

평균이 한 값으로 모인다는 것은 극한⁠(limit)⁠의 언어로 말하면 Xˉn→E[X]\bar X_n \to \mathbb{E}[X]입니다. 다만 수열의 극한과는 뜻이 조금 다릅니다. 앞면만 1000번 연달아 나오는 일도 불가능하지는 않으니, "어떤 경우에도 반드시"라고는 말할 수 없습니다. 그래서 확률⁠(probability)⁠을 넣어 말합니다. 가장 흔한 형태(약한 큰 수의 법칙)는 이렇습니다. 평균이 기댓값에서 아무리 작게 정한 폭 ε보다 더 벗어날 확률이 n이 커질수록 0에 다가갑니다. 더 강한 형태(강한 큰 수의 법칙)는 한 사람의 선을 끝까지 따라가면 확률 1로 기댓값에 수렴⁠(convergence)⁠한다고 말합니다. 수렴하지 않는 선도 가능한 결과이지만, 그런 선들을 모두 모아도 확률이 0입니다. 두 형태 모두 시행들이 서로 독립이고 분포가 같으며 기댓값이 유한하다는 조건 아래 성립합니다.

이 법칙을 처음 증명한 사람은 스위스의 야코프 베르누이입니다. 그 자신의 말로 20년을 매달린 증명은 그가 죽은 뒤 1713년 『추측의 기술』에 실렸습니다. 1867년 러시아의 체비쇼프는 분산이 유한하면 어떤 분포에서든 성립한다는 것을 짧게 보였습니다. 평균이 기댓값에서 ε 넘게 벗어날 확률은 평균의 분산 σ2/n\sigma^2/n을 ε2\varepsilon^2으로 나눈 값보다 클 수 없다는 부등식(체비쇼프 부등식⁠, Chebyshev's inequality⁠)을 쓴 것입니다. 1929년 소련의 수학자 힌친은 분산이 무한해도 기댓값만 유한하면 된다는 것을 보였습니다. 기댓값이 없는 코시 분포⁠(Cauchy distribution)⁠에서는 평균이 끝내 모이지 않습니다.

깔때기의 폭이 1/n1/\sqrt n로 줄어드는 이유는 분산에 있습니다. 독립인 값 n개를 더하면 분산은 n배가 되고, n으로 나누면 평균의 분산은 σ2/n\sigma^2/n, 표준편차⁠(standard deviation)⁠는 σ/n\sigma/\sqrt n입니다. 정확도를 10배 높이려면 100배 더 던져야 합니다. 평균 주변의 흔들림이 어떤 모양인지까지 알려 주는 것이 중심극한정리⁠(central limit theorem)⁠입니다.

이 법칙 덕분에 확률을 실험으로 잴 수 있습니다. 무작위 점을 많이 뿌려 넓이⁠(area)⁠나 π를 구하는 몬테카를로 방법⁠(Monte Carlo method)⁠이 바로 이 법칙 위에 서 있습니다. 신경망⁠(neural network)⁠을 학습시키는 확률적 경사 하강법⁠(stochastic gradient descent)⁠도 마찬가지입니다. 무작위로 뽑은 자료 B개로 구한 기울기⁠(slope)⁠의 평균은 전체 자료의 기울기를 치우침 없이 어림하고, 그 흩어짐은 1/B1/\sqrt B에 비례해 줄어듭니다.

데이터를 보기 전에 가진 믿음(사전 믿음)의 영향이 관측이 쌓일수록 줄어드는 것도 같은 원리입니다. 베이즈 정리⁠(Bayes' theorem)⁠로 믿음을 계속 고치면, 동전이 공정한지를 두고 처음 믿음이 달랐던 두 사람도 같은 던지기 결과를 충분히 많이 보고 나면 거의 같은 결론에 이릅니다. 쌓인 데이터의 무게가 처음 믿음의 차이를 덮어 버리기 때문입니다. 단, 두 사람 모두 참인 값에 처음부터 확률 0을 주지는 않았어야 합니다. 0에 무엇을 곱해도 0이니까요.

이 법칙은 앞에서 치우친 만큼 뒤에서 '갚아 준다'는 뜻이 아닙니다. 동전이 앞면만 다섯 번 나왔다고 여섯 번째에 뒷면이 나올 확률이 커지지는 않습니다. 앞의 치우침은 그대로 남아 있지만, 뒤에 쌓이는 수많은 결과에 묻혀 평균에서 차지하는 몫이 작아질 뿐입니다. 비슷해 보이는 평균으로의 회귀⁠(regression to the mean)⁠는 다른 이야기입니다. 측정값에 우연이 섞여 있으면, 유난히 극단적인 값이 나온 다음번 측정은 덜 극단적이기 쉽다는 현상입니다.

이 법칙은 섀넌의 정보 이론을 떠받칩니다. 0이 확률 0.9, 1이 확률 0.1로 서로 독립적으로 나오는 길이 1000의 문자열을 생각해 봅시다. 큰 수의 법칙 때문에 1의 개수는 거의 언제나 100개 근처입니다(표준편차가 약 9.5개라서, 70개 아래나 130개 위로 벗어날 확률은 약 0.13%입니다). 1이 대략 100개인 이런 문자열을 '전형적인' 문자열이라 하는데, 그 개수는 약 2nH2^{nH}개입니다. 여기서 n = 1000은 길이이고 H는 기호 하나당 엔트로피⁠(entropy)⁠로, 이 예에서는 약 0.47비트입니다. 가능한 문자열 210002^{1000}개 가운데 전형적인 것은 약 24702^{470}개뿐인데, 실제로 나오는 문자열은 거의 모두 그 안에 듭니다. 그러니 전형적인 문자열에만 번호를 붙이면 1000비트 대신 약 470비트로 적을 수 있습니다. 섀넌은 1948년 이 논법으로, 기호 하나당 평균 H비트까지는 줄일 수 있고 그보다 더는 줄일 수 없다는 원천 부호화 정리⁠(source coding theorem)⁠를 증명했습니다.

같은 논리가 잡음에도 통합니다. 비트 하나가 확률 p로 뒤집히는 통로로 n비트짜리 긴 부호어⁠(codeword)⁠를 보내면, 뒤집히는 비트 수는 거의 언제나 np 근처입니다. 오류의 개수가 거의 정해져 있으니, 받은 문자열에서 '약 np개를 뒤집어 얻을 수 있는 부호어'만 찾아보면 됩니다. 부호어들을 이런 범위가 서로 거의 겹치지 않게 골라 두면 거의 틀리지 않고 원래 부호어를 되찾을 수 있다는 것이 통로 부호화 정리⁠(noisy-channel coding theorem)⁠의 뼈대입니다.

물리에서도 같습니다. 0 °C, 1기압의 기체 1리터에는 분자가 약 2.7 × 10²²개 있어서 이 법칙이 더없이 정확하게 들어맞습니다. 열은 뜨거운 곳에서 차가운 곳으로만 흐르고 섞인 기체는 저절로 갈라지지 않는다는 열역학 제2법칙⁠(second law of thermodynamics)⁠은, 사실 '분자들이 골고루 섞인 배치가 압도적으로 많아서 거의 확실히 그렇게 된다'는 통계⁠(statistics)⁠ 법칙입니다. 이 점을 파고든 사고 실험⁠(thought experiment)⁠이 맥스웰이 1867년 내놓은 맥스웰의 악마⁠(Maxwell's demon)⁠입니다. 분자를 하나하나 보고 칸막이 문을 여닫아 빠른 분자만 한쪽으로 모으는 작은 존재가 있다면 제2법칙을 깰 수 있을까 하는 질문입니다.

차원이 높은 공간에서도 이 법칙이 뜻밖의 결과를 냅니다. d차원에서 두 점 사이 거리의 제곱은 좌표 차이의 제곱 d개를 더한 것입니다. 좌표를 서로 독립으로 뽑은 무작위 점들이라면, d가 클 때 이 합을 d로 나눈 값은 큰 수의 법칙대로 평균 근처로 모입니다. 그래서 거리들의 평균에 비해 거리들 사이의 차이가 점점 작아지고, 어느 두 점을 골라도 거리가 거의 같아 보입니다. '가까운 점'과 '먼 점'의 구별이 흐려지는 이 현상이 차원의 저주⁠(curse of dimensionality)⁠입니다.

언어 모델⁠(language model)⁠에게 같은 문제를 여러 번 풀게 해 가장 많이 나온 답을 고를 때도 이 법칙이 결론을 정합니다. 풀이들이 서로 독립이라면 표본⁠(sample)⁠을 늘릴수록 각 답의 비율이 제 확률에 붙으므로, 정답이 나올 확률이 가장 흔한 오답이 나올 확률보다 크기만 하면 다수결은 거의 확실히 맞고, 작으면 거의 확실히 틀립니다(추론 모델).

이 개념이 나오는 큰 생각근사와 오차무작위성무한을 다루는 법

이 개념이 나오는 긴 글

확률 도박판에서 온 편지 1654년, 도중에 멈춘 내기의 판돈을 어떻게 나눌까? 두 수학자가 주고받은 편지에서 확률론이 태어났다. 소수 소수를 세는 사람들 소수는 제멋대로 흩어져 있는 것 같다. 그런데 멀리서 세어 보면 로그가 보인다. 정수론과 암호 나머지로 지키는 비밀 한 번도 만난 적 없는 두 사람이 모두가 엿듣는 통신망에서 비밀 열쇠를 맞출 수 있을까? 답은 시계의 산수와 1640년 페르마의 정리에 있다. 집합론 무한에도 크기가 있다 자연수와 짝수는 어느 쪽이 많을까? 칸토어는 무한을 세는 법을 찾았고, 무한이 하나가 아님을 보였다. 최소제곱과 선형대수 잃어버린 소행성 1801년, 발견 몇 주 만에 태양 뒤로 사라진 세레스. 스물네 살의 가우스는 흩어진 관측값에서 궤도를 되찾았다. 그래프 이론 일곱 다리의 도시 쾨니히스베르크의 일곱 다리를 한 번씩만 건너 산책할 수 있을까? 오일러는 지도를 지우고 점과 선만 남겼다. 혼돈 나비의 날갯짓 방정식이 정해져 있으면 미래도 정해질까? 소수점 아래 몇 자리를 버린 계산이 날씨 예보의 한계를 드러냈다. 통계와 인과 담배와 폐암 상관관계는 인과관계가 아니라고들 한다. 그렇다면 담배가 폐암을 일으킨다는 것은 어떻게 알게 되었을까? 거리와 유사도 까마귀와 택시 까마귀는 곧장 날고 택시는 블록을 돌아간다. '얼마나 먼가'에는 답이 하나가 아니고, 어떤 거리를 고르느냐가 통계와 기계 학습의 답을 바꾼다. 계산언어학 말을 세는 기계 문법은 규칙일까, 확률일까? 파니니의 문법에서 촘스키의 위계, 섀넌의 영어 엔트로피, 오늘날의 언어 모델까지. 조합론 세지 않고 세기 시의 운율을 세던 인도의 운율학자부터 오일러의 생성함수까지. 하나하나 늘어놓지 않고 경우의 수를 세는 법은 어떻게 자라났을까? 램지 이론 완전한 무질서는 없다 여섯 명이 모이면 서로 아는 세 사람이나 서로 모르는 세 사람이 반드시 있다. 충분히 크면 어디에나 질서가 숨어 있다는 이론과, 그것을 동전 던지기로 증명한 에르되시. 정보 이론과 압축 짧게 보내기 모스 부호는 왜 E를 점 하나로 보낼까? 섀넌의 엔트로피가 정한 압축의 한계와, 허프만 부호에서 JPEG까지 그 한계에 다가간 방법들. 통신과 잡음 잡음 너머로 대서양 바닥의 케이블은 왜 신호를 뭉갰을까? 잡음이 있어도 오류 없이 보낼 수 있다는 섀넌의 정리와, 그 한계를 50년 동안 쫓은 부호들. 신경망과 기계 학습 배우는 기계 예를 보여 주면 규칙을 스스로 찾는 기계. 1958년의 퍼셉트론에서 오늘의 심층 신경망까지, 그 밑바닥에는 미분과 연쇄법칙이 있다. 언어 모델 다음 단어를 맞히는 기계 다음 낱말을 짐작하는 일만으로 어디까지 갈 수 있을까? 마르코프의 글자 세기에서 섀넌의 추측 게임, 트랜스포머와 규모의 법칙, 사람의 선호까지. 밑바닥에는 확률의 곱셈 규칙과 로그 하나가 있고, 그 수학은 모델이 왜 그럴듯하게 틀리는지도 말해 준다.

이 개념 위에 세워진 것

이 개념을 언급하는 페이지

이 페이지가 가리키는 개념