수학 개념 지도
확률과 통계(Probability and statistics)

정규분포(Normal distribution)

평균⁠(mean)⁠ μ를 중심으로 표준편차⁠(standard deviation)⁠ σ만큼 퍼진 종 모양 분포. 서로 독립⁠(independence)⁠인 작은 요인이 많이 더해지면, 어느 하나가 압도하지 않는 한 합이 이 모양에 가까워진다.

f(x)=1σ2π e−(x−μ)22σ2f(x) = \frac{1}{\sigma\sqrt{2\pi}}\, e^{-\frac{(x-\mu)^2}{2\sigma^2}}
먼저 보면 좋은 개념지수함수 eˣ분산과 표준편차

정규분포는 두 수로 결정됩니다. 중심 μ=\mu = 와 폭 σ=\sigma = 입니다. σ를 줄이면 곡선은 좁고 높아지는데, 곡선 아래 넓이⁠(area)⁠는 언제나 1을 유지해야 하기 때문입니다.

노란 점을 끌면 중심이, 청록 점(μ+σ)을 끌면 폭이 바뀝니다. 짙은 띠부터 ±1σ, ±2σ, ±3σ 구간입니다.

어떤 μ와 σ든 ±1σ 안에 약 68.3%, ±2σ 안에 95.4%, ±3σ 안에 99.7%가 들어갑니다. σ를 잣대로 쓰면 모든 정규분포가 같은 모양이기 때문입니다. 곡선의 모양은 지수함수⁠(exponential function)⁠ e−x2/2e^{-x^2/2}에서 옵니다. 표준정규분포(μ = 0, σ = 1)에서는 중심에서 거리 x만큼 떨어지면 높이의 로그가 x2/2x^2/2만큼, 곧 거리의 제곱에 비례해 줄어듭니다. 그래서 꼬리가 아주 빨리 얇아집니다. ±3σ 바깥은 0.3%쯤이지만 ±5σ 바깥은 100만 분의 1도 안 됩니다.

앞의 상수 1/2π1/\sqrt{2\pi}는 넓이를 1로 맞추는 값입니다. 원이 보이지 않는데 원주율⁠(pi)⁠이 들어오는 까닭은 다음과 같습니다(가우스 적분⁠(Gaussian integral)⁠). 적분⁠(integral)⁠ I=∫e−x2dxI = \int e^{-x^2}dx를 제곱하면 평면 전체에서 e−(x2+y2)e^{-(x^2+y^2)}를 적분한 값이 됩니다. 이 함수⁠(function)⁠는 원점에서 같은 거리에 있는 점에서 모두 같은 값이므로, 평면을 원점 중심의 가는 고리들로 잘라 더할 수 있습니다. 반지름 r인 고리의 둘레가 2πr2\pi r이라서 그 합은 π가 되고, 원래 적분 I는 그 제곱근 π\sqrt{\pi}입니다.

정규분포가 도처에 있는 이유는 중심극한정리⁠(central limit theorem)⁠입니다. 서로 독립인 작은 요인들을 많이 더하면, 각 요인의 분산⁠(variance)⁠이 유한하고 어느 하나가 합을 좌우하지 않는 한, 요인들의 분포와 상관없이 합이 이 모양에 가까워집니다. n걸음 뒤 무작위 행보⁠(random walk)⁠의 위치와 많은 측정 오차가 그렇고, 사람의 키도 성별을 나누어 보면 대략 그렇습니다. 그 폭은 분산이 정합니다. 거꾸로 그림을 조금씩 줄이면서 정규분포 잡음을 더하기를 되풀이하면 어떤 그림이든 결국 표준정규분포⁠(standard normal distribution)⁠의 표본⁠(sample)⁠과 구별할 수 없게 되는데, 이 과정을 거꾸로 돌리도록 신경망⁠(neural network)⁠을 학습시킨 것이 확산 모델⁠(diffusion model)⁠입니다.

이 곡선은 1733년 드무아브르가 동전을 많이 던졌을 때 앞면 수의 분포(이항분포⁠, binomial distribution⁠)를 어림하다가 처음 찾았습니다. 1809년 가우스는 천체 관측값의 오차가 이 분포를 따른다고 보고 최소제곱법⁠(method of least squares)⁠을 정당화했고, 그래서 '가우스 분포⁠(Gaussian distribution)⁠'라는 이름이 붙었습니다. 곧이어 1810년 라플라스가 작은 오차들의 합이 이 모양이 된다는 것, 곧 중심극한정리의 한 형태를 내놓았습니다.

골턴은 부모와 자식의 키를 정규분포로 다루다가, 키가 큰 부모의 자식이 평균 쪽으로 돌아오는 경향을 찾았습니다(평균으로의 회귀⁠, regression to the mean⁠).

키와 몸무게처럼 두 변수를 함께 보면, 정규분포는 평면 위의 언덕이 됩니다. 언덕 높이(확률밀도⁠, probability density⁠)가 같은 점들을 이은 등고선은, 두 변수가 서로 관계가 없으면 원이나 축에 나란한 타원⁠(ellipse)⁠이고, 한쪽이 클 때 다른 쪽도 큰 경향(상관)이 있으면 기울어진 타원입니다. 이 타원을 원으로 펴는 변환을 한 다음 잰 거리가 마할라노비스 거리⁠(Mahalanobis distance)⁠입니다. 흩어짐이 큰 방향으로는 멀리 떨어져도 덜 이상하다고 보는 거리입니다.

평균과 분산만 정해 두고 그 밖에는 아무것도 가정하지 않는 분포를 고르고 싶다면, 가장 예측하기 어려운 분포, 곧 엔트로피⁠(entropy)⁠가 가장 큰 분포를 고르는 것이 원칙입니다(최대 엔트로피 원리⁠, principle of maximum entropy⁠). 실수⁠(real number)⁠ 위의 연속분포 가운데 평균과 분산이 정해진 것들을 모아 보면, 엔트로피가 가장 큰 것이 바로 정규분포입니다. 그래서 잡음의 모양을 모를 때 정규분포로 두는 것이 가장 조심스러운 선택입니다. 거꾸로, 잡음의 세기(전력, 곧 잡음 값의 제곱의 평균)가 같다면 정규분포 잡음이 통신을 가장 크게 방해합니다. 섀넌–하틀리 공식이 정규분포 잡음을 두고 계산되는 이유입니다(섀넌–하틀리 정리⁠(Shannon–Hartley theorem)⁠).

이 개념이 나오는 긴 글

미분에서 회전까지 · 2편 · 적분 거리를 되찾기 속도계 기록만 남았다. 차가 어디까지 갔는지 되찾을 수 있을까? 확률 도박판에서 온 편지 1654년, 도중에 멈춘 내기의 판돈을 어떻게 나눌까? 두 수학자가 주고받은 편지에서 확률론이 태어났다. 소수 소수를 세는 사람들 소수는 제멋대로 흩어져 있는 것 같다. 그런데 멀리서 세어 보면 로그가 보인다. 최소제곱과 선형대수 잃어버린 소행성 1801년, 발견 몇 주 만에 태양 뒤로 사라진 세레스. 스물네 살의 가우스는 흩어진 관측값에서 궤도를 되찾았다. 혼돈 나비의 날갯짓 방정식이 정해져 있으면 미래도 정해질까? 소수점 아래 몇 자리를 버린 계산이 날씨 예보의 한계를 드러냈다. 거리와 유사도 까마귀와 택시 까마귀는 곧장 날고 택시는 블록을 돌아간다. '얼마나 먼가'에는 답이 하나가 아니고, 어떤 거리를 고르느냐가 통계와 기계 학습의 답을 바꾼다. 계산언어학 말을 세는 기계 문법은 규칙일까, 확률일까? 파니니의 문법에서 촘스키의 위계, 섀넌의 영어 엔트로피, 오늘날의 언어 모델까지. 통신과 잡음 잡음 너머로 대서양 바닥의 케이블은 왜 신호를 뭉갰을까? 잡음이 있어도 오류 없이 보낼 수 있다는 섀넌의 정리와, 그 한계를 50년 동안 쫓은 부호들. 역문제 거꾸로 푸는 문제는 왜 어려운가 원인에서 결과를 계산하기는 쉽다. 흐린 사진, CT, 블랙홀 사진은 왜 결과에서 원인을 되찾기 어려웠을까? 작은 특잇값이 잡음을 키우는 벽과, 정규화·릿지 회귀·베이즈 사전확률이 사실은 같은 처방이라는 이야기. 라플라시안 라플라시안, 가장 많이 재사용된 식 이웃의 평균에서 나를 뺀다. 이 한 줄이 열의 법칙이고, 도박꾼이 이길 확률이고, 전기 회로와 나무 세기이고, 북의 음색이고, 사진의 윤곽선이고, 그래프를 가르는 칼이고, 잡음에서 그림을 빚는 확산 모델의 밑그림이다. 측정의 수학 재는 순간 바뀐다 해안선의 길이는 자에 따라, 평균은 누구에게 묻느냐에 따라, 지표는 목표가 되는 순간 달라진다. 리처드슨의 국경과 프랙털 차원, 스티븐스의 척도, 버스 정류장과 타율의 역설, 스피어먼의 요인, 굿하트의 법칙과 보상 해킹을 한 줄로 꿴다. 압축과 과학 압축하는 것이 이해하는 것이다 튀코 브라헤가 20년 동안 적은 행성의 위치를 케플러는 법칙 세 줄로 줄였다. 짧게 적는 일과 이해하는 일은 정말 같은 일일까? 오컴의 면도날을 비트로 재는 법, 과적합을 압축의 실패로 읽는 법, 그리고 그 말이 정리인 곳과 철학인 곳.

이 개념 위에 세워진 것

이 개념을 언급하는 페이지

이 페이지가 가리키는 개념