수학 개념 지도
확률과 통계(Probability and statistics)

분산과 표준편차(Variance and standard deviation)

값들이 평균⁠(mean)⁠에서 얼마나 퍼져 있는가. 평균과의 차이를 한 변으로 하는 정사각형 넓이⁠(area)⁠의 평균이 분산⁠(variance)⁠, 그 정사각형의 한 변이 표준편차다.

Var⁡(X)=E[(X−μ)2],σ=Var⁡(X)\operatorname{Var}(X) = E\big[(X - \mu)^2\big], \qquad \sigma = \sqrt{\operatorname{Var}(X)}
먼저 보면 좋은 개념기댓값

평균이 같아도 흩어진 정도는 다를 수 있습니다. 퍼짐을 재려면 각 값이 평균 μ\mu에서 얼마나 떨어졌는지 봐야 하는데, 차이를 그냥 더하면 양수와 음수가 상쇄되어 늘 0입니다. 그래서 차이를 제곱합니다. 제곱은 말 그대로 정사각형입니다. 아래 점들을 좌우로 끌어 보세요.

각 점과 평균(노란 선)의 차이를 한 변으로 하는 정사각형들. 그 넓이의 평균이 분산이고, 청록 점선 정사각형이 넓이가 분산과 같은 정사각형, 곧 한 변이 σ입니다.

지금 평균은 , 분산(정사각형 넓이의 평균)은 , 표준편차⁠(standard deviation)⁠는 입니다. 다시 뽑기 멀리 떨어진 점 하나가 거대한 정사각형을 만들어 분산을 끌어올리는 것이 보입니다. 제곱은 먼 값에 더 큰 벌점을 줍니다.

제곱을 쓰는 더 깊은 이유는 기하학입니다. 무작위로 값이 정해지는 수를 확률변수⁠(random variable)⁠라고 합니다(주사위의 눈, 내일의 기온). 서로 독립⁠(independence)⁠인 두 확률변수 X, Y를 더하면 분산이 그냥 더해집니다: Var⁡(X+Y)=Var⁡X+Var⁡Y\operatorname{Var}(X+Y) = \operatorname{Var}X + \operatorname{Var}Y. 표준편차로 쓰면 σ2=σX2+σY2\sigma^2 = \sigma_X^2 + \sigma_Y^2, 곧 직각삼각형⁠(right triangle)⁠의 피타고라스 정리⁠(Pythagorean theorem)⁠와 같은 모양입니다.

이 닮음은 우연이 아닙니다. 두 변수가 함께 평균보다 크거나 함께 작은 경향을 재는 공분산⁠(covariance)⁠ Cov⁡(X,Y)=E[(X−μX)(Y−μY)]\operatorname{Cov}(X,Y) = E[(X-\mu_X)(Y-\mu_Y)]을 두 변수의 내적⁠(dot product)⁠으로 삼으면, 확률변수를 화살표처럼 다룰 수 있습니다. 분산은 자기 자신과의 내적, 곧 길이의 제곱이 됩니다. 독립인 두 변수는 공분산이 0이므로 서로 직각인 두 화살표처럼 행동하고, 그래서 길이의 제곱이 피타고라스 정리처럼 더해집니다. 사실 분산이 더해지는 데 필요한 것은 독립이 아니라 공분산이 0인 것(상관없음)뿐입니다. 거꾸로 공분산이 0이라고 독립인 것은 아닙니다. X가 −1, 0, 1을 1/3씩 갖고 Y=X2Y = X^2이면 공분산은 0이지만, X를 알면 Y가 완전히 정해집니다. 이 그림에서 상관계수⁠(correlation coefficient)⁠는 두 화살표 사이 각도의 코사인입니다.

그래서 한 걸음의 표준편차가 σ인 독립적인 걸음을 n번 걸으면, 퍼짐(표준편차)은 n배가 아니라 n\sqrt{n}배가 됩니다. 분산이 n배가 되고, 표준편차는 그 제곱근이기 때문입니다(무작위 행보⁠, random walk⁠). 분산은 정규분포⁠(normal distribution)⁠의 폭을 정합니다. 회귀가 줄이려는 오차 제곱합도, 주성분 분석⁠(principal component analysis)⁠이 최대로 만드는 퍼짐도 모두 같은 제곱의 평균으로 잽니다. 모형이 새 자료에서 내는 제곱 오차의 기댓값⁠(expected value)⁠도 잡음, 편향의 제곱, 그리고 표본⁠(sample)⁠에 따라 예측이 흔들리는 정도인 분산으로 정확히 나뉩니다(편향–분산 분해⁠(bias–variance decomposition)⁠). 기댓값은 그대로 두고 분산만 줄이는 요령도 있습니다. 언어 모델⁠(language model)⁠을 채점 결과로 강화 학습⁠(reinforcement learning)⁠할 때 보상에서 상수 기준선을 빼도 기울기⁠(slope)⁠의 기댓값은 바뀌지 않지만 분산은 크게 달라지고, 같은 질문에 뽑은 답들의 평균 보상을 기준선으로 쓰는 GRPO가 이 생각을 씁니다(추론 모델).

평균은 모든 값까지의 거리의 제곱을 더한 합이 가장 작아지는 자리입니다. 제곱 대신 거리 자체(절댓값⁠, absolute value⁠)를 더한 합이 가장 작아지는 자리를 찾으면, 답은 평균이 아니라 중앙값⁠(median)⁠이 됩니다. 1, 2, 100이라면 제곱의 합은 평균 약 34.3에서, 거리의 합은 중앙값 2에서 가장 작습니다.

이 개념이 나오는 큰 생각근사와 오차

이 개념이 나오는 긴 글

확률 도박판에서 온 편지 1654년, 도중에 멈춘 내기의 판돈을 어떻게 나눌까? 두 수학자가 주고받은 편지에서 확률론이 태어났다. 소수 소수를 세는 사람들 소수는 제멋대로 흩어져 있는 것 같다. 그런데 멀리서 세어 보면 로그가 보인다. 최소제곱과 선형대수 잃어버린 소행성 1801년, 발견 몇 주 만에 태양 뒤로 사라진 세레스. 스물네 살의 가우스는 흩어진 관측값에서 궤도를 되찾았다. 혼돈 나비의 날갯짓 방정식이 정해져 있으면 미래도 정해질까? 소수점 아래 몇 자리를 버린 계산이 날씨 예보의 한계를 드러냈다. 통계와 인과 담배와 폐암 상관관계는 인과관계가 아니라고들 한다. 그렇다면 담배가 폐암을 일으킨다는 것은 어떻게 알게 되었을까? 거리와 유사도 까마귀와 택시 까마귀는 곧장 날고 택시는 블록을 돌아간다. '얼마나 먼가'에는 답이 하나가 아니고, 어떤 거리를 고르느냐가 통계와 기계 학습의 답을 바꾼다. 통신과 잡음 잡음 너머로 대서양 바닥의 케이블은 왜 신호를 뭉갰을까? 잡음이 있어도 오류 없이 보낼 수 있다는 섀넌의 정리와, 그 한계를 50년 동안 쫓은 부호들. 언어 모델 다음 단어를 맞히는 기계 다음 낱말을 짐작하는 일만으로 어디까지 갈 수 있을까? 마르코프의 글자 세기에서 섀넌의 추측 게임, 트랜스포머와 규모의 법칙, 사람의 선호까지. 밑바닥에는 확률의 곱셈 규칙과 로그 하나가 있고, 그 수학은 모델이 왜 그럴듯하게 틀리는지도 말해 준다. 측정의 수학 재는 순간 바뀐다 해안선의 길이는 자에 따라, 평균은 누구에게 묻느냐에 따라, 지표는 목표가 되는 순간 달라진다. 리처드슨의 국경과 프랙털 차원, 스티븐스의 척도, 버스 정류장과 타율의 역설, 스피어먼의 요인, 굿하트의 법칙과 보상 해킹을 한 줄로 꿴다.

이 개념 위에 세워진 것

이 개념을 언급하는 페이지

이 페이지가 가리키는 개념