분산과 표준편차(Variance and standard deviation)
값들이 평균(mean)에서 얼마나 퍼져 있는가. 평균과의 차이를 한 변으로 하는 정사각형 넓이(area)의 평균이 분산(variance), 그 정사각형의 한 변이 표준편차다.
평균이 같아도 흩어진 정도는 다를 수 있습니다. 퍼짐을 재려면 각 값이 평균
지금 평균은
제곱을 쓰는 더 깊은 이유는 기하학입니다. 무작위로 값이 정해지는 수를 확률변수(random variable)라고 합니다(주사위의 눈, 내일의 기온). 서로 독립(independence)인 두 확률변수 X, Y를 더하면 분산이 그냥 더해집니다:
이 닮음은 우연이 아닙니다. 두 변수가 함께 평균보다 크거나 함께 작은 경향을 재는 공분산(covariance)
그래서 한 걸음의 표준편차가 σ인 독립적인 걸음을 n번 걸으면, 퍼짐(표준편차)은 n배가 아니라
평균은 모든 값까지의 거리의 제곱을 더한 합이 가장 작아지는 자리입니다. 제곱 대신 거리 자체(절댓값, absolute value)를 더한 합이 가장 작아지는 자리를 찾으면, 답은 평균이 아니라 중앙값(median)이 됩니다. 1, 2, 100이라면 제곱의 합은 평균 약 34.3에서, 거리의 합은 중앙값 2에서 가장 작습니다.
이 개념이 나오는 긴 글
이 개념 위에 세워진 것
이 개념을 언급하는 페이지
- 벡터
… 공간의 벡터 하나가 됩니다. 각 값에서 평균을 뺀 벡터를 만들면, 그 길이의 제곱을 n으로 나눈 값이분산이고(표본으로 모집단을 어림할 때는 n − 1로 나누기도 합니다), 두 측정(키와 몸무게)에서 각각 평균을 …
- 고유벡터와 고유값
… 가장 많이 퍼진 방향은 공분산 행렬에서 가장 큰 고유값의 고유벡터입니다. 공분산 행렬은 각 변수의분산과, 두 변수가 함께 커지고 작아지는 정도를 모은 표입니다(주성분 분석). 함수에도 고유벡터가 …
- 내적
… 벡터 사이 각의 코사인은 상관계수입니다. 같은 방향이면 1, 수직이면 0, 반대 방향이면 −1입니다(분산, 주성분 분석). 함수도 벡터처럼 내적할 수 있습니다. 성분끼리 곱해 더하는 대신 두 함수의 값을 …
- 피타고라스 정리
… 독립인 두 변수는 공분산이 0, 곧 서로 "직각"입니다. 그래서 이 식은 확률의 피타고라스 정리입니다(분산). 식이 성립하는 데 필요한 것은 사실 공분산이 0이라는 것뿐이고, 독립은 그보다 강한 조건입니다. 세 …
- 기댓값
… 기댓값으로 다가간다는 것이 큰 수의 법칙이고, 받침점 주변으로 무게가 얼마나 퍼져 있는지를 재는 것이분산입니다. 평균 대신 한가운데 값을 쓸 수도 있습니다. 순서대로 늘어놓았을 때 가운데 오는 중앙값은 …
- 이항분포
… 지금까지 개가 떨어졌습니다. 시행 하나를 성공이면 1, 실패면 0인 수로 적으면, 그 기댓값은 p,분산은 p(1-p) 입니다. 합의 기댓값과 (독립일 때) 분산은 그냥 더해지므로 이항분포의 기댓값은 np …
- 정규분포
… 행보⟧의 위치와 많은 측정 오차가 그렇고, 사람의 키도 성별을 나누어 보면 대략 그렇습니다. 그 폭은분산이 정합니다. 거꾸로 그림을 조금씩 줄이면서 정규분포 잡음을 더하기를 되풀이하면 어떤 그림이든 결국 …
- 중심극한정리
… 모양이 남아 있습니다. 원래 분포가 치우칠수록 더 큰 n이 필요합니다. 원래 분포가 남기는 것은 평균 μ와분산σ²뿐이고, 그 밖의 개성(치우침, 막대가 몇 개인지)은 더하는 동안 지워집니다. 정확히 말하면, 서로 …
- 큰 수의 법칙
… 없는 코시 분포에서는 평균이 끝내 모이지 않습니다. 깔때기의 폭이 1/\sqrt n 로 줄어드는 이유는분산에 있습니다. 독립인 값 n개를 더하면 분산은 n배가 되고, n으로 나누면 평균의 분산은 …
- 무작위 행보
… 평균 위치는 0입니다. 앞뒤가 반반이니까요. 그런데 사람들은 점점 넓게 퍼집니다. 한 걸음의분산이 1이고, 독립인 걸음을 더하면 분산이 더해지니 n걸음 뒤 분산은 n, 표준편차는 \sqrt n …
- 최소제곱 회귀
… 계산해 보면 그 기울기는 x와 y의 공분산(x가 평균보다 클 때 y도 평균보다 큰 경향을 재는 값)을 x의분산으로 나눈 값입니다. 기울기 m에 따른 오차 제곱 합. 노란 점이 지금 직선, 청록 점이 최소입니다. …
- 주성분 분석
… 화살표가 주성분입니다. 어떤 방향 \vec u 를 골라 모든 점을 그 직선에 정사영하면, 투영된 값들의분산은 입니다. 방향을 돌리면 이 값이 바뀌고, 가장 커지는 방향( )이 제1 주성분 , 그와 수직인 방향( …
- 중앙값
… = 0 , 곧 c가 평균일 때 가장 작다는 것이 바로 나옵니다(최적화). 그 최솟값을 개수로 나눈 것이분산입니다. 값이 짝수 개면 가운데 두 값 사이 전체가 평평한 바닥이 되어 그 사이 어느 c든 최소이고, 보통 …
- 상관관계
… 점(노랑)은 곱이 양수, 한쪽만 큰 점(파랑)은 음수입니다. 이 곱의 평균이 공분산 이고, 공분산을 두표준편차의 곱으로 나눠 단위를 없앤 것이 r입니다. 점마다 곱의 크기가 다르니 개수만 세는 것은 아닙니다. …
- 평균으로의 회귀
… 얼마나 물러나는지는 두 시험 점수의 상관계수 \rho = 가 정합니다. 이 모형에서 ρ는 점수의분산가운데 실력이 차지하는 몫입니다. 두 점수가 함께 정규분포를 따르고 둘 다 평균 50, 표준편차 …
- 무작위 대조 시험
… 반면 관찰 연구 의 추정값들은 좁아지기는 해도 엉뚱한 곳(평균 점)으로 모입니다. 우연에 의한 흔들림, 곧분산은 표본을 늘려 줄일 수 있지만, 설계가 만든 치우침은 줄지 않습니다. 시험을 되풀이해 얻은 효과 추정값의 …
- 마할라노비스 거리
값이 하나뿐이라면 '평균에서 얼마나 먼가'는표준편차로 잽니다. 평균보다 표준편차 세 개만큼 큰 키는 드물고, 반 개만큼 큰 키는 흔합니다. 값이 둘 이상이고 …
- 거리 함수
… 새 데이터를 가장 가까운 예와 같은 무리로 분류하는 방법이 최근접 이웃 분류입니다. 변수마다 단위와퍼짐이 다르면 유클리드 거리가 공정하지 않습니다. 퍼짐까지 고려해 거리를 다시 잰 것이 ⟦마할라노비스 …
- 유클리드 거리
… 직각이 아닌 삼각형으로 넓힌 것이 코사인 법칙입니다. 제곱한 거리는 통계에서도 자주 쓰입니다.분산은 각 자료가 평균에서 떨어진 거리를 제곱해 평균한 것입니다. 예를 들어 1, 2, 3의 평균은 2이고 …
- 과적합
… 표본을 아무리 바꿔도 같은 쪽으로 틀리고(편향), 복잡하면 표본이 바뀔 때마다 답이 크게 흔들립니다(분산). '새 표본'을 여러 번 눌러 보면 d가 큰 곡선일수록 모양이 크게 바뀝니다. 가장 좋은 복잡도는 이 …
- 최대 엔트로피 원리
… 위에서 아무 조건이 없으면 균등분포, 양의 실수 위에서 평균만 정해지면 지수분포, 실수 전체에서 평균과분산이 정해지면 정규분포입니다. 중심극한정리에서 합이 정규분포로 다가가는 것도 분산을 지키며 엔트로피가 …
- 통계학
… 더해 사람 수로 나눈 값)이나 중앙값(순서대로 세웠을 때 한가운데 값)으로, 얼마나 퍼져 있는지는분산과 표준편차로, 두 가지 양이 함께 움직이는 정도는 상관계수로 말합니다. 예컨대 '평균 165 cm, 표준편차 6 …
- 확률변수
… 모자를 받는 사람 수의 기댓값은 n과 상관없이 1입니다(교란순열). 값이 기댓값에서 얼마나 흩어지는지는분산E[(X - E[X])^2] 이 잽니다. 독립. 두 확률변수 X, Y가 서로 독립이라는 것은 모든 값 …
- 편향–분산 분해
… 평균제곱오차도 편향² + 분산이라서, 편향을 조금 들여 분산을 크게 줄이면 이깁니다. 정규분포 표본의분산을 추정할 때 편차 제곱합을 n − 1로 나누면 편향이 없지만, 평균제곱오차는 n + 1로 나눌 때 가장 …
- 교차 검증과 일반화
… 공짜로 얻습니다. 교차 검증이 재는 오차는 편향–분산 분해의 세 조각을 합한 것이고, 그 어림 자체도분산을 가진 확률 변수라는 점을 잊지 않아야 합니다.
- EM 알고리즘과 가우스 혼합
… 모양입니다. 책임도는 베이즈 정리의 사후 확률이고, M 단계의 가중 평균과 가중 분산은 기댓값과분산을 책임도로 센 것입니다. 하한과 KL 발산으로 나누는 항등식은 교차 엔트로피가 엔트로피와 KL …
- 특잇값 분해
… T}\Sigma V^{\mathsf T} 이므로, 주성분 분석의 축은 V의 열이고 각 축의분산은 \sigma_i^2/(n-1) 입니다. 실제 계산에서는 공분산 행렬을 만들지 않고 X를 바로 …
- 볼록 함수와 볼록 최적화
… E[f(X)] = , f(\mathbb E[X]) = , 차는 입니다. f = x²이면 이 차가 바로분산입니다( \mathbb E[X^2] - (\mathbb E[X])^2 = \operatorname{Var} …
- 확률적 경사 하강법과 Adam
… 제곱 평균의 제곱근은 지금 이고, 아래 식으로 계산한 이론값은 입니다. 예 하나의 기울기들이 흩어진 정도를분산σ²로 재면, 서로 독립으로 뽑은 B개의 평균은 분산이 σ²/B입니다. 그래서 흩어짐의 폭은 \sqrt B …
- 어텐션
… 나누는가. d는 쿼리와 키의 차원입니다. 학습을 시작할 때처럼 q와 k의 성분이 서로 독립이고 평균 0,분산1이라고 합시다. 내적 q\cdot k = \sum_{i=1}^{d} q_i k_i 의 각 항은 평균 0, …
- 트랜스포머
… = \frac1d\sum_j (x_j - \mu)^2 통계에서 자료를 표준화하는 것(평균 0,분산1로 맞추기)을 층마다 토큰마다 하는 셈입니다. ε은 0으로 나누지 않으려고 더하는 아주 작은 수입니다. …
- 추론 모델과 테스트 시점 계산
… = \nabla\sum_y \pi = \nabla 1 = 0 이기 때문입니다. 그러나분산은 크게 바꿉니다. 보상이 모두 1 근처라면 b 없이는 모든 답을 한꺼번에 밀어 올리는 잡음 큰 신호가 …