수학 개념 지도
확률과 통계(Probability and statistics)

중앙값(Median)

값들을 크기순으로 늘어놓았을 때 한가운데 오는 값. 거리의 합 Σ|x−c|를 가장 작게 하며, 평균⁠(mean)⁠과 달리 이상값⁠(outlier)⁠에 거의 흔들리지 않는다.

median⁡=arg⁡min⁡c∑i∣xi−c∣,mean=arg⁡min⁡c∑i(xi−c)2\operatorname{median} = \arg\min_c \sum_i |x_i - c|, \qquad \text{mean} = \arg\min_c \sum_i (x_i - c)^2
먼저 보면 좋은 개념기댓값최적화

값들을 크기순으로 늘어놓았을 때 한가운데 오는 값이 중앙값입니다. 값의 절반은 그보다 작거나 같고, 절반은 그보다 크거나 같습니다. 아래 수직선의 일곱 점을 끌어 보세요. 평균은 , 중앙값은 입니다. 한 점을 멀리 보내기 처음으로

분홍 눈금이 평균, 청록 눈금이 중앙값, 노란 점선이 아래 그래프의 후보 c입니다.

가장 큰 점을 오른쪽 끝까지 보내도 중앙값은 꿈쩍하지 않지만 평균, 곧 기댓값⁠(expected value)⁠은 끌려갑니다. 평균은 모든 값의 크기를 쓰고, 중앙값은 순서만 쓰기 때문입니다. 그래서 소득이나 집값처럼 드물지만 아주 큰 값들이 한쪽으로 길게 늘어선 자료(긴 꼬리가 있는 자료, 지프의 법칙⁠(Zipf's law)⁠을 따르는 낱말 빈도가 그 예)에서는 중앙값이 "보통"을 더 잘 나타냅니다. 이렇게 이상값에 잘 흔들리지 않는 성질을 강건하다고 합니다.

무엇을 가장 작게 하는가. 대푯값 c 하나를 고를 때 "틀린 정도"를 어떻게 재느냐에 따라 답이 달라집니다. 거리의 합 ∑∣xi−c∣\sum|x_i - c|를 가장 작게 하는 c는 중앙값이고, 거리 제곱의 합 ∑(xi−c)2\sum(x_i - c)^2을 가장 작게 하는 c는 평균입니다. 후보 c=c = 를 움직여 보세요(그래프의 노란 점도 끌 수 있습니다).

거리의 합 Σ|xᵢ − c|. 꺾인 직선들로 이루어져 있고, 바닥이 중앙값입니다.
거리 제곱의 합 Σ(xᵢ − c)². 매끄러운 포물선⁠(parabola)⁠이고, 바닥이 평균입니다.

첫 번째 그래프는 꺾인 직선들입니다. c를 오른쪽으로 조금 옮기면 c보다 왼쪽의 점들과는 멀어지고 오른쪽의 점들과는 가까워지므로, 기울기⁠(slope)⁠는 (왼쪽 점의 수) − (오른쪽 점의 수) = 입니다. 기울기가 음수에서 양수로 바뀌는 곳, 곧 양쪽 개수가 같아지는 곳이 바닥이고 그것이 중앙값입니다. 두 번째 그래프는 매끄러운 포물선이라 미분⁠(differentiation)⁠해서 0으로 놓으면 −2∑(xi−c)=0-2\sum(x_i - c) = 0, 곧 c가 평균일 때 가장 작다는 것이 바로 나옵니다(최적화⁠, optimization⁠). 그 최솟값을 개수로 나눈 것이 분산⁠(variance)⁠입니다. 값이 짝수 개면 가운데 두 값 사이 전체가 평평한 바닥이 되어 그 사이 어느 c든 최소이고, 보통 두 값의 평균을 중앙값이라 부릅니다.

이 차이는 직선 맞추기로 그대로 이어집니다. 세로 오차의 제곱 합을 줄이는 최소제곱 회귀⁠(least-squares regression)⁠는 정사영⁠(orthogonal projection)⁠ 한 번으로 풀리지만 이상값 하나에 크게 끌려가고, 절댓값⁠(absolute value)⁠ 합을 줄이는 직선은 강건한 대신 공식이 아니라 반복 계산으로 찾아야 합니다. 최소제곱⁠(least squares)⁠이 자리 잡기 전인 18세기에, 크로아티아 출신 예수회 학자 루제르 보스코비치(1757년, 지구 모양 측량 자료)와 라플라스는 절댓값 합을 기준으로 쓰기도 했습니다.

확률분포⁠(probability distribution)⁠의 중앙값. 확률변수⁠(random variable)⁠ X에서는 P(X≤m)≥12P(X \le m) \ge \tfrac12이고 P(X≥m)≥12P(X \ge m) \ge \tfrac12인 m이 중앙값입니다(확률⁠, probability⁠). 정규분포⁠(normal distribution)⁠처럼 좌우 대칭이면 평균과 같지만, 기다리는 시간처럼 오른쪽 꼬리가 긴 지수분포⁠(exponential distribution)⁠에서는 중앙값이 평균의 ln⁡2≈0.69\ln 2 \approx 0.69배입니다(자연로그⁠, natural logarithm⁠). 분포의 중앙값이 하나로 정해져 있다면, 표본⁠(sample)⁠의 중앙값도 큰 수의 법칙⁠(law of large numbers)⁠의 평균처럼 표본이 커질수록 그 값에 다가갑니다.

수직선 위 여러 곳에 흙이 쌓여 있고 이것을 한 곳에 모두 모은다면, 옮기는 양 × 거리의 합이 가장 작은 곳이 중앙값입니다(첫 번째 그래프가 바로 그 비용입니다). 흙더미를 한 점이 아니라 다른 모양의 흙더미로 옮기는 문제로 넓혀, 분포 전체를 다른 분포로 옮기는 최소 비용을 따지는 것이 최적 수송⁠(optimal transport)⁠입니다.

평면이나 더 높은 차원에서도 같은 일이 일어납니다. 가로 거리와 세로 거리를 더한 맨해튼 거리⁠(Manhattan distance)⁠로 재면, 모든 점까지의 거리 합이 가장 작은 점은 x좌표들의 중앙값과 y좌표들의 중앙값을 따로 구해 짝지은 점입니다. 맨해튼 거리는 좌표마다의 절댓값 거리를 더한 것이라 좌표마다 따로 가장 작게 하면 되기 때문입니다.

중앙값을 구하는 가장 쉬운 방법은 값들을 정렬하는 것이지만, 더 빠른 방법이 있습니다. 퀵정렬⁠(quicksort)⁠처럼 기준값 하나를 골라 그보다 작은 값과 큰 값으로 나눈 뒤, 중앙값이 들어 있는 쪽만 계속 파고드는 것입니다. 1961년 토니 호어가 내놓은 이 방법(퀵셀렉트⁠, quickselect⁠)은 평균적으로 값의 개수 n에 비례하는 걸음(O(n)O(n), 점근 표기법⁠(asymptotic notation)⁠)이면 끝납니다. 값이 하나씩 들어올 때는, 가장 큰 값이나 가장 작은 값을 곧바로 꺼낼 수 있는 자료 구조인 힙⁠(heap)⁠ 두 개에 아래 절반과 위 절반을 나눠 담아 두면 중앙값을 언제든 곧바로 꺼낼 수 있습니다.

이 개념이 나오는 큰 생각가장 좋은 것 고르기

이 개념이 나오는 긴 글

최소제곱과 선형대수 잃어버린 소행성 1801년, 발견 몇 주 만에 태양 뒤로 사라진 세레스. 스물네 살의 가우스는 흩어진 관측값에서 궤도를 되찾았다. 거리와 유사도 까마귀와 택시 까마귀는 곧장 날고 택시는 블록을 돌아간다. '얼마나 먼가'에는 답이 하나가 아니고, 어떤 거리를 고르느냐가 통계와 기계 학습의 답을 바꾼다. 알고리즘과 복잡도 줄 세우기의 한계 카드 천 장을 가장 빨리 줄 세우는 방법은? 인구조사의 천공 카드에서 퀵정렬까지, 그리고 어떤 방법도 넘을 수 없는 n log n의 벽. 측정의 수학 재는 순간 바뀐다 해안선의 길이는 자에 따라, 평균은 누구에게 묻느냐에 따라, 지표는 목표가 되는 순간 달라진다. 리처드슨의 국경과 프랙털 차원, 스티븐스의 척도, 버스 정류장과 타율의 역설, 스피어먼의 요인, 굿하트의 법칙과 보상 해킹을 한 줄로 꿴다. 불가능성 정리 불가능의 증명 각의 삼등분, 5차방정식의 근의 공식, 모든 파일을 줄이는 압축, 멈춤을 판정하는 프로그램, 공정한 투표 규칙. 없다는 것은 어떻게 증명할까? 서로 먼 분야의 불가능성 증명들은 거의 모두 불변량, 세기, 대각선이라는 세 가지 무기 가운데 하나를 쓴다.

이 개념을 언급하는 페이지

이 페이지가 가리키는 개념