수학 개념 지도
확률과 통계(Probability and statistics)

통계학(Statistics)

자료를 모아 몇 개의 수로 요약하고, 일부(표본⁠, sample⁠)를 보고 전체(모집단⁠, population⁠)를 짐작하며, 눈에 보이는 차이가 우연인지 가리는 학문. 답과 함께 그 답이 얼마나 틀릴 수 있는지를 말하는 것이 핵심이다.

xˉ=1n∑i=1nxi,p^±1.96p^ (1−p^)n\bar x = \frac{1}{n}\sum_{i=1}^{n} x_i, \qquad \hat p \pm 1.96\sqrt{\frac{\hat p\,(1-\hat p)}{n}}
먼저 보면 좋은 개념확률기댓값분산과 표준편차

1662년 런던의 상인 존 그랜트는 얇은 책 한 권을 냈습니다. 런던의 교구들은 16세기 말부터 역병을 감시하려고 매주 세례와 장례의 수를 적은 사망표⁠(bills of mortality)⁠를 내고 있었고 1629년부터는 사인⁠(sine)⁠도 적었는데, 그랜트는 수십 년 치 사망표를 모아 표로 정리했습니다. 누가 언제 죽을지는 아무도 모르지만, 도시 전체로 보면 해마다 태어나는 아이 가운데 남자아이가 여자아이보다 조금 많았고(그는 대략 14 대 13으로 셌습니다), 사인별 사망의 비율도 해마다 놀랄 만큼 일정했습니다. 한 사람에 대해서는 말할 수 없는 것을 많은 사람에 대해서는 말할 수 있다는 것, 그리고 그 말을 얼마나 믿어도 되는지 재는 것이 통계학의 출발점입니다. 통계학이 하는 일은 크게 셋, 요약하기와 추정하기와 검정하기입니다.

요약하기(기술 통계⁠, descriptive statistics⁠). 한 반 30명의 키를 그대로 늘어놓으면 한눈에 들어오지 않습니다. 그래서 몇 개의 수로 줄입니다. 가운데가 어디인지는 평균(모두 더해 사람 수로 나눈 값)이나 중앙값(순서대로 세웠을 때 한가운데 값)으로, 얼마나 퍼져 있는지는 분산과 표준편차⁠(variance and standard deviation)⁠로, 두 가지 양이 함께 움직이는 정도는 상관계수⁠(correlation coefficient)⁠로 말합니다. 예컨대 '평균⁠(mean)⁠ 165 cm, 표준편차⁠(standard deviation)⁠ 6 cm'라고 하면, 키의 분포가 종 모양에 가까울 때 셋 가운데 둘가량이 159 cm와 171 cm 사이에 있다는 것까지 짐작할 수 있습니다. 다만 요약은 정보를 버립니다. 1973년 통계학자 프랜시스 앤스콤은 평균과 분산⁠(variance)⁠, 상관계수, 회귀 직선(점들 사이를 가장 가깝게 지나는 직선)이 모두 같은데 그림으로 그리면 전혀 다른 자료 네 벌을 만들어 보였습니다. 수로 줄이기 전에 먼저 그림을 그려 보라는 것이 존 튜키가 1977년 『탐색적 자료 분석⁠(exploratory data analysis)⁠』에서 강조한 태도입니다.

추정하기. 알고 싶은 것은 대개 전체에 관한 것입니다. 유권자 4천만 명 가운데 어떤 후보를 지지하는 사람의 비율 같은 것입니다. 이 전체를 모집단이라 하고, 알고 싶은 비율을 p라 합시다. 모두에게 물을 수는 없으니 몇 사람을 뽑아 묻습니다. 이렇게 뽑힌 일부를 표본이라 하고, 표본 n명 가운데 지지하는 사람의 비율을 p^\hat p('피 햇'이라 읽습니다)라 씁니다. 표본을 다시 뽑으면 p^\hat p도 달라집니다. 이처럼 뽑을 때마다 우연에 따라 값이 달라지는 양을 확률변수⁠(random variable)⁠라 합니다.

그러면 p^\hat p는 참값 p 둘레에서 얼마나 흔들릴까요? 사람을 무작위로 뽑았다고 합시다. 한 사람의 답을 지지하면 1, 아니면 0으로 적으면, 이 값의 평균은 p이고 제곱의 평균도 p(1² = 1, 0² = 0이므로)이니 분산은 p−p2=p(1−p)p - p^2 = p(1-p)입니다. p^\hat p는 서로 독립⁠(independence)⁠인 n개의 답을 평균한 것이고, 독립인 값 n개를 평균하면 분산이 n분의 1로 줄어 p(1−p)/np(1-p)/n가 됩니다. 표준편차는 분산의 제곱근이므로 p(1−p)/n\sqrt{p(1-p)/n}입니다. 게다가 n이 충분히 크면 중심극한정리⁠(central limit theorem)⁠에 따라 p^\hat p는 참값 p를 가운데 둔 종 모양(정규분포⁠, normal distribution⁠)에 가깝게 흩어집니다.

종 모양에서는 가운데에서 표준편차의 1.96배 안에 전체의 95%가 들어갑니다. 그러니 p^\hat p에서 양쪽으로 표준편차의 1.96배만큼 벌린 구간을 만들면 됩니다. 다만 p를 모르니 표준편차 식의 p 자리에 p^\hat p를 넣습니다. 이것이 위의 식이고, 이런 구간을 신뢰구간⁠(confidence interval)⁠이라 합니다. 숫자로 해 봅시다. p(1−p)p(1-p)는 p = 0.5에서 0.5 × 0.5 = 0.25로 가장 큽니다. 그러니 1,000명에게 물었다면 표준편차는 많아야 0.25/1000=0.00025≈0.0158\sqrt{0.25/1000} = \sqrt{0.00025} \approx 0.0158이고, 여기에 1.96을 곱하면 1.96×0.0158≈0.0311.96 \times 0.0158 \approx 0.031, 백분율로 3.1%포인트입니다. 지지율이 40%로 나왔다면 대략 37%에서 43% 사이라는 뜻입니다. 뉴스에서 말하는 '오차 범위 ±3.1%포인트'가 바로 이 값입니다.

아래 그림에서 실제 지지율은 40%로 정해 두었지만 조사하는 사람은 그 값을 모릅니다. 한 번에 n = 명씩 무작위로 물어 95% 신뢰구간을 만드는 조사를 50번 되풀이했습니다. 다시 조사하기

가로줄 하나가 조사 한 번의 신뢰구간이고, 가운데 점이 그 조사의 비율입니다. 청록 구간은 참값 40%(노란 선)를 품었고, 분홍 구간은 놓쳤습니다.

지금 50개 가운데 개가 참값을 품었습니다. '95%'의 정확한 뜻이 여기 있습니다. 이 방법으로 조사를 되풀이하면 만들어지는 구간 가운데 약 95%가 참값을 품는다는 것입니다. 이미 만들어진 구간 하나는 참값을 품었거나 놓쳤거나 둘 중 하나이고, 우리는 어느 쪽인지 모를 뿐입니다. n을 네 배로 늘리면 구간의 폭은 절반이 됩니다. 폭이 1/n1/\sqrt n(n의 제곱근 분의 1)에 비례하고 4=2\sqrt 4 = 2이기 때문입니다. 지금 n에서 오차 범위, 다시 말해 가운데 점에서 구간 한쪽 끝까지의 거리는 약 입니다. 이 값은 참값 40%를 넣어 계산한 것이고, 각 조사는 자기 p^\hat p를 넣으므로 줄마다 조금씩 다릅니다. 흔히 전체가 클수록 더 많이 물어야 한다고 생각하지만, 모집단이 10만 명이든 4천만 명이든 표본이 전체의 작은 몫이기만 하면 폭은 거의 같습니다. 정확도를 정하는 것은 뽑은 사람의 수이지 전체에서 차지하는 몫이 아닙니다. 더 무서운 것은 뽑는 방법의 치우침입니다. 1936년 미국 대선에서 잡지 『리터러리 다이제스트』는 240만 명의 응답으로 공화당 랜던의 승리를 예측했지만, 명단을 전화번호부와 자동차 등록부에서 뽑았고 응답한 사람들도 한쪽으로 쏠려 있었습니다. 훨씬 적은 수를 성별과 지역, 소득별로 고르게 나누어 뽑은 조지 갤럽은 루스벨트의 승리를 맞혔습니다. 표본이 아무리 커도 치우침은 줄지 않습니다.

검정하기. 1710년 스코틀랜드 출신 의사 존 아버스넛은 그랜트의 뒤를 이어 런던의 세례 기록을 살폈습니다. 1629년부터 1710년까지 82년 동안 한 해도 빠짐없이 남자아이가 여자아이보다 많이 태어났습니다. 해마다 어느 쪽이 많은지가 동전 던지기처럼 반반이라면 82년 내리 남자 쪽일 확률⁠(probability)⁠은 (1/2)82≈2×10−25(1/2)^{82} \approx 2 \times 10^{-25}입니다. 그러니 우연이 아니라고 그는 결론지었습니다. 이것이 흔히 기록에 남은 첫 유의성 검정⁠(significance test)⁠으로 꼽힙니다. 논리는 이렇습니다. 먼저 '특별한 것은 없다'는 가설(귀무가설⁠, null hypothesis⁠)을 세우고, 그 가설이 옳다면 지금 본 것만큼 또는 그보다 더 치우친 결과가 나올 확률을 계산합니다. 이 확률을 p값이라 합니다. 아버스넛이 계산한 (1/2)82(1/2)^{82}가 바로 p값입니다. 다만 그는 남자 쪽으로 치우친 한쪽만 셌습니다.

동전을 100번 던졌더니 앞면이 번 나왔습니다. 동전이 공정하다는 가설 아래에서의 분포를 그렸습니다.

공정한 동전을 100번 던질 때 앞면 수의 분포(이항분포⁠, binomial distribution⁠). 분홍 막대는 지금 결과만큼 또는 더 50에서 먼 결과들이고, 그 높이의 합이 p값입니다.

60번이면 p값⁠(p-value)⁠이 약 0.057, 61번이면 약 0.035입니다. 로널드 피셔는 1925년 p값이 0.05(스무 번에 한 번)보다 작으면 우연으로 보기 어렵다고 여기는 것이 편리하다고 썼고, 이 기준이 널리 퍼졌습니다. 조심할 것이 있습니다. p값은 '동전이 공정할 확률'이 아닙니다. 동전이 공정하다고 가정했을 때 이런 결과가 나올 확률입니다. 또 p값이 크다고 가설이 옳다는 뜻도 아닙니다. 차이가 있어도 표본이 작으면 드러나지 않습니다. 1930년대 칼 피어슨의 아들 이건 피어슨과 폴란드계 수학자 예지 네이만은 검정을 '결정 규칙'으로 다시 세웠습니다. 옳은 가설을 버리는 잘못(1종 오류⁠, type I error⁠)과 틀린 가설을 못 버리는 잘못(2종 오류⁠, type II error⁠)을 함께 따져, 앞의 잘못이 일어날 확률을 미리 정해 둔 수준(흔히 5%) 이하로 묶어 둔 채 뒤의 잘못이 일어날 확률을 가장 작게 하는 규칙을 고르는 것입니다. 네이만은 1937년 신뢰구간의 이론도 세웠습니다.

역사. '통계'라는 말은 18세기 독일에서 나라의 인구와 재정을 기술하는 학문을 부르던 Statistik에서 왔습니다. 그러나 수학의 뼈대는 두 갈래에서 따로 자라 20세기 초에 만났습니다.

첫째 갈래는 도박과 천문학입니다. 도박에서 나온 물음은 '동전을 많이 던지면 앞면의 비율은 어떻게 되는가'였습니다. 야코프 베르누이는 1713년 유고에서 던지는 횟수가 늘수록 표본의 비율이 참값에 다가간다는 큰 수의 법칙⁠(law of large numbers)⁠을 증명했습니다. 드무아브르는 1733년 그 비율이 참값 둘레에 어떻게 흩어지는지를 종 모양 곡선으로 어림했습니다. 천문학에서 나온 물음은 '같은 별의 위치를 여러 번 쟀더니 값이 조금씩 다를 때 무엇을 믿을까'였습니다. 르장드르(1805)와 가우스(1809)는 관측값과의 어긋남을 제곱해 모두 더한 값이 가장 작아지도록 답을 고르는 최소제곱법⁠(method of least squares)⁠을 내놓았습니다. 라플라스는 작은 오차가 많이 더해지면 종 모양 곡선이 된다는 것을 보여 이 방법을 확률로 떠받쳤습니다. 그러자 이 '오차의 곡선'이 사람에게도 들어맞는지 묻는 사람이 나왔습니다. 벨기에의 천문학자 아돌프 케틀레는 1835년 사람들의 키 같은 특징을 평균 낸 '평균적 인간'을 말했고, 1846년에는 스코틀랜드 병사 5,738명의 가슴둘레가 오차 곡선을 따른다고 보였습니다.

둘째 갈래는 유전입니다. 케틀레의 곡선은 한 세대 안의 흩어짐만 말했습니다. 19세기 말 프랜시스 골턴은 이 흩어짐이 부모에서 자식으로 어떻게 넘어가는지 물었고, 부모와 자식의 키에서 평균으로의 회귀⁠(regression to the mean)⁠와 상관을 찾았습니다. 칼 피어슨은 상관계수를 다듬었고, 1900년에는 관측한 개수가 이론이 예측한 개수와 얼마나 어긋나는지 재는 카이제곱 검정⁠(chi-squared test)⁠을 만들었습니다. 이듬해에는 골턴, 웰던과 함께 학술지 『바이오메트리카』를 세웠습니다.

두 갈래는 농업과 산업의 현장에서 만났습니다. 기네스 양조장의 윌리엄 고셋은 원료를 몇 번밖에 시험할 수 없었습니다. 그는 1908년 '스튜던트'라는 필명으로, 작은 표본의 평균이 얼마나 흔들리는지 알려 주는 t분포⁠(t-distribution)⁠를 발표했습니다. 1920–30년대 로담스테드 농업 시험장의 피셔는 밭마다 흙이 달라 비료의 효과가 가려지는 문제와 씨름했습니다. 그 과정에서 최대가능도법(지금 본 자료가 나올 확률을 가장 크게 만드는 값을 답으로 고르는 방법), 분산분석(자료의 흩어짐을 원인별 몫으로 나누는 방법), 무작위 배정⁠(random assignment)⁠과 라틴 방진⁠(Latin square)⁠을 쓰는 실험 설계를 만들었고, 이것들로 통계학을 하나의 학문으로 묶었습니다(골턴 연구소와 로담스테드). 같은 무렵 인도의 마할라노비스는 1931년 인도 통계 연구소를 세워 나라 규모의 표본 조사⁠(sample survey)⁠를 이끌었습니다.

원인을 캐는 일도 통계학의 몫이 되었습니다. 1854년 존 스노는 집집이 조사해, 콜레라 사망자들이 런던 브로드가의 한 급수⁠(series)⁠ 펌프 둘레에 몰려 있음을 지도로 보였습니다. 1948년 오스틴 브래드퍼드 힐은 환자를 무작위로 두 무리로 나눈 시험으로 결핵약 스트렙토마이신의 효과를 확인했습니다(무작위 대조 시험⁠, randomized controlled trial⁠). 1950년에는 리처드 돌과 함께 흡연과 폐암의 관계를 밝혔습니다. 사람에게 담배를 억지로 피우게 할 수는 없으니, 이런 연구는 무작위로 나누지 못한 채 관찰만 합니다. 그래서 담배 말고 다른 원인이 흡연과 폐암을 함께 움직였을 가능성(교란 변수⁠, confounding variable⁠)을 늘 따져야 합니다.

컴퓨터가 나오자 계산이 이론을 대신하기 시작했습니다. 난수로 분포를 흉내 내는 몬테카를로 방법⁠(Monte Carlo method)⁠이 그 하나이고, 1979년 브래들리 에프런이 내놓은 붓스트랩(표본에서 다시 표본을 뽑아 흩어짐을 재는 방법)이 또 하나입니다. 마르코프 연쇄⁠(Markov chain)⁠로 복잡한 사후 분포(자료를 본 뒤의 믿음)에서 표본을 뽑는 계산도 가능해졌습니다. 덕분에 18세기 토머스 베이즈의 이름이 붙은 베이즈 추론이 되살아났습니다. 주디아 펄의 인과 그래프⁠(causal graph)⁠는 실험 없이도 인과⁠(causation)⁠를 말할 수 있는 조건을 따졌습니다.

이 위키의 통계 페이지들.

이어지는 곳.

이 개념이 나오는 큰 생각선형화: 휘어진 것을 곧게 보기

이 개념이 나오는 긴 글

확률 도박판에서 온 편지 1654년, 도중에 멈춘 내기의 판돈을 어떻게 나눌까? 두 수학자가 주고받은 편지에서 확률론이 태어났다. 통계와 인과 담배와 폐암 상관관계는 인과관계가 아니라고들 한다. 그렇다면 담배가 폐암을 일으킨다는 것은 어떻게 알게 되었을까? 거리와 유사도 까마귀와 택시 까마귀는 곧장 날고 택시는 블록을 돌아간다. '얼마나 먼가'에는 답이 하나가 아니고, 어떤 거리를 고르느냐가 통계와 기계 학습의 답을 바꾼다.

이 개념을 언급하는 페이지

이 페이지가 가리키는 개념