통계학(Statistics)
자료를 모아 몇 개의 수로 요약하고, 일부(표본, sample)를 보고 전체(모집단, population)를 짐작하며, 눈에 보이는 차이가 우연인지 가리는 학문. 답과 함께 그 답이 얼마나 틀릴 수 있는지를 말하는 것이 핵심이다.
1662년 런던의 상인 존 그랜트는 얇은 책 한 권을 냈습니다. 런던의 교구들은 16세기 말부터 역병을 감시하려고 매주 세례와 장례의 수를 적은 사망표(bills of mortality)를 내고 있었고 1629년부터는 사인(sine)도 적었는데, 그랜트는 수십 년 치 사망표를 모아 표로 정리했습니다. 누가 언제 죽을지는 아무도 모르지만, 도시 전체로 보면 해마다 태어나는 아이 가운데 남자아이가 여자아이보다 조금 많았고(그는 대략 14 대 13으로 셌습니다), 사인별 사망의 비율도 해마다 놀랄 만큼 일정했습니다. 한 사람에 대해서는 말할 수 없는 것을 많은 사람에 대해서는 말할 수 있다는 것, 그리고 그 말을 얼마나 믿어도 되는지 재는 것이 통계학의 출발점입니다. 통계학이 하는 일은 크게 셋, 요약하기와 추정하기와 검정하기입니다.
요약하기(기술 통계, descriptive statistics). 한 반 30명의 키를 그대로 늘어놓으면 한눈에 들어오지 않습니다. 그래서 몇 개의 수로 줄입니다. 가운데가 어디인지는 평균(모두 더해 사람 수로 나눈 값)이나 중앙값(순서대로 세웠을 때 한가운데 값)으로, 얼마나 퍼져 있는지는 분산과 표준편차(variance and standard deviation)로, 두 가지 양이 함께 움직이는 정도는 상관계수(correlation coefficient)로 말합니다. 예컨대 '평균(mean) 165 cm, 표준편차(standard deviation) 6 cm'라고 하면, 키의 분포가 종 모양에 가까울 때 셋 가운데 둘가량이 159 cm와 171 cm 사이에 있다는 것까지 짐작할 수 있습니다. 다만 요약은 정보를 버립니다. 1973년 통계학자 프랜시스 앤스콤은 평균과 분산(variance), 상관계수, 회귀 직선(점들 사이를 가장 가깝게 지나는 직선)이 모두 같은데 그림으로 그리면 전혀 다른 자료 네 벌을 만들어 보였습니다. 수로 줄이기 전에 먼저 그림을 그려 보라는 것이 존 튜키가 1977년 『탐색적 자료 분석(exploratory data analysis)』에서 강조한 태도입니다.
추정하기. 알고 싶은 것은 대개 전체에 관한 것입니다. 유권자 4천만 명 가운데 어떤 후보를 지지하는 사람의 비율 같은 것입니다. 이 전체를 모집단이라 하고, 알고 싶은 비율을 p라 합시다. 모두에게 물을 수는 없으니 몇 사람을 뽑아 묻습니다. 이렇게 뽑힌 일부를 표본이라 하고, 표본 n명 가운데 지지하는 사람의 비율을
그러면
종 모양에서는 가운데에서 표준편차의 1.96배 안에 전체의 95%가 들어갑니다. 그러니
아래 그림에서 실제 지지율은 40%로 정해 두었지만 조사하는 사람은 그 값을 모릅니다. 한 번에 n =
지금 50개 가운데
검정하기. 1710년 스코틀랜드 출신 의사 존 아버스넛은 그랜트의 뒤를 이어 런던의 세례 기록을 살폈습니다. 1629년부터 1710년까지 82년 동안 한 해도 빠짐없이 남자아이가 여자아이보다 많이 태어났습니다. 해마다 어느 쪽이 많은지가 동전 던지기처럼 반반이라면 82년 내리 남자 쪽일 확률(probability)은
동전을 100번 던졌더니 앞면이
역사. '통계'라는 말은 18세기 독일에서 나라의 인구와 재정을 기술하는 학문을 부르던 Statistik에서 왔습니다. 그러나 수학의 뼈대는 두 갈래에서 따로 자라 20세기 초에 만났습니다.
첫째 갈래는 도박과 천문학입니다. 도박에서 나온 물음은 '동전을 많이 던지면 앞면의 비율은 어떻게 되는가'였습니다. 야코프 베르누이는 1713년 유고에서 던지는 횟수가 늘수록 표본의 비율이 참값에 다가간다는 큰 수의 법칙(law of large numbers)을 증명했습니다. 드무아브르는 1733년 그 비율이 참값 둘레에 어떻게 흩어지는지를 종 모양 곡선으로 어림했습니다. 천문학에서 나온 물음은 '같은 별의 위치를 여러 번 쟀더니 값이 조금씩 다를 때 무엇을 믿을까'였습니다. 르장드르(1805)와 가우스(1809)는 관측값과의 어긋남을 제곱해 모두 더한 값이 가장 작아지도록 답을 고르는 최소제곱법(method of least squares)을 내놓았습니다. 라플라스는 작은 오차가 많이 더해지면 종 모양 곡선이 된다는 것을 보여 이 방법을 확률로 떠받쳤습니다. 그러자 이 '오차의 곡선'이 사람에게도 들어맞는지 묻는 사람이 나왔습니다. 벨기에의 천문학자 아돌프 케틀레는 1835년 사람들의 키 같은 특징을 평균 낸 '평균적 인간'을 말했고, 1846년에는 스코틀랜드 병사 5,738명의 가슴둘레가 오차 곡선을 따른다고 보였습니다.
둘째 갈래는 유전입니다. 케틀레의 곡선은 한 세대 안의 흩어짐만 말했습니다. 19세기 말 프랜시스 골턴은 이 흩어짐이 부모에서 자식으로 어떻게 넘어가는지 물었고, 부모와 자식의 키에서 평균으로의 회귀(regression to the mean)와 상관을 찾았습니다. 칼 피어슨은 상관계수를 다듬었고, 1900년에는 관측한 개수가 이론이 예측한 개수와 얼마나 어긋나는지 재는 카이제곱 검정(chi-squared test)을 만들었습니다. 이듬해에는 골턴, 웰던과 함께 학술지 『바이오메트리카』를 세웠습니다.
두 갈래는 농업과 산업의 현장에서 만났습니다. 기네스 양조장의 윌리엄 고셋은 원료를 몇 번밖에 시험할 수 없었습니다. 그는 1908년 '스튜던트'라는 필명으로, 작은 표본의 평균이 얼마나 흔들리는지 알려 주는 t분포(t-distribution)를 발표했습니다. 1920–30년대 로담스테드 농업 시험장의 피셔는 밭마다 흙이 달라 비료의 효과가 가려지는 문제와 씨름했습니다. 그 과정에서 최대가능도법(지금 본 자료가 나올 확률을 가장 크게 만드는 값을 답으로 고르는 방법), 분산분석(자료의 흩어짐을 원인별 몫으로 나누는 방법), 무작위 배정(random assignment)과 라틴 방진(Latin square)을 쓰는 실험 설계를 만들었고, 이것들로 통계학을 하나의 학문으로 묶었습니다(골턴 연구소와 로담스테드). 같은 무렵 인도의 마할라노비스는 1931년 인도 통계 연구소를 세워 나라 규모의 표본 조사(sample survey)를 이끌었습니다.
원인을 캐는 일도 통계학의 몫이 되었습니다. 1854년 존 스노는 집집이 조사해, 콜레라 사망자들이 런던 브로드가의 한 급수(series) 펌프 둘레에 몰려 있음을 지도로 보였습니다. 1948년 오스틴 브래드퍼드 힐은 환자를 무작위로 두 무리로 나눈 시험으로 결핵약 스트렙토마이신의 효과를 확인했습니다(무작위 대조 시험, randomized controlled trial). 1950년에는 리처드 돌과 함께 흡연과 폐암의 관계를 밝혔습니다. 사람에게 담배를 억지로 피우게 할 수는 없으니, 이런 연구는 무작위로 나누지 못한 채 관찰만 합니다. 그래서 담배 말고 다른 원인이 흡연과 폐암을 함께 움직였을 가능성(교란 변수, confounding variable)을 늘 따져야 합니다.
컴퓨터가 나오자 계산이 이론을 대신하기 시작했습니다. 난수로 분포를 흉내 내는 몬테카를로 방법(Monte Carlo method)이 그 하나이고, 1979년 브래들리 에프런이 내놓은 붓스트랩(표본에서 다시 표본을 뽑아 흩어짐을 재는 방법)이 또 하나입니다. 마르코프 연쇄(Markov chain)로 복잡한 사후 분포(자료를 본 뒤의 믿음)에서 표본을 뽑는 계산도 가능해졌습니다. 덕분에 18세기 토머스 베이즈의 이름이 붙은 베이즈 추론이 되살아났습니다. 주디아 펄의 인과 그래프(causal graph)는 실험 없이도 인과(causation)를 말할 수 있는 조건을 따졌습니다.
이 위키의 통계 페이지들.
- 바탕이 되는 확률: 확률, 조건부 확률(conditional probability), 확률변수, 기댓값(expected value), 분산.
- 자주 만나는 분포: 이항분포와 정규분포. 표본이 커질 때 일어나는 일은 큰 수의 법칙과 중심극한정리가 말합니다.
- 요약: 중앙값(median)과 상관관계(correlation). 변수가 여럿일 때의 요약은 주성분 분석(principal component analysis)과 마할라노비스 거리(Mahalanobis distance)가 이어받습니다.
- 추정: 최대가능도법(maximum likelihood), 최소제곱 회귀(least-squares regression), 베이즈 정리(Bayes' theorem).
- 실험과 인과: 무작위 대조 시험, 라틴 방진, 교란 변수, 심슨의 역설(Simpson's paradox), 평균으로의 회귀.
- 계산으로 하는 통계: 몬테카를로 방법과 마르코프 연쇄. 자료에서 규칙을 배우는 쪽은 기계 학습(machine learning)입니다.
이어지는 곳.
- 통계학과 기계 학습은 같은 질문을 다른 말투로 묻습니다. '본 자료에서 보지 못한 자료로 얼마나 넓혀 말할 수 있는가'입니다.
- 모형이 자료를 얼마나 잘 설명하는지는 쿨백–라이블러 발산(Kullback–Leibler divergence)과 엔트로피(entropy) 같은 정보의 양으로도 잽니다.
- 편향–분산 분해(bias–variance decomposition)는 모형이 복잡할수록 표본마다 크게 흔들린다는 것을, 교차 검증(cross-validation)은 떼어 둔 자료로 새 자료에서의 오차를 어림하는 법을 다룹니다. 두 분야가 함께 쓰는 도구입니다.
- 우연을 일부러 끌어들여 치우침을 끊는 생각은 무작위성에서 다른 분야와 만납니다.
- 답과 함께 틀림의 크기를 말하는 태도는 근사와 오차에서 다른 분야와 만납니다.
이 개념이 나오는 긴 글
이 개념을 언급하는 페이지
- 베이즈 정리
… 깨지기 쉽습니다. 확률을 "증거에 따라 갱신되는 믿음"으로 읽는 이 관점을 베이즈 통계라고 부르며, 오늘날통계학과 기계 학습의 큰 기둥입니다. 관측 하나가 두 가설 가운데 한쪽으로 믿음을 평균적으로 얼마나 밀어 …
- 상관관계
… 1896년 칼 피어슨이 지금의 식으로 다듬었습니다. 그래서 '피어슨 상관계수'라고도 부르며, 근대통계학의 첫 도구 가운데 하나가 되었습니다. 상관계수는 회귀 직선의 기울기가 아닙니다. y의 단위를 바꿔 …
- 확률변수
… 서로에 대해 알려 주는 양이 상호 정보량입니다. 자료를 보고 확률변수의 분포를 거꾸로 짐작하는 것이통계학, 특히 최대가능도법의 일입니다.
- 최대가능도법
… 무게가 되고, 참인 가설 아래에서 잰 그 로그의 평균이 쿨백–라이블러 발산입니다. 추정 전반은통계학에서, 자료에서 규칙을 배우는 넓은 틀은 기계 학습에서 이어집니다.
- 기계 학습
… 곧 본 것에서 보지 못한 것으로 어떻게 넓혀 갈지에 대한 서로 다른 답입니다. 이 점에서 기계 학습은통계학과 한 뿌리입니다. 역사. 1943년 워런 맥컬러와 월터 피츠는 뉴런을 켜짐과 꺼짐만 있는 논리 …
- 인공지능
… 기댄 서포트 벡터 머신, 그리고 결정 트리와 랜덤 포레스트 같은 방법이었습니다. 이렇게 인공지능은통계학과 가까워졌습니다. 한편 1997년 5월 IBM의 딥 블루가 가리 카스파로프를 3.5 대 2.5로 이긴 …