수학 개념 지도
확률과 통계(Probability and statistics)

평균으로의 회귀(Regression to the mean)

극단적인 값이 나온 다음에는 평균⁠(mean)⁠에 더 가까운 값이 나오기 쉬운 현상. 두 측정의 상관이 완전하지 않으면 언제나 생기며, 어떤 힘이나 원인이 아니다.

E[X2∣X1=x]=μ+ρ (x−μ)\mathbb{E}[X_2 \mid X_1 = x] = \mu + \rho\,(x - \mu)
먼저 보면 좋은 개념상관관계정규분포

학생 600명이 시험을 두 번 봤습니다. 점수가 %의 학생을 골라 보면, 그들의 1차 평균은 점, 2차 평균은 점입니다. 두 시험 사이에 아무것도 가르치지 않았는데, 다른 시험의 평균이 전체 평균 50점 쪽으로 돌아와 있습니다. 다시 뽑기

점 하나가 학생 한 명입니다. 노란 점이 고른 학생, 분홍 점이 그들의 평균, 점선은 두 점수가 같은 대각선, 청록 직선은 회귀 직선입니다.

점수를 실력과 운의 합이라고 생각해 봅시다. 극단적으로 높은 점수를 받은 학생은 실력도 좋았겠지만 대개 운도 좋았습니다. 실력은 다음 시험까지 남아 있어도 운은 따라오지 않으니, 다음 점수는 평균 쪽으로 물러납니다. 얼마나 물러나는지는 두 시험 점수의 상관계수⁠(correlation coefficient)⁠ ρ=\rho = 가 정합니다. 이 모형에서 ρ는 점수의 분산⁠(variance)⁠ 가운데 실력이 차지하는 몫입니다. 두 점수가 함께 정규분포⁠(normal distribution)⁠를 따르고 둘 다 평균 50, 표준편차⁠(standard deviation)⁠ 10이면, 1차 점수가 x인 학생들의 2차 점수의 기댓값⁠(expected value)⁠은 조건부 평균

E[X2∣X1=x]=50+ρ (x−50)\mathbb{E}[X_2 \mid X_1 = x] = 50 + \rho\,(x - 50)

입니다. 평균에서 벗어난 거리가 평균적으로 ρ배로 줄어든다는 뜻이고(개인마다는 더 멀어질 수도 있습니다), 고른 학생들에 대해 이 식이 예측하는 다른 시험의 평균은 점입니다. 그림의 청록 직선이 바로 이 식, 곧 회귀 직선이고, 기울기⁠(slope)⁠가 ρ < 1이라 대각선보다 완만합니다. ρ = 1이면(운이 없으면) 전혀 돌아오지 않고, ρ = 0이면(모두 운이면) 완전히 평균으로 돌아갑니다.

기준을 2차 시험으로 바꿔 보세요. 2차 시험에서 뛰어났던 학생들을 고르면, 이번에는 그들의 1차 점수가 평균 쪽에 있습니다. 시간을 거꾸로 거슬러도 똑같이 일어나니, 평균으로의 회귀는 무언가를 끌어당기는 힘이 아닙니다. 극단을 골라냈다는 사실이 만든 통계적 현상입니다. 전체 분포의 폭도 줄지 않습니다. 개인들이 평균으로 모이는 것이 아니라, 극단의 자리를 매번 다른 사람들이 채울 뿐입니다.

이 현상은 원인을 착각하게 만듭니다. 성적이 가장 나빴던 학생들에게 보충 수업을 하면, 수업이 쓸모없어도 다음 점수는 대개 오릅니다. 증상이 가장 심할 때 병원을 찾은 환자는 어떤 치료를 받든 대개 나아집니다. 크게 칭찬받은 다음에는 성과가 떨어지고 꾸중 들은 다음에는 오르는 것처럼 보이기도 합니다. 효과를 가려내려면 똑같이 골랐지만 처치를 받지 않은 비교 집단이 있어야 하고, 그것이 무작위 대조 시험⁠(randomized controlled trial)⁠의 대조군입니다.

이름은 1880년대 프랜시스 골턴의 유전 연구에서 왔습니다. 그는 키가 아주 큰 부모의 자녀가 평균적으로 부모보다는 작다는 것을 보고 평균으로 '되돌아간다'고 불렀고, 그때 쓴 직선에 회귀 직선이라는 이름이 남았습니다.

이어지는 곳. 평균으로의 회귀는 큰 수의 법칙⁠(law of large numbers)⁠과 다릅니다. 동전은 앞면이 많이 나왔다고 뒷면으로 '갚지' 않습니다. 회귀는 이미 나온 극단을 보상하는 것이 아니라, 다음 값이 원래 분포에서 새로 나오기 때문에 생깁니다. 점수마다 평균을 빼고 표준편차로 나누어 표준화⁠(standardization)⁠한 뒤(평균 0, 표준편차 1로 맞춘 뒤) 학생들의 두 점수를 각각 벡터⁠(vector)⁠로 보면, 회귀 기울기 ρ는 한 벡터를 다른 벡터에 정사영⁠(orthogonal projection)⁠했을 때 줄어드는 배율이고, 두 벡터의 내적⁠(dot product)⁠을 학생 수로 나눈 값입니다. 여기서는 두 점수가 '실력'이라는 공통 요인을 나눠 가져서 상관이 생겼는데, 원인 후보와 결과 사이에 이런 숨은 공통 원인이 끼어들어 가짜 인과⁠(causation)⁠처럼 보이면 교란 변수⁠(confounding variable)⁠의 문제가 됩니다.

이 개념이 나오는 큰 생각무작위성

이 개념이 나오는 긴 글

확률 도박판에서 온 편지 1654년, 도중에 멈춘 내기의 판돈을 어떻게 나눌까? 두 수학자가 주고받은 편지에서 확률론이 태어났다. 최소제곱과 선형대수 잃어버린 소행성 1801년, 발견 몇 주 만에 태양 뒤로 사라진 세레스. 스물네 살의 가우스는 흩어진 관측값에서 궤도를 되찾았다. 통계와 인과 담배와 폐암 상관관계는 인과관계가 아니라고들 한다. 그렇다면 담배가 폐암을 일으킨다는 것은 어떻게 알게 되었을까? 측정의 수학 재는 순간 바뀐다 해안선의 길이는 자에 따라, 평균은 누구에게 묻느냐에 따라, 지표는 목표가 되는 순간 달라진다. 리처드슨의 국경과 프랙털 차원, 스티븐스의 척도, 버스 정류장과 타율의 역설, 스피어먼의 요인, 굿하트의 법칙과 보상 해킹을 한 줄로 꿴다.

이 개념 위에 세워진 것

이 개념을 언급하는 페이지

이 페이지가 가리키는 개념