상관관계(Correlation)
두 변수가 함께 변하는 정도. 상관계수(correlation coefficient) r은 −1에서 1 사이의 수로 직선적인 관계의 세기와 방향을 재며, 인과관계와는 다르다.
공부한 시간과 시험 점수, 키와 몸무게처럼 짝지어진 두 값을 점 하나로 찍은 그림을 산점도라고 합니다. 두 값이 함께 커지는 경향이 있으면 점들은 오른쪽 위로 기운 구름이 되고, 그 경향의 세기와 방향을 −1에서 1 사이의 수 하나로 잰 것이 상관계수
r은 이렇게 셉니다. 점마다 x가 평균에서 벗어난 양과 y가 평균에서 벗어난 양을 곱합니다. 둘 다 평균보다 크거나 둘 다 작은 점(노랑)은 곱이 양수, 한쪽만 큰 점(파랑)은 음수입니다. 이 곱의 평균이 공분산(covariance)이고, 공분산을 두 표준편차(standard deviation)의 곱으로 나눠 단위를 없앤 것이 r입니다. 점마다 곱의 크기가 다르니 개수만 세는 것은 아닙니다. 평균에서 멀리 떨어진 노란 점이 많을수록 r은 1 쪽으로, 그런 파란 점이 많을수록 −1 쪽으로 갑니다. 이 수는 1888년 프랜시스 골턴이 몸의 여러 치수가 함께 변하는 정도를 재려고 처음 생각했고, 1896년 칼 피어슨이 지금의 식으로 다듬었습니다. 그래서 '피어슨 상관계수'라고도 부르며, 근대 통계학(statistics)의 첫 도구 가운데 하나가 되었습니다.
상관계수는 회귀 직선의 기울기(slope)가 아닙니다. y의 단위를 바꿔 세로로
기하(geometry)로 보면 r은 코사인입니다. 편차
그러나 r 하나가 그림을 대신할 수는 없습니다. 아래 네 자료는 영국 출신 통계학자 프랜시스 앤스컴이 1973년에 만든 것('앤스컴 콰르텟(Anscombe's quartet)')으로, 평균과 분산, r(약 0.816), 회귀 직선(
r은 직선적인 관계만 잽니다.
이어지는 곳. 변수가 여럿이면 짝마다의 공분산을 모은 공분산 행렬(covariance matrix)이 생기고, 그 고유벡터(eigenvector)가 주성분 분석(principal component analysis)의 축입니다. 두 값이 함께 정규분포(normal distribution)를 따르면 산점도(scatter plot)는 타원(ellipse) 모양이 되고, r은 두 표준편차와 함께 그 타원이 얼마나 가늘고 어느 쪽으로 기울었는지를 정합니다. 이렇게 함께 정규분포를 따를 때는 r = 0이 곧 독립을 뜻하지만, 일반적으로는 그렇지 않습니다. 두 대상이 얼마나 닮았는지를 내적으로 재는 생각은 푸리에 급수(Fourier series)에서도 그대로 쓰입니다. 함수(function) 하나에 사인파(sinusoid)가 얼마나 들어 있는지(푸리에 계수)를 그 함수와 사인파의 내적으로 구하기 때문입니다. y = x²처럼 휘어진 관계는 r이 0에 가까워도 x가 y를 크게 알려 주는데, 모양과 상관없이 의존의 크기를 재는 것이 상호 정보량(mutual information)입니다. 상호 정보량은 두 변수가 독립일 때, 그리고 그때만 0입니다.
두 벡터 사이 각의 코사인으로 닮음을 재는 코사인 유사도(cosine similarity)는 문서 검색과 추천에서 흔히 쓰입니다. 두 데이터 열에서 각각 평균을 뺀 다음 코사인 유사도를 구하면, 위에서 본 대로 그것이 바로 상관계수입니다.
이 개념이 나오는 긴 글
이 개념 위에 세워진 것
이 개념을 언급하는 페이지
- 벡터
… n − 1로 나누기도 합니다), 두 측정(키와 몸무게)에서 각각 평균을 뺀 두 벡터가 이루는 각의 코사인이상관계수입니다. 흩어진 정도와 함께 움직이는 정도가 길이와 각도의 문제가 됩니다. 두 벡터의 차의 길이를 내적으로 …
- 고유벡터와 고유값
… 분포, 곧 정상분포에 다가갑니다. 정상분포는 고유값 1의 고유벡터입니다. 데이터가 가장 많이 퍼진 방향은공분산행렬에서 가장 큰 고유값의 고유벡터입니다. 공분산 행렬은 각 변수의 분산과, 두 변수가 함께 커지고 …
- 내적
… 뒤 n으로 나누면 공분산, 곧 두 양이 함께 커지고 작아지는 정도가 됩니다. 두 벡터 사이 각의 코사인은상관계수입니다. 같은 방향이면 1, 수직이면 0, 반대 방향이면 −1입니다(분산, 주성분 분석). 함수도 …
- 피타고라스 정리
… + \sigma_Y^2 . 평균을 뺀 확률변수를 화살표로 보고, 평균을 뺀 두 변수를 곱한 값의 평균(공분산)을 두 화살표의 내적으로 봅시다. 그러면 독립인 두 변수는 공분산이 0, 곧 서로 "직각"입니다. 그래서 …
- 분산과 표준편차
… 1을 1/3씩 갖고 Y = X^2 이면 공분산은 0이지만, X를 알면 Y가 완전히 정해집니다. 이 그림에서상관계수는 두 화살표 사이 각도의 코사인입니다. 그래서 한 걸음의 표준편차가 σ인 독립적인 걸음을 n번 걸으면, …
- 최소제곱 회귀
… 회귀⟧라 불렀는데, 부모 키로 자식 키를 예측하는 이 직선에 그 이름이 그대로 붙었습니다. 기울기는상관계수에 두 표준편차의 비 \sigma_y/\sigma_x 를 곱한 값입니다. 점들이 한 직선 위에 있지 않으면 …
- 주성분 분석
… 함께 움직이는 데이터(키와 몸무게, 두 과목 점수)를 점으로 찍으면 비스듬한 타원 모양 구름이 됩니다.상관계수\rho = 를 바꿔 보세요. 다시 뽑기 노란 손잡이로 방향을 돌리면 점들이 그 직선 위로 …
- 평균으로의 회귀
… 있어도 운은 따라오지 않으니, 다음 점수는 평균 쪽으로 물러납니다. 얼마나 물러나는지는 두 시험 점수의상관계수\rho = 가 정합니다. 이 모형에서 ρ는 점수의 분산 가운데 실력이 차지하는 몫입니다. 두 점수가 …
- 심슨의 역설
… 집단마다 따로 그린 회귀 직선은 모두 기울기가 양수인데, 집단들을 합치면 음수가 될 수 있습니다.상관관계의 부호가 뒤집히는 것입니다. 비율을 (환자 수, 성공 수) 벡터로 그려도 보입니다. 이 화살표의 …
- 교란 변수
… 많습니다. 아래 점들은 그런 날들을 흉내 낸 가상 자료(평균에서 벗어난 정도로 나타낸 값)로, 두 값의상관계수가 입니다. 그렇다면 아이스크림을 금지하면 사고가 줄까요? 이 자료를 만든 규칙에서 아이스크림 X가 사고 …
- 무작위 대조 시험
… 무작위 배정 노릇을 해서, 학교의 효과를 재는 자연 실험이 되기도 합니다. 무작위 실험을 할 수 없을 때는상관관계에서 인과를 끌어내기 위해 교란을 하나하나 찾아 조정해야 합니다.
- 마할라노비스 거리
… 평균보다 표준편차 세 개만큼 큰 키는 드물고, 반 개만큼 큰 키는 흔합니다. 값이 둘 이상이고 서로상관되어 있으면 사정이 달라집니다. 아래 구름은 가로 표준편차 \sigma_x = , 세로 표준편차 …
- 코사인 유사도
… 평점 벡터를 비교할 때도 같습니다. 이어지는 곳. 두 벡터에서 각각 평균을 빼고 코사인을 재면상관계수가 됩니다. 0과 1로만 된 벡터(무엇을 가졌는가)라면 코사인은 |A\cap B|/\sqrt{|A||B|} …
- 이산 코사인 변환
… 에너지가 낮은 진동수 몇 개에 몰립니다. 그래서 몇 개만 남겨도 거의 그대로 되살아납니다. 이웃한 값의상관이 1에 가까운 단순한 모형(한 칸 떨어진 값끼리만 직접 닮는 1차 마르코프 모형)에서는, 데이터에 맞춰 …
- 상호 정보량
… 부호를 충분히 길게 한 오류 정정 부호로 오류를 얼마든지 줄일 수 있다고 말합니다. 상호 정보량은상관계수와 무엇이 다를까요? 상관계수는 점들이 한 직선 둘레에 얼마나 몰렸는지를 잽니다. 상호 정보량은 x를 알 …
- 통계학
… 때 한가운데 값)으로, 얼마나 퍼져 있는지는 분산과 표준편차로, 두 가지 양이 함께 움직이는 정도는상관계수로 말합니다. 예컨대 '평균 165 cm, 표준편차 6 cm'라고 하면, 키의 분포가 종 모양에 가까울 때 …
- 굿하트의 법칙
… 뜻 대신 적어 준 보상의 허점을 찾는 보상 해킹은 적대형과 극단형이 섞인 사례이고, 회귀형의 수학은상관계수가 1보다 작을 때 생기는 평균으로의 회귀와 같습니다. 해안선의 길이에서 지능 검사와 보상 모델까지, …