마할라노비스 거리(Mahalanobis distance)
데이터의 퍼짐과 상관을 고려한 거리. 공분산 행렬(covariance matrix)이 늘이고 돌려 놓은 공간을 되돌린(백색화(whitening)한) 뒤 잰 유클리드 거리(Euclidean distance)로, 평균(mean)에서 '표준편차(standard deviation) 몇 개만큼' 떨어졌는지를 여러 차원에서 잰다.
값이 하나뿐이라면 '평균에서 얼마나 먼가'는 표준편차로 잽니다. 평균보다 표준편차 세 개만큼 큰 키는 드물고, 반 개만큼 큰 키는 흔합니다. 값이 둘 이상이고 서로 상관되어 있으면 사정이 달라집니다. 아래 구름은 가로 표준편차
처음 자리에서 A와 B는 평균에서 자로 잰 유클리드 거리가
숫자의 뜻은 '표준편차 몇 개만큼'입니다. 구름 240개 가운데 A보다 (마할라노비스 거리로) 먼 점은
이고(A는
계산에는 공분산 행렬
특별한 경우를 보면 익숙합니다.
이어지는 곳. 여러 변수를 함께 본 정규분포(다변량 정규분포, multivariate normal distribution)의 밀도는
이 개념이 나오는 긴 글
이 개념을 언급하는 페이지
- 정규분포
… 다른 쪽도 큰 경향(상관)이 있으면 기울어진 타원입니다. 이 타원을 원으로 펴는 변환을 한 다음 잰 거리가마할라노비스 거리입니다. 흩어짐이 큰 방향으로는 멀리 떨어져도 덜 이상하다고 보는 거리입니다. 평균과 분산만 정해 두고 그 …
- 주성분 분석
… 각 축을 그 축의 표준편차로 나누면 타원 구름이 둥근 구름이 됩니다. 그 좌표에서 잰 보통의 거리가마할라노비스 거리입니다. 단어마다 수백 개의 수로 된 벡터를 붙여 뜻이 비슷한 단어끼리 가깝게 놓은 것을 ⟦단어 …
- 최근접 이웃 분류
… 큰 쪽이 거리를 혼자 정하므로, 보통은 좌표마다 평균을 빼고 표준편차로 나누어 눈금을 맞추거나(표준화)마할라노비스 거리를 씁니다. 문서라면 코사인 유사도, 철자라면 편집 거리, 0과 1의 문자열이라면 해밍 거리로 …
- k-평균 군집
… 가정하고 점을 확률로 부드럽게 나눠 배정하면 가우스 혼합 모형이 되고, 그때 무리마다의 거리는마할라노비스 거리가 됩니다. 거꾸로 무리들이 모두 폭이 같은 둥근 정규분포라고 두고 그 폭을 0으로 줄이면, 가우스 혼합을 …
- 차원의 저주
… 많아서, 주성분 분석이나 그것을 비선형으로 넓힌 오토인코더 같은 차원 축소가 저주를 누그러뜨립니다.마할라노비스 거리처럼 공분산을 추정해야 하는 방법은 차원이 높을수록 자료가 훨씬 많이 필요합니다. 자료에 비해 변수가 …
- 거리 함수
… 변수마다 단위와 퍼짐이 다르면 유클리드 거리가 공정하지 않습니다. 퍼짐까지 고려해 거리를 다시 잰 것이마할라노비스 거리입니다. 점과 점이 아니라 분포와 분포 사이의 거리도 잴 수 있습니다. 한 분포를 다른 분포로 옮기는 최소 …
- 유클리드 거리
… 상관된 데이터에서는 좌표 차이를 그대로 제곱해 더하는 것이 공정하지 않습니다. 이때는 퍼짐과 상관을 반영한마할라노비스 거리가 맞습니다. 좌표가 서로 독립으로 흩어진 점들이라면, 차원이 아주 높을 때 가장 가까운 점과 가장 먼 …
- Lp 노름
… 차원의 저주의 한 얼굴입니다. L2의 공(원)을 방향마다 다르게 늘이고 돌려 타원으로 만든 것이마할라노비스 거리의 '원'입니다. p를 바꾸면 거리의 '원'이 바뀌니, 가장 가까운 기준점별로 나눈 ⟦보로노이 …
- 통계학
… 중심극한정리가 말합니다. 요약: 중앙값과 상관관계. 변수가 여럿일 때의 요약은 주성분 분석과마할라노비스 거리가 이어받습니다. 추정: 최대가능도법, 최소제곱 회귀, 베이즈 정리. 실험과 인과: ⟦무작위 …
- 기계 학습
… 저주⟧에서 다룹니다. 거리로 배우는 방법은 최근접 이웃 분류, k-평균 군집, 코사인 유사도,마할라노비스 거리에, 선형대수로 배우는 방법은 최소제곱 회귀와 주성분 분석에 있습니다. 확률 모형으로 배우는 쪽은 …
- EM 알고리즘과 가우스 혼합
… 경계로) 긋는 것과 달리, 가우스 혼합은 퍼짐이 다른 무리도 나누고, 여러 차원에서는 무리마다의 공분산으로마할라노비스 거리를 씁니다. 딱 잘라 나누면 혼합 모형의 로그 가능도가 줄지 않는다는 보장은 사라집니다. 그 방식이 늘리는 …