수학 개념 지도
기하(Geometry)

Lp 노름(Lp norm)

성분 크기의 p제곱을 더해 p제곱근을 씌운 벡터⁠(vector)⁠의 크기. p = 1이면 맨해튼, p = 2면 유클리드, p → ∞이면 체비쇼프 거리⁠(Chebyshev distance)⁠가 되고, 단위원⁠(unit circle)⁠의 모양이 p에 따라 바뀐다.

∥x∥p=(∣x1∣p+∣x2∣p+⋯+∣xn∣p)1/p,dp(x,y)=∥x−y∥p\|\mathbf x\|_p = \big(|x_1|^p + |x_2|^p + \cdots + |x_n|^p\big)^{1/p}, \qquad d_p(\mathbf x, \mathbf y) = \|\mathbf x - \mathbf y\|_p
먼저 보면 좋은 개념벡터거리 함수유클리드 거리

벡터의 크기를 재는 방법은 하나가 아닙니다. 성분마다 크기를 p제곱해 더한 뒤 p제곱근을 씌우는 것이 Lp 노름입니다. 예를 들어 (3,4)(3, 4)의 L1 노름⁠(norm)⁠은 3+4=73 + 4 = 7, L2 노름은 9+16=5\sqrt{9 + 16} = 5입니다. 두 점 사이의 거리는 두 점의 차의 노름 ∥x−y∥p\|\mathbf x - \mathbf y\|_p로 잽니다. 이 거리를 독일 수학자 헤르만 민코프스키의 이름을 따 민코프스키 거리⁠(Minkowski distance)⁠라고도 합니다. p = 2이면 피타고라스 정리⁠(Pythagorean theorem)⁠의 유클리드 거리⁠(Euclidean distance)⁠, p = 1이면 맨해튼 거리⁠(Manhattan distance)⁠, p를 한없이 키우면 가장 큰 성분만 남는 체비쇼프 거리입니다.

노름이 1인 점들, 곧 '단위원'을 그려 봅시다. p=p = p = 0.5 p = 1 p = 2 p = 8 흐린 선은 비교용으로 그린 p = 1의 마름모, p = 2의 원, p = ∞의 정사각형입니다. p가 커질수록 노란 곡선은 모서리를 향해 부풀어 정사각형에 다가갑니다.

노름이 되려면 세 가지가 필요합니다. 0벡터만 크기가 0이고, ∥cx∥=∣c∣ ∥x∥\|c\mathbf x\| = |c|\,\|\mathbf x\|이며, 삼각부등식⁠(triangle inequality)⁠ ∥x+y∥≤∥x∥+∥y∥\|\mathbf x + \mathbf y\| \le \|\mathbf x\| + \|\mathbf y\|가 성립해야 합니다. 그러면 ∥x−y∥\|\mathbf x - \mathbf y\|는 거리 함수⁠(metric)⁠가 됩니다. p ≥ 1이면 이것이 성립하고(민코프스키 부등식⁠, Minkowski inequality⁠), 단위원은 볼록합니다. 볼록하다는 것은 안의 두 점을 잇는 선분이 언제나 안에 머문다는 뜻입니다. p가 1보다 작으면 단위원이 안으로 오목해집니다. 두 단위벡터를 잇는 흰검은 점선의 가운데 점이 원 이때 ∥e1+e2∥p=21/p=\|\mathbf e_1 + \mathbf e_2\|_p = 2^{1/p} = 인데 ∥e1∥p+∥e2∥p=2\|\mathbf e_1\|_p + \|\mathbf e_2\|_p = 2이니, p < 1에서는 삼각부등식이 깨져 노름이 아닙니다. 다만 0 < p < 1이어도 p제곱근을 씌우지 않은 합 ∑i∣xi−yi∣p\sum_i |x_i - y_i|^p은 거리 함수입니다. 대신 이 값은 두 점의 차이를 두 배로 늘려도 두 배가 되지 않으니(2p2^p배), 노름에서 나온 거리는 아닙니다.

점 X를 끌어 보세요. 오른쪽 그래프는 p에 따른 ∥X∥p\|X\|_p입니다. 지금 ∥X∥1=\|X\|_1 = , ∥X∥2=\|X\|_2 = , ∥X∥∞=\|X\|_\infty = 이고, p를 키울수록 값은 줄어들고(0이 아닌 성분이 하나뿐이면 그대로), 가장 큰 성분의 크기로 수렴⁠(convergence)⁠합니다(극한⁠(limit)⁠). 큰 항을 p제곱하면 작은 항들은 상대적으로 사라지기 때문입니다. 그래서 언제나 ∥x∥∞≤∥x∥2≤∥x∥1\|\mathbf x\|_\infty \le \|\mathbf x\|_2 \le \|\mathbf x\|_1입니다.

p = 2만 내적⁠(dot product)⁠에서 나옵니다(∥x∥22=x⋅x\|\mathbf x\|_2^2 = \mathbf x\cdot\mathbf x). 그래서 각도, 직교⁠(orthogonality)⁠, 정사영⁠(orthogonal projection)⁠, 최소제곱⁠(least squares)⁠의 선형 회귀, 주성분 분석⁠(principal component analysis)⁠은 모두 L2의 세계에 삽니다.

p = 1의 마름모는 꼭짓점⁠(vertex)⁠이 축 위에 뾰족하게 나와 있습니다. 회귀에서 오차 제곱합에 계수들의 절댓값⁠(absolute value)⁠ 합(L1 크기)을 벌점으로 더해 함께 줄이는 방법을 라소⁠(lasso)⁠라고 합니다. 답이 되는 곳에서는 오차가 같은 계수들을 이은 등고선이 L1 크기가 일정한 마름모에 바깥에서 맞닿습니다. 타원⁠(ellipse)⁠ 모양 등고선이 마름모에 닿을 때는 평평한 변보다 뾰족한 꼭짓점에 먼저 닿기 쉽습니다. 꼭짓점에서는 좌표 몇 개가 정확히 0이니, 계수 몇 개가 정확히 0이 되어 꼭 필요한 변수만 남습니다(최적화⁠(optimization)⁠).

이어지는 곳.

  • 합을 적분⁠(integral)⁠으로 바꾸면 함수⁠(function)⁠의 크기 (∫∣f∣p)1/p(\int |f|^p)^{1/p}가 됩니다. 푸리에 급수⁠(Fourier series)⁠는 이 가운데 L2에서 가장 자연스럽게 수렴합니다. 푸리에 계수는 함수를 사인파⁠(sinusoid)⁠ 방향으로 정사영한 값이라서, 항 수를 정하면 L2 거리로 가장 가까운 근사가 되기 때문입니다.
  • 차원이 높아지면 정육면체에 꼭 맞게 들어간 공이 정육면체 부피에서 차지하는 몫이 0으로 줄어듭니다. 부피 대부분이 모서리 쪽에 몰린다는 뜻이고, 차원의 저주⁠(curse of dimensionality)⁠의 한 얼굴입니다.
  • L2의 공(원)을 방향마다 다르게 늘이고 돌려 타원으로 만든 것이 마할라노비스 거리⁠(Mahalanobis distance)⁠의 '원'입니다.
  • p를 바꾸면 거리의 '원'이 바뀌니, 가장 가까운 기준점별로 나눈 보로노이 다이어그램⁠(Voronoi diagram)⁠의 경계도 바뀝니다.
  • 삼각부등식에서 두 길이를 덧셈 대신 (ap+bp)1/p(a^p + b^p)^{1/p}로 이으면 p마다 다른 '삼각부등식'이 나오고, p → ∞의 최댓값으로 이으면 초거리⁠(ultrametric)⁠의 강한 삼각부등식 d(x,z)≤max⁡(d(x,y),d(y,z))d(x,z) \le \max(d(x,y), d(y,z))이 됩니다. 또 거리를 늘리지 않는 사상의 범주⁠(category)⁠에서 두 공간의 곱에 붙는 거리는 ℓ∞\ell^\infty, 커링⁠(currying)⁠을 허락하는 텐서곱⁠(tensor product)⁠에 붙는 거리는 ℓ1\ell^1입니다(풍부화된 범주⁠, enriched category⁠).
  • 민코프스키는 19세기 말 수의 기하학⁠(geometry of numbers)⁠을 연구하며 이런 거리들을 다루었습니다. 수의 기하학은 좌표가 모두 정수⁠(integer)⁠인 격자점⁠(lattice point)⁠과 볼록한 도형이 어떻게 겹치는지를 보고 정수론⁠(number theory)⁠의 문제를 푸는 분야입니다.

이 개념이 나오는 긴 글

거리와 유사도 까마귀와 택시 까마귀는 곧장 날고 택시는 블록을 돌아간다. '얼마나 먼가'에는 답이 하나가 아니고, 어떤 거리를 고르느냐가 통계와 기계 학습의 답을 바꾼다. 역문제 거꾸로 푸는 문제는 왜 어려운가 원인에서 결과를 계산하기는 쉽다. 흐린 사진, CT, 블랙홀 사진은 왜 결과에서 원인을 되찾기 어려웠을까? 작은 특잇값이 잡음을 키우는 벽과, 정규화·릿지 회귀·베이즈 사전확률이 사실은 같은 처방이라는 이야기.

이 개념 위에 세워진 것

이 개념을 언급하는 페이지

이 페이지가 가리키는 개념