수학 개념 지도
큰 생각(Big ideas)

선형화: 휘어진 것을 곧게 보기

휘어진 것도 충분히 가까이 보면 곧다. 곡선을 접선⁠(tangent line)⁠으로, 휘어진 변환을 행렬⁠(matrix)⁠로, 비선형 운동을 선형 미분방정식⁠(linear differential equation)⁠으로 바꿔 풀고, 그 근사가 어디까지 믿을 만한지를 따지는 생각.

F(p+h)=F(p)+JF(p) h+o(∣h∣)F(\mathbf p + \mathbf h) = F(\mathbf p) + J_F(\mathbf p)\,\mathbf h + o(|\mathbf h|)
먼저 보면 좋은 개념국소 선형성선형변환

수학이 속속들이 이해하고 있는 대상은 생각보다 적습니다. 그 가운데 으뜸이 직선과 평면, 그리고 그것들을 옮기는 선형변환⁠(linear transformation)⁠입니다. 일차식은 더하면 더한 대로, 늘이면 늘인 대로 움직이고, 여러 개를 연립해도 가우스 소거법⁠(Gaussian elimination)⁠으로 풀리며, 고유벡터⁠(eigenvector)⁠를 찾으면 몇 번을 거듭 적용한 결과까지 한눈에 보입니다. 그런데 세상은 휘어 있습니다. 행성의 궤도⁠(orbit)⁠, 진자의 흔들림, 전염병이 퍼지는 빠르기, 신경망⁠(neural network)⁠의 출력은 모두 일차식이 아닙니다. 휘어진 문제는 어떻게 풀까요? 수학이 수백 년 동안 되풀이해 온 대답은 뜻밖에 단순합니다. 충분히 가까이 가서 보면 휘어진 것도 곧다. 그러니 곧은 것으로 바꿔 풀고, 그 대신 얼마나 가까이 있어야 하는지를 따지자는 것입니다.

아래 네 그림은 서로 다른 분야에서 온 휘어진 대상입니다. ① 곡선, ② 평면을 휘게 옮기는 변환 z↦z2z \mapsto z^2, ③ 진자의 위치와 속도⁠(velocity)⁠가 그리는 궤도, ④ 같은 규칙을 되풀이하는 로지스틱 사상⁠(logistic map)⁠의 거미줄 그림입니다. 배율을 배로 올려 보세요. 확대하기 처음으로 곡선은 , 진자는 근처를 봅니다.

노란색이 휘어진 원래 대상이고, 청록 점선이 그 점에서 만든 일차 근사입니다. 화면 크기에 견준 둘의 차이는 지금 입니다. 배율을 열 배 올리면 차이는 약 10분의 1로 줄고, 휘어짐이 세제곱에서 시작하는 진자에서는 약 100분의 1로 줄어듭니다. 꺾인 곡선 |x|만은 아무리 확대해도 80%에서 꿈쩍하지 않습니다. 확대해도 모양이 그대로인 V자라서, 어떤 직선을 대도 차이가 줄지 않습니다. 네 그림은 모두 같은 일을 하고 있습니다. 확대할수록 휘어진 부분은 한 차수 높은 작은 양으로 밀려나고, 남는 것은 직선 하나, 행렬 하나, 곱할 수 하나입니다.

곡선을 직선으로. 이 생각의 첫 모습은 17세기 편지 공화국에서 나타났습니다. 페르마는 극값을 찾을 때 x를 아주 조금 옮긴 x + e에서의 값을 원래 값과 '거의 같다'고 놓고, 차이를 e로 나눈 뒤 e를 지웠습니다. 이 원고는 파리의 수도사 마랭 메르센을 거쳐 데카르트와의 논쟁으로 번졌습니다. 반세기 뒤 뉴턴과 라이프니츠가 이것을 하나의 계산법으로 만들었습니다. 한 점에서의 미분계수⁠(derivative)⁠는 곡선을 그 점 근처에서 가장 잘 흉내 내는 직선의 기울기⁠(slope)⁠입니다. 오늘날의 말로 적으면 f(x0+h)=f(x0)+f′(x0) h+(h보다 빨리 작아지는 양)f(x_0 + h) = f(x_0) + f'(x_0)\,h + (h\text{보다 빨리 작아지는 양})이고, 그림 ①이 그 문장을 눈으로 본 것입니다(국소 선형성⁠, local linearity⁠). 이 근사만 있으면 4.1≈2+0.1/4=2.025\sqrt{4.1} \approx 2 + 0.1/4 = 2.025처럼 손으로 계산이 되고(참값은 2.0248…), 둘째 항과 셋째 항까지 붙여 나가면 테일러 급수⁠(Taylor series)⁠가 됩니다. 선형화⁠(linearization)⁠는 테일러 급수의 첫 계단입니다.

근을 찾을 때. 직선의 0점은 나눗셈 한 번이면 나오지만 곡선의 0점은 그렇지 않습니다. 그래서 곡선을 지금 자리의 접선으로 바꿔 접선의 0점으로 건너뛰고, 거기서 다시 접선을 긋습니다. 뉴턴은 1669년의 원고 『해석에 관하여』에서 x3−2x−5=0x^3 - 2x - 5 = 0의 근이 2 근처라 보고 x=2+px = 2 + p를 넣은 뒤, p가 작으니 제곱 이상의 항을 버리고 푸는 일을 되풀이해 2.0945…에 다가갔습니다. 1690년 영국의 조지프 랩슨이 더 쓰기 편한 꼴로 다듬은 이 절차가 오늘날의 뉴턴 방법⁠(Newton's method)⁠입니다. 근 가까이에서는 버린 부분이 오차의 제곱 크기라서, 한 번 건널 때마다 맞는 자릿수가 대략 두 배로 늘어납니다. x2=2x^2 = 2에 쓰면 1, 3/2, 17/12, 577/408이 나오는데, 이것은 1세기 알렉산드리아의 헤론이 제곱근을 구할 때 쓴 '평균⁠(mean)⁠ 내기'와 같고, 분수들은 √2의 연분수⁠(continued fraction)⁠ 근사 가운데 일부입니다. 방정식이 여러 개면 접선 대신 행렬로 만든 일차 근사⁠(first-order approximation)⁠를 쓰고, 한 걸음마다 연립일차방정식⁠(system of linear equations)⁠을 하나씩 풉니다.

휘어진 변환을 행렬로. 평면을 평면으로 옮기는 변환도 마찬가지입니다. 그림 ②의 z↦z2z \mapsto z^2은 격자를 크게 휘게 하지만, 한 점 근처의 작은 격자는 확대할수록 곧은 평행사변형 격자로 옮겨집니다. 그 평행사변형을 정하는 것이 야코비 행렬⁠(Jacobian matrix)⁠입니다. 다른 변수는 그대로 두고 한 변수만 조금 움직였을 때 출력이 얼마나 변하는지(편미분⁠, partial derivative⁠)를 변수마다, 출력마다 구해 표로 늘어놓은 행렬로, 독일의 수학자 카를 야코비의 이름을 땄습니다. 1차원에서 기울기 하나가 하던 일을 2차원에서는 행렬 하나가 합니다. 복소수⁠(complex number)⁠ 함수⁠(function)⁠에서는 그 행렬이 특별한 꼴입니다. z2z^2은 z0z_0 근처에서 2z02z_0를 곱하는 일, 곧 돌리고 늘이는 복소수 곱셈⁠(complex multiplication)⁠처럼 움직이므로 작은 정사각형은 기울어진 정사각형으로 갑니다(z0≠0z_0 \ne 0일 때). 미분⁠(differentiation)⁠가능한 복소함수⁠(complex function)⁠가 미분계수가 0이 아닌 곳에서 작은 도형의 각을 지키는 까닭이고, 도메인 컬러링⁠(domain coloring)⁠에서 크기의 띠와 각도의 색 경계가 직각으로 만나는 까닭입니다. 이 행렬의 행렬식⁠(determinant)⁠의 절댓값⁠(absolute value)⁠은 그 점 근처의 넓이⁠(area)⁠ 배율이라, 적분⁠(integral)⁠에서 변수를 바꿀 때 붙는 인자가 됩니다. 극좌표⁠(polar coordinates)⁠로 옮기면 dx dydx\,dy가 r dr dθr\,dr\,d\theta가 되고, 이것이 가우스 적분⁠(Gaussian integral)⁠을 푸는 열쇠입니다. 변환을 이어 붙이면 국소 행렬들이 곱해지니 연쇄법칙⁠(chain rule)⁠은 행렬의 곱⁠(matrix multiplication)⁠이 됩니다.

평형점⁠(equilibrium)⁠ 근처의 운동. 진자의 운동 방정식은 단위를 적당히 고르면 θ¨=−sin⁡θ\ddot\theta = -\sin\theta이고, 이 식의 해는 초등 함수로 적히지 않습니다. 그러나 흔들림이 작으면 sin⁡θ≈θ\sin\theta \approx \theta이고, 식은 해가 사인파⁠(sinusoid)⁠인 선형 미분방정식 θ¨=−θ\ddot\theta = -\theta가 됩니다. 그림 ③에서 아래 평형점을 확대하면 달걀 모양이던 궤도가 원으로 펴지는 것이 이것입니다. 갈릴레이가 진자의 주기⁠(period)⁠는 흔들림의 크기와 상관없다고 본 것도 사실은 이 선형화 안에서만 맞는 말이고, 크게 흔들면 주기가 길어집니다. 1673년 하위헌스는 추가 원 대신 사이클로이드(굴러가는 바퀴 위의 한 점이 그리는 곡선)를 따라 움직이게 하면 주기가 정확히 같아진다는 것을 보여, 선형 근사에서만 성립하던 성질을 정확한 성질로 만들었습니다. 위 평형점에서는 선형화가 두 고유값⁠(eigenvalue)⁠의 부호가 반대인 안장, 곧 한 방향으로는 평형점에 다가오고 다른 방향으로는 멀어지는 평형점을 내놓아, 거꾸로 세운 진자가 왜 넘어지는지를 양수인 고유값 하나로 설명합니다. 일반적으로 야코비 행렬의 고유값들의 실수부⁠(real part)⁠가 모두 0이 아니면, 평형점 가까이의 비선형 흐름은 그 행렬로 만든 선형 흐름을 연속적으로 찌그러뜨린 것과 같은 모양입니다(하트만–그로브만 정리⁠, Hartman–Grobman theorem⁠). 시간에 따라 규칙대로 변하는 상태를 다루는 동역학계⁠(dynamical system)⁠ 이론이 평형점마다 가장 먼저 하는 일이 이 선형화이고, 그래서 로렌츠의 방정식도 원점이 안장이라는 것부터 읽어 낼 수 있습니다(로렌츠 끌개⁠, Lorenz attractor⁠). 되풀이하는 규칙도 같습니다. 그림 ④의 로지스틱 사상은 규칙을 적용해도 제자리인 점, 곧 f(x∗)=x∗f(x^*) = x^*인 고정점⁠(fixed point)⁠ 근처에서 기울기 f′(x∗)=−0.8f'(x^*) = -0.8인 직선처럼 움직여, 거미줄의 간격이 매번 0.8배로 줄며 좌우로 뒤집힙니다. 규칙 x↦rx(1−x)x \mapsto rx(1-x)의 r(그림에서는 2.8)을 키워 기울기가 −1 아래로 내려가는 순간(r = 3) 고정점은 불안정해지고, 값이 두 값 사이를 번갈아 오가는 주기 2의 궤도가 생기는 주기 배가⁠(period doubling)⁠가 시작됩니다(분기⁠(bifurcation)⁠).

작은 진동과 겹침. 18세기 중반 달랑베르가 떨리는 줄의 파동방정식⁠(wave equation)⁠을 세울 때도, 줄이 조금만 휜다고 보고 기울기의 제곱 같은 작은 양을 버렸습니다. 그렇게 얻은 방정식은 선형이어서 해 두 개를 더해도 해입니다. 이 겹침, 곧 중첩 원리⁠(superposition principle)⁠가 선형화가 주는 가장 큰 선물입니다. 복잡한 해를 단순한 조각으로 나누어 따로 풀고 더하면 되기 때문입니다. 푸리에가 열의 흐름(열방정식⁠, heat equation⁠)을 사인파 하나하나로 쪼개 푼 푸리에 급수⁠(Fourier series)⁠도, 전기 회로와 신호 처리의 계산도 이 겹침 위에 서 있습니다. 전신과 해저 케이블의 시대에 윌리엄 톰슨이 먼 케이블 끝에서 신호가 뭉개지는 까닭을 계산할 때 쓴 것도 전선을 따라 퍼지는 전압의 선형 방정식이었습니다.

데이터에 직선을. 통계학⁠(statistics)⁠에서도 가장 먼저 해 보는 일은 직선을 맞추는 것입니다. 르장드르가 1805년 발표하고 가우스가 그보다 앞서 썼다고 주장한 최소제곱 회귀⁠(least-squares regression)⁠는 모형이 계수에 대해 일차식이어서, 관측값을 가능한 답들이 이루는 평면에 정사영⁠(orthogonal projection)⁠하는 한 번의 계산으로 풀립니다. 행성의 궤도처럼 식이 휘어 있으면 어림한 답 근처에서 식을 일차식으로 펴고, 그 일차식에 최소제곱⁠(least squares)⁠을 적용해 답을 고치기를 되풀이합니다. 두 사람의 이름을 따 가우스–뉴턴 방법⁠(Gauss–Newton method)⁠이라 부르는 절차입니다. 데이터 구름을 가장 잘 따라가는 평면을 찾는 주성분 분석⁠(principal component analysis)⁠도, 두 변수의 관계를 직선 하나의 기울어짐으로 요약하는 상관계수⁠(correlation coefficient)⁠도 같은 생각입니다. 대가도 분명합니다. 상관계수는 직선 관계만 보기 때문에, 포물선⁠(parabola)⁠처럼 완벽한 관계를 0으로 잴 수도 있습니다. 어떤 모양의 의존성이든 잡아내는 상호 정보량⁠(mutual information)⁠이 따로 필요한 까닭입니다.

곧은 층과 휘는 층. 1958년 로젠블랫의 퍼셉트론⁠(perceptron)⁠은 입력과 가중치⁠(weight)⁠의 내적⁠(dot product)⁠이 문턱⁠(threshold)⁠을 넘는지로 답하는, 곧 평면을 직선 하나로 가르는 선형 분류기였습니다. 1969년 마빈 민스키와 시모어 패퍼트가 짚었듯, 두 입력 가운데 정확히 하나만 1일 때 1을 내는 XOR처럼 직선 하나로 가를 수 없는 문제는 풀지 못합니다. 평면의 네 점 (0,0), (1,1)과 (0,1), (1,0)을 두 무리로 나누는 직선은 없기 때문입니다. 선형 층을 여러 겹 쌓아도 소용이 없습니다. 일차 변환을 이어 붙인 것은 행렬의 곱, 곧 다시 일차 변환 하나이기 때문입니다. 그래서 신경망은 선형 층 사이에 일부러 휘어진 함수를 끼웁니다. 그런데 그 신경망을 학습시키는 방법은 다시 선형화입니다. 경사 하강법⁠(gradient descent)⁠은 손실 함수⁠(loss function)⁠를 지금 자리에서 일차식으로 바꿔 가장 가파르게 내려가는 쪽으로 한 걸음 옮기고, 역전파⁠(backpropagation)⁠는 층마다의 야코비 행렬을 출력 쪽부터 거꾸로 곱해 그 일차식을 구합니다(자동 미분⁠(automatic differentiation)⁠의 후진 모드⁠(reverse mode)⁠). 모형은 휘게 만들되, 고치는 일은 곧은 근사로 하는 셈입니다.

곧게 볼 수 없는 곳. 선형화는 세 군데에서 무너집니다. 첫째, 꺾인 점에서는 아무리 확대해도 직선이 나오지 않습니다. 19세기 수학자들은 이어진 곡선이라면 이런 점은 드문 예외라고 믿었는데, 1872년 카를 바이어슈트라스가 어디서나 이어져 있지만 어느 점에서도 미분할 수 없는 함수를 발표하자 그 믿음이 깨졌습니다(연속성⁠, continuity⁠). 둘째, 근사는 가까운 곳에서만 맞습니다. 뉴턴 방법을 복소평면⁠(complex plane)⁠에서 돌리면 어느 근으로 끌려갈지가 출발점마다 달라, 그 영역들의 경계가 아무리 확대해도 비슷하게 복잡한 무늬가 되풀이되는 프랙털⁠(fractal)⁠이 되고, 진자를 세게 밀면 사인파 근사가 전혀 보지 못하는 '한 바퀴 넘어가는' 운동이 나옵니다. 셋째, 선형화가 아무것도 정하지 못하는 경우가 있습니다. 고유값이 허수축 위에 놓여 선형 근사가 제자리를 도는 닫힌 고리를 내놓으면, 실제 궤도가 안으로 감길지 밖으로 풀릴지는 버린 고차항이 정합니다. 선형화가 옳게 작동해도 결론이 불편할 수 있습니다. 혼돈⁠(chaos)⁠에서 가까운 두 궤도가 벌어지는 빠르기도 선형화로 잽니다. 궤도를 따라 걸음마다 선형화한 배율들을 곱한 뒤 한 걸음당 평균 배율을 구하고, 그 로그를 랴푸노프 지수라 부릅니다(러시아의 수학자 알렉산드르 랴푸노프의 이름). 이 값이 양수라는 것은 처음의 작은 오차가 평균적으로 지수적으로 커진다는 뜻입니다. 선형화가 스스로, 자신이 통하는 범위가 좁다고 알려 주는 셈입니다.

이어지는 곳. 선형화는 근사의 첫 계단이고, 버린 부분이 얼마나 되는지를 재는 일은 근사와 오차의 몫입니다. 한 점 근처의 일차 근사를 이어 붙여 전체를 되찾는 이야기는 국소에서 전체로에, 일차 근사가 수평이 되는 곳을 찾는 이야기는 가장 좋은 것 고르기에 있습니다. 선형 근사로 바꾼 뒤에는 고유벡터 좌표로 옮겨 적으면 계산이 쉬워지는데, 이것은 표현 바꾸기의 대표적인 예입니다. 겹침의 원리가 주는 구조, 곧 해들을 더하고 늘여도 해로 남는 성질은 대칭과 불변량⁠(invariant)⁠에서 다시 만납니다.

이 생각이 나오는 긴 글

라플라시안 라플라시안, 가장 많이 재사용된 식 이웃의 평균에서 나를 뺀다. 이 한 줄이 열의 법칙이고, 도박꾼이 이길 확률이고, 전기 회로와 나무 세기이고, 북의 음색이고, 사진의 윤곽선이고, 그래프를 가르는 칼이고, 잡음에서 그림을 빚는 확산 모델의 밑그림이다.

이 생각을 언급하는 페이지

이 페이지가 가리키는 개념