수학 개념 지도
큰 생각(Big ideas)

근사와 오차(Approximation and error)

정확한 답 대신 가까운 수를 내놓고, 그 거리가 품을 들일수록 어떤 속도⁠(velocity)⁠로 줄어드는지를 따진다. 아르키메데스의 다각형, 테일러 급수⁠(Taylor series)⁠, 리만 합⁠(Riemann sum)⁠, 뉴턴 방법⁠(Newton's method)⁠, 몬테카를로, 최소제곱⁠(least squares)⁠, JPEG이 모두 '오차가 몇 제곱으로 줄어드는가'라는 한 질문으로 비교된다.

오차(n)≈C n−p    (로그–로그에서 기울기 −p),또는    C r n,    εk+1≈c εk2\text{오차}(n) \approx C\,n^{-p} \;\;(\text{로그–로그에서 기울기 } {-p}), \qquad \text{또는}\;\; C\,r^{\,n}, \;\; \varepsilon_{k+1} \approx c\,\varepsilon_k^{2}

정확한 답을 모를 때 우리는 무엇을 알 수 있을까요? 답이 어디쯤 있는지, 그리고 그 '어디쯤'이 얼마나 좁은지입니다. 근사는 답 대신 답에 가까운 수를 내놓는 일이고, 오차는 둘 사이의 거리입니다. 수학자들이 정말 따지는 것은 근사값 하나가 아니라 품을 더 들이면 오차가 어떤 속도로 줄어드는가입니다. 일을 두 배로 했을 때 오차가 절반이 되는지, 4분의 1이 되는지, 아니면 맞는 자릿수가 두 배가 되는지. 원주율⁠(pi)⁠ π라는 한 목표를 두고 2,000년 넘게 나온 방법들을 한 그림에 모으면 이 질문이 선명해집니다. 분야도 시대도 다른 방법들이 몇 가지 기울기⁠(slope)⁠로 깔끔하게 줄을 섭니다.

가로축은 들인 품 n입니다. 다각형의 변 수, 막대 수, 급수⁠(series)⁠의 항 수, 반복 횟수, 무작위 점의 수가 모두 n입니다. 세로축은 π와의 차이이고, 두 축 모두 로그 눈금이라 한 칸이 10배입니다. log⁡10n=\log_{10} n = , 곧 n = 일 때 π와의 차이는 몬테카를로 다시

파랑: 아르키메데스의 내접 다각형(변 n개). 보라: 4/(1+x²)의 리만 합(막대 n개). 주황: 마다바 급수(n항). 초록: 보정항을 붙인 마다바 급수. 분홍: 마친 공식(두 테일러 급수 n항씩). 노랑: 몬테카를로(점 n개). 흰색검은색: 이분법(n번). 청록: 뉴턴 방법(n번). 점선은 컴퓨터가 적을 수 있는 자릿수의 바닥입니다.

오차가 Cn−pC n^{-p}처럼 줄면 로그–로그 그림에서 기울기 −p인 직선이 됩니다. 이 p를 방법의 차수라 부르고, 차수가 방법의 성격을 거의 다 말해 줍니다. 변의 수를 두 배로 하면 다각형의 오차는 4분의 1(p = 2), 리만 합의 오차는 절반(p = 1)이 됩니다. 마다바 급수는 기울기 −1로 너무 느려서 백만 항을 더해도 앞의 여섯 자리(3.14159)밖에 맞지 않지만, 끝에 보정항 하나를 붙이면 기울기가 −5로 꺾입니다. 몬테카를로는 기울기 −1/2라 한 자리를 더 얻으려면 점이 100배 필요합니다. 반면 아래로 휘어 떨어지는 곡선들은 차수로 잴 수 없을 만큼 빠릅니다. 이분법은 한 번에 오차를 절반으로 줄이니 걸음마다 이진수 한 자리, 곧 1비트씩, 마친 공식은 항마다 약 1.4자리를 얻고(log⁡1025≈1.4\log_{10} 25 \approx 1.4), 뉴턴 방법은 맞는 자릿수 자체가 몇 배씩 불어납니다. 여기서 쓴 sin⁡x=0\sin x = 0에서는 대칭 덕분에 세 배씩, 보통은 두 배씩입니다.

도형: 안팎에서 조이기. 기원전 3세기 시라쿠사의 아르키메데스는 원 안팎에 정육각형을 그리고 변을 두 배씩 늘려 96각형까지 가서, π가 310713\tfrac{10}{71}과 3173\tfrac17 사이에 있음을 보였습니다. 그는 알렉산드리아의 학자들, 특히 에라토스테네스와 편지를 주고받으며 결과를 알렸습니다. 이 결과가 근사의 모범인 까닭은 값이 아니라 틀의 모양에 있습니다. 안쪽 다각형은 원보다 짧고 바깥 다각형은 길다는 것이 증명되어 있으니, 오차가 '작을 것 같다'가 아니라 '이 폭을 넘지 않는다'고 보장됩니다. 정적분⁠(definite integral)⁠도 같은 모양으로 정의됩니다. 곡선 아래를 막대로 채운 합이 막대를 가늘게 할수록 한 값으로 조여 들면, 그 값이 정적분입니다(리만). 막대 높이를 왼쪽 끝 대신 가운데에서 재면 오차가 1/n에서 1/n21/n^2로 줄어드는데, 곡선이 막대 위로 삐져나온 부분과 모자란 부분이 서로 지워지기 때문입니다.

급수: 한 점에서 멀리까지. 테일러 급수는 한 점에서의 미분값만으로 함수⁠(function)⁠를 흉내 냅니다. 0을 중심으로 n차에서 끊으면 남는 오차는 정확히 f(n+1)(ξ) xn+1/(n+1)!f^{(n+1)}(\xi)\,x^{n+1}/(n+1)!입니다. 여기서 ξ\xi는 0과 x 사이의 어떤 점입니다(라그랑주가 이 나머지의 꼴을 정리했습니다). 지수함수⁠(exponential function)⁠나 사인과 코사인⁠(sine and cosine)⁠처럼 미분값이 한 범위 안에 머무는 함수라면, 계승⁠(factorial)⁠ (n+1)!=1×2×⋯×(n+1)(n+1)! = 1 \times 2 \times \cdots \times (n+1)이 분모에 있어 오차가 무섭게 빨리 줄어듭니다. 14세기 인도 남부의 마다바와 케랄라 학파는 유럽보다 두 세기 넘게 앞서 사인⁠(sine)⁠, 코사인⁠(cosine)⁠, 아크탄젠트⁠(arctangent)⁠의 급수를 얻었고, 느린 π 급수에는 마지막 항 뒤의 꼬리를 어림하는 보정항 n/(4n2+1)n/(4n^2 + 1)을 붙였습니다. 그림의 초록 선이 그 보정항의 힘입니다. 1706년 런던의 천문학자 존 마친은 π4=4arctan⁡15−arctan⁡1239\tfrac{\pi}{4} = 4\arctan\tfrac15 - \arctan\tfrac{1}{239}처럼 π를 아크탄젠트 두 개로 쪼개, 1/5과 1/239처럼 작은 수에서 급수를 쓰는 공식을 찾아 100자리를 계산했습니다. x가 작으면 x3,x5,…x^3, x^5, \dots이 빠르게 작아지니 항마다 여러 자리를 얻습니다. 급수가 빨리 수렴⁠(convergence)⁠하도록 문제를 바꿔 쓰는 것, 이것이 근사 기술의 절반입니다. 나머지 절반은 한계를 아는 것입니다. 중심에서 수렴반경⁠(radius of convergence)⁠ 밖으로 나가면 항이 0으로 가지 않아, 항을 아무리 더해도 부분합⁠(partial sum)⁠이 한 값으로 모이지 않습니다. 그 반경은 흔히 실수축 위에서는 보이지 않는 복소평면⁠(complex plane)⁠의 특이점⁠(singularity)⁠, 예컨대 극이 정합니다. 1/(1+x2)1/(1+x^2)의 급수 1−x2+x4−⋯1 - x^2 + x^4 - \cdots는 ∣x∣≥1|x| \ge 1이면 발산⁠(divergence)⁠하는데, 실수⁠(real number)⁠ 위의 그래프는 어디서나 매끈하지만 복소수⁠(complex number)⁠ x = ±i에서 분모가 0이 되기 때문입니다. 한 점 근처의 급수가 아니라 구간 전체에서 함수를 가장 잘 흉내 내는 방법을 따지는 분야가 근사 이론⁠(approximation theory)⁠입니다. 1850년대 파프누티 체비쇼프는 차수가 정해진 다항식⁠(polynomial)⁠ 가운데 구간 위에서 가장 큰 오차가 가장 작은 것을 찾는 문제를 세웠고, 1885년 카를 바이어슈트라스는 닫힌 구간 위의 연속 함수라면 무엇이든, 구간의 모든 점에서 한꺼번에 원하는 만큼 가까운(균등 수렴⁠, uniform convergence⁠) 다항식이 있음을 증명했습니다.

미분⁠(differentiation)⁠: 곡선을 직선으로. 미분계수⁠(derivative)⁠는 가장 좋은 일차 근사입니다. 점에서 h만큼 떨어진 곳에서 접선⁠(tangent line)⁠이 곡선과 벌어지는 정도는 h보다 빨리 줄어들고, 함수가 두 번 미분가능하면 h2h^2에 비례하는 크기로 줄어듭니다(국소 선형성⁠, local linearity⁠). 뉴턴 방법이 빠른 것도 이 때문입니다. 접선의 0점으로 건너뛰면 다음 오차가 지금 오차의 제곱에 비례하니, 근 가까이에 들어서면(그리고 근에서 기울기가 0이 아니면) 맞는 자릿수가 두 배씩 늡니다. 기원전 1800년 무렵 바빌로니아의 점토판 YBC 7289에 적힌 √2의 값은 이런 되풀이로 얻을 수 있는 정밀도⁠(precision)⁠를 보여 줍니다. 되풀이가 내놓는 1 → 3/2 → 17/12 → 577/408은 √2의 연분수⁠(continued fraction)⁠ 근사이기도 하고, 연분수는 주어진 크기의 분모로 만들 수 있는 가장 좋은 유리 근사를 줍니다. 디리클레는 비둘기집 원리⁠(pigeonhole principle)⁠로, 어떤 무리수⁠(irrational number)⁠ x에 대해서도 ∣x−p/q∣<1/q2|x - p/q| \lt 1/q^2을 만족하는 분수 p/q가 무한히 많다는 것을 보였습니다. 분모가 q인 분수들의 간격은 1/q이니, 그보다 훨씬 가까이 다가가는 분수가 끝없이 있다는 뜻입니다. 그리고 연분수가 1만 되풀이되는 황금비⁠(golden ratio)⁠는 분수로 근사하기 가장 어려운 수입니다. 정확히는, 모든 무리수가 오차 1/(5 q2)1/(\sqrt5\,q^2)보다 가까운 분수를 무한히 많이 갖는데, 5\sqrt5를 조금이라도 키우면 황금비에서는 이 말이 거짓이 됩니다(후르비츠의 정리). 한편 이진 탐색⁠(binary search)⁠과 이분법은 한 번의 질문으로 1비트씩, 느리지만 틀림없이 다가갑니다.

확률⁠(probability)⁠: 무작위의 느리지만 끈질긴 정확함. 몬테카를로 방법⁠(Monte Carlo method)⁠의 전형적인 오차가 1/N1/\sqrt N에 비례하는 것은 큰 수의 법칙⁠(law of large numbers)⁠과 중심극한정리⁠(central limit theorem)⁠가 말하는 평균⁠(mean)⁠의 흔들림 때문입니다(분산⁠(variance)⁠). 점 N개의 평균은 표준편차⁠(standard deviation)⁠가 한 점의 1/N1/\sqrt N배입니다. 느리지만 이 속도는 차원과 상관이 없어서, 격자 점이 폭발하는 고차원 적분⁠(integral)⁠에서는 흔히 가장 쓸 만한 방법이 됩니다. 확률에는 다른 종류의 근사도 있습니다. 1733년 런던의 드무아브르는 이항분포⁠(binomial distribution)⁠를 종 모양 곡선으로 어림했고, 그 계산의 열쇠인 스털링 공식⁠(Stirling's formula)⁠ n!≈2πn (n/e)nn! \approx \sqrt{2\pi n}\,(n/e)^n은 기묘합니다. 두 값의 비는 1로 가는데 차이는 오히려 끝없이 커집니다. 비가 1로 가는 이런 근사를 점근적 근사라 부르고 ~로 적습니다. 소수 정리⁠(prime number theorem)⁠도 같습니다. x 이하의 소수⁠(prime number)⁠ 개수를 π(x)\pi(x)라 합시다. 훗날 가우스 자신이 밝힌 바로는 열다섯 살 무렵 소수표를 보며 짐작했고, 르장드르도 1798년 비슷한 공식으로 내놓은 π(x)∼x/ln⁡x\pi(x) \sim x/\ln x는 상대 오차⁠(relative error)⁠가 0으로 갑니다. 하지만 소수를 하나하나 세는 데 쓰면 차이는 오히려 커집니다. x가 백만이면 6,116개, 10억이면 약 259만 개가 모자랍니다. 어떤 오차를 재느냐가 근사의 뜻을 바꿉니다.

데이터: 풀 수 없는 식을 가장 덜 틀리게. 1801년 새해 첫날 발견된 소행성 세레스는 몇 주 만에 태양 뒤로 사라졌고, 몇 안 되는 관측으로 궤도⁠(orbit)⁠를 되찾아야 했습니다. 관측이 미지수보다 많고 저마다 조금씩 틀려서 모든 식을 동시에 만족하는 답은 없었습니다. 스물네 살의 가우스는 궤도를 계산해 세레스가 다시 나타날 자리를 맞혔습니다. 그는 오차의 제곱합이 가장 작은 답을 고르는 방법을 1795년부터 써 왔다고 훗날 밝혔지만, 이 방법을 처음 출판한 것은 1805년의 르장드르였습니다. 기하⁠(geometry)⁠로 보면 관측값 벡터⁠(vector)⁠를 가능한 답들이 이루는 열공간⁠(column space)⁠에 수선⁠(perpendicular)⁠을 내려 가장 가까운 점을 찾는 정사영⁠(orthogonal projection)⁠이고, 남은 오차는 그 공간과 수직입니다(최소제곱 회귀⁠, least-squares regression⁠). 가우스는 오차가 정규분포⁠(normal distribution)⁠를 따른다면 이 답이 가장 그럴듯하다는 근거도 댔습니다. 그러나 자료에 너무 잘 맞추는 것도 오차입니다. 모형에서 자료에 맞춰 고르는 수, 곧 매개변수⁠(parameter)⁠를 늘려 곡선이 점을 모두 지나게 하면 잡음까지 외워 새 자료에서 크게 틀리는 과적합⁠(overfitting)⁠이 생깁니다. 새 자료에서의 제곱 오차의 기댓값⁠(expected value)⁠은 잡음, 모형이 단순해서 늘 같은 쪽으로 빗나가는 편향의 제곱, 표본⁠(sample)⁠마다 예측이 흔들리는 분산으로 정확히 나뉘고, 매개변수를 늘리면 대개 편향은 줄고 분산은 늡니다(편향–분산 분해⁠(bias–variance decomposition)⁠). 매개변수가 넷이면 코끼리를, 다섯이면 코끼리 코까지 움직이게 할 수 있다는, 폰 노이만이 했다고 전해지는 농담이 그 경고입니다.

신호와 정보: 비트 하나에 오차 4분의 1. 푸리에 급수⁠(Fourier series)⁠를 몇 항에서 끊는 것도 근사이고, 사진을 코사인으로 쪼개 높은 진동수⁠(frequency)⁠를 거칠게 버리는 이산 코사인 변환⁠(discrete cosine transform)⁠이 JPEG의 핵심입니다. 얼마나 버려도 되는지는, 허용하는 오차(왜곡)가 정해졌을 때 꼭 필요한 최소 비트 수를 주는 율–왜곡 이론⁠(rate–distortion theory)⁠이 정합니다. 정규분포를 따르는 값을 이론상 가장 잘 부호화하면, 표본 하나에 비트를 하나 더 쓸 때마다 되살린 값과 원래 값의 차이를 제곱해 평균한 평균 제곱 오차⁠(mean squared error)⁠가 4분의 1로 줄어듭니다. 무손실 압축⁠(lossless compression)⁠에도 기울기 −1이 숨어 있습니다. 기호를 n개씩 묶어 허프만 부호⁠(Huffman coding)⁠로 적으면 기호당 비트 수가 엔트로피⁠(entropy)⁠보다 1/n 이상 많지 않다는 것이 원천 부호화 정리⁠(source coding theorem)⁠입니다. 근사가 끝내 따라가지 못하는 곳도 있습니다. 네모파처럼 절벽이 있는 함수는 푸리에 항을 아무리 늘려도 절벽 옆에 약 9%의 뿔이 남습니다(깁스 현상⁠, Gibbs phenomenon⁠). 오차의 넓이⁠(area)⁠는 0으로 가는데 가장 큰 오차는 줄지 않는 것입니다. '오차가 줄어든다'는 말도 무엇으로 재느냐에 따라 참이 되기도 거짓이 되기도 합니다.

어긋남과 놀라움. 1961년 에드워드 로렌츠는 날씨 모형을 중간부터 다시 돌리려고 컴퓨터 안의 0.506127 대신 출력지에 찍힌 0.506을 넣었습니다. 0.000127짜리 반올림 오차⁠(round-off error)⁠가 한 시간쯤 계산이 이어진 뒤에는 전혀 다른 날씨로 불어나 있었습니다. 혼돈⁠(chaos)⁠에서는 오차가 줄기는커녕 평균적으로 걸음마다 일정한 비율로 커지니, 계산을 아무리 정밀하게 해도 예측할 수 있는 기간은 자릿수에 비례해 조금씩만 늘어납니다. 1823년 코시는 반대쪽의 놀라움을 보였습니다. e−1/x2e^{-1/x^2}(0에서는 0)은 0에서 모든 미분값이 0이라 테일러 급수가 0이 되고, 그 급수는 어디서나 수렴하지만 원래 함수와는 0에서만 같습니다. 컴퓨터의 산술 자체도 근사입니다. 거의 같은 두 수를 빼면 앞자리가 지워지고 반올림 오차만 남는데, 가까운 두 지점의 거리를 재는 하버사인 공식⁠(haversine formula)⁠이 굳이 사인의 제곱을 쓰는 까닭이 이것입니다. 코사인을 쓰는 공식은 1에 아주 가까운 두 수를 빼야 해서, 몇 미터 떨어진 두 점의 거리가 반올림 오차에 묻혀 버립니다. 그림에서 여러 선이 10−1610^{-16} 근처에서 멈추는 것도 같은 벽입니다.

이어지는 곳. 곡선을 접선으로 바꾸는 근사는 그 자체로 하나의 큰 생각⁠(big ideas)⁠, 선형화⁠(linearization)⁠입니다. 근사를 끝없이 밀고 가 오차를 0으로 보내는 것이 무한을 다루는 법의 한가운데에 있는 극한⁠(limit)⁠이고, 제곱 오차를 가장 작게 고르는 최소제곱은 가장 좋은 것 고르기의 한 예입니다. 같은 함수라도 어떤 기저로 적느냐에 따라 몇 항으로 충분한지가 달라진다는 것은 표현 바꾸기에서, 무작위 표본이 왜 믿을 만한지는 무작위성에서, 한 점 근처의 테일러 급수가 어디까지 통하는지는 국소에서 전체로에서 이어집니다.

이 생각을 언급하는 페이지

이 페이지가 가리키는 개념