근사와 오차(Approximation and error)
정확한 답 대신 가까운 수를 내놓고, 그 거리가 품을 들일수록 어떤 속도(velocity)로 줄어드는지를 따진다. 아르키메데스의 다각형, 테일러 급수(Taylor series), 리만 합(Riemann sum), 뉴턴 방법(Newton's method), 몬테카를로, 최소제곱(least squares), JPEG이 모두 '오차가 몇 제곱으로 줄어드는가'라는 한 질문으로 비교된다.
정확한 답을 모를 때 우리는 무엇을 알 수 있을까요? 답이 어디쯤 있는지, 그리고 그 '어디쯤'이 얼마나 좁은지입니다. 근사는 답 대신 답에 가까운 수를 내놓는 일이고, 오차는 둘 사이의 거리입니다. 수학자들이 정말 따지는 것은 근사값 하나가 아니라 품을 더 들이면 오차가 어떤 속도로 줄어드는가입니다. 일을 두 배로 했을 때 오차가 절반이 되는지, 4분의 1이 되는지, 아니면 맞는 자릿수가 두 배가 되는지. 원주율(pi) π라는 한 목표를 두고 2,000년 넘게 나온 방법들을 한 그림에 모으면 이 질문이 선명해집니다. 분야도 시대도 다른 방법들이 몇 가지 기울기(slope)로 깔끔하게 줄을 섭니다.
가로축은 들인 품 n입니다. 다각형의 변 수, 막대 수, 급수(series)의 항 수, 반복 횟수, 무작위 점의 수가 모두 n입니다. 세로축은 π와의 차이이고, 두 축 모두 로그 눈금이라 한 칸이 10배입니다.
오차가
도형: 안팎에서 조이기. 기원전 3세기 시라쿠사의 아르키메데스는 원 안팎에 정육각형을 그리고 변을 두 배씩 늘려 96각형까지 가서, π가
급수: 한 점에서 멀리까지. 테일러 급수는 한 점에서의 미분값만으로 함수(function)를 흉내 냅니다. 0을 중심으로 n차에서 끊으면 남는 오차는 정확히
미분(differentiation): 곡선을 직선으로. 미분계수(derivative)는 가장 좋은 일차 근사입니다. 점에서 h만큼 떨어진 곳에서 접선(tangent line)이 곡선과 벌어지는 정도는 h보다 빨리 줄어들고, 함수가 두 번 미분가능하면
확률(probability): 무작위의 느리지만 끈질긴 정확함. 몬테카를로 방법(Monte Carlo method)의 전형적인 오차가
데이터: 풀 수 없는 식을 가장 덜 틀리게. 1801년 새해 첫날 발견된 소행성 세레스는 몇 주 만에 태양 뒤로 사라졌고, 몇 안 되는 관측으로 궤도(orbit)를 되찾아야 했습니다. 관측이 미지수보다 많고 저마다 조금씩 틀려서 모든 식을 동시에 만족하는 답은 없었습니다. 스물네 살의 가우스는 궤도를 계산해 세레스가 다시 나타날 자리를 맞혔습니다. 그는 오차의 제곱합이 가장 작은 답을 고르는 방법을 1795년부터 써 왔다고 훗날 밝혔지만, 이 방법을 처음 출판한 것은 1805년의 르장드르였습니다. 기하(geometry)로 보면 관측값 벡터(vector)를 가능한 답들이 이루는 열공간(column space)에 수선(perpendicular)을 내려 가장 가까운 점을 찾는 정사영(orthogonal projection)이고, 남은 오차는 그 공간과 수직입니다(최소제곱 회귀, least-squares regression). 가우스는 오차가 정규분포(normal distribution)를 따른다면 이 답이 가장 그럴듯하다는 근거도 댔습니다. 그러나 자료에 너무 잘 맞추는 것도 오차입니다. 모형에서 자료에 맞춰 고르는 수, 곧 매개변수(parameter)를 늘려 곡선이 점을 모두 지나게 하면 잡음까지 외워 새 자료에서 크게 틀리는 과적합(overfitting)이 생깁니다. 새 자료에서의 제곱 오차의 기댓값(expected value)은 잡음, 모형이 단순해서 늘 같은 쪽으로 빗나가는 편향의 제곱, 표본(sample)마다 예측이 흔들리는 분산으로 정확히 나뉘고, 매개변수를 늘리면 대개 편향은 줄고 분산은 늡니다(편향–분산 분해(bias–variance decomposition)). 매개변수가 넷이면 코끼리를, 다섯이면 코끼리 코까지 움직이게 할 수 있다는, 폰 노이만이 했다고 전해지는 농담이 그 경고입니다.
신호와 정보: 비트 하나에 오차 4분의 1. 푸리에 급수(Fourier series)를 몇 항에서 끊는 것도 근사이고, 사진을 코사인으로 쪼개 높은 진동수(frequency)를 거칠게 버리는 이산 코사인 변환(discrete cosine transform)이 JPEG의 핵심입니다. 얼마나 버려도 되는지는, 허용하는 오차(왜곡)가 정해졌을 때 꼭 필요한 최소 비트 수를 주는 율–왜곡 이론(rate–distortion theory)이 정합니다. 정규분포를 따르는 값을 이론상 가장 잘 부호화하면, 표본 하나에 비트를 하나 더 쓸 때마다 되살린 값과 원래 값의 차이를 제곱해 평균한 평균 제곱 오차(mean squared error)가 4분의 1로 줄어듭니다. 무손실 압축(lossless compression)에도 기울기 −1이 숨어 있습니다. 기호를 n개씩 묶어 허프만 부호(Huffman coding)로 적으면 기호당 비트 수가 엔트로피(entropy)보다 1/n 이상 많지 않다는 것이 원천 부호화 정리(source coding theorem)입니다. 근사가 끝내 따라가지 못하는 곳도 있습니다. 네모파처럼 절벽이 있는 함수는 푸리에 항을 아무리 늘려도 절벽 옆에 약 9%의 뿔이 남습니다(깁스 현상, Gibbs phenomenon). 오차의 넓이(area)는 0으로 가는데 가장 큰 오차는 줄지 않는 것입니다. '오차가 줄어든다'는 말도 무엇으로 재느냐에 따라 참이 되기도 거짓이 되기도 합니다.
어긋남과 놀라움. 1961년 에드워드 로렌츠는 날씨 모형을 중간부터 다시 돌리려고 컴퓨터 안의 0.506127 대신 출력지에 찍힌 0.506을 넣었습니다. 0.000127짜리 반올림 오차(round-off error)가 한 시간쯤 계산이 이어진 뒤에는 전혀 다른 날씨로 불어나 있었습니다. 혼돈(chaos)에서는 오차가 줄기는커녕 평균적으로 걸음마다 일정한 비율로 커지니, 계산을 아무리 정밀하게 해도 예측할 수 있는 기간은 자릿수에 비례해 조금씩만 늘어납니다. 1823년 코시는 반대쪽의 놀라움을 보였습니다.
이어지는 곳. 곡선을 접선으로 바꾸는 근사는 그 자체로 하나의 큰 생각(big ideas), 선형화(linearization)입니다. 근사를 끝없이 밀고 가 오차를 0으로 보내는 것이 무한을 다루는 법의 한가운데에 있는 극한(limit)이고, 제곱 오차를 가장 작게 고르는 최소제곱은 가장 좋은 것 고르기의 한 예입니다. 같은 함수라도 어떤 기저로 적느냐에 따라 몇 항으로 충분한지가 달라진다는 것은 표현 바꾸기에서, 무작위 표본이 왜 믿을 만한지는 무작위성에서, 한 점 근처의 테일러 급수가 어디까지 통하는지는 국소에서 전체로에서 이어집니다.
이 생각을 언급하는 페이지
- 로렌츠 끌개
… 넣었더니 전혀 다른 결과가 나왔다는 것입니다. 작은 반올림 오차가 걷잡을 수 없이 불어나는 이 사례는근사와 오차가 묻는 질문의 극단을 보여 줍니다. 평형점, 곧 속도가 0인 점은 원점과 두 대류 상태 C^\pm = …
- 급수의 수렴과 발산
… 이어집니다. 무한을 다루는 태도는 무한을 다루는 법에서, 몇 항에서 끊었을 때의 오차를 셈하는 태도는근사와 오차에서 볼 수 있습니다.
- 점별 수렴과 균등 수렴
… 좋은 성질이 전체로 퍼지는 조건을 묻는 일은 국소에서 전체로, 오차를 어떤 잣대로 재느냐의 문제는근사와 오차로 이어집니다.
- 근사 이론
… 푸리에 급수입니다. 어느 잣대로 재느냐에 따라 '가장 좋은' 답이 달라지는 이야기는 Lp 노름과근사와 오차에 있습니다. 함수열이 구간 전체에서 한꺼번에 다가간다는 말의 정확한 뜻은 점별 수렴과 균등 수렴에 …
- 통계학
… 치우침을 끊는 생각은 무작위성에서 다른 분야와 만납니다. 답과 함께 틀림의 크기를 말하는 태도는근사와 오차에서 다른 분야와 만납니다.
- 역문제와 잘 놓인 문제
… 측정보다 미지수가 훨씬 많아도 답을 되찾을 수 있습니다. 여러 분야에서 같은 모양으로 일하는 근사의 생각은근사와 오차에 모여 있습니다.