재는 순간 바뀐다
해안선의 길이는 자에 따라, 평균(mean)은 누구에게 묻느냐에 따라, 지표는 그것을 목표로 삼는 순간 달라집니다. 측정은 세계를 그대로 받아 적는 일이 아니라, 무엇을 어떻게 셀지 정하는 수학적 선택입니다.
이 글의
1950년 무렵, 영국의 수학자 루이스 프라이 리처드슨은 전쟁을 세고 있었습니다. 퀘이커 교도로 1차 대전에 구급차 부대원으로 나갔던 그는 전쟁이 왜 일어나는지를 숫자로 따져 보고 싶어 했습니다. 그래서 1820년부터 20세기 중반까지의 크고 작은 싸움을 모아 목록을 만들었습니다. 그가 세운 가설 하나는 이웃 나라와 맞닿은 국경이 길수록 싸움도 잦으리라는 것이었습니다. 이 가설을 따져 보려면 국경의 길이가 필요했습니다.
백과사전을 찾아보니 이상한 일이 있었습니다. 에스파냐와 포르투갈이 맞닿은 국경의 길이가 한쪽 나라의 자료에는 987 km, 다른 쪽 나라의 자료에는 1,214 km로 적혀 있었습니다. 네덜란드와 벨기에 사이에서도 비슷하게 어긋났습니다. 누가 틀렸을까요? 리처드슨이 찾은 설명은 어느 쪽도 계산을 틀리지 않았을 수 있다는 것이었습니다. 짧은 자로 잴수록 구불구불한 곳을 더 많이 따라가니 국경이 더 길게 나옵니다. 그리고 해안선이나 강을 따라가는 국경에는 '자와 상관없는 참길이'라는 것이 없을 수도 있습니다.
이 글의 질문은 이것입니다. 잰다는 것은 무엇이고, 잰 숫자는 언제 믿을 수 있는가? 답을 따라가다 보면 서로 멀어 보이던 것들이 한 가지 모양으로 모입니다. 해안선의 프랙털 차원(fractal dimension), 심리학자들이 싸운 측정의 정의, 버스 정류장의 대기 시간, 야구 타율, 지능 검사의 역사, 그리고 오늘날의 인공지능(artificial intelligence)이 점수를 속이는 방식입니다. 모든 측정에는 세 가지 선택이 숨어 있습니다. 무엇으로 재는가(자의 크기, 숫자를 붙이는 규칙), 무엇을 세는가(누구에게 묻고 어떻게 합치는가), 그리고 잰 다음에 무엇을 하는가(그 숫자를 목표로 삼는가)입니다. 제목의 '바뀐다'는 물리학에서 말하는 관측의 문제와는 다른 이야기입니다. 여기서 바뀌는 것은 대개 세계가 아니라 숫자이고, 8절에서는 숫자를 좇는 사람들 때문에 세계도 바뀝니다.
1 · 1950년 무렵 스코틀랜드자가 짧을수록 길어지는 국경
이 절의 물음은 이것입니다. 같은 국경을 잰 두 숫자가 다를 때, 누가 틀렸는지 가릴 수 있을까? 아니면 '길이'라는 질문 자체에 자가 숨어 있을까?
리처드슨이 한 일을 그대로 해 봅시다. 컴퍼스(디바이더)를 일정한 폭으로 벌리고 해안선의 한쪽 끝에 한 발을 댑니다. 다른 발이 해안선에 닿는 곳으로 건너가고, 거기서 다시 건너가기를 반대쪽 끝까지 되풀이합니다. 걸음 수에 폭을 곱하면 잰 길이입니다. 아래 그림의
자를 300 km에서 6 km까지 줄여 보세요. 잰 길이는 줄지 않고 계속 늘어납니다. 짧은 자는 긴 자가 건너뛴 만과 곶을 하나하나 따라 들어가기 때문입니다. 이 해안선은 선분 하나를 같은 길이의 네 토막으로 바꾸는 일을 되풀이해 만들었습니다. 양 끝의 두 토막은 원래 선분 위에 두고, 가운데 두 토막은
오른쪽 그림이 리처드슨의 발견입니다. 자의 길이
로그 눈금에서 직선이라는 것은
매끄러운 곡선에서는
흔히 이것을 '해안선의 길이는 무한하다'로 요약하지만, 조금 더 정확히 말해야 합니다. 실제 해안선은 모래알보다 작게 들쭉날쭉하지 않고, 파도와 조수 때문에 경계가 늘 움직입니다. 거듭제곱 관계는 리처드슨이 잰 범위(수 km에서 수백 km)에서 관찰된 사실이지, 모든 규모에서 성립하는 정리가 아닙니다. 확실하게 말할 수 있는 것은 이것입니다. 해안선의 길이는 자의 길이를 함께 말하지 않으면 뜻이 없는 숫자입니다. 반면 자에 따라 길이가 변하는 빠르기, 곧 지수
정리하면, 들쭉날쭉한 곡선의 잰 길이는 자의 길이에 따라 거듭제곱으로 변하고, 두 숫자가 다른 것은 누가 틀려서가 아니라 자가 달라서일 수 있습니다. 믿을 만한 숫자는 길이가 아니라 그 변하는 빠르기
숫자가 재는 방법에 따라 달라지는 문제에, 나라들이 오래전부터 내놓은 답은 재는 도구를 하나로 맞추는 것이었습니다. 1441년 조선 세종 때 만든 측우기가 좋은 예입니다. 그전에는 빗물이 땅에 스며든 깊이로 비의 양을 어림했는데, 흙마다 물을 빨아들이는 정도가 달라 고을끼리 숫자를 견줄 수 없었습니다. 그래서 정해진 크기의 원통 그릇에 고인 빗물의 깊이를 눈금 자로 재게 하고, 1442년 같은 규격의 측우기를 각 도의 관아에 내려보냈습니다. 농사를 돌보려면 여러 고을의 비를 한 잣대로 견주어야 했기 때문입니다. 350여 년 뒤 혁명기의 프랑스는 길이의 단위 자체를 새로 정했습니다. 1792년부터 6년여 동안 천문학자 들랑브르와 메생이 됭케르크에서 바르셀로나까지 자오선(meridian)을 삼각측량(triangulation)해, 북극에서 적도까지 거리의 1000만분의 1을 1미터로 삼았습니다. 그러나 리처드슨의 국경은 단위를 맞추어도 남는 문제가 있음을 보여 줍니다. 두 나라가 모두 킬로미터로 적었어도, 몇 킬로미터짜리 걸음으로 따라갔는지가 다르면 숫자가 달라집니다.
2 · 1967년 요크타운하이츠차원이라는 새로운 자
이 절의 물음은 이것입니다. 리처드슨의 지수
리처드슨의 「인접의 문제」는 『일반 체계 연감』에 실린 채 거의 읽히지 않았습니다. 그것을 찾아낸 사람이 IBM 연구소의 수학자 브누아 망델브로입니다. 1967년 그는 『사이언스』에 「영국의 해안선은 얼마나 긴가? 통계적 자기 닮음(self-similarity)과 분수 차원」을 실어, 리처드슨의 지수
왜 이것이 차원일까요? 익숙한 도형으로 돌아가 봅시다. 선분을 3분의 1로 줄인 복사본 3개를 이어 붙이면 원래 선분이 됩니다. 정사각형은 3분의 1로 줄인 복사본 9개, 정육면체는 27개가 필요합니다. 복사본의 수는
1904년 스웨덴의 수학자 헬게 폰 코흐가 만든 곡선에 이 식을 써 봅시다. 1872년 바이어슈트라스가 어느 점에서도 미분(differentiation)할 수 없는 연속함수를 무한급수(infinite series)로 내놓자 많은 수학자가 그것을 괴물 취급했습니다. 이 함수(function)가 '순간의 기울기'라는 생각에 던진 물음은 「순간의 속도」에 있습니다. 코흐는 같은 성질의 곡선을 식 대신 초등 기하(geometry)의 작도만으로 보이려 했고, 그렇게 나온 것이 이 곡선입니다. 선분을 셋으로 나누고 가운데 토막을 정삼각형의 두 변으로 바꾸기를 끝없이 되풀이한 곡선입니다. 코흐 곡선(Koch curve)은 3분의 1로 줄인 자기 복사본 4개로 이루어지므로
1절의 그림에서 꺾임각을 60°로 두면 이 곡선의 방향을 제멋대로 뒤집은 것이 됩니다. 이때 점들의 기울기에서 읽은 차원(
여기서 프랙털 차원이 '측정'에 관한 개념이라는 점이 드러납니다. 코흐 곡선에 1차원의 자(길이)를 대면 무한대가 나오고, 2차원의 자(넓이)를 대면 0이 나옵니다. 둘 다 틀린 답은 아니지만, 곡선에 관해 아무것도 알려 주지 않습니다. 1918년에 쓴 논문에서 독일의 수학자 펠릭스 하우스도르프는 차수
익숙한 도형으로 먼저 따라가 봅시다. 한 변이 1인 정사각형을 한 변
코흐 곡선을
이 생각은 앙리 르베그가 1902년 학위 논문에서 세운 '측도'의 이론 위에 서 있습니다. 측도는 길이·넓이·부피를 한데 부르는 말입니다. 르베그는 측도가 지켜야 할 규칙을 먼저 정했습니다. 겹치지 않는 조각들을 합친 도형의 측도는 각 조각의 측도의 합이어야 하고(조각이 가산 개, 곧 1번, 2번, 3번… 하고 번호를 붙일 수 있는 만큼 무한히 많아도), 도형을 옮겨도 측도는 변하지 않아야 합니다. 이 규칙으로 르베그 적분(Lebesgue integral)이 나왔습니다.
규칙이 있으면 규칙이 닿지 않는 곳도 생깁니다. 칸토어 집합(Cantor set)은 0부터 1까지의 선분에서 가운데 3분의 1을 빼고, 남은 두 토막에서 또 가운데 3분의 1을 빼기를 끝없이 되풀이하고 남은 점들입니다. 뺀 길이는
1905년 이탈리아의 주세페 비탈리는 선택공리(무한히 많은 주머니에서 하나씩을 한꺼번에 골라 낼 수 있다는 공리(axiom))를 받아들이면, 위의 두 규칙을 지키고 구간에는 제 길이를 주는 한, 어떤 길이도 모순 없이 매길 수 없는 실수의 부분집합(subset)이 있음을 보였습니다. 잴 수 있다는 것 자체가 당연하지 않다는 뜻입니다.
1924년 폴란드의 스테판 바나흐와 알프레트 타르스키는 같은 선택공리(axiom of choice)로 더 이상한 결과를 보였습니다. 3차원의 공 하나를 유한 개의 조각으로 나눈 뒤, 조각들을 늘이거나 줄이지 않고 옮기고 돌리기만 해서 원래와 같은 크기의 공 두 개로 다시 짜 맞출 수 있다는 것입니다. 조각들에 부피를 매길 수 없어서 가능한 일입니다. 조각들에 부피가 있다면 옮기고 돌려도 부피의 합이 그대로여야 하니 공 하나가 공 둘이 될 수 없습니다.
1933년 콜모고로프가 확률(probability)을 측도로 세울 때 모든 부분집합이 아니라 '잴 수 있는' 사건(event)들에만 확률을 준 것도 이 때문입니다(「도박판에서 온 편지」 7절).
망델브로가 이 논문에 이르기까지 걸어온 길이 그 자체로 이야기입니다. 1924년 바르샤바의 유대인 가정에서 태어난 그는 1936년 가족과 함께 파리로 옮겼고, 독일 점령기에는 프랑스 시골에서 신분을 숨기고 지냈습니다. 전쟁 뒤 에콜 폴리테크니크에서 공부하고 1958년 IBM 연구소에 들어간 그가 먼저 붙든 것은 해안선이 아니라 전화선의 오류와 목화 값이었습니다. 1963년 그는 두 가지를 보고했습니다. 전화선의 오류가 고르게 흩어지지 않고 어느 시간 규모로 보아도 비슷하게 뭉쳐 온다는 것(「잡음 너머로」 8절), 그리고 목화 값의 하루 변동이 정규분포(normal distribution)보다 훨씬 두꺼운 꼬리를 보인다는 것입니다. 규모를 바꿔도 되풀이되는 들쭉날쭉함과 8절에서 다시 볼 두꺼운 꼬리가 해안선보다 먼저 그의 주제였습니다. 리처드슨의 연구가 발표되기 전에 같은 현상을 적은 사람도 있습니다. 폴란드의 수학자 후고 슈타인하우스는 1954년 논문 「길이, 모양, 넓이」에서, 비스와강의 왼쪽 기슭을 점점 더 정밀하게 재면 학교 지도에서 읽은 길이의 열 배, 백 배, 심지어 천 배가 나올 것이라고 썼습니다. 1916년 무렵 크라쿠프의 공원 벤치에서 젊은 바나흐를 만나 그를 자신의 가장 큰 '발견'이라 불렀다는 그 슈타인하우스입니다. 두 사람이 르부프에서 함께 한 일은 「이기는 쪽이 존재한다」 7절에 있습니다.
르베그의 측도는 네 해 앞서 에밀 보렐이 1898년 내놓은 생각을 넓힌 것이었습니다. 하우스도르프의 차원도 같은 줄기에서 나왔습니다. 1914년 콘스탄티노스 카라테오도리가 르베그의 생각을 일반화해 외측도(어떤 집합(set)이든 바깥에서 덮어 크기를 어림하는 방법)의 틀을 세웠고, 하우스도르프는 이것을 차수가 실수인 경우로 넓혔습니다. 브레슬라우에서 태어난 유대계 수학자 하우스도르프는 1914년 『집합론(set theory) 개요』에서 '거리 공간(metric space)'이라는 이름을 붙인 사람이기도 합니다(「까마귀와 택시」 4절). 1935년 나치 정권에 교수직을 빼앗긴 그는 1942년 1월 강제 수용소로 끌려가게 되자 아내, 처제와 함께 스스로 목숨을 끊었습니다.
자를 다시 생각한 한 세기. 수학 줄(파랑)에 칸토어, 르베그, 코흐, 하우스도르프가 이어지고, 과학 줄(청록)의 리처드슨의 국경이 대서양을 건너 망델브로의 1967년 논문이 됩니다.
망델브로는 1975년 '부서진'이라는 뜻의 라틴어에서 '프랙털(fractal)'이라는 말을 지었고, 1982년 『자연의 프랙털 기하학』에서 구름과 산맥, 혈관, 주가의 움직임에서 같은 모양을 찾았습니다. 1998년 일본의 수학자 시시쿠라 미쓰히로는 망델브로가 그린 망델브로 집합(Mandelbrot set)의 경계가 하우스도르프 차원(Hausdorff dimension) 2라는 것을 증명했습니다. 평면 위의 경계인데도 차원으로는 평면과 같다는 뜻입니다. 다만 이 경계의 넓이가 0보다 큰지는 아직 아무도 모릅니다. 그리고 두 축을 모두 로그로 찍었을 때 직선이 나오는 관계, 곧 거듭제곱 법칙(power law)은 이 글에서 여러 번 다시 나옵니다. 측정의 결과가 '한 숫자'가 아니라 '규모에 따라 변하는 방식'일 때, 그 방식을 요약하는 자연스러운 숫자가 지수이기 때문입니다.
정리하면, 차원은 '크기를 몇 배로 할 때 복사본이 몇 제곱으로 필요한가'이고, 그 수가 정수(integer)가 아닌 곡선에는 길이도 넓이도 아닌
3 · 1946년 하버드숫자를 붙이는 규칙
이 절의 물음은 이것입니다. 대상에 숫자를 붙였을 때, 그 숫자로 무엇을 말해도 되고 무엇을 말하면 안 될까? 평균을 내거나 '두 배'라고 말하는 것이 언제 뜻이 있을까?
감각을 재려는 시도는 1860년 독일의 물리학자이자 철학자 구스타프 페히너의 『정신물리학 원론』으로 거슬러 올라갑니다. 페히너는 사람이 겨우 알아챌 수 있는 자극의 차이를 감각의 한 눈금으로 삼고 그 눈금들을 쌓아, 감각의 크기가 자극 세기의 로그에 비례한다고 보았습니다(베버–페히너 법칙, Weber–Fechner law). 무게가 두 배, 네 배, 여덟 배가 될 때 느낌은 한 칸씩 고르게 커진다는 것입니다. 로그는 곱셈을 덧셈으로 바꾸므로, 자극이 같은 배율로 커질 때마다 감각이 같은 양만큼 커진다는 말과 같습니다. 그러나 '겨우 알아챌 수 있는 차이'들이 정말 같은 크기인지는 아무도 확인할 수 없었습니다.
1932년 영국 과학진흥협회는 위원회 하나를 꾸렸습니다. 물리학자 A. 퍼거슨이 이끈 이 위원회의 질문은 "감각의 크기를 정말로 잴 수 있는가"였습니다. 심리학자들은 소리가 '두 배 크게' 들린다는 판단을 모아 크기의 척도를 만들고 있었습니다. 위원 가운데 물리학자 노먼 캠벨은 그것이 측정이 아니라고 주장했습니다. 길이나 무게를 잴 수 있는 것은 막대 두 개를 이어 붙이거나 추 두 개를 한 접시에 올리는 '더하기'가 실제로 있기 때문인데, 감각에는 그런 더하기가 없다는 것입니다. 8년의 논의 끝에 1940년 나온 최종 보고서에서 위원들은 합의하지 못했습니다.
캠벨의 기준에는 수학의 뒷받침이 있었습니다. 1901년 라이프치히의 수학자 오토 횔더는 「양의 공리와 측정 이론」에서, 크기를 견주는 순서와 이어 붙이는 더하기가 몇 가지 공리를 지키면 그 양들을 양의 실수로, 이어 붙이기를 수의 덧셈으로 그대로 옮겨 적을 수 있음을 증명했습니다. 길이와 무게가 수로 잴 수 있는 양인 까닭을 공리에서 끌어낸 것입니다. 반대쪽의 생각은 하버드에서 자랐습니다. 1927년 하버드의 물리학자 퍼시 브리지먼은 『현대 물리학의 논리』에서, 개념의 뜻은 그것을 재는 조작들의 모음과 같다는 조작주의를 내놓았습니다. 같은 대학의 젊은 심리학자 스탠리 스미스 스티븐스는 1935년부터 이 생각을 심리학에 들여오는 글들을 썼습니다. 재는 절차가 곧 개념이라면, 더하기가 없어도 규칙에 따라 수를 매기는 절차만 있으면 잴 수 있다는 결론이 됩니다.
1946년 하버드의 심리학자 스탠리 스미스 스티븐스는 『사이언스』에 네 쪽짜리 논문 「측정 척도의 이론에 관하여」를 실어 이 논쟁에 다른 답을 내놓았습니다. 측정이란 규칙에 따라 대상에 숫자를 붙이는 일이고, 규칙이 달라지면 숫자로 할 수 있는 일도 달라진다는 것입니다. 그는 척도를 네 가지로 나누었고, 나누는 기준은 '숫자를 어떻게 바꿔 붙여도 같은 정보가 남는가'였습니다. 아래에서
- 명목 척도(nominal scale). 등번호, 혈액형 번호처럼 이름표 구실만 하는 숫자입니다. 서로 다른 것에 서로 다른 숫자를 붙이기만 하면 어떻게 바꿔 붙여도 됩니다. 번호들을 서로 맞바꾸는 이런 바꿈을 순열(permutation)이라 합니다. 의미 있는 통계는 개수와 최빈값 정도입니다.
- 서열 척도(ordinal scale). 만족도 설문의 1–5점, 경주의 등수처럼 순서만 뜻이 있는 숫자입니다. 순서를 지키는 한 어떤 증가함수(큰 수를 늘 더 큰 수로 보내는 바꿈)로 바꿔 붙여도 됩니다. 1, 2, 3, 4, 5를 1, 2, 4, 8, 16으로 바꿔도 순서는 같습니다. 중앙값(median)과 백분위수는 뜻이 있지만, 평균은 그렇지 않을 수 있습니다(곧 그림으로 봅니다).
- 등간 척도(interval scale). 섭씨·화씨 온도처럼 차이의 크기는 뜻이 있지만 0의 자리가 임의인 숫자입니다.
( )로 바꿔도 됩니다. 평균, 분산(variance), 상관계수(correlation coefficient)는 뜻이 있지만 비는 뜻이 없습니다. - 비율 척도(ratio scale). 길이, 무게, 절대 온도(absolute temperature)처럼 0이 진짜 '없음'인 숫자입니다. 단위만 바꿀 수 있습니다(
). 여기서는 "두 배"라는 말도 뜻이 있습니다.
온도로 확인해 봅시다. 어제 10°C, 오늘 20°C라면 "오늘이 두 배 덥다"고 할 수 있을까요? 같은 두 날을 화씨로 적으면 50°F와 68°F라서 1.36배이고, 절대 온도로 적으면 283.15 K와 293.15 K라서 1.035배입니다. 단위를 바꾸었을 뿐인데 '몇 배'가 달라지니, 섭씨의 비는 온도에 관한 사실이 아니라 섭씨라는 규칙이 만든 인공물입니다. 반면 "어제에서 오늘까지 오른 폭은 그제에서 어제까지 오른 폭과 같다" 같은 차이의 비교는 어느 단위로 적어도 참이면 참, 거짓이면 거짓으로 남습니다.
이것을 서열 척도에서 해 봅시다. 두 가게의 손님 12명씩에게 만족도를 물었습니다.
손으로 먼저 해 봅시다. 가게 A의 12명은 '불만' 1명, '보통' 3명, '만족' 8명이고, 가게 B의 12명은 '매우 불만' 3명, '불만' 1명, '보통' 2명, '만족' 1명, '매우 만족' 5명입니다. 1, 2, 3, 4, 5를 붙이면 A의 평균은 (2 + 3 × 3 + 4 × 8) ÷ 12 = 43 ÷ 12 ≈ 3.58, B는 (1 × 3 + 2 + 3 × 2 + 4 + 5 × 5) ÷ 12 = 40 ÷ 12 ≈ 3.33으로 A가 앞섭니다. 이번에는 순서를 지키면서 1, 1.5, 2, 2.5, 5를 붙여 봅시다. A는 (1.5 + 2 × 3 + 2.5 × 8) ÷ 12 = 27.5 ÷ 12 ≈ 2.29, B는 (1 × 3 + 1.5 + 2 × 2 + 2.5 + 5 × 5) ÷ 12 = 36 ÷ 12 = 3으로 B가 앞섭니다. 같은 응답인데 평균의 순위가 뒤집혔습니다. 그림에서 직접 끌어 보세요.
지금 붙인 숫자는 (
여기에 이 절의 핵심이 있습니다. 스티븐스의 분류는 '어떤 바꿔 붙이기를 허락하는가'라는 변환의 군으로 척도를 나눈 것입니다. 여기서 군은 '허락된 바꿈 둘을 잇달아 해도, 한 바꿈을 되돌려도 여전히 허락된 바꿈인' 바꿈들의 모임을 가리킵니다. 섭씨를 화씨로 바꾸고 다시 절대 온도 식으로 바꾸어도 여전히
그렇다고 만족도의 평균을 내면 안 된다는 뜻은 아닙니다. 1953년 통계학자 프레더릭 로드는 「미식축구 등번호의 통계적 처리에 관하여」라는 짧은 풍자글에서, "숫자는 자기가 어디서 왔는지 모른다"며 스티븐스의 규칙을 너무 엄격하게 따르는 태도를 꼬집었습니다. 평균이 가리키는 판정이 그럴듯한 번호 매기기들에서 모두 같다면 평균을 믿어도 됩니다. 물어야 할 질문은 "이 척도가 서열인가"라는 분류가 아니라, "내 결론이 번호를 바꿔 붙여도 살아남는가"입니다. 위의 그림은 그 질문을 직접 던지는 도구입니다.
스티븐스 자신은 측정을 넓게 잡은 이 정의를 들고 실험실로 돌아갔습니다. 사람들에게 소리나 빛의 세기를 수로 직접 매기게 하자(크기 추정법, magnitude estimation), 답은 페히너의 로그가 아니라 자극 세기의 거듭제곱을 따랐습니다. 1957년 논문 「정신물리 법칙에 관하여」에서 그는 페히너의 법칙을 감각 = 상수 × 자극지수 꼴의 거듭제곱 법칙으로 바꾸자고 했고, 지수는 감각마다 달랐습니다. 두 축을 모두 로그로 찍어 직선을 찾는다는 점에서 1절의 리처드슨과 같은 방법입니다. 캠벨이라면 여전히 측정이 아니라고 했겠지만, 스티븐스에게는 규칙에 따라 붙인 수로 충분했습니다. 무엇을 측정이라 부를지부터가 이 논쟁의 대상이었던 것입니다.
4 · 버스 정류장누구에게 묻는가
이 절의 물음은 이것입니다. 같은 사실을 두고 두 사람이 서로 다른 '평균'을 정직하게 말할 수 있을까? 이번에는 숫자를 붙이는 규칙이 아니라 무엇을 세는가를 봅시다. 버스 회사가 "우리 노선의 버스는 평균 10분마다 옵니다"라고 발표합니다. 아무 때나 정류장에 나간 승객은 평균 몇 분을 기다릴까요? 많은 사람이 5분이라고 답합니다. 버스가 정확히 10분마다 온다면 맞습니다. 그러나 버스가
10시간 동안의 기록으로 계산하면
까닭은 왼쪽 그림에 있습니다.
작은 예로 확인해 봅시다. 간격이 4분과 16분 두 개뿐인 20분을 생각합니다. 4분 간격에 들어온 승객은 평균 2분, 16분 간격에 들어온 승객은 평균 8분을 기다립니다. 승객이 1분에 한 명씩 고르게 온다면 20명 가운데 4명은 짧은 간격에, 16명은 긴 간격에 들어가니, 평균 대기는 (4 × 2 + 16 × 8) ÷ 20 = 136 ÷ 20 = 6.8분입니다. 톱니 넓이로 보면
간격이
여기서
이것을 기댓값의 말로 적으면 이렇습니다. 버스 회사는 간격마다 같은 무게 1을 주어 평균을 내고, 승객은 간격마다 그 길이에 비례하는 무게를 주어 평균을 냅니다. 둘 다 정직한 평균이지만 서로 다른 평균입니다.
확률론에서는 이것을 검사의 역설(inspection paradox), 또는 크기에 비례해 뽑히는 표본의 치우침이라고 부릅니다. 윌리엄 펠러는 1966년 확률론 교과서의 둘째 권에서 이것을 '대기 시간의 역설(waiting-time paradox)'이라 부르며 널리 알렸습니다. 같은 일이 곳곳에서 일어납니다. 학생 10명인 반과 90명인 반만 있는 학교는 "평균 학급 크기 50명"이라고 발표하지만, 학생에게 물으면 평균
정리하면, 버스 회사의 평균은 간격마다 같은 무게를, 승객의 평균은 간격의 길이만큼의 무게를 준 평균이고, 두 평균의 차이는 간격의 분산이 만듭니다.
5 · 1995–1996년 뉴욕과 애틀랜타합치면 뒤집힌다
이 절의 물음은 이것입니다. 해마다 앞선 선수가 두 해를 합치면 질 수 있을까? 있다면 그 까닭을 그림 한 장으로 볼 수 있을까? 평균이 무게를 고르는 일이라는 것을 알면, 더 이상한 현상도 설명됩니다. 1995년과 1996년 두 시즌 동안 뉴욕 양키스의 데릭 지터와 애틀랜타 브레이브스의 데이비드 저스티스의 타율(안타 수 ÷ 타수)을 봅시다. 수학자 켄 로스가 『야구장의 수학자』(2004)에서 소개한 자료입니다. 1995년에는 지터가 48타수 12안타로 .250, 저스티스가 411타수 104안타로 .253이었습니다. 1996년에는 지터가 582타수 183안타로 .314, 저스티스가 140타수 45안타로 .321이었습니다. 두 해 모두 저스티스가 앞섭니다. 그런데 두 해를 합치면 지터는 630타수 195안타로 .310, 저스티스는 551타수 149안타로 .270입니다. 해마다 진 지터가 합계에서 이깁니다.
이것이 심슨의 역설(Simpson's paradox)입니다. 결석 치료와 버클리 대학원 입학 자료로 본 설명은 위키와 「담배와 폐암」에 있으니, 여기서는 같은 현상을 벡터(vector)의 덧셈으로 봅시다. 한 선수의 한 시즌을 (타수, 안타)라는 화살표로 그리면, 화살표의 기울기가 곧 타율입니다. 두 시즌을 합치는 것은 두 화살표를 이어 붙이는 것이고, 합친 타율은 처음에서 끝까지 잇는
화살표를 보면 뒤집힘이 자연스럽습니다.
4절과 5절은 같은 이야기입니다. 모든 평균은 가중 평균이고, 무게는 측정하는 방식이 고릅니다. 버스 회사와 승객은 같은 간격들에 서로 다른 무게를 주었고, 지터와 저스티스는 두 시즌에 서로 다른 무게(타수)를 주었습니다. 합친 타율은 두 시즌 타율 사이의 한 점이고, 그 점이 어디에 놓일지는 타수의 비율이 정합니다. 지터로 적으면 합친 타율은 (48 × .250 + 582 × .314) ÷ 630으로, 타수 48과 582를 무게로 준 평균입니다. 무게의 92%가 1996년에 있으니 합계 .310은 1996년의 .314 가까이 놓입니다. 저스티스는 무게의 75%가 1995년(411 ÷ 551)에 있어서 합계 .270이 1995년의 .253 쪽으로 끌려갑니다. 그래서 두 집단이 부분마다 같은 순서여도, 무게가 다르면 전체의 순서는 어느 쪽으로든 나올 수 있습니다.
그렇다면 누가 더 나은 타자였을까요? 표만으로는 답이 정해지지 않습니다. 1995년은 지터가 메이저리그에 데뷔한 해로, 그는 시즌 대부분을 마이너리그에서 보냈습니다. 두 해의 투수와 구장도 달랐습니다. 나눠 본 결과를 믿을지 합친 결과를 믿을지는 무게의 차이가 어디서 왔는지, 곧 무엇이 무엇의 원인인지에 달려 있습니다. 여기서 '연도'처럼 무게(누가 어느 해에 많이 쳤는가)와 결과(타율) 양쪽에 얽힌 제3의 요인이 교란 변수(confounding variable)이고, 그것을 가려내는 방법이 「담배와 폐암」의 주제입니다.
정리하면, 합친 비율은 부분 비율들의 가중 평균이어서 두 집단의 무게가 다르면 부분의 순서와 전체의 순서가 어긋날 수 있고, 어느 쪽을 믿을지는 수학이 아니라 무게가 생긴 까닭이 정합니다.
6 · 1886년과 1904년 런던잡음이 섞인 자
이 절의 물음은 이것입니다. 자 자체가 떨린다면, 잰 숫자는 어떤 쪽으로 어긋날까? 우연히 흔들리기만 할까, 아니면 한쪽으로 치우칠까?
이제 자 자체가 떨리는 경우를 봅시다. 몸무게를 재면 체중계가 조금씩 다른 값을 보여 주고, 같은 학생이 같은 시험을 두 번 보면 점수가 다릅니다. 잰 값은 참값에 잡음이 더해진 것입니다. 심리 측정에서는 잰 점수의 분산(점수가 평균에서 벗어난 양의 제곱을 평균한 것, 곧 흩어짐의 크기) 가운데 참값이 차지하는 몫을 그 검사의 신뢰도라고 부릅니다. 참값과 잡음이 서로 무관하면 잰 점수의 분산은 참값의 분산과 잡음의 분산의 합이므로, 신뢰도 = 참값의 분산 ÷ (참값의 분산 + 잡음의 분산)입니다. 신뢰도가 1이면 잡음이 없고, 0.5면 점수의 분산 가운데 절반이 잡음에서 옵니다.
신뢰도를 높이는 가장 오래된 방법은 비슷한 문항을 더 많이 묻는 것입니다. 1910년 영국의 심리학자 찰스 스피어먼과 윌리엄 브라운은 같은 해 같은 학술지에 따로, 비슷한 문항을
공식이 어디서 나오는지 따라가기
문항 하나의 참값 분산을
잡음 섞인 자가 만드는 첫째 착시는 1886년 프랜시스 골턴이 이름 붙인 평균으로의 회귀(regression to the mean)입니다. 첫 시험에서 가장 높은 점수를 받은 학생들은 실력도 좋았지만 대개 운도 좋았습니다. 두 번째 시험에서 운은 따라오지 않으니, 그들의 평균 점수는 전체 평균 쪽으로 물러납니다. 실력이 좋았던 만큼 여전히 전체 평균보다는 높지만, 첫 시험만큼 높지는 않습니다. 심리학자 대니얼 카너먼은 1974년 아모스 트버스키와 함께 『사이언스』에 쓴 글에서 이런 이야기를 소개했습니다. 그는 1960년대 이스라엘 공군의 비행 교관들에게 칭찬보다 꾸중이 효과적이라는 말을 들었습니다. 잘한 훈련생을 칭찬하면 다음 비행에서 못하고, 못한 훈련생을 꾸중하면 다음에 나아진다는 것입니다. 카너먼은 그것이 칭찬과 꾸중의 효과가 아니라, 가장 잘하고 가장 못한 비행을 골라 보았기 때문에 생기는 회귀라고 설명했습니다. 이 현상을 직접 끌어 보는 그림은 위키의 평균으로의 회귀 페이지에 있습니다.
둘째 착시는 덜 알려져 있습니다. 두 가지 능력이 실제로 얼마나 관련되어 있는지 알고 싶다고 합시다. 두 능력을 각각 잡음 섞인 검사로 재고 두 점수의 상관계수를 구하면, 그 값은 참값들의 상관보다 체계적으로 0에 가깝게, 곧 양의 상관이면 더 작게 나옵니다. 아래 그림에서 두 능력의 참값의 상관은
여기서
이 식은 어두운 면도 알려 줍니다. 신뢰도를 추정하는 일에도 오차가 있어서, 보정한 상관이 1을 넘는 일이 실제로 생깁니다. 상관계수는 1을 넘을 수 없으니, 그런 값은 보정이 추정과 가정에 기대고 있다는 신호입니다. 또 '잡음이 참값과 무관하다'는 가정이 깨지면 보정은 엉뚱한 쪽으로 갑니다. 가정에서 나온 식은 가정이 맞을 때만 믿을 수 있다는, 당연하지만 자주 잊히는 사실입니다. 그리고 같은 해 스피어먼은 이 도구를 들고 훨씬 큰 질문으로 나아갔습니다.
정리하면, 잡음 섞인 자는 우연히만 흔들리지 않고 한쪽으로 치우친 착시를 만듭니다. 극단값을 골라 다시 재면 평균 쪽으로 돌아오고(회귀), 두 양의 관계를 재면 실제보다 약하게 나옵니다(희석).
7 · 1904–1938년보이지 않는 것을 재기: 요인과 지능 검사
이 절의 물음은 이것입니다. 눈에 보이지 않는 능력을, 눈에 보이는 점수들 사이의 상관만으로 잴 수 있을까? 잰다면 그 결과는 하나로 정해질까?
스피어먼은 영국의 한 예비학교 학생들의 과목 성적과 음높이 구별 능력을 모아 서로의 상관을 계산했습니다. 고전어와 프랑스어의 상관은 .83, 영어와 수학은 .64, 음높이 구별과 음악은 .40이었고(그가 보고한 표의 값입니다), 모든 쌍의 상관이 양수였습니다. 한 과목을 잘하는 학생은 다른 과목도 잘하는 경향이 있었던 것입니다. 이런 '모든 상관이 양수'인 패턴은 그 뒤 한 세기 동안 거의 모든 인지 검사 묶음에서 되풀이해 관찰되었습니다. 이 패턴을 양의 다양체(positive manifold)라고 부릅니다.
스피어먼은 이 패턴을 가장 간단하게 설명하는 모형을 세웠습니다. 모든 검사 점수가 하나의 공통 요인
1938년 시카고의 루이스 서스톤은 검사 56개를 분석해, 하나의
지금 요인 1의 방향은
이것이 요인의 회전 불확정성입니다. 요인이 둘 이상이면, 상관표는 요인 공간에서 검사들의 상대적인 배치만 정하고 축의 방향은 정하지 않습니다. 첫째 축을 화살표들의 한가운데로 돌리면 모든 검사가 크게 실리는 '일반 요인'과 말 대 수를 가르는 양극 요인이 보이고, 축을 두 무리에 하나씩 맞추면 일반 요인 없이 '언어'와 '수리' 두 능력이 보입니다. 어느 쪽이 '참된' 요인인지는 상관표가 아니라 다른 근거가 정해야 합니다. 서스톤은 각 검사가 되도록 적은 요인에 실리는 '단순 구조(simple structure)'를 기준으로 삼았습니다. 그런데 그렇게 찾은 기본 능력들이 서로 양의 상관을 보였고, 그 상관을 다시 분석하면 윗단에 일반 요인이 나왔습니다. 1993년 존 캐럴은 460여 개의 자료를 다시 분석해 일반 요인 아래 넓은 능력들, 그 아래 좁은 능력들이 있는 3층 모형을 내놓았습니다. 오늘날 많은 연구가 이런 위계 모형을 씁니다.
정리하면, 상관표는 검사 화살표들의 서로 간 각도와 길이만 정하고, 요인의 축을 어디에 둘지는 정하지 않습니다. 하나의 일반 요인도, 여러 기본 능력도 같은 상관표의 서로 다른 읽기입니다.
수학과 나란히, 지능 검사는 전혀 다른 길로 자랐습니다. 스피어먼과 같은 무렵 파리에서는 다른 일이 있었습니다. 1880년대 초 쥘 페리의 교육법으로 프랑스에서 모든 아이가 학교에 다녀야 하는 무상 의무 교육이 시작되자, 수업을 따라가지 못하는 아이를 어떻게 가려내 도울지가 행정의 문제가 되었습니다. 1904년 교육부는 이 문제로 위원회를 꾸렸습니다. 여기에 들어간 심리학자 알프레드 비네가 이듬해인 1905년 의사 테오도르 시몽과 함께, 특별한 도움이 필요한 아이를 가려내는 검사를 만들었습니다. 쉬운 것부터 어려운 것까지 문제 30개를 늘어놓은 검사였고, 1908년 개정판부터는 몇 살 아이들이 보통 풀 수 있는지로 문제를 묶어 '정신 연령'을 정했습니다. 비네는 이 척도가 키처럼 재는 것이 아니라고 분명히 적었습니다. 지적인 성질은 이어 붙여 더할 수 없으니, 선분을 재듯 잴 수 없다는 것입니다. 3절의 캠벨과 같은 말이고, 스티븐스의 말로 하면 서열 척도라는 뜻입니다.
그러나 숫자는 곧 한 줄로 요약되었습니다. 1912년 브레슬라우의 심리학자 빌헬름 슈테른이 정신 연령을 실제 나이로 나눈 '지능 지수'를 제안했고, 1916년 스탠퍼드의 루이스 터먼은 여기에 100을 곱한 스탠퍼드–비네 검사를 펴냈습니다. 1917–1918년 미국 육군은 로버트 여키스의 주도로 신병 약 175만 명에게 집단 검사를 치렀습니다. 그리고 이 숫자들은 과학이 감당할 수 없는 곳까지 쓰였습니다. 1923년 프린스턴의 심리학자 칼 브리검은 육군 검사 자료로 『미국인의 지능 연구』를 써서 이민자 집단들 사이에 '지능'의 우열이 있다고 주장했습니다. 이 책은 출신국별로 이민을 제한한 1924년 이민법을 둘러싼 의회 논의에서 인용되었습니다. 브리검은 1930년, 점수가 영어 실력과 미국에 산 햇수에 크게 좌우되었다며 자기 연구가 "완전히 무너진다"고 거두어들였습니다. 그사이 그는 1926년 대학 입학을 위한 시험 SAT를 만들었습니다. 1927년 미국 대법원은 벅 대 벨 판결에서 '정신박약'으로 분류된 여성의 강제 불임을 합헌이라고 했고, 여러 나라의 우생학 정책이 비슷한 분류에 기댔습니다. 측정 도구의 역사를 말할 때 이 사실을 빼놓을 수는 없습니다.
무엇이 확립되었고 무엇이 열려 있는지 나누어 말하는 것이 공정합니다. 인지 검사 점수들이 서로 양의 상관을 보이며, 그것을 요약하는 하나의 수가 학업 성적 같은 결과를 꽤 예측한다는 것은 여러 나라의 자료에서 되풀이된 관찰입니다. 미국 심리학회의 1996년 보고서 「지능: 알려진 것과 알려지지 않은 것」은 지능 검사 점수와 학교 성적의 상관을 약 0.5로 정리했습니다. 상관이 0.5라는 것은 같은 점수의 학생들 사이에서도 성적이 넓게 흩어진다는 뜻이기도 합니다.
반면
한편 검사 점수의 기준 자체도 움직였습니다. 제임스 플린은 1984년(미국)과 1987년(14개국)의 논문에서, 20세기 동안 같은 검사의 원점수 평균이 IQ로 환산해 10년에 약 3점씩 올랐음을 정리했습니다(플린 효과, Flynn effect). 1990년대 이후 노르웨이 등 몇몇 나라에서는 이 오름세가 멈추거나 뒤집혔습니다. 한 집단의 유전자 구성이 수십 년 만에 그만큼 바뀌기는 어려우므로, 연구자들은 대체로 이 변화의 큰 부분이 환경에서 왔다고 봅니다.
8 · 1975년 이후지표가 목표가 될 때
이 절의 물음은 이것입니다. 좋은 지표를 목표로 삼아 세게 밀어붙이면 왜 지표와 목표가 갈라질까? 지금까지는 숫자가 세계를 어떻게 비추는지 보았습니다. 이 절에서는 숫자가 세계를 바꿉니다. 1902년 프랑스 식민 정부는 하노이에서 쥐를 잡으려고 쥐꼬리 하나마다 현상금을 주었습니다. 역사학자 마이클 밴의 연구에 따르면, 머지않아 꼬리만 잘린 채 살아 돌아다니는 쥐들이 보고되었고 쥐를 기르는 사람까지 나왔다고 합니다. 꼬리의 수는 잡은 쥐의 수를 재는 좋은 지표였지만, 돈을 거는 순간 쥐를 줄이는 일과 꼬리를 늘리는 일이 갈라졌습니다. 인도의 코브라 현상금 이야기도 자주 인용되지만, 그쪽은 기록으로 확인되지 않은 일화입니다.
1975년 영국 중앙은행의 경제학자 찰스 굿하트는 오스트레일리아 준비은행이 펴낸 논문집에 영국의 통화 정책을 다룬 글을 실었고, 거기서 이렇게 썼습니다. "관찰된 통계적 규칙성은 그것을 통제의 목적으로 압박하는 순간 무너지는 경향이 있다." 통화량과 경기 사이의 안정된 관계를 믿고 통화량을 정책 목표로 삼자, 바로 그 관계가 흐트러졌다는 관찰입니다. 오늘날 흔히 인용되는 문장 "측정값이 목표가 되면 좋은 측정이 아니게 된다"는 1997년 인류학자 메릴린 스트래선이 영국 대학 평가를 다룬 글에서 굿하트의 생각을 일반화한 표현입니다. 비슷한 시기 미국의 사회심리학자 도널드 캠벨은 "양적 사회 지표가 사회적 결정에 많이 쓰일수록 부패의 압력을 더 받고, 그것이 감시하려던 사회 과정을 더 왜곡한다"고 적었습니다(1976). 이것이 굿하트의 법칙(Goodhart's law)입니다. 법칙이라는 이름과 달리 정리가 아니라 경험에서 나온 경고입니다.
굿하트의 관찰은 1970년대 영국 경제의 사정에서 나왔습니다. 물가가 치솟던 때, 통화량을 잘 조절하면 물가가 잡힌다는 통화주의의 처방이 힘을 얻었고, 영국 중앙은행도 통화량 지표를 정책의 기준으로 삼기 시작했습니다. 그러자 그때까지 안정돼 보이던 통화량과 경기 사이의 관계가 흐트러졌습니다. 금융 기관과 기업이 새 규제와 목표에 맞추어 돈을 움직이는 방식을 바꾸었기 때문입니다. 같은 무렵 미국의 경제학자 로버트 루커스는 비슷한 경고를 더 일반적인 모양으로 다듬었습니다. 1976년 그는 과거 자료에서 찾은 경제 변수들 사이의 관계는 사람들이 그때의 정책을 예상하고 행동한 결과이므로, 정책을 바꾸면 그 관계도 바뀐다고 지적했습니다(루커스 비판, Lucas critique). 숫자를 보는 쪽이 움직이면 숫자를 만드는 쪽도 움직입니다. 원인과 연관을 가르는 「담배와 폐암」의 물음이 정책의 언어로 다시 나타난 셈입니다.
시험이 목표가 되면 시험이 재려던 것과 갈라진다는 걱정은 훨씬 오래되었습니다. 중국의 과거는 유교 경전을 얼마나 깊이 이해하는지 물어 관리를 뽑는 시험이었고, 15세기 명나라에서 답안을 여덟 마디의 정해진 틀로 쓰는 팔고문이 자리 잡았습니다. 17세기 학자 고염무는 『일지록』의 「의제(擬題)」 조에서 그 결과를 이렇게 적었습니다(요지). 부잣집에서는 이름난 선비를 집에 들여 나올 만한 문제 수십 개에 답안을 한 편씩 짓게 하고 편마다 값을 치른 뒤, 자제와 영리한 종들에게 외우게 했다. 시험장에서 문제가 나오면 열에 여덟아홉은 들어맞아, 외운 글을 그대로 옮겨 적었다. 그는 팔고문의 해악이 진시황의 분서와 같고, 인재를 망친 것은 그보다 심하다고 했습니다. 경전을 이해하는 사람을 고르려던 시험이, 나올 문제를 짐작해 외우는 일을 재게 된 것입니다. 과거는 1905년에 폐지되었습니다.
왜 이런 일이 일어날까요? 가장 조용한 메커니즘은 6절에서 이미 보았습니다. 대리 점수가 참값과 잡음의 합이라면, 대리 점수가 가장 높은 것을 고르는 일은 참값이 높은 것과 함께 잡음이 큰 것을 고르는 일입니다. 아래 그림에서 후보
이번에
잡음이 종 모양일 때는 식으로 확인할 수 있습니다.
꼬리가 두꺼운 잡음에서는 사정이 다릅니다. 대리 점수가 아주 높은 후보는 참값이 높을 가능성보다 잡음이 터무니없이 컸을 가능성이 훨씬 큽니다. 정규분포의 꼬리는
2018년 데이비드 맨하임과 스콧 개러브랜트는 굿하트 현상을 넷으로 나누었는데, 위의 두 경우는 그중 '회귀형'과 '극단형'에 가깝습니다. 나머지는 원인이 아닌 상관을 조작하는 '인과형'(체온계를 차갑게 하면 열이 내린 것처럼 보이는 식)과, 지표를 보는 상대가 일부러 속이는 '적대형'입니다.
이 그림은 오늘날의 인공지능에서 문자 그대로 일어납니다. 강화 학습(reinforcement learning)은 적어 준 보상을 최대화하는 방법이고, 보상은 설계자가 바라는 것의 대리 지표입니다. 2016년 오픈AI의 잭 클라크와 다리오 아모데이는 보트 경주 게임 「코스트러너스」에서, 코스를 도는 대신 한 웅덩이를 빙글빙글 돌며 점수 아이템을 되풀이해 맞히는 에이전트(agent)를 보고했습니다. 이 에이전트는 불이 붙고 다른 배와 부딪히면서도 정상적으로 경주를 마치는 것보다 높은 점수를 얻었습니다.
언어 모델(language model)을 사람의 선호에 맞추는 인간 피드백 강화 학습에서는 사람의 판단을 흉내 낸 보상 모델(reward model)이 대리 지표입니다. 2022년 레오 가오, 존 슐먼, 제이컵 힐턴은 '진짜' 역할을 하는 큰 보상 모델을 따로 두고 작은 대리 보상 모델로 최적화(optimization)하는 실험에서, 출발점에서 멀어질수록 대리 보상은 계속 오르지만 진짜 보상은 오르다가 떨어지는 것을 관찰했습니다. 꼬리가 두꺼운 잡음일 때 오른쪽 그림의 청록 곡선과 닮은 모양입니다. 다만 모양이 닮았다고 원인까지 같다는 뜻은 아닙니다. 흔한 처방은 원래 모델에서 너무 멀어지지 않게 KL 발산(두 확률 분포가 얼마나 다른지 재는 양) 벌점을 거는 것입니다. 2024년 토머스 콰 등은 보상 모델의 오차가 꼬리가 두꺼우면 이 벌점으로도 막을 수 없는 경우가 있음을 증명했습니다. 그런데 그들이 실제 보상 모델들의 꼬리를 재 본 결과는 꼬리가 얇은 쪽에 가까웠습니다.
시험 점수도 같습니다. 언어 모델의 능력은 공개된 문제 모음(벤치마크)의 점수로 재는데, 그 문제나 비슷한 문제가 학습 자료에 섞여 들어가면 점수는 능력이 아니라 기억을 잽니다. 2024년 스케일 AI의 연구진은 널리 쓰이는 초등 수학 문제 모음(GSM8K)과 같은 양식으로 새 문제 1,250개(GSM1k)를 사람이 직접 만들어 여러 모델에 풀게 했습니다. 논문의 최종판에 따르면 정답률이 최대 8%포인트쯤 떨어졌고, 몇몇 모델군은 거의 모든 크기에서 체계적으로 떨어졌지만, 가장 앞선 모델들은 거의 떨어지지 않았습니다. 기계 학습(machine learning)이 오래전부터 지켜 온 규칙, 곧 모델을 고르는 데 쓴 자료와 마지막 평가에 쓰는 자료를 나누라는 규칙(과적합(overfitting), 교차 검증(cross-validation))은 굿하트의 법칙에 맞서는 방어입니다. 시험 문제를 한 번 보고 나면 그 문제는 더 이상 시험이 아닙니다.
정리하면, 대리 지표 = 참목표 + 오차일 때 대리 지표로 세게 고를수록 오차가 큰 것까지 함께 고르게 됩니다. 오차가 종 모양이면 참목표는 절반만 따라오고, 꼬리가 두꺼우면 끝내 따라오지 않습니다.
숫자가 목표가 되기까지. 과학 줄(청록)에서 파리의 비네 검사가 브레슬라우의 지능 지수와 스탠퍼드의 검사로 옮겨 가고, 철학 줄(보라)에서 굿하트, 캠벨, 스트래선의 경고가 이어지며, 수학 줄(파랑)의 끝에서 보상 모델과 벤치마크의 문제가 됩니다.
9 · 이어지는 길재는 일의 수학
이 글의 여덟 장면은 한 가지를 되풀이했습니다. 숫자는 세계와 측정 규칙이 함께 만든 것이고, 규칙을 바꿔도 살아남는 것만이 세계에 관한 사실입니다. 해안선에서는 자를 바꿔도 남는 지수가, 척도에서는 번호를 바꿔도 남는 순서가, 평균에서는 무게를 밝혔을 때의 결론이, 요인에서는 축을 돌려도 남는 상관이 그런 것이었습니다. 그리고 굿하트의 법칙은 측정 규칙이 알려지고 보상이 걸리면 세계가 그 규칙에 맞춰 움직인다는 경고였습니다.
- 측도와 적분(integral)으로: 해안선이 던진 '길이란 무엇인가'라는 질문의 수학적 답이 르베그 적분의 측도 이론입니다. 셀 수 없이 많은 점이 모여도 길이가 0일 수 있다는 측도 0과 칸토어 집합은 「무한에도 크기가 있다」에서, 리만 합(Riemann sum)에서 출발하는 넓이의 이야기는 「거리를 되찾기」에서 이어집니다. 선택공리 대신 '모든 무한 게임에 이기는 쪽이 있다'는 결정성 공리(axiom of determinacy)를 받아들이면 실수의 모든 부분집합을 잴 수 있다는 이야기는 「이기는 쪽이 존재한다」 7절에, 측도 위에 세운 확률의 공리는 「도박판에서 온 편지」 7절에 있습니다.
- 거듭제곱 법칙으로: 로그–로그 그림의 직선은 해안선에만 있지 않습니다. 낱말의 빈도가 순위의 거듭제곱으로 줄어드는 지프의 법칙(Zipf's law)은 「말을 세는 기계」에, 언어 모델의 손실이 계산량의 거듭제곱으로 줄어드는 규모의 법칙(scaling laws)은 「다음 단어를 맞히는 기계」에 있습니다. 규모의 법칙도 리처드슨의 지수처럼 잰 범위 안에서 맞춘 경험식이라, 범위 밖으로 늘여 쓰는 것은 예측이지 보장이 아닙니다.
- 혼돈(chaos)으로: 리처드슨의 수치 예보(numerical weather prediction)는 「나비의 날갯짓」의 출발점이고, 혼돈계의 끌개(attractor)는 흔히 프랙털 차원을 가집니다. 로렌츠 끌개(Lorenz attractor)의 차원은 약 2.05로 추정됩니다(혼돈, 로렌츠 끌개).
- 불변량으로: 스티븐스의 척도는 허락된 변환의 군과, 그 아래에서 변하지 않는 명제로 정의됩니다. 같은 생각이 기하학을 분류한 클라인의 에를랑겐 프로그램과 물리 법칙의 대칭에 있습니다(대칭과 불변량, 「평행선의 반란」). 무엇으로 만들었는지 대신 어떤 변환을 허락하는지로 대상을 보는 태도를 끝까지 밀고 간 언어가 「화살표만으로 본 수학」의 범주론입니다.
- 평균과 인과(causation)로: 무게가 다른 평균이 부분과 전체를 뒤집는 심슨의 역설, 그 무게를 만드는 교란 변수, 무작위 배정(random assignment)으로 무게를 같게 만드는 무작위 대조 시험(randomized controlled trial)은 「담배와 폐암」에서 이어집니다. 검사의 역설은 무엇을 같은 무게의 경우로 세느냐의 문제라서, 파스칼과 페르마가 가능한 미래를 하나하나 세던 「도박판에서 온 편지」와도 닿아 있습니다.
- 잡음과 회귀로: 잰 값 = 참값 + 잡음이라는 모형은 평균으로의 회귀와 희석 보정을 함께 설명합니다. 오차를 제곱해 더하는 사고방식과 정규분포의 뿌리는 「잃어버린 소행성」에서, 잡음 섞인 통로로 정보를 보내는 한계는 「잡음 너머로」에서 이어집니다.
- 선형대수(linear algebra)로: 요인의 적재량은 검사 벡터의 정사영이고, 상관은 내적이며, 회전은 내적을 지키는 회전 행렬(rotation matrix)입니다. 상관 행렬(matrix)의 고유벡터(eigenvector)를 찾는 주성분 분석과 특잇값 분해(singular value decomposition)가 그 계산의 도구입니다.
- 학습과 정렬로: 대리 지표를 최적화하다 참목표에서 멀어지는 일은 기계 학습의 과적합과 뿌리가 같습니다. 「배우는 기계」의 과적합 그림에서 학습 오차가 대리 지표, 새 자료의 오차가 참목표입니다. 보상 모델과 인간 피드백 강화 학습의 수학은 「다음 단어를 맞히는 기계」에 있습니다. 자료를 외운 모형은 새 자료를 짧게 적지 못한다는, 과적합을 압축의 실패로 읽는 관점은 「압축하는 것이 이해하는 것이다」 6절에 있습니다.
- 미분할 수 없는 곡선으로: 코흐 곡선을 낳은 바이어슈트라스의 '괴물' 함수, 곧 어디서도 접선(tangent line)을 그을 수 없는 연속 곡선은 「순간의 속도」에서 순간의 기울기라는 개념의 한계로 나옵니다. 하우스도르프가 거리 공간의 규칙을 세운 이야기는 「까마귀와 택시」 4절에 있습니다.
요약. 들쭉날쭉한 곡선의 잰 길이는 (잰 범위 안에서) 자의 길이
그리고 대리 지표를 세게 최적화하면, 참목표와 함께 대리 지표의 오차까지 골라내게 됩니다. 재는 일이 정직하려면 무엇으로, 무엇을, 그리고 왜 재는지를 함께 적어야 합니다.