← 갤러리
측정의 수학

재는 순간 바뀐다

해안선의 길이는 자에 따라, 평균⁠(mean)⁠은 누구에게 묻느냐에 따라, 지표는 그것을 목표로 삼는 순간 달라집니다. 측정은 세계를 그대로 받아 적는 일이 아니라, 무엇을 어떻게 셀지 정하는 수학적 선택입니다.

이 글의 처럼 점선이 그어진 숫자는 좌우로 끌 수 있고(키보드 ←/→도 됩니다), 색이 칠해진 같은 말은 눌러서 바꿀 수 있습니다. 밑줄 친 말에 마우스를 올리면 그림에서 그 부분이 빛납니다. 그림 속의 노란 점은 끌어서 옮길 수 있고, 점과 칸에 마우스를 올리면 정확한 값이 나옵니다. 따로 밝히지 않은 자료는 원리를 보이려고 만든 가상의 자료입니다. 휴대폰에서는 마우스를 올리는 대신 누르면 됩니다.

1950년 무렵, 영국의 수학자 루이스 프라이 리처드슨은 전쟁을 세고 있었습니다. 퀘이커 교도로 1차 대전에 구급차 부대원으로 나갔던 그는 전쟁이 왜 일어나는지를 숫자로 따져 보고 싶어 했습니다. 그래서 1820년부터 20세기 중반까지의 크고 작은 싸움을 모아 목록을 만들었습니다. 그가 세운 가설 하나는 이웃 나라와 맞닿은 국경이 길수록 싸움도 잦으리라는 것이었습니다. 이 가설을 따져 보려면 국경의 길이가 필요했습니다.

백과사전을 찾아보니 이상한 일이 있었습니다. 에스파냐와 포르투갈이 맞닿은 국경의 길이가 한쪽 나라의 자료에는 987 km, 다른 쪽 나라의 자료에는 1,214 km로 적혀 있었습니다. 네덜란드와 벨기에 사이에서도 비슷하게 어긋났습니다. 누가 틀렸을까요? 리처드슨이 찾은 설명은 어느 쪽도 계산을 틀리지 않았을 수 있다는 것이었습니다. 짧은 자로 잴수록 구불구불한 곳을 더 많이 따라가니 국경이 더 길게 나옵니다. 그리고 해안선이나 강을 따라가는 국경에는 '자와 상관없는 참길이'라는 것이 없을 수도 있습니다.

이 글의 질문은 이것입니다. 잰다는 것은 무엇이고, 잰 숫자는 언제 믿을 수 있는가? 답을 따라가다 보면 서로 멀어 보이던 것들이 한 가지 모양으로 모입니다. 해안선의 프랙털 차원⁠(fractal dimension)⁠, 심리학자들이 싸운 측정의 정의, 버스 정류장의 대기 시간, 야구 타율, 지능 검사의 역사, 그리고 오늘날의 인공지능⁠(artificial intelligence)⁠이 점수를 속이는 방식입니다. 모든 측정에는 세 가지 선택이 숨어 있습니다. 무엇으로 재는가(자의 크기, 숫자를 붙이는 규칙), 무엇을 세는가(누구에게 묻고 어떻게 합치는가), 그리고 잰 다음에 무엇을 하는가(그 숫자를 목표로 삼는가)입니다. 제목의 '바뀐다'는 물리학에서 말하는 관측의 문제와는 다른 이야기입니다. 여기서 바뀌는 것은 대개 세계가 아니라 숫자이고, 8절에서는 숫자를 좇는 사람들 때문에 세계도 바뀝니다.

1 · 1950년 무렵 스코틀랜드자가 짧을수록 길어지는 국경

이 절의 물음은 이것입니다. 같은 국경을 잰 두 숫자가 다를 때, 누가 틀렸는지 가릴 수 있을까? 아니면 '길이'라는 질문 자체에 자가 숨어 있을까?

리처드슨이 한 일을 그대로 해 봅시다. 컴퍼스(디바이더)를 일정한 폭으로 벌리고 해안선의 한쪽 끝에 한 발을 댑니다. 다른 발이 해안선에 닿는 곳으로 건너가고, 거기서 다시 건너가기를 반대쪽 끝까지 되풀이합니다. 걸음 수에 폭을 곱하면 잰 길이입니다. 아래 그림의 파란 선은 양 끝이 곧게 1,000 km 떨어진 가상의 해안선이고, 노란 꺾은선이 폭 의 자로 건너간 자취입니다. 지금 걸음, 잰 길이는 km입니다.

해안선과 자의 자취
자의 길이와 잰 길이 (두 축 모두 로그 눈금)
왼쪽: 파란 선이 해안선, 노란 꺾은선과 점이 자로 건너간 자취입니다. 오른쪽: 파란 점 하나가 자 하나로 잰 결과이고, 분홍 점선은 그 점들에 맞춘 직선입니다. 노란 점을 좌우로 끌면 자의 길이가 바뀝니다.

자를 300 km에서 6 km까지 줄여 보세요. 잰 길이는 줄지 않고 계속 늘어납니다. 짧은 자는 긴 자가 건너뛴 만과 곶을 하나하나 따라 들어가기 때문입니다. 이 해안선은 선분 하나를 같은 길이의 네 토막으로 바꾸는 일을 되풀이해 만들었습니다. 양 끝의 두 토막은 원래 선분 위에 두고, 가운데 두 토막은 만큼 꺾어 지붕처럼 세웁니다. 지붕을 어느 쪽으로 세울지는 토막마다 동전을 던져 정합니다. 그래서 얼마나 확대해도 비슷하게 들쭉날쭉합니다. ↻ 다른 해안선으로 동전을 다시 던질 수 있고, 으로 바꾸어 비교할 수도 있습니다.

오른쪽 그림이 리처드슨의 발견입니다. 자의 길이 ss와 잰 길이 L(s)L(s)를 두 축 모두 로그 눈금에 찍으면 점들이 거의 한 직선 위에 놓입니다. 로그 눈금은 1, 10, 100, 1000이 같은 간격으로 놓이는 눈금, 곧 '몇 배인가'를 거리로 나타내는 눈금입니다. 여기서 로그 log⁡x\log x는 '10을 몇 번 곱해야 xx가 되는가'이고(log⁡100=2\log 100 = 2), 곱셈을 덧셈으로 바꿉니다.

로그 눈금에서 직선이라는 것은 log⁡L=a+mlog⁡s\log L = a + m \log s, 곧 L(s)=c smL(s) = c\, s^{m}라는 거듭제곱 관계라는 뜻입니다(cc는 log⁡c=a\log c = a인 상수). 말로 하면 '자를 몇 배로 바꾸든, 같은 배율이면 잰 길이도 늘 같은 배율로 바뀐다'는 관계입니다. 예를 들어 기울기⁠(slope)⁠ m=−0.25m = -0.25이면 자를 10분의 1로 줄일 때마다 잰 길이가 100.25≈1.7810^{0.25} \approx 1.78배가 됩니다. 지금 맞춘 직선의 기울기는 입니다. 리처드슨은 이 기울기를 1−D1 - D로 적었습니다.

L(s)  ≈  c s 1−DL(s) \;\approx\; c\, s^{\,1-D}

매끄러운 곡선에서는 D=1D = 1이어서 자를 줄여도 길이가 한 값으로 모입니다. 반원으로 바꿔 보면 점들이 수평선을 이룹니다. 들쭉날쭉한 해안선에서는 DD가 1보다 커서, 이 관계가 이어지는 한 자를 줄일수록 길이가 한없이 늘어납니다. 리처드슨은 영국 서해안의 지도에서 D≈1.25D \approx 1.25를 얻었습니다. 그렇다면 자를 10분의 1로 줄일 때마다 잰 길이는 100.25≈1.7810^{0.25} \approx 1.78배가 됩니다. 에스파냐와 포르투갈 사이의 국경에서 그가 얻은 값은 D≈1.14D \approx 1.14입니다. 이 값이면 두 나라의 숫자의 비 1214/987≈1.231214/987 \approx 1.23은 두 측량의 자가 약 4.4배 달랐다는 것만으로 설명됩니다(4.40.14≈1.234.4^{0.14} \approx 1.23). 식으로 따라가면, 자 s1s_1과 s2s_2로 잰 두 길이의 비는 cc가 약분되어 (s1/s2)1−D(s_1/s_2)^{1-D}이고, 1−D=−0.141 - D = -0.14이니 긴 자가 짧은 자의 4.4배일 때 짧은 자로 잰 길이가 4.40.144.4^{0.14}배 깁니다. 두 숫자가 다른 까닭은 한쪽이 틀려서가 아니라 서로 다른 자를 썼기 때문일 가능성이 큽니다.

흔히 이것을 '해안선의 길이는 무한하다'로 요약하지만, 조금 더 정확히 말해야 합니다. 실제 해안선은 모래알보다 작게 들쭉날쭉하지 않고, 파도와 조수 때문에 경계가 늘 움직입니다. 거듭제곱 관계는 리처드슨이 잰 범위(수 km에서 수백 km)에서 관찰된 사실이지, 모든 규모에서 성립하는 정리가 아닙니다. 확실하게 말할 수 있는 것은 이것입니다. 해안선의 길이는 자의 길이를 함께 말하지 않으면 뜻이 없는 숫자입니다. 반면 자에 따라 길이가 변하는 빠르기, 곧 지수 DD는 그 범위 안에서 자를 바꿔도 변하지 않는 그 해안선의 성질입니다. 측정의 대상이 '길이'에서 '길이가 자에 따라 변하는 방식'으로 옮겨 간 것입니다.

정리하면, 들쭉날쭉한 곡선의 잰 길이는 자의 길이에 따라 거듭제곱으로 변하고, 두 숫자가 다른 것은 누가 틀려서가 아니라 자가 달라서일 수 있습니다. 믿을 만한 숫자는 길이가 아니라 그 변하는 빠르기 DD입니다.

숫자가 재는 방법에 따라 달라지는 문제에, 나라들이 오래전부터 내놓은 답은 재는 도구를 하나로 맞추는 것이었습니다. 1441년 조선 세종 때 만든 측우기가 좋은 예입니다. 그전에는 빗물이 땅에 스며든 깊이로 비의 양을 어림했는데, 흙마다 물을 빨아들이는 정도가 달라 고을끼리 숫자를 견줄 수 없었습니다. 그래서 정해진 크기의 원통 그릇에 고인 빗물의 깊이를 눈금 자로 재게 하고, 1442년 같은 규격의 측우기를 각 도의 관아에 내려보냈습니다. 농사를 돌보려면 여러 고을의 비를 한 잣대로 견주어야 했기 때문입니다. 350여 년 뒤 혁명기의 프랑스는 길이의 단위 자체를 새로 정했습니다. 1792년부터 6년여 동안 천문학자 들랑브르와 메생이 됭케르크에서 바르셀로나까지 자오선⁠(meridian)⁠을 삼각측량⁠(triangulation)⁠해, 북극에서 적도까지 거리의 1000만분의 1을 1미터로 삼았습니다. 그러나 리처드슨의 국경은 단위를 맞추어도 남는 문제가 있음을 보여 줍니다. 두 나라가 모두 킬로미터로 적었어도, 몇 킬로미터짜리 걸음으로 따라갔는지가 다르면 숫자가 달라집니다.

2 · 1967년 요크타운하이츠차원이라는 새로운 자

이 절의 물음은 이것입니다. 리처드슨의 지수 DD를 왜 '차원'이라 부를 수 있을까? 그리고 길이가 뜻을 잃는 곡선에는 어떤 자를 대야 할까?

리처드슨의 「인접의 문제」는 『일반 체계 연감』에 실린 채 거의 읽히지 않았습니다. 그것을 찾아낸 사람이 IBM 연구소의 수학자 브누아 망델브로입니다. 1967년 그는 『사이언스』에 「영국의 해안선은 얼마나 긴가? 통계적 자기 닮음⁠(self-similarity)⁠과 분수 차원」을 실어, 리처드슨의 지수 DD를 차원으로 읽자고 제안했습니다. 리처드슨 자신은 DD를 국경마다 다른 '특성값'이라고만 불렀습니다. 리처드슨이 구한 값은 영국 서해안이 약 1.25, 독일의 육지 국경이 약 1.15, 오스트레일리아 해안이 약 1.13, 남아프리카 해안이 약 1.02였습니다. 남아프리카의 해안은 거의 매끄러운 곡선이고, 영국 서해안은 훨씬 들쭉날쭉합니다.

왜 이것이 차원일까요? 익숙한 도형으로 돌아가 봅시다. 선분을 3분의 1로 줄인 복사본 3개를 이어 붙이면 원래 선분이 됩니다. 정사각형은 3분의 1로 줄인 복사본 9개, 정육면체는 27개가 필요합니다. 복사본의 수는 31,32,333^1, 3^2, 3^3이고, 지수가 바로 우리가 아는 차원 1, 2, 3입니다. 일반적으로 어떤 도형이 크기를 rr배(0<r<10 \lt r \lt 1)로 줄인 자기 복사본 NN개를 겹치지 않게 이어 붙인 것이라면, 차원을 N=(1/r)DN = (1/r)^D, 곧 D=log⁡N/log⁡(1/r)D = \log N / \log(1/r)로 정합니다. 뒤의 식은 앞의 식의 양변에 로그를 취해 log⁡N=Dlog⁡(1/r)\log N = D \log(1/r)로 만든 뒤 DD에 대해 푼 것입니다. 정사각형이면 N=9N = 9, 1/r=31/r = 3이고 9=329 = 3^2이니 D=2D = 2입니다. 차원은 '크기를 3배로 키우면 복사본이 몇 개 필요한가'를 '3의 몇 제곱인가'로 읽은 수입니다.

1904년 스웨덴의 수학자 헬게 폰 코흐가 만든 곡선에 이 식을 써 봅시다. 1872년 바이어슈트라스가 어느 점에서도 미분⁠(differentiation)⁠할 수 없는 연속함수를 무한급수⁠(infinite series)⁠로 내놓자 많은 수학자가 그것을 괴물 취급했습니다. 이 함수⁠(function)⁠가 '순간의 기울기'라는 생각에 던진 물음은 「순간의 속도」에 있습니다. 코흐는 같은 성질의 곡선을 식 대신 초등 기하⁠(geometry)⁠의 작도만으로 보이려 했고, 그렇게 나온 것이 이 곡선입니다. 선분을 셋으로 나누고 가운데 토막을 정삼각형의 두 변으로 바꾸기를 끝없이 되풀이한 곡선입니다. 코흐 곡선⁠(Koch curve)⁠은 3분의 1로 줄인 자기 복사본 4개로 이루어지므로 D=log⁡4/log⁡3≈1.262D = \log 4/\log 3 \approx 1.262입니다. 곧 31.262≈43^{1.262} \approx 4입니다. 크기를 3배로 키우면 복사본이 선분처럼 3개(313^1)도, 정사각형처럼 9개(323^2)도 아닌 4개가 필요하니, 차원은 1과 2 사이입니다. 한 단계마다 길이는 4/34/3배가 되니, 열 단계면 약 17.8배, 무한히 되풀이하면 길이는 무한대입니다. 그러면서도 곡선은 유한한 상자 안에 들어 있고 넓이⁠(area)⁠는 0입니다.

1절의 그림에서 꺾임각을 60°로 두면 이 곡선의 방향을 제멋대로 뒤집은 것이 됩니다. 이때 점들의 기울기에서 읽은 차원()이 만든 규칙에서 계산한 값()과 가깝게 나옵니다. 꺾임각을 키우면 한 토막의 길이 비 rr가 커지고, 같은 4조각으로 더 길게 뻗으니 차원도 커집니다. 75°에서는 약 1.50입니다.

여기서 프랙털 차원이 '측정'에 관한 개념이라는 점이 드러납니다. 코흐 곡선에 1차원의 자(길이)를 대면 무한대가 나오고, 2차원의 자(넓이)를 대면 0이 나옵니다. 둘 다 틀린 답은 아니지만, 곡선에 관해 아무것도 알려 주지 않습니다. 1918년에 쓴 논문에서 독일의 수학자 펠릭스 하우스도르프는 차수 ss를 실수⁠(real number)⁠로 풀어 준 'ss차원 측도⁠(measure)⁠'를 정의했습니다. 도형을 지름이 δ\delta('델타') 이하인 조각들로 덮고, 조각 지름의 ss제곱을 모두 더합니다. 가장 알뜰하게 덮었을 때의 합을 구하고, δ\delta를 0으로 보내며 극한(한없이 다가가는 값)을 봅니다. 어떤 도형이든 경계값이 하나 있어서, ss가 그보다 작으면 이 값이 무한대, 크면 0입니다. 그 경계값이 하우스도르프 차원입니다.

익숙한 도형으로 먼저 따라가 봅시다. 한 변이 1인 정사각형을 한 변 δ\delta인 작은 정사각형 (1/δ)2(1/\delta)^2개로 덮습니다(편의상 조각의 크기를 지름 대신 한 변으로 재겠습니다. 상수배만 달라져서 결론은 같습니다). 조각 크기의 ss제곱을 모두 더하면 (1/δ)2×δs=δ s−2(1/\delta)^2 \times \delta^s = \delta^{\,s-2}입니다. δ\delta를 0으로 보내면 s<2s \lt 2일 때 무한대(s=1s = 1, 곧 정사각형의 '길이'는 무한대), s=2s = 2일 때 1(넓이), s>2s \gt 2일 때 0(부피는 0)입니다. 경계값은 2, 우리가 아는 차원입니다.

코흐 곡선을 kk단계의 조각, 곧 크기 3−k3^{-k}인 조각 4k4^k개로 덮으면 합은 4k×3−ks=(4/3s)k4^k \times 3^{-ks} = (4/3^s)^k입니다. 3s3^s이 4보다 작으면 괄호 안이 1보다 커서 kk를 키울수록 무한대로, 4보다 크면 0으로 갑니다. 경계는 3s=43^s = 4, 곧 s=log⁡4/log⁡3s = \log 4/\log 3이고, 이 경계값에서만 0도 무한대도 아닌 유한한 값이 나옵니다(정사각형에서도 코흐 곡선에서도, 이렇게 고른 덮기가 가장 알뜰한 덮기와 같은 경계값을 준다는 것은 따로 증명할 일입니다). 알맞은 자를 찾은 셈입니다.

이 생각은 앙리 르베그가 1902년 학위 논문에서 세운 '측도'의 이론 위에 서 있습니다. 측도는 길이·넓이·부피를 한데 부르는 말입니다. 르베그는 측도가 지켜야 할 규칙을 먼저 정했습니다. 겹치지 않는 조각들을 합친 도형의 측도는 각 조각의 측도의 합이어야 하고(조각이 가산 개, 곧 1번, 2번, 3번… 하고 번호를 붙일 수 있는 만큼 무한히 많아도), 도형을 옮겨도 측도는 변하지 않아야 합니다. 이 규칙으로 르베그 적분⁠(Lebesgue integral)⁠이 나왔습니다.

규칙이 있으면 규칙이 닿지 않는 곳도 생깁니다. 칸토어 집합⁠(Cantor set)⁠은 0부터 1까지의 선분에서 가운데 3분의 1을 빼고, 남은 두 토막에서 또 가운데 3분의 1을 빼기를 끝없이 되풀이하고 남은 점들입니다. 뺀 길이는 13+29+427+⋯=1\tfrac13 + \tfrac29 + \tfrac4{27} + \cdots = 1이라 남은 길이는 0인데, 남은 점은 셀 수 없이 많습니다(측도 0⁠, measure zero⁠). 크기 3분의 1인 자기 복사본 2개로 이루어지니 차원은 log⁡2/log⁡3≈0.631\log 2/\log 3 \approx 0.631입니다.

1905년 이탈리아의 주세페 비탈리는 선택공리(무한히 많은 주머니에서 하나씩을 한꺼번에 골라 낼 수 있다는 공리⁠(axiom)⁠)를 받아들이면, 위의 두 규칙을 지키고 구간에는 제 길이를 주는 한, 어떤 길이도 모순 없이 매길 수 없는 실수의 부분집합⁠(subset)⁠이 있음을 보였습니다. 잴 수 있다는 것 자체가 당연하지 않다는 뜻입니다.

1924년 폴란드의 스테판 바나흐와 알프레트 타르스키는 같은 선택공리⁠(axiom of choice)⁠로 더 이상한 결과를 보였습니다. 3차원의 공 하나를 유한 개의 조각으로 나눈 뒤, 조각들을 늘이거나 줄이지 않고 옮기고 돌리기만 해서 원래와 같은 크기의 공 두 개로 다시 짜 맞출 수 있다는 것입니다. 조각들에 부피를 매길 수 없어서 가능한 일입니다. 조각들에 부피가 있다면 옮기고 돌려도 부피의 합이 그대로여야 하니 공 하나가 공 둘이 될 수 없습니다.

1933년 콜모고로프가 확률⁠(probability)⁠을 측도로 세울 때 모든 부분집합이 아니라 '잴 수 있는' 사건⁠(event)⁠들에만 확률을 준 것도 이 때문입니다(「도박판에서 온 편지」 7절).

망델브로가 이 논문에 이르기까지 걸어온 길이 그 자체로 이야기입니다. 1924년 바르샤바의 유대인 가정에서 태어난 그는 1936년 가족과 함께 파리로 옮겼고, 독일 점령기에는 프랑스 시골에서 신분을 숨기고 지냈습니다. 전쟁 뒤 에콜 폴리테크니크에서 공부하고 1958년 IBM 연구소에 들어간 그가 먼저 붙든 것은 해안선이 아니라 전화선의 오류와 목화 값이었습니다. 1963년 그는 두 가지를 보고했습니다. 전화선의 오류가 고르게 흩어지지 않고 어느 시간 규모로 보아도 비슷하게 뭉쳐 온다는 것(「잡음 너머로」 8절), 그리고 목화 값의 하루 변동이 정규분포⁠(normal distribution)⁠보다 훨씬 두꺼운 꼬리를 보인다는 것입니다. 규모를 바꿔도 되풀이되는 들쭉날쭉함과 8절에서 다시 볼 두꺼운 꼬리가 해안선보다 먼저 그의 주제였습니다. 리처드슨의 연구가 발표되기 전에 같은 현상을 적은 사람도 있습니다. 폴란드의 수학자 후고 슈타인하우스는 1954년 논문 「길이, 모양, 넓이」에서, 비스와강의 왼쪽 기슭을 점점 더 정밀하게 재면 학교 지도에서 읽은 길이의 열 배, 백 배, 심지어 천 배가 나올 것이라고 썼습니다. 1916년 무렵 크라쿠프의 공원 벤치에서 젊은 바나흐를 만나 그를 자신의 가장 큰 '발견'이라 불렀다는 그 슈타인하우스입니다. 두 사람이 르부프에서 함께 한 일은 「이기는 쪽이 존재한다」 7절에 있습니다.

르베그의 측도는 네 해 앞서 에밀 보렐이 1898년 내놓은 생각을 넓힌 것이었습니다. 하우스도르프의 차원도 같은 줄기에서 나왔습니다. 1914년 콘스탄티노스 카라테오도리가 르베그의 생각을 일반화해 외측도(어떤 집합⁠(set)⁠이든 바깥에서 덮어 크기를 어림하는 방법)의 틀을 세웠고, 하우스도르프는 이것을 차수가 실수인 경우로 넓혔습니다. 브레슬라우에서 태어난 유대계 수학자 하우스도르프는 1914년 『집합론⁠(set theory)⁠ 개요』에서 '거리 공간⁠(metric space)⁠'이라는 이름을 붙인 사람이기도 합니다(「까마귀와 택시」 4절). 1935년 나치 정권에 교수직을 빼앗긴 그는 1942년 1월 강제 수용소로 끌려가게 되자 아내, 처제와 함께 스스로 목숨을 끊었습니다.

자를 다시 생각한 한 세기. 수학 줄(파랑)에 칸토어, 르베그, 코흐, 하우스도르프가 이어지고, 과학 줄(청록)의 리처드슨의 국경이 대서양을 건너 망델브로의 1967년 논문이 됩니다.

망델브로는 1975년 '부서진'이라는 뜻의 라틴어에서 '프랙털⁠(fractal)⁠'이라는 말을 지었고, 1982년 『자연의 프랙털 기하학』에서 구름과 산맥, 혈관, 주가의 움직임에서 같은 모양을 찾았습니다. 1998년 일본의 수학자 시시쿠라 미쓰히로는 망델브로가 그린 망델브로 집합⁠(Mandelbrot set)⁠의 경계가 하우스도르프 차원⁠(Hausdorff dimension)⁠ 2라는 것을 증명했습니다. 평면 위의 경계인데도 차원으로는 평면과 같다는 뜻입니다. 다만 이 경계의 넓이가 0보다 큰지는 아직 아무도 모릅니다. 그리고 두 축을 모두 로그로 찍었을 때 직선이 나오는 관계, 곧 거듭제곱 법칙⁠(power law)⁠은 이 글에서 여러 번 다시 나옵니다. 측정의 결과가 '한 숫자'가 아니라 '규모에 따라 변하는 방식'일 때, 그 방식을 요약하는 자연스러운 숫자가 지수이기 때문입니다.

정리하면, 차원은 '크기를 몇 배로 할 때 복사본이 몇 제곱으로 필요한가'이고, 그 수가 정수⁠(integer)⁠가 아닌 곡선에는 길이도 넓이도 아닌 DD차원의 자가 맞습니다. 그리고 규칙을 지키는 자를 모든 집합에 댈 수는 없습니다.

3 · 1946년 하버드숫자를 붙이는 규칙

이 절의 물음은 이것입니다. 대상에 숫자를 붙였을 때, 그 숫자로 무엇을 말해도 되고 무엇을 말하면 안 될까? 평균을 내거나 '두 배'라고 말하는 것이 언제 뜻이 있을까?

감각을 재려는 시도는 1860년 독일의 물리학자이자 철학자 구스타프 페히너의 『정신물리학 원론』으로 거슬러 올라갑니다. 페히너는 사람이 겨우 알아챌 수 있는 자극의 차이를 감각의 한 눈금으로 삼고 그 눈금들을 쌓아, 감각의 크기가 자극 세기의 로그에 비례한다고 보았습니다(베버–페히너 법칙⁠, Weber–Fechner law⁠). 무게가 두 배, 네 배, 여덟 배가 될 때 느낌은 한 칸씩 고르게 커진다는 것입니다. 로그는 곱셈을 덧셈으로 바꾸므로, 자극이 같은 배율로 커질 때마다 감각이 같은 양만큼 커진다는 말과 같습니다. 그러나 '겨우 알아챌 수 있는 차이'들이 정말 같은 크기인지는 아무도 확인할 수 없었습니다.

1932년 영국 과학진흥협회는 위원회 하나를 꾸렸습니다. 물리학자 A. 퍼거슨이 이끈 이 위원회의 질문은 "감각의 크기를 정말로 잴 수 있는가"였습니다. 심리학자들은 소리가 '두 배 크게' 들린다는 판단을 모아 크기의 척도를 만들고 있었습니다. 위원 가운데 물리학자 노먼 캠벨은 그것이 측정이 아니라고 주장했습니다. 길이나 무게를 잴 수 있는 것은 막대 두 개를 이어 붙이거나 추 두 개를 한 접시에 올리는 '더하기'가 실제로 있기 때문인데, 감각에는 그런 더하기가 없다는 것입니다. 8년의 논의 끝에 1940년 나온 최종 보고서에서 위원들은 합의하지 못했습니다.

캠벨의 기준에는 수학의 뒷받침이 있었습니다. 1901년 라이프치히의 수학자 오토 횔더는 「양의 공리와 측정 이론」에서, 크기를 견주는 순서와 이어 붙이는 더하기가 몇 가지 공리를 지키면 그 양들을 양의 실수로, 이어 붙이기를 수의 덧셈으로 그대로 옮겨 적을 수 있음을 증명했습니다. 길이와 무게가 수로 잴 수 있는 양인 까닭을 공리에서 끌어낸 것입니다. 반대쪽의 생각은 하버드에서 자랐습니다. 1927년 하버드의 물리학자 퍼시 브리지먼은 『현대 물리학의 논리』에서, 개념의 뜻은 그것을 재는 조작들의 모음과 같다는 조작주의를 내놓았습니다. 같은 대학의 젊은 심리학자 스탠리 스미스 스티븐스는 1935년부터 이 생각을 심리학에 들여오는 글들을 썼습니다. 재는 절차가 곧 개념이라면, 더하기가 없어도 규칙에 따라 수를 매기는 절차만 있으면 잴 수 있다는 결론이 됩니다.

1946년 하버드의 심리학자 스탠리 스미스 스티븐스는 『사이언스』에 네 쪽짜리 논문 「측정 척도의 이론에 관하여」를 실어 이 논쟁에 다른 답을 내놓았습니다. 측정이란 규칙에 따라 대상에 숫자를 붙이는 일이고, 규칙이 달라지면 숫자로 할 수 있는 일도 달라진다는 것입니다. 그는 척도를 네 가지로 나누었고, 나누는 기준은 '숫자를 어떻게 바꿔 붙여도 같은 정보가 남는가'였습니다. 아래에서 x↦ax+bx \mapsto ax + b는 '원래 숫자 xx를 ax+bax + b로 바꿔 붙인다'로 읽습니다. 섭씨를 화씨로 바꾸는 x↦1.8x+32x \mapsto 1.8x + 32가 그런 바꿈입니다.

온도로 확인해 봅시다. 어제 10°C, 오늘 20°C라면 "오늘이 두 배 덥다"고 할 수 있을까요? 같은 두 날을 화씨로 적으면 50°F와 68°F라서 1.36배이고, 절대 온도로 적으면 283.15 K와 293.15 K라서 1.035배입니다. 단위를 바꾸었을 뿐인데 '몇 배'가 달라지니, 섭씨의 비는 온도에 관한 사실이 아니라 섭씨라는 규칙이 만든 인공물입니다. 반면 "어제에서 오늘까지 오른 폭은 그제에서 어제까지 오른 폭과 같다" 같은 차이의 비교는 어느 단위로 적어도 참이면 참, 거짓이면 거짓으로 남습니다.

이것을 서열 척도에서 해 봅시다. 두 가게의 손님 12명씩에게 만족도를 물었습니다. 가게 A의 손님은 대부분 '만족'이고, 가게 B의 손님은 '매우 만족'과 '매우 불만'으로 갈렸습니다. 보통은 다섯 칸에 1, 2, 3, 4, 5를 붙이고 평균을 냅니다. 그런데 '불만'과 '보통' 사이가 '만족'과 '매우 만족' 사이와 같은 간격이라는 근거는 없습니다. 순서만 지킨다면 가운데 세 칸의 노란 점을 어디로 옮겨도 똑같이 정당한 번호 매기기입니다.

손으로 먼저 해 봅시다. 가게 A의 12명은 '불만' 1명, '보통' 3명, '만족' 8명이고, 가게 B의 12명은 '매우 불만' 3명, '불만' 1명, '보통' 2명, '만족' 1명, '매우 만족' 5명입니다. 1, 2, 3, 4, 5를 붙이면 A의 평균은 (2 + 3 × 3 + 4 × 8) ÷ 12 = 43 ÷ 12 ≈ 3.58, B는 (1 × 3 + 2 + 3 × 2 + 4 + 5 × 5) ÷ 12 = 40 ÷ 12 ≈ 3.33으로 A가 앞섭니다. 이번에는 순서를 지키면서 1, 1.5, 2, 2.5, 5를 붙여 봅시다. A는 (1.5 + 2 × 3 + 2.5 × 8) ÷ 12 = 27.5 ÷ 12 ≈ 2.29, B는 (1 × 3 + 1.5 + 2 × 2 + 2.5 + 5 × 5) ÷ 12 = 36 ÷ 12 = 3으로 B가 앞섭니다. 같은 응답인데 평균의 순위가 뒤집혔습니다. 그림에서 직접 끌어 보세요.

가로줄의 점 다섯 개가 다섯 칸에 붙인 숫자입니다. 양 끝(1과 5)은 고정했고, 가운데 노란 점 셋은 순서를 지키는 범위에서 좌우로 끌 수 있습니다. 위쪽 파란 점이 가게 A의 손님, 아래쪽 분홍 점이 가게 B의 손님이고, 화살표가 각 가게의 평균입니다.

지금 붙인 숫자는 ()이고, 평균은 A가 , B가 입니다. 가운데 점 셋을 왼쪽 끝(1) 쪽으로 몰아 보거나 '매우 만족'을 멀리 떼어 놓기를 누르면 평균의 순위가 뒤집힙니다. A의 손님이 몰린 '만족'의 값이 작아지고, B의 손님 다섯이 있는 '매우 만족'만 멀리 남기 때문입니다. '매우 불만'을 멀리 떼어 놓기를 누르면 다시 A가 크게 앞서고, 고른 간격으로 돌아올 수 있습니다. 그동안 중앙값(12명을 낮은 쪽부터 줄 세웠을 때 여섯째 응답)은 번호를 어떻게 붙여도 A는 '', B는 '' 그대로입니다. 중앙값은 순서만 보고 정해지기 때문입니다. 서열 척도에서 "A의 평균이 더 높다"는 말은 설문 자료에 관한 사실이 아니라, 우리가 고른 번호 매기기에 관한 사실입니다.

여기에 이 절의 핵심이 있습니다. 스티븐스의 분류는 '어떤 바꿔 붙이기를 허락하는가'라는 변환의 군으로 척도를 나눈 것입니다. 여기서 군은 '허락된 바꿈 둘을 잇달아 해도, 한 바꿈을 되돌려도 여전히 허락된 바꿈인' 바꿈들의 모임을 가리킵니다. 섭씨를 화씨로 바꾸고 다시 절대 온도 식으로 바꾸어도 여전히 ax+bax + b 꼴인 것처럼요. 순열 전체, 증가함수 전체, 일차함수 전체, 확대 전체 순으로 군이 작아지고, 군이 작을수록 살아남는 명제가 많습니다. 뒤에 측정 이론은 이것을 한 문장으로 다듬었습니다. 어떤 명제가 의미 있다는 것은, 허락된 모든 변환 아래에서 그 명제의 참·거짓이 변하지 않는다는 것입니다. 1872년 펠릭스 클라인이 에를랑겐에서 "기하학이란 어떤 변환군 아래에서 변하지 않는 성질을 연구하는 것"이라고 한 말과 똑같은 모양입니다(대칭과 불변량⁠(invariant)⁠). 클라인이 이 강령으로 유클리드 기하와 새로 나타난 비유클리드 기하⁠(non-Euclidean geometry)⁠들을 한 지도 위에 정리한 이야기는 「평행선의 반란」에 있습니다. 유클리드 기하에서 넓이는 뜻이 있지만 방향은 뜻이 없듯, 등간 척도에서 차이의 비는 뜻이 있지만 값의 비는 뜻이 없습니다.

그렇다고 만족도의 평균을 내면 안 된다는 뜻은 아닙니다. 1953년 통계학자 프레더릭 로드는 「미식축구 등번호의 통계적 처리에 관하여」라는 짧은 풍자글에서, "숫자는 자기가 어디서 왔는지 모른다"며 스티븐스의 규칙을 너무 엄격하게 따르는 태도를 꼬집었습니다. 평균이 가리키는 판정이 그럴듯한 번호 매기기들에서 모두 같다면 평균을 믿어도 됩니다. 물어야 할 질문은 "이 척도가 서열인가"라는 분류가 아니라, "내 결론이 번호를 바꿔 붙여도 살아남는가"입니다. 위의 그림은 그 질문을 직접 던지는 도구입니다.

스티븐스 자신은 측정을 넓게 잡은 이 정의를 들고 실험실로 돌아갔습니다. 사람들에게 소리나 빛의 세기를 수로 직접 매기게 하자(크기 추정법⁠, magnitude estimation⁠), 답은 페히너의 로그가 아니라 자극 세기의 거듭제곱을 따랐습니다. 1957년 논문 「정신물리 법칙에 관하여」에서 그는 페히너의 법칙을 감각 = 상수 × 자극지수 꼴의 거듭제곱 법칙으로 바꾸자고 했고, 지수는 감각마다 달랐습니다. 두 축을 모두 로그로 찍어 직선을 찾는다는 점에서 1절의 리처드슨과 같은 방법입니다. 캠벨이라면 여전히 측정이 아니라고 했겠지만, 스티븐스에게는 규칙에 따라 붙인 수로 충분했습니다. 무엇을 측정이라 부를지부터가 이 논쟁의 대상이었던 것입니다.

4 · 버스 정류장누구에게 묻는가

이 절의 물음은 이것입니다. 같은 사실을 두고 두 사람이 서로 다른 '평균'을 정직하게 말할 수 있을까? 이번에는 숫자를 붙이는 규칙이 아니라 무엇을 세는가를 봅시다. 버스 회사가 "우리 노선의 버스는 평균 10분마다 옵니다"라고 발표합니다. 아무 때나 정류장에 나간 승객은 평균 몇 분을 기다릴까요? 많은 사람이 5분이라고 답합니다. 버스가 정확히 10분마다 온다면 맞습니다. 그러나 버스가 경우를 봅시다. 선택지를 바꿔 가며 오른쪽 그림에서 파란 막대와 분홍 막대가 어떻게 다른지 보세요.

처음 두 시간: 버스와 승객
배차 간격의 분포, 누가 세었는가
왼쪽: 파란 세로줄이 버스가 온 시각, 분홍 점 하나가 승객 한 명입니다. 점의 가로 위치는 승객이 정류장에 온 시각, 높이는 다음 버스까지 기다린 시간입니다. 오른쪽: 파란 막대는 버스마다 한 번씩 센 간격, 분홍 막대는 승객마다 '내가 들어간 간격'을 한 번씩 센 것입니다. 막대에 마우스를 올리면 두 비율이 나옵니다.

10시간 동안의 기록으로 계산하면 버스 회사가 센 평균 간격은 분입니다. 그런데 승객 1,200명에게 "당신이 기다린 버스와 그 앞 버스 사이는 몇 분이었습니까?"라고 물으면 평균이 분이고, 실제로 기다린 시간의 평균은 분입니다. ↻ 다른 날을 눌러도 이 차이는 사라지지 않습니다.

까닭은 왼쪽 그림에 있습니다. 승객의 점은 버스와 버스 사이마다 톱니 모양의 삼각형을 이룹니다. 간격이 gg분이면 그 사이에 오는 승객 수는 gg에 비례하고, 그들이 기다리는 시간도 평균 g/2g/2로 gg에 비례합니다. 그래서 긴 간격은 승객 수로 한 번, 기다림으로 또 한 번, 두 번 무게를 받습니다. 삼각형의 넓이가 g2/2g^2/2인 것이 그 두 번입니다. 아무 때나 도착한 승객의 평균 대기 시간은 이 넓이를 모두 더해 전체 시간으로 나눈 값입니다.

작은 예로 확인해 봅시다. 간격이 4분과 16분 두 개뿐인 20분을 생각합니다. 4분 간격에 들어온 승객은 평균 2분, 16분 간격에 들어온 승객은 평균 8분을 기다립니다. 승객이 1분에 한 명씩 고르게 온다면 20명 가운데 4명은 짧은 간격에, 16명은 긴 간격에 들어가니, 평균 대기는 (4 × 2 + 16 × 8) ÷ 20 = 136 ÷ 20 = 6.8분입니다. 톱니 넓이로 보면 (42/2+162/2)÷20(4^2/2 + 16^2/2) \div 20로 같은 계산입니다. 간격의 단순 평균은 10분인데 대기는 그 절반인 5분이 아니라 6.8분입니다.

간격이 g1,g2,…,gmg_1, g_2, \dots, g_m이면 같은 셈이 (∑gi2/2)÷∑gi\big(\sum g_i^2/2\big) \div \sum g_i입니다. 분자와 분모를 모두 간격 수 mm으로 나누면 '간격의 제곱의 평균 ÷ (2 × 간격의 평균)'이 됩니다. 이것을 기호로 적은 것이 아래 식의 왼쪽입니다. E[ ⋅ ]\mathbb E[\,\cdot\,]는 평균(기댓값⁠, expected value⁠), Var(G)\mathrm{Var}(G)는 분산, 곧 '간격이 평균에서 벗어난 양의 제곱'의 평균입니다. 오른쪽 식은 제곱의 평균이 '평균의 제곱 + 분산'이라는 사실(E[G2]=E[G]2+Var(G)\mathbb E[G^2] = \mathbb E[G]^2 + \mathrm{Var}(G))을 넣어 고쳐 쓴 것입니다.

E[대기]  =  E[G2]2 E[G]  =  E[G]2(1+Var(G)E[G]2)\mathbb E[\text{대기}] \;=\; \frac{\mathbb E[G^2]}{2\,\mathbb E[G]} \;=\; \frac{\mathbb E[G]}{2}\left(1 + \frac{\mathrm{Var}(G)}{\mathbb E[G]^2}\right)

여기서 GG는 버스 회사가 센 배차 간격이고, 기댓값은 오랜 시간 동안 간격들에 대해 낸 평균입니다. 승객이 버스 시각과 무관하게 온다면, 간격들이 서로 독립⁠(independence)⁠이 아니어도 이 식이 성립합니다. 간격이 늘 같으면 분산이 0이라서 5분입니다. 이 표본⁠(sample)⁠에서 식으로 계산한 값은 분으로, 승객에게서 잰 값과 거의 같습니다. 간격의 분산이 클수록 기다림이 길어집니다. 흔히 '평균 10분 간격이면 평균 5분 기다린다'고 생각하지만, 그것은 간격이 모두 같을 때만 맞습니다. 버스가 완전히 제멋대로 오는 경우도 있습니다. 어느 1분 동안이든 버스가 올 확률이 같고 앞 버스와도 무관한 경우(푸아송 과정⁠, Poisson process⁠)입니다. 이때는 간격의 표준편차(분산의 제곱근)가 평균과 같아서, 식의 괄호 안이 1 + 1 = 2가 되고 평균 대기가 5 × 2 = 10분, 꼬박 10분입니다. 평균 간격의 절반이 아니라 간격 전체입니다. 둘씩 몰려오는 버스에서는 시간의 90%가 긴 간격에 속하므로, 승객 대부분이 긴 간격을 겪습니다.

이것을 기댓값의 말로 적으면 이렇습니다. 버스 회사는 간격마다 같은 무게 1을 주어 평균을 내고, 승객은 간격마다 그 길이에 비례하는 무게를 주어 평균을 냅니다. 둘 다 정직한 평균이지만 서로 다른 평균입니다.

확률론에서는 이것을 검사의 역설⁠(inspection paradox)⁠, 또는 크기에 비례해 뽑히는 표본의 치우침이라고 부릅니다. 윌리엄 펠러는 1966년 확률론 교과서의 둘째 권에서 이것을 '대기 시간의 역설⁠(waiting-time paradox)⁠'이라 부르며 널리 알렸습니다. 같은 일이 곳곳에서 일어납니다. 학생 10명인 반과 90명인 반만 있는 학교는 "평균 학급 크기 50명"이라고 발표하지만, 학생에게 물으면 평균 (10⋅10+90⋅90)/100=82(10\cdot 10 + 90\cdot 90)/100 = 82명입니다(1977년 사회학자 스콧 펠드와 정치학자 버나드 그로프먼이 대학 강의의 규모로 이 차이를 따졌습니다). 어느 날 병원에 입원해 있는 환자를 조사하면 오래 입원하는 환자가 지나치게 많이 잡힙니다. 1991년 사회학자 스콧 펠드는 같은 원리로 친구 관계의 역설⁠(friendship paradox)⁠을 설명했습니다. 모든 사람의 친구 목록을 모아 '친구의 친구 수'를 평균하면, 사람들의 친구 수를 그냥 평균한 값보다 크거나 같습니다(모두의 친구 수가 같을 때만 같습니다). 친구가 많은 사람일수록 누군가의 친구로 더 자주 세어지기 때문입니다.

정리하면, 버스 회사의 평균은 간격마다 같은 무게를, 승객의 평균은 간격의 길이만큼의 무게를 준 평균이고, 두 평균의 차이는 간격의 분산이 만듭니다.

5 · 1995–1996년 뉴욕과 애틀랜타합치면 뒤집힌다

이 절의 물음은 이것입니다. 해마다 앞선 선수가 두 해를 합치면 질 수 있을까? 있다면 그 까닭을 그림 한 장으로 볼 수 있을까? 평균이 무게를 고르는 일이라는 것을 알면, 더 이상한 현상도 설명됩니다. 1995년과 1996년 두 시즌 동안 뉴욕 양키스의 데릭 지터와 애틀랜타 브레이브스의 데이비드 저스티스의 타율(안타 수 ÷ 타수)을 봅시다. 수학자 켄 로스가 『야구장의 수학자』(2004)에서 소개한 자료입니다. 1995년에는 지터가 48타수 12안타로 .250, 저스티스가 411타수 104안타로 .253이었습니다. 1996년에는 지터가 582타수 183안타로 .314, 저스티스가 140타수 45안타로 .321이었습니다. 두 해 모두 저스티스가 앞섭니다. 그런데 두 해를 합치면 지터는 630타수 195안타로 .310, 저스티스는 551타수 149안타로 .270입니다. 해마다 진 지터가 합계에서 이깁니다.

이것이 심슨의 역설⁠(Simpson's paradox)⁠입니다. 결석 치료와 버클리 대학원 입학 자료로 본 설명은 위키와 「담배와 폐암」에 있으니, 여기서는 같은 현상을 벡터⁠(vector)⁠의 덧셈으로 봅시다. 한 선수의 한 시즌을 (타수, 안타)라는 화살표로 그리면, 화살표의 기울기가 곧 타율입니다. 두 시즌을 합치는 것은 두 화살표를 이어 붙이는 것이고, 합친 타율은 처음에서 끝까지 잇는 점선의 기울기입니다.

노란 화살표가 지터, 파란 화살표가 저스티스의 시즌이고(1995년이 먼저, 1996년이 이어서), 점선이 두 해의 합입니다. 화살표 끝의 점을 끌면 타율(기울기)은 그대로 둔 채 그 시즌의 타수(길이)만 바뀝니다. 흐린 점선은 타율 .250과 .300의 기준선입니다.

화살표를 보면 뒤집힘이 자연스럽습니다. 저스티스의 긴 화살표는 타율이 낮은 1995년이고, 지터의 긴 화살표는 타율이 높은 1996년입니다. 해마다 저스티스의 화살표가 조금 더 가파르지만, 합친 기울기는 긴 화살표 쪽으로 끌려갑니다. 지금은 이고, 합친 타율은 지터 , 저스티스 입니다. 점을 끌어 뒤집힘을 없애 보세요. 네 시즌 모두 300타수로를 누르면 두 선수에게 같은 무게를 준 셈이 되어 뒤집힘이 사라집니다. 실제 기록으로 돌아올 수 있습니다.

4절과 5절은 같은 이야기입니다. 모든 평균은 가중 평균이고, 무게는 측정하는 방식이 고릅니다. 버스 회사와 승객은 같은 간격들에 서로 다른 무게를 주었고, 지터와 저스티스는 두 시즌에 서로 다른 무게(타수)를 주었습니다. 합친 타율은 두 시즌 타율 사이의 한 점이고, 그 점이 어디에 놓일지는 타수의 비율이 정합니다. 지터로 적으면 합친 타율은 (48 × .250 + 582 × .314) ÷ 630으로, 타수 48과 582를 무게로 준 평균입니다. 무게의 92%가 1996년에 있으니 합계 .310은 1996년의 .314 가까이 놓입니다. 저스티스는 무게의 75%가 1995년(411 ÷ 551)에 있어서 합계 .270이 1995년의 .253 쪽으로 끌려갑니다. 그래서 두 집단이 부분마다 같은 순서여도, 무게가 다르면 전체의 순서는 어느 쪽으로든 나올 수 있습니다.

그렇다면 누가 더 나은 타자였을까요? 표만으로는 답이 정해지지 않습니다. 1995년은 지터가 메이저리그에 데뷔한 해로, 그는 시즌 대부분을 마이너리그에서 보냈습니다. 두 해의 투수와 구장도 달랐습니다. 나눠 본 결과를 믿을지 합친 결과를 믿을지는 무게의 차이가 어디서 왔는지, 곧 무엇이 무엇의 원인인지에 달려 있습니다. 여기서 '연도'처럼 무게(누가 어느 해에 많이 쳤는가)와 결과(타율) 양쪽에 얽힌 제3의 요인이 교란 변수⁠(confounding variable)⁠이고, 그것을 가려내는 방법이 「담배와 폐암」의 주제입니다.

정리하면, 합친 비율은 부분 비율들의 가중 평균이어서 두 집단의 무게가 다르면 부분의 순서와 전체의 순서가 어긋날 수 있고, 어느 쪽을 믿을지는 수학이 아니라 무게가 생긴 까닭이 정합니다.

6 · 1886년과 1904년 런던잡음이 섞인 자

이 절의 물음은 이것입니다. 자 자체가 떨린다면, 잰 숫자는 어떤 쪽으로 어긋날까? 우연히 흔들리기만 할까, 아니면 한쪽으로 치우칠까?

이제 자 자체가 떨리는 경우를 봅시다. 몸무게를 재면 체중계가 조금씩 다른 값을 보여 주고, 같은 학생이 같은 시험을 두 번 보면 점수가 다릅니다. 잰 값은 참값에 잡음이 더해진 것입니다. 심리 측정에서는 잰 점수의 분산(점수가 평균에서 벗어난 양의 제곱을 평균한 것, 곧 흩어짐의 크기) 가운데 참값이 차지하는 몫을 그 검사의 신뢰도라고 부릅니다. 참값과 잡음이 서로 무관하면 잰 점수의 분산은 참값의 분산과 잡음의 분산의 합이므로, 신뢰도 = 참값의 분산 ÷ (참값의 분산 + 잡음의 분산)입니다. 신뢰도가 1이면 잡음이 없고, 0.5면 점수의 분산 가운데 절반이 잡음에서 옵니다.

신뢰도를 높이는 가장 오래된 방법은 비슷한 문항을 더 많이 묻는 것입니다. 1910년 영국의 심리학자 찰스 스피어먼과 윌리엄 브라운은 같은 해 같은 학술지에 따로, 비슷한 문항을 kk배로 늘린 검사의 신뢰도가 kρ/(1+(k−1)ρ)k\rho/(1 + (k-1)\rho)가 된다는 공식을 실었습니다(ρ\rho는 원래 신뢰도). 문항 kk개를 더하면 참값의 분산은 k2k^2배로 커지지만, 문항마다 독립인 잡음의 분산은 kk배로만 커지기 때문입니다. 신뢰도 0.5인 검사를 네 배로 늘리면 4 × 0.5 ÷ (1 + 3 × 0.5) = 2 ÷ 2.5 = 0.8이 됩니다. 오늘날 '스피어먼–브라운 공식⁠(Spearman–Brown formula)⁠'이라 부릅니다.

공식이 어디서 나오는지 따라가기

문항 하나의 참값 분산을 tt, 잡음 분산을 ee라 하면 원래 신뢰도는 ρ=t/(t+e)\rho = t/(t + e)입니다. 같은 참값을 재는 문항 kk개의 점수를 더하면, 참값 부분은 같은 값이 kk번 더해져 kk배가 되니 분산은 k2tk^2 t이고, 서로 무관한 잡음 kk개의 분산은 그냥 더해져 kek e입니다. 새 신뢰도는 k2t/(k2t+ke)=kt/(kt+e)k^2 t / (k^2 t + k e) = k t/(k t + e)입니다. 분자와 분모를 t+et + e로 나누면 t/(t+e)=ρt/(t+e) = \rho, e/(t+e)=1−ρe/(t+e) = 1 - \rho이므로 kρ/(kρ+1−ρ)=kρ/(1+(k−1)ρ)k\rho / (k\rho + 1 - \rho) = k\rho/(1 + (k-1)\rho)입니다.

잡음 섞인 자가 만드는 첫째 착시는 1886년 프랜시스 골턴이 이름 붙인 평균으로의 회귀⁠(regression to the mean)⁠입니다. 첫 시험에서 가장 높은 점수를 받은 학생들은 실력도 좋았지만 대개 운도 좋았습니다. 두 번째 시험에서 운은 따라오지 않으니, 그들의 평균 점수는 전체 평균 쪽으로 물러납니다. 실력이 좋았던 만큼 여전히 전체 평균보다는 높지만, 첫 시험만큼 높지는 않습니다. 심리학자 대니얼 카너먼은 1974년 아모스 트버스키와 함께 『사이언스』에 쓴 글에서 이런 이야기를 소개했습니다. 그는 1960년대 이스라엘 공군의 비행 교관들에게 칭찬보다 꾸중이 효과적이라는 말을 들었습니다. 잘한 훈련생을 칭찬하면 다음 비행에서 못하고, 못한 훈련생을 꾸중하면 다음에 나아진다는 것입니다. 카너먼은 그것이 칭찬과 꾸중의 효과가 아니라, 가장 잘하고 가장 못한 비행을 골라 보았기 때문에 생기는 회귀라고 설명했습니다. 이 현상을 직접 끌어 보는 그림은 위키의 평균으로의 회귀 페이지에 있습니다.

둘째 착시는 덜 알려져 있습니다. 두 가지 능력이 실제로 얼마나 관련되어 있는지 알고 싶다고 합시다. 두 능력을 각각 잡음 섞인 검사로 재고 두 점수의 상관계수를 구하면, 그 값은 참값들의 상관보다 체계적으로 0에 가깝게, 곧 양의 상관이면 더 작게 나옵니다. 아래 그림에서 두 능력의 참값의 상관은 , 두 검사의 신뢰도는 둘 다 입니다. 보면서 신뢰도를 낮춰 보세요. 볼 것은 점들의 구름이 길쭉한 모양에서 둥근 모양으로 바뀌는가입니다. 구름이 둥글수록 상관이 약합니다.

점 하나가 한 사람입니다. 파란 점은 두 검사에서 잰 점수, 회색 점은 (볼 수 없는) 참값입니다. 신뢰도를 낮추면 잡음이 점들을 사방으로 흩어 구름이 둥글어지고, 상관계수가 작아집니다.

잰 점수의 상관()은 참값의 상관()보다 작습니다. 1904년 스피어먼은 이 줄어듦을 식으로 적었습니다. 두 검사의 잡음이 서로, 그리고 참값과 무관하다면, 잰 점수의 상관은 참값의 상관에 두 신뢰도의 기하평균(두 수를 곱해 제곱근을 취한 값)을 곱한 것이 됩니다. 예를 들어 참값의 상관이 0.8이고 두 신뢰도가 모두 0.5이면, 잰 점수의 상관은 0.8 × √(0.5 × 0.5) = 0.8 × 0.5 = 0.4로 절반이 됩니다.

rXY  =  ρTXTY ρXX′ ρYY′r_{XY} \;=\; \rho_{T_X T_Y}\,\sqrt{\rho_{XX'}\,\rho_{YY'}}

여기서 rXYr_{XY}는 잰 점수끼리의 상관, ρTXTY\rho_{T_X T_Y}('로')는 두 참값끼리의 상관, ρXX′\rho_{XX'}, ρYY′\rho_{YY'}는 두 검사의 신뢰도입니다. 지금 값을 넣으면 이고, 그림의 표본에서 잰 값과 거의 같습니다. 거꾸로 잰 상관을 두 신뢰도의 기하평균으로 나누면(여기서는 두 신뢰도가 같으니 신뢰도 하나로 나누면) 참값의 상관을 되찾을 수 있습니다. 지금 표본에서는 입니다. 이것이 스피어먼의 '희석 보정⁠(correction for attenuation)⁠'입니다. 한 줄의 이유는 이렇습니다. 상관계수는 공분산(두 점수가 평균에서 벗어난 양을 사람마다 곱해 평균한 것, 함께 움직이는 정도)을 두 표준편차(분산의 제곱근)로 나눈 값입니다. 서로 무관한 잡음은 공분산⁠(covariance)⁠에는 평균적으로 아무것도 더하지 않고 표준편차⁠(standard deviation)⁠만 키웁니다. 분자는 그대로이고 분모만 커지니 상관이 줄어듭니다. 분모의 표준편차가 각각 1/신뢰도1/\sqrt{\text{신뢰도}}배로 커지므로, 상관은 ρXX′ ρYY′\sqrt{\rho_{XX'}\,\rho_{YY'}}배가 됩니다.

이 식은 어두운 면도 알려 줍니다. 신뢰도를 추정하는 일에도 오차가 있어서, 보정한 상관이 1을 넘는 일이 실제로 생깁니다. 상관계수는 1을 넘을 수 없으니, 그런 값은 보정이 추정과 가정에 기대고 있다는 신호입니다. 또 '잡음이 참값과 무관하다'는 가정이 깨지면 보정은 엉뚱한 쪽으로 갑니다. 가정에서 나온 식은 가정이 맞을 때만 믿을 수 있다는, 당연하지만 자주 잊히는 사실입니다. 그리고 같은 해 스피어먼은 이 도구를 들고 훨씬 큰 질문으로 나아갔습니다.

정리하면, 잡음 섞인 자는 우연히만 흔들리지 않고 한쪽으로 치우친 착시를 만듭니다. 극단값을 골라 다시 재면 평균 쪽으로 돌아오고(회귀), 두 양의 관계를 재면 실제보다 약하게 나옵니다(희석).

7 · 1904–1938년보이지 않는 것을 재기: 요인과 지능 검사

이 절의 물음은 이것입니다. 눈에 보이지 않는 능력을, 눈에 보이는 점수들 사이의 상관만으로 잴 수 있을까? 잰다면 그 결과는 하나로 정해질까?

스피어먼은 영국의 한 예비학교 학생들의 과목 성적과 음높이 구별 능력을 모아 서로의 상관을 계산했습니다. 고전어와 프랑스어의 상관은 .83, 영어와 수학은 .64, 음높이 구별과 음악은 .40이었고(그가 보고한 표의 값입니다), 모든 쌍의 상관이 양수였습니다. 한 과목을 잘하는 학생은 다른 과목도 잘하는 경향이 있었던 것입니다. 이런 '모든 상관이 양수'인 패턴은 그 뒤 한 세기 동안 거의 모든 인지 검사 묶음에서 되풀이해 관찰되었습니다. 이 패턴을 양의 다양체⁠(positive manifold)⁠라고 부릅니다.

스피어먼은 이 패턴을 가장 간단하게 설명하는 모형을 세웠습니다. 모든 검사 점수가 하나의 공통 요인 gg와 검사마다 다른 고유 요인의 합이라는 것입니다. 고유 요인들이 서로, 그리고 gg와 무관하다고 둡니다. 검사 ii가 gg에 실리는 정도(적재량⁠(factor loading)⁠, 곧 검사 점수와 gg의 상관)를 aia_i라 하면, 서로 다른 두 검사 ii, jj의 상관은 aiaja_i a_j가 됩니다. 두 검사가 함께 움직이는 까닭이 gg를 함께 담고 있다는 것 하나뿐이기 때문입니다. 예를 들어 적재량이 0.9인 검사와 0.8인 검사의 상관은 0.9 × 0.8 = 0.72입니다. 검사가 10개면 두 개씩 짝지은 상관표의 칸이 10 × 9 ÷ 2 = 45개인데, 이것을 숫자 10개로 요약하는 셈이고, 이것이 요인 분석의 시작입니다. 가까운 친척으로 주성분 분석⁠(principal component analysis)⁠이 있습니다. 주성분 분석은 자료의 흩어짐을 가장 잘 설명하는 방향을 찾는 순수한 회전⁠(rotation)⁠이고, 요인 분석은 여기에 '공통 부분 + 검사마다의 잡음'이라는 모형을 덧붙인 것입니다.

1938년 시카고의 루이스 서스톤은 검사 56개를 분석해, 하나의 gg 대신 일곱 가지 '기본 정신 능력'(언어 이해, 수, 공간, 기억 등)이 있다고 주장했습니다. 같은 종류의 자료에서 한 사람은 하나를, 다른 사람은 일곱을 본 것입니다. 둘 가운데 한쪽이 계산을 틀렸던 것일까요? 아래 그림은 둘 다 틀리지 않았을 수 있음을 보여 줍니다. 여섯 검사를 각각 두 요인 공간의 화살표로 그렸습니다. 두 검사의 상관은 두 화살표의 내적(두 화살표의 성분을 짝지어 곱해 더한 값)이고, 한 검사가 한 요인에 실리는 적재량은 화살표를 그 요인의 축에 비춘 그림자의 길이입니다(정사영⁠, orthogonal projection⁠). 요인이 하나일 때의 aiaja_i a_j를 요인 둘로 늘린 것이 ai1aj1+ai2aj2a_{i1} a_{j1} + a_{i2} a_{j2}, 곧 내적입니다. 볼 것은 노란 점을 끌어 축을 돌릴 때 오른쪽의 두 표 가운데 어느 것이 바뀌고 어느 것이 그대로인가입니다.

요인 공간의 검사들
적재량과 상관
왼쪽: 파란 화살표는 말 검사, 주황 화살표는 수 검사입니다. 노란 축이 요인 1, 청록 축이 요인 2이고, 노란 점을 끌어 두 축을 함께 돌립니다. 오른쪽: 왼쪽 표가 각 검사의 적재량과 공통성(두 적재량의 제곱합), 오른쪽 표가 검사 사이의 상관입니다. 칸에 마우스를 올리면 계산이 나옵니다.

지금 요인 1의 방향은 이고, 요인 1이 설명하는 몫은 공통 부분 전체의 입니다. 요인 1을 가장 크게(약 °)와 서스톤의 단순 구조로(0°)를 번갈아 눌러 보세요. 적재량 표는 크게 달라지지만, 상관표는 한 칸도 변하지 않습니다. 두 축을 함께 돌려도 화살표끼리의 내적⁠(dot product)⁠은 변하지 않기 때문입니다. 적재량으로 되살린 상관과 원래 상관의 차이는 지금 가장 큰 것도 입니다.

이것이 요인의 회전 불확정성입니다. 요인이 둘 이상이면, 상관표는 요인 공간에서 검사들의 상대적인 배치만 정하고 축의 방향은 정하지 않습니다. 첫째 축을 화살표들의 한가운데로 돌리면 모든 검사가 크게 실리는 '일반 요인'과 말 대 수를 가르는 양극 요인이 보이고, 축을 두 무리에 하나씩 맞추면 일반 요인 없이 '언어'와 '수리' 두 능력이 보입니다. 어느 쪽이 '참된' 요인인지는 상관표가 아니라 다른 근거가 정해야 합니다. 서스톤은 각 검사가 되도록 적은 요인에 실리는 '단순 구조⁠(simple structure)⁠'를 기준으로 삼았습니다. 그런데 그렇게 찾은 기본 능력들이 서로 양의 상관을 보였고, 그 상관을 다시 분석하면 윗단에 일반 요인이 나왔습니다. 1993년 존 캐럴은 460여 개의 자료를 다시 분석해 일반 요인 아래 넓은 능력들, 그 아래 좁은 능력들이 있는 3층 모형을 내놓았습니다. 오늘날 많은 연구가 이런 위계 모형을 씁니다.

정리하면, 상관표는 검사 화살표들의 서로 간 각도와 길이만 정하고, 요인의 축을 어디에 둘지는 정하지 않습니다. 하나의 일반 요인도, 여러 기본 능력도 같은 상관표의 서로 다른 읽기입니다.

수학과 나란히, 지능 검사는 전혀 다른 길로 자랐습니다. 스피어먼과 같은 무렵 파리에서는 다른 일이 있었습니다. 1880년대 초 쥘 페리의 교육법으로 프랑스에서 모든 아이가 학교에 다녀야 하는 무상 의무 교육이 시작되자, 수업을 따라가지 못하는 아이를 어떻게 가려내 도울지가 행정의 문제가 되었습니다. 1904년 교육부는 이 문제로 위원회를 꾸렸습니다. 여기에 들어간 심리학자 알프레드 비네가 이듬해인 1905년 의사 테오도르 시몽과 함께, 특별한 도움이 필요한 아이를 가려내는 검사를 만들었습니다. 쉬운 것부터 어려운 것까지 문제 30개를 늘어놓은 검사였고, 1908년 개정판부터는 몇 살 아이들이 보통 풀 수 있는지로 문제를 묶어 '정신 연령'을 정했습니다. 비네는 이 척도가 키처럼 재는 것이 아니라고 분명히 적었습니다. 지적인 성질은 이어 붙여 더할 수 없으니, 선분을 재듯 잴 수 없다는 것입니다. 3절의 캠벨과 같은 말이고, 스티븐스의 말로 하면 서열 척도라는 뜻입니다.

그러나 숫자는 곧 한 줄로 요약되었습니다. 1912년 브레슬라우의 심리학자 빌헬름 슈테른이 정신 연령을 실제 나이로 나눈 '지능 지수'를 제안했고, 1916년 스탠퍼드의 루이스 터먼은 여기에 100을 곱한 스탠퍼드–비네 검사를 펴냈습니다. 1917–1918년 미국 육군은 로버트 여키스의 주도로 신병 약 175만 명에게 집단 검사를 치렀습니다. 그리고 이 숫자들은 과학이 감당할 수 없는 곳까지 쓰였습니다. 1923년 프린스턴의 심리학자 칼 브리검은 육군 검사 자료로 『미국인의 지능 연구』를 써서 이민자 집단들 사이에 '지능'의 우열이 있다고 주장했습니다. 이 책은 출신국별로 이민을 제한한 1924년 이민법을 둘러싼 의회 논의에서 인용되었습니다. 브리검은 1930년, 점수가 영어 실력과 미국에 산 햇수에 크게 좌우되었다며 자기 연구가 "완전히 무너진다"고 거두어들였습니다. 그사이 그는 1926년 대학 입학을 위한 시험 SAT를 만들었습니다. 1927년 미국 대법원은 벅 대 벨 판결에서 '정신박약'으로 분류된 여성의 강제 불임을 합헌이라고 했고, 여러 나라의 우생학 정책이 비슷한 분류에 기댔습니다. 측정 도구의 역사를 말할 때 이 사실을 빼놓을 수는 없습니다.

무엇이 확립되었고 무엇이 열려 있는지 나누어 말하는 것이 공정합니다. 인지 검사 점수들이 서로 양의 상관을 보이며, 그것을 요약하는 하나의 수가 학업 성적 같은 결과를 꽤 예측한다는 것은 여러 나라의 자료에서 되풀이된 관찰입니다. 미국 심리학회의 1996년 보고서 「지능: 알려진 것과 알려지지 않은 것」은 지능 검사 점수와 학교 성적의 상관을 약 0.5로 정리했습니다. 상관이 0.5라는 것은 같은 점수의 학생들 사이에서도 성적이 넓게 흩어진다는 뜻이기도 합니다.

반면 gg가 뇌 속의 한 가지 원인인지는 열린 질문입니다. 2006년 한 무리의 연구자들(반 데르 마스 등)은 처음에는 서로 무관한 여러 능력이 자라면서 서로를 북돋우기만 해도 양의 다양체가 생긴다는 모형을 보였습니다. 이런 반론의 첫 판은 이미 1916년에 나왔습니다. 영국의 심리학자 고드프리 톰슨(뒤에 에든버러 대학 교수)은 주사위를 던져 가짜 점수를 만들었습니다. 서로 겹치는 수많은 작은 요소를 검사마다 제비뽑듯 골라 쓰기만 해도, 하나의 일반 요인 없이 스피어먼의 모형과 구별하기 어려운 상관표가 나온다는 것을 보인 것입니다. 두 사람은 그 뒤 수십 년 동안 논쟁했습니다. 요약하는 수가 있다는 것과 그 수에 해당하는 하나의 물건이 있다는 것은 다른 주장입니다. 1981년 고생물학자 스티븐 제이 굴드가 『인간에 대한 오해』에서 비판한 것도 이 둘을 섞는 일, 곧 추상을 물건으로 여기는 일이었습니다.

한편 검사 점수의 기준 자체도 움직였습니다. 제임스 플린은 1984년(미국)과 1987년(14개국)의 논문에서, 20세기 동안 같은 검사의 원점수 평균이 IQ로 환산해 10년에 약 3점씩 올랐음을 정리했습니다(플린 효과⁠, Flynn effect⁠). 1990년대 이후 노르웨이 등 몇몇 나라에서는 이 오름세가 멈추거나 뒤집혔습니다. 한 집단의 유전자 구성이 수십 년 만에 그만큼 바뀌기는 어려우므로, 연구자들은 대체로 이 변화의 큰 부분이 환경에서 왔다고 봅니다.

8 · 1975년 이후지표가 목표가 될 때

이 절의 물음은 이것입니다. 좋은 지표를 목표로 삼아 세게 밀어붙이면 왜 지표와 목표가 갈라질까? 지금까지는 숫자가 세계를 어떻게 비추는지 보았습니다. 이 절에서는 숫자가 세계를 바꿉니다. 1902년 프랑스 식민 정부는 하노이에서 쥐를 잡으려고 쥐꼬리 하나마다 현상금을 주었습니다. 역사학자 마이클 밴의 연구에 따르면, 머지않아 꼬리만 잘린 채 살아 돌아다니는 쥐들이 보고되었고 쥐를 기르는 사람까지 나왔다고 합니다. 꼬리의 수는 잡은 쥐의 수를 재는 좋은 지표였지만, 돈을 거는 순간 쥐를 줄이는 일과 꼬리를 늘리는 일이 갈라졌습니다. 인도의 코브라 현상금 이야기도 자주 인용되지만, 그쪽은 기록으로 확인되지 않은 일화입니다.

1975년 영국 중앙은행의 경제학자 찰스 굿하트는 오스트레일리아 준비은행이 펴낸 논문집에 영국의 통화 정책을 다룬 글을 실었고, 거기서 이렇게 썼습니다. "관찰된 통계적 규칙성은 그것을 통제의 목적으로 압박하는 순간 무너지는 경향이 있다." 통화량과 경기 사이의 안정된 관계를 믿고 통화량을 정책 목표로 삼자, 바로 그 관계가 흐트러졌다는 관찰입니다. 오늘날 흔히 인용되는 문장 "측정값이 목표가 되면 좋은 측정이 아니게 된다"는 1997년 인류학자 메릴린 스트래선이 영국 대학 평가를 다룬 글에서 굿하트의 생각을 일반화한 표현입니다. 비슷한 시기 미국의 사회심리학자 도널드 캠벨은 "양적 사회 지표가 사회적 결정에 많이 쓰일수록 부패의 압력을 더 받고, 그것이 감시하려던 사회 과정을 더 왜곡한다"고 적었습니다(1976). 이것이 굿하트의 법칙⁠(Goodhart's law)⁠입니다. 법칙이라는 이름과 달리 정리가 아니라 경험에서 나온 경고입니다.

굿하트의 관찰은 1970년대 영국 경제의 사정에서 나왔습니다. 물가가 치솟던 때, 통화량을 잘 조절하면 물가가 잡힌다는 통화주의의 처방이 힘을 얻었고, 영국 중앙은행도 통화량 지표를 정책의 기준으로 삼기 시작했습니다. 그러자 그때까지 안정돼 보이던 통화량과 경기 사이의 관계가 흐트러졌습니다. 금융 기관과 기업이 새 규제와 목표에 맞추어 돈을 움직이는 방식을 바꾸었기 때문입니다. 같은 무렵 미국의 경제학자 로버트 루커스는 비슷한 경고를 더 일반적인 모양으로 다듬었습니다. 1976년 그는 과거 자료에서 찾은 경제 변수들 사이의 관계는 사람들이 그때의 정책을 예상하고 행동한 결과이므로, 정책을 바꾸면 그 관계도 바뀐다고 지적했습니다(루커스 비판⁠, Lucas critique⁠). 숫자를 보는 쪽이 움직이면 숫자를 만드는 쪽도 움직입니다. 원인과 연관을 가르는 「담배와 폐암」의 물음이 정책의 언어로 다시 나타난 셈입니다.

시험이 목표가 되면 시험이 재려던 것과 갈라진다는 걱정은 훨씬 오래되었습니다. 중국의 과거는 유교 경전을 얼마나 깊이 이해하는지 물어 관리를 뽑는 시험이었고, 15세기 명나라에서 답안을 여덟 마디의 정해진 틀로 쓰는 팔고문이 자리 잡았습니다. 17세기 학자 고염무는 『일지록』의 「의제(擬題)」 조에서 그 결과를 이렇게 적었습니다(요지). 부잣집에서는 이름난 선비를 집에 들여 나올 만한 문제 수십 개에 답안을 한 편씩 짓게 하고 편마다 값을 치른 뒤, 자제와 영리한 종들에게 외우게 했다. 시험장에서 문제가 나오면 열에 여덟아홉은 들어맞아, 외운 글을 그대로 옮겨 적었다. 그는 팔고문의 해악이 진시황의 분서와 같고, 인재를 망친 것은 그보다 심하다고 했습니다. 경전을 이해하는 사람을 고르려던 시험이, 나올 문제를 짐작해 외우는 일을 재게 된 것입니다. 과거는 1905년에 폐지되었습니다.

왜 이런 일이 일어날까요? 가장 조용한 메커니즘은 6절에서 이미 보았습니다. 대리 점수가 참값과 잡음의 합이라면, 대리 점수가 가장 높은 것을 고르는 일은 참값이 높은 것과 함께 잡음이 큰 것을 고르는 일입니다. 아래 그림에서 후보 개(n=2kn = 2^k, k=k = ) 가운데 대리 점수 U=V+XU = V + X가 가장 높은 하나를 고릅니다. 참값 VV는 표준정규분포(평균 0, 표준편차 1인 종 모양 분포)를 따르고, 잡음 XX는 VV와 독립이고, 그 분포는 지금 쪽입니다. 종 모양이면 XX도 VV와 표준편차가 같은 정규분포입니다. 꼬리가 두꺼운 쪽은 자유도⁠(degrees of freedom)⁠ 2인 t 분포⁠(t-distribution)⁠로, 한가운데의 폭은 정규분포와 비슷하지만 아주 큰 값이 훨씬 자주 나와서 분산이 무한대입니다. 오른쪽 그림에서 볼 것은 고르는 폭 nn을 늘릴 때 청록 곡선(참값)이 분홍 곡선(대리 점수)을 계속 따라 오르는지, 어디선가 꺾이는지입니다.

후보들과 고른 하나
고르는 폭에 따른 평균
왼쪽: 회색 점 하나가 후보 하나로, 가로가 대리 점수, 세로가 참값입니다. 노란 점이 대리 점수가 가장 높아 뽑힌 후보입니다. 오른쪽: 뽑힌 후보의 대리 점수(분홍)와 참값(청록)의 기댓값을, 고르는 폭 n을 늘려 가며 계산한 곡선입니다. 흐린 곡선은 다른 잡음 분포일 때입니다. 청록 점을 좌우로 끌 수 있습니다.

이번에 뽑힌 후보는 대리 점수 , 참값 입니다(↻ 다른 후보들). 한 번의 추첨은 흔들리니 오른쪽 곡선을 봅시다. 지금 폭에서 대리 점수의 기댓값은 , 참값의 기댓값은 입니다.

잡음이 종 모양일 때는 식으로 확인할 수 있습니다. VV와 XX가 표준편차가 같은 정규분포이면 E[V∣U=u]=u/2\mathbb E[V \mid U = u] = u/2입니다. 기호는 '대리 점수가 uu인 후보들만 모았을 때 참값의 평균'으로 읽습니다. 까닭은 대칭에 있습니다. VV와 XX는 같은 분포를 따르고 서로 독립이니, 합이 uu라는 것만 알 때 둘 가운데 어느 쪽이 더 컸을지 편들 근거가 없습니다. 그래서 두 평균이 같고, 둘을 더하면 uu이니 각각 u/2u/2입니다. 대리 점수를 아무리 높여도 참값은 늘 그 절반만 따라옵니다. 이것도 평균으로의 회귀입니다.

꼬리가 두꺼운 잡음에서는 사정이 다릅니다. 대리 점수가 아주 높은 후보는 참값이 높을 가능성보다 잡음이 터무니없이 컸을 가능성이 훨씬 큽니다. 정규분포의 꼬리는 e−v2/2e^{-v^2/2}처럼 빨리 줄지만 이 잡음의 꼬리는 거듭제곱으로 천천히 줄기 때문입니다. 그래서 세게 고를수록 뽑힌 것은 '잡음의 챔피언'이 되고, 참값의 기댓값은 0으로 돌아갑니다.

2018년 데이비드 맨하임과 스콧 개러브랜트는 굿하트 현상을 넷으로 나누었는데, 위의 두 경우는 그중 '회귀형'과 '극단형'에 가깝습니다. 나머지는 원인이 아닌 상관을 조작하는 '인과형'(체온계를 차갑게 하면 열이 내린 것처럼 보이는 식)과, 지표를 보는 상대가 일부러 속이는 '적대형'입니다.

이 그림은 오늘날의 인공지능에서 문자 그대로 일어납니다. 강화 학습⁠(reinforcement learning)⁠은 적어 준 보상을 최대화하는 방법이고, 보상은 설계자가 바라는 것의 대리 지표입니다. 2016년 오픈AI의 잭 클라크와 다리오 아모데이는 보트 경주 게임 「코스트러너스」에서, 코스를 도는 대신 한 웅덩이를 빙글빙글 돌며 점수 아이템을 되풀이해 맞히는 에이전트⁠(agent)⁠를 보고했습니다. 이 에이전트는 불이 붙고 다른 배와 부딪히면서도 정상적으로 경주를 마치는 것보다 높은 점수를 얻었습니다.

언어 모델⁠(language model)⁠을 사람의 선호에 맞추는 인간 피드백 강화 학습에서는 사람의 판단을 흉내 낸 보상 모델⁠(reward model)⁠이 대리 지표입니다. 2022년 레오 가오, 존 슐먼, 제이컵 힐턴은 '진짜' 역할을 하는 큰 보상 모델을 따로 두고 작은 대리 보상 모델로 최적화⁠(optimization)⁠하는 실험에서, 출발점에서 멀어질수록 대리 보상은 계속 오르지만 진짜 보상은 오르다가 떨어지는 것을 관찰했습니다. 꼬리가 두꺼운 잡음일 때 오른쪽 그림의 청록 곡선과 닮은 모양입니다. 다만 모양이 닮았다고 원인까지 같다는 뜻은 아닙니다. 흔한 처방은 원래 모델에서 너무 멀어지지 않게 KL 발산(두 확률 분포가 얼마나 다른지 재는 양) 벌점을 거는 것입니다. 2024년 토머스 콰 등은 보상 모델의 오차가 꼬리가 두꺼우면 이 벌점으로도 막을 수 없는 경우가 있음을 증명했습니다. 그런데 그들이 실제 보상 모델들의 꼬리를 재 본 결과는 꼬리가 얇은 쪽에 가까웠습니다.

시험 점수도 같습니다. 언어 모델의 능력은 공개된 문제 모음(벤치마크)의 점수로 재는데, 그 문제나 비슷한 문제가 학습 자료에 섞여 들어가면 점수는 능력이 아니라 기억을 잽니다. 2024년 스케일 AI의 연구진은 널리 쓰이는 초등 수학 문제 모음(GSM8K)과 같은 양식으로 새 문제 1,250개(GSM1k)를 사람이 직접 만들어 여러 모델에 풀게 했습니다. 논문의 최종판에 따르면 정답률이 최대 8%포인트쯤 떨어졌고, 몇몇 모델군은 거의 모든 크기에서 체계적으로 떨어졌지만, 가장 앞선 모델들은 거의 떨어지지 않았습니다. 기계 학습⁠(machine learning)⁠이 오래전부터 지켜 온 규칙, 곧 모델을 고르는 데 쓴 자료와 마지막 평가에 쓰는 자료를 나누라는 규칙(과적합⁠(overfitting)⁠, 교차 검증⁠(cross-validation)⁠)은 굿하트의 법칙에 맞서는 방어입니다. 시험 문제를 한 번 보고 나면 그 문제는 더 이상 시험이 아닙니다.

정리하면, 대리 지표 = 참목표 + 오차일 때 대리 지표로 세게 고를수록 오차가 큰 것까지 함께 고르게 됩니다. 오차가 종 모양이면 참목표는 절반만 따라오고, 꼬리가 두꺼우면 끝내 따라오지 않습니다.

숫자가 목표가 되기까지. 과학 줄(청록)에서 파리의 비네 검사가 브레슬라우의 지능 지수와 스탠퍼드의 검사로 옮겨 가고, 철학 줄(보라)에서 굿하트, 캠벨, 스트래선의 경고가 이어지며, 수학 줄(파랑)의 끝에서 보상 모델과 벤치마크의 문제가 됩니다.

9 · 이어지는 길재는 일의 수학

이 글의 여덟 장면은 한 가지를 되풀이했습니다. 숫자는 세계와 측정 규칙이 함께 만든 것이고, 규칙을 바꿔도 살아남는 것만이 세계에 관한 사실입니다. 해안선에서는 자를 바꿔도 남는 지수가, 척도에서는 번호를 바꿔도 남는 순서가, 평균에서는 무게를 밝혔을 때의 결론이, 요인에서는 축을 돌려도 남는 상관이 그런 것이었습니다. 그리고 굿하트의 법칙은 측정 규칙이 알려지고 보상이 걸리면 세계가 그 규칙에 맞춰 움직인다는 경고였습니다.

요약. 들쭉날쭉한 곡선의 잰 길이는 (잰 범위 안에서) 자의 길이 ss에 따라 거듭제곱으로 변하고, 그 지수에서 나오는 프랙털 차원 DD가 자와 무관한 곡선의 성질입니다. 척도는 허락된 번호 바꾸기의 군으로 나뉘고, 그 아래에서 참·거짓이 변하지 않는 명제만 의미가 있습니다. 모든 평균은 가중 평균이어서, 누구에게 묻고 어떻게 합치느냐가 답을 바꿉니다. 잡음 섞인 자로 재면, 극단값을 골라 다시 잴 때 평균 쪽으로 돌아오고 상관은 0 쪽으로 희석됩니다.

L(s)≈c s1−D,E[대기]=E[G2]2 E[G],rXY=ρTXTYρXX′ρYY′L(s) \approx c\,s^{1-D}, \qquad \mathbb E[\text{대기}] = \frac{\mathbb E[G^2]}{2\,\mathbb E[G]}, \qquad r_{XY} = \rho_{T_XT_Y}\sqrt{\rho_{XX'}\rho_{YY'}}

그리고 대리 지표를 세게 최적화하면, 참목표와 함께 대리 지표의 오차까지 골라내게 됩니다. 재는 일이 정직하려면 무엇으로, 무엇을, 그리고 왜 재는지를 함께 적어야 합니다.