수학 개념 지도
확률과 통계(Probability and statistics)

굿하트의 법칙(Goodhart's law)

어떤 측정값을 목표로 삼아 압박하면, 그 측정값과 원래 목표 사이의 관계가 무너지는 경향. 정리가 아니라 경험에서 나온 경고이고, 회귀·극단·인과⁠(causation)⁠·적대의 네 가지 메커니즘으로 나누어 볼 수 있다.

U=V+X,E[V∣U=u]=u2U = V + X, \qquad \mathbb E[V \mid U = u] = \tfrac{u}{2}

1902년 프랑스 식민 정부는 하노이의 쥐를 줄이려고 쥐꼬리 하나마다 현상금을 주었습니다. 역사학자 마이클 밴에 따르면 곧 꼬리만 잘린 채 살아 있는 쥐들이 보이기 시작했고, 쥐를 기르는 사람까지 나왔다고 합니다. 꼬리의 수는 잡은 쥐의 수를 잘 알려 주는 지표였지만, 돈을 거는 순간 쥐를 줄이는 일과 꼬리를 늘리는 일이 갈라졌습니다.

1975년 영국 중앙은행의 경제학자 찰스 굿하트는 영국 통화 정책에 관한 글에서 이렇게 썼습니다. "관찰된 통계적 규칙성은 그것을 통제의 목적으로 압박하는 순간 무너지는 경향이 있다." 흔히 인용되는 "측정값이 목표가 되면 좋은 측정이 아니게 된다"는 1997년 인류학자 메릴린 스트래선의 일반화이고, 미국의 사회심리학자 도널드 캠벨도 1976년 비슷한 경고를 남겼습니다(캠벨의 법칙⁠, Campbell's law⁠). 이름은 법칙이지만 수학의 정리가 아닙니다. 많은 사례에서 되풀이된 관찰이고, 언제 얼마나 일어나는지는 경우마다 다릅니다.

아래는 굿하트의 원래 문장을 장난감으로 옮긴 것입니다. 글쓰기 과제의 질(세로축)은 볼 수 없고, 채점자는 쪽수(가로축)만 셉니다. 짧은 글은 내용이 모자라고 너무 긴 글은 군더더기가 많아서, 질은 흐린 곡선처럼 10쪽 근처에서 가장 높다고 합시다. 쪽수를 점수로 쓰기 전, 학생들은 평균⁠(mean)⁠ 4쪽쯤 썼고 그 범위에서는 긴 글이 대개 더 좋았습니다. 그 회색 점들에서 잰 상관계수⁠(correlation coefficient)⁠는 입니다. 이제 쪽수에 점수를 걸어, 학생들의 평균 쪽수를 로 밀어 올려 봅시다.

점 하나가 학생 한 명의 글입니다. 회색 점은 쪽수를 점수로 쓰기 전, 노란 점은 쪽수를 목표로 삼은 뒤의 글이고, 큰 점이 노란 점들의 평균입니다. 흐린 곡선이 쪽수에 따른 평균적인 질입니다.

지금 평균 쪽수는 쪽, 평균 질은 점이고, 이 학생들 사이에서 잰 쪽수와 질의 상관계수는 입니다. 평균 쪽수를 10쪽 너머로 밀면 점수(쪽수)는 계속 오르는데 질은 떨어지고, 압박하기 전에 관찰한 양의 상관은 사라지다가 음수가 됩니다. 규칙성은 거짓이 아니었습니다. 그것은 압박하기 전의 범위에서만 참이었고, 압박이 시스템을 그 범위 밖으로 밀어냈습니다.

2018년 데이비드 맨하임과 스콧 개러브랜트는 이런 일이 생기는 길을 넷으로 나누었습니다. 회귀형: 대리 지표 UU가 참값 VV에 잡음 XX가 더해진 것이면, UU가 가장 높은 것을 고를 때 잡음이 큰 것도 함께 골라집니다. VV와 XX가 서로 독립⁠(independence)⁠이고 같은 정규분포⁠(normal distribution)⁠를 따르면 E[V∣U=u]=u/2\mathbb E[V \mid U = u] = u/2여서, 참값은 늘 대리 지표가 오른 만큼의 절반만 따라옵니다(평균으로의 회귀⁠, regression to the mean⁠). 극단형: 위의 그림처럼, 관찰한 범위 밖에서는 관계 자체가 달라집니다. 인과형: 원인이 아닌 상관만 있는 지표를 조작하면(체온계를 식히면 열이 내린 것처럼 보이듯) 참값은 움직이지 않습니다(교란 변수⁠, confounding variable⁠). 적대형: 지표를 보는 상대가 지표를 알고 일부러 맞춥니다. 쥐꼬리 현상금은 적대형입니다.

흔히 굿하트의 법칙을 "측정하지 말라"는 뜻으로 읽지만, 그렇지 않습니다. 대리 지표가 곧 목표 자체라면(물건의 무게를 재어 무게로 값을 매기듯) 문제는 없습니다. 문제는 지표와 목표 사이의 틈이 압박을 받을 때 생깁니다. 그래서 흔한 처방은 틈을 줄이거나 압박을 조절하는 것입니다. 여러 지표를 함께 보기, 지표를 가끔 바꾸거나 미리 알리지 않기, 고르는 데 쓴 자료와 마지막 평가에 쓰는 자료를 나누기(교차 검증⁠, cross-validation⁠), 원래 상태에서 너무 멀어지지 않게 벌점을 걸기가 그런 예입니다. 기계 학습⁠(machine learning)⁠의 과적합⁠(overfitting)⁠은 학습 오차라는 대리 지표를 너무 잘 줄인 결과이고, 인간 피드백 강화 학습⁠(reinforcement learning)⁠에서 KL 발산⁠(KL divergence)⁠ 벌점을 거는 것도 보상 모델⁠(reward model)⁠이라는 대리 지표를 너무 세게 최적화⁠(optimization)⁠하지 않으려는 장치입니다.

이어지는 곳. 지표를 목표로 삼는 일은 최적화의 한 경우이고, 최적화는 대개 목표 함수⁠(function)⁠의 가장 극단적인 곳, 곧 대리 지표와 참값이 가장 많이 어긋날 수 있는 곳으로 갑니다. 강화 학습에서 에이전트⁠(agent)⁠가 설계자의 뜻 대신 적어 준 보상의 허점을 찾는 보상 해킹⁠(reward hacking)⁠은 적대형과 극단형이 섞인 사례이고, 회귀형의 수학은 상관계수가 1보다 작을 때 생기는 평균으로의 회귀와 같습니다. 해안선의 길이에서 지능 검사와 보상 모델까지, 측정이 결과를 바꾸는 여러 방식을 한 줄로 꿰는 글은 「재는 순간 바뀐다」입니다.

이 개념이 나오는 긴 글

언어 모델 다음 단어를 맞히는 기계 다음 낱말을 짐작하는 일만으로 어디까지 갈 수 있을까? 마르코프의 글자 세기에서 섀넌의 추측 게임, 트랜스포머와 규모의 법칙, 사람의 선호까지. 밑바닥에는 확률의 곱셈 규칙과 로그 하나가 있고, 그 수학은 모델이 왜 그럴듯하게 틀리는지도 말해 준다. 측정의 수학 재는 순간 바뀐다 해안선의 길이는 자에 따라, 평균은 누구에게 묻느냐에 따라, 지표는 목표가 되는 순간 달라진다. 리처드슨의 국경과 프랙털 차원, 스티븐스의 척도, 버스 정류장과 타율의 역설, 스피어먼의 요인, 굿하트의 법칙과 보상 해킹을 한 줄로 꿴다.

이 개념을 언급하는 페이지

이 페이지가 가리키는 개념