굿하트의 법칙(Goodhart's law)
어떤 측정값을 목표로 삼아 압박하면, 그 측정값과 원래 목표 사이의 관계가 무너지는 경향. 정리가 아니라 경험에서 나온 경고이고, 회귀·극단·인과(causation)·적대의 네 가지 메커니즘으로 나누어 볼 수 있다.
1902년 프랑스 식민 정부는 하노이의 쥐를 줄이려고 쥐꼬리 하나마다 현상금을 주었습니다. 역사학자 마이클 밴에 따르면 곧 꼬리만 잘린 채 살아 있는 쥐들이 보이기 시작했고, 쥐를 기르는 사람까지 나왔다고 합니다. 꼬리의 수는 잡은 쥐의 수를 잘 알려 주는 지표였지만, 돈을 거는 순간 쥐를 줄이는 일과 꼬리를 늘리는 일이 갈라졌습니다.
1975년 영국 중앙은행의 경제학자 찰스 굿하트는 영국 통화 정책에 관한 글에서 이렇게 썼습니다. "관찰된 통계적 규칙성은 그것을 통제의 목적으로 압박하는 순간 무너지는 경향이 있다." 흔히 인용되는 "측정값이 목표가 되면 좋은 측정이 아니게 된다"는 1997년 인류학자 메릴린 스트래선의 일반화이고, 미국의 사회심리학자 도널드 캠벨도 1976년 비슷한 경고를 남겼습니다(캠벨의 법칙, Campbell's law). 이름은 법칙이지만 수학의 정리가 아닙니다. 많은 사례에서 되풀이된 관찰이고, 언제 얼마나 일어나는지는 경우마다 다릅니다.
아래는 굿하트의 원래 문장을 장난감으로 옮긴 것입니다. 글쓰기 과제의 질(세로축)은 볼 수 없고, 채점자는 쪽수(가로축)만 셉니다. 짧은 글은 내용이 모자라고 너무 긴 글은 군더더기가 많아서, 질은
지금 평균 쪽수는
2018년 데이비드 맨하임과 스콧 개러브랜트는 이런 일이 생기는 길을 넷으로 나누었습니다. 회귀형: 대리 지표
흔히 굿하트의 법칙을 "측정하지 말라"는 뜻으로 읽지만, 그렇지 않습니다. 대리 지표가 곧 목표 자체라면(물건의 무게를 재어 무게로 값을 매기듯) 문제는 없습니다. 문제는 지표와 목표 사이의 틈이 압박을 받을 때 생깁니다. 그래서 흔한 처방은 틈을 줄이거나 압박을 조절하는 것입니다. 여러 지표를 함께 보기, 지표를 가끔 바꾸거나 미리 알리지 않기, 고르는 데 쓴 자료와 마지막 평가에 쓰는 자료를 나누기(교차 검증, cross-validation), 원래 상태에서 너무 멀어지지 않게 벌점을 걸기가 그런 예입니다. 기계 학습(machine learning)의 과적합(overfitting)은 학습 오차라는 대리 지표를 너무 잘 줄인 결과이고, 인간 피드백 강화 학습(reinforcement learning)에서 KL 발산(KL divergence) 벌점을 거는 것도 보상 모델(reward model)이라는 대리 지표를 너무 세게 최적화(optimization)하지 않으려는 장치입니다.
이어지는 곳. 지표를 목표로 삼는 일은 최적화의 한 경우이고, 최적화는 대개 목표 함수(function)의 가장 극단적인 곳, 곧 대리 지표와 참값이 가장 많이 어긋날 수 있는 곳으로 갑니다. 강화 학습에서 에이전트(agent)가 설계자의 뜻 대신 적어 준 보상의 허점을 찾는 보상 해킹(reward hacking)은 적대형과 극단형이 섞인 사례이고, 회귀형의 수학은 상관계수가 1보다 작을 때 생기는 평균으로의 회귀와 같습니다. 해안선의 길이에서 지능 검사와 보상 모델까지, 측정이 결과를 바꾸는 여러 방식을 한 줄로 꿰는 글은 「재는 순간 바뀐다」입니다.
이 개념이 나오는 긴 글
이 개념을 언급하는 페이지
- 강화 학습
… 보고됩니다. 이것을 보상 해킹이라 하고, 재는 값을 목표로 삼으면 그 값이 더는 좋은 잣대가 아니게 된다는굿하트의 법칙의 한 모습입니다. 이어지는 곳. 마르코프 연쇄: 다음 상태가 지금에만 달려 있다는 가정이 여기서 …
- 인간 피드백 강화 학습과 정렬
… 떨어지는 것을 관찰하고 그 모양을 경험식으로 맞췄습니다. 측정값이 목표가 되면 좋은 측정이 아니게 된다는굿하트의 법칙의 한 사례입니다. DPO: 보상 모델 없이. 위의 해를 거꾸로 풀면 보상을 정책으로 나타낼 수 있습니다. …