수학 개념 지도
확률과 통계(Probability and statistics)

무작위 대조 시험(Randomized controlled trial)

처치를 받을 사람을 동전 던지기처럼 무작위로 정해, 교란을 끊고 처치의 인과⁠(causation)⁠ 효과를 재는 실험.

τ^=Yˉ처치−Yˉ대조,E[τ^]=τ\hat\tau = \bar Y_{\text{처치}} - \bar Y_{\text{대조}}, \qquad \mathbb{E}[\hat\tau] = \tau
먼저 보면 좋은 개념교란 변수기댓값큰 수의 법칙

새 치료가 회복을 돕는지 알고 싶습니다. 가장 쉬운 방법은 이미 그 치료를 받은 사람과 받지 않은 사람의 회복 점수를 비교하는 관찰 연구입니다. 문제는 누가 치료를 받았는지가 우연이 아니라는 점입니다. 원래 건강한 사람이 새 치료를 더 잘 찾아 받는다면(치우침 ), 치료군⁠(treatment group)⁠의 회복이 좋은 것이 치료 덕인지 원래 건강 덕인지 가릴 수 없습니다. 건강 상태가 교란 변수⁠(confounding variable)⁠인 것입니다.

아래는 환자 명의 가상 시험입니다. 참 효과는 점인데, 에서 두 집단의 평균⁠(mean)⁠ 차이로 잰 효과는 점입니다. 다시 시험하기

가로축은 연구자가 볼 수 없는 건강 상태, 세로축은 회복 점수입니다. 노랑이 치료군, 파랑이 대조군⁠(control group)⁠이고 가로선은 각 집단의 평균입니다.

위 문장의 '관찰 연구⁠(observational study)⁠'를 눌러 '무작위 배정⁠(random assignment)⁠'으로 바꿔 보세요. 무작위 대조 시험에서는 누가 치료를 받을지를 연구자도 환자도 아닌 동전이 정합니다. 동전은 건강 상태를 모르므로, 두 집단은 건강, 나이, 유전자, 생활 습관까지 쟀든 재지 않았든 모든 면에서 평균적으로 같아집니다. 그러면 두 집단의 체계적인 차이는 치료 하나뿐이고, 평균 차이의 기댓값⁠(expected value)⁠이 정확히 참 효과가 됩니다. 사람마다 효과가 다르다면 참 효과는 그 평균입니다. 원인 관계를 화살표로 그린 그래프로 말하면, 동전이 '건강 → 치료'라는 화살표를 끊어 버립니다.

물론 동전도 운이 나쁘면 한쪽에 건강한 사람을 몰아줄 수 있어서, 한 번의 시험은 흔들립니다. 아래는 같은 시험을 300번 되풀이해 얻은 추정값들의 분포입니다. 무작위 배정의 추정값들은 참 효과를 중심으로(평균 점) 종 모양, 곧 정규분포⁠(normal distribution)⁠에 가깝게 퍼지고, 환자 수를 늘리면 폭이 1/n1/\sqrt n에 비례해 좁아집니다(중심극한정리⁠(central limit theorem)⁠와 큰 수의 법칙⁠(law of large numbers)⁠). 반면 관찰 연구의 추정값들은 좁아지기는 해도 엉뚱한 곳(평균 점)으로 모입니다. 우연에 의한 흔들림, 곧 분산⁠(variance)⁠은 표본⁠(sample)⁠을 늘려 줄일 수 있지만, 설계가 만든 치우침은 줄지 않습니다.

시험을 되풀이해 얻은 효과 추정값의 히스토그램⁠(histogram)⁠. 청록은 무작위 배정, 분홍은 관찰 연구, 노란 세로선은 참 효과입니다.

대조군이 막는 것은 교란만이 아닙니다. 증상이 심할 때 등록한 환자는 아무것도 하지 않아도 평균으로의 회귀⁠(regression to the mean)⁠ 때문에 나아지고, 치료를 받는다는 믿음만으로 좋아지는 위약⁠(placebo)⁠ 효과도 있습니다. 대조군도 같은 일을 겪으므로 두 집단의 차이에서는 이런 효과가 빠집니다. 그래서 대조군에는 흔히 가짜 약(위약)을 주고, 환자와 평가자 모두 누가 어느 집단인지 모르게 하는 이중맹검⁠(double-blind)⁠을 씁니다.

관찰된 차이가 우연인지는 어떻게 알까요? 효과가 전혀 없다면 치료군과 대조군이라는 이름표는 회복 점수와 아무 상관이 없습니다. 치료군을 n명 가운데 n/2명으로 정해 두었다면, 치료군을 고르는 모든 방법, 곧 이항계수⁠(binomial coefficient)⁠ (nn/2)\binom{n}{n/2}가지의 배정이 똑같이 그럴듯합니다. 이름표를 다시 섞어 가며 평균 차이를 계산해, 실제 차이가 그 분포의 얼마나 끝에 있는지 보면 됩니다.

가능한 배정 가운데 실제 차이만큼 또는 그보다 더 극단적인 차이를 내는 배정의 비율을 p값⁠(p-value)⁠이라 합니다. p값이 0.01이라면 '효과가 없다고 가정하면, 순전히 배정의 운으로 이만큼 또는 더 큰 차이가 나올 확률⁠(probability)⁠이 1%'라는 뜻입니다. 흔히 '효과가 없을 확률이 1%'로 읽지만 그렇지 않습니다. p값은 효과가 없다는 가정 아래서 계산한 데이터의 확률이지, 데이터를 본 뒤 그 가정이 참일 확률이 아닙니다. 둘은 베이즈 정리⁠(Bayes' theorem)⁠에서 조건의 방향이 뒤바뀐 두 확률만큼 다릅니다. p값이 작다고 효과가 크다는 뜻도 아닙니다. 환자가 아주 많으면 하찮게 작은 효과도 작은 p값을 냅니다. 배정을 모두 세어 보기는 어렵습니다. 20명만 돼도 배정의 수가 (2010)=184756\binom{20}{10} = 184756가지라서(파스칼의 삼각형⁠(Pascal's triangle)⁠에서 맨 위를 0번째 줄로 셀 때 20번째 줄의 가운데 수), 보통은 몬테카를로 방법⁠(Monte Carlo method)⁠으로 일부만 뽑아 봅니다.

무작위 배정은 1920~30년대 로널드 피셔가 영국 로담스테드 농업 시험장의 밭 실험에서 체계화했고, 의학에서는 1948년 영국 의학연구위원회가 오스틴 브래드퍼드 힐의 설계로 발표한 스트렙토마이신 결핵 시험이 흔히 최초의 현대적 무작위 대조 시험으로 꼽힙니다.

이어지는 곳. 무작위 배정은 환자 집합⁠(set)⁠을 동전으로 둘로 나누는 일이라, 사람마다 동전을 던지면 치료군의 크기는 이항분포⁠(binomial distribution)⁠를 따릅니다. 부분마다와 전체의 결론이 엇갈리는 심슨의 역설⁠(Simpson's paradox)⁠은 집단마다 구성 비율이 달라서 생기는데, 무작위 배정에서는 그 비율이 평균적으로 같아집니다. 웹사이트가 두 디자인을 무작위로 보여 주고 비교하는 A/B 테스트도 같은 설계입니다. 학생의 희망과 학교의 우선순위를 맞춰 배정하는 제도(안정 매칭⁠, stable matching⁠)에서 같은 순위의 지원자를 추첨으로 가를 때는 그 추첨이 무작위 배정 노릇을 해서, 학교의 효과를 재는 자연 실험⁠(natural experiment)⁠이 되기도 합니다. 무작위 실험을 할 수 없을 때는 상관관계⁠(correlation)⁠에서 인과를 끌어내기 위해 교란을 하나하나 찾아 조정해야 합니다.

이 개념이 나오는 큰 생각무작위성

이 개념이 나오는 긴 글

확률 도박판에서 온 편지 1654년, 도중에 멈춘 내기의 판돈을 어떻게 나눌까? 두 수학자가 주고받은 편지에서 확률론이 태어났다. 통계와 인과 담배와 폐암 상관관계는 인과관계가 아니라고들 한다. 그렇다면 담배가 폐암을 일으킨다는 것은 어떻게 알게 되었을까? 매칭과 흐름 짝을 찾는 알고리즘 의대 졸업생과 병원, 신장 기증자와 환자, 철도와 화물. 누구를 누구와 이을지 정하는 수학은 냉전의 철도 지도에서 노벨 경제학상까지 이어진다. 측정의 수학 재는 순간 바뀐다 해안선의 길이는 자에 따라, 평균은 누구에게 묻느냐에 따라, 지표는 목표가 되는 순간 달라진다. 리처드슨의 국경과 프랙털 차원, 스티븐스의 척도, 버스 정류장과 타율의 역설, 스피어먼의 요인, 굿하트의 법칙과 보상 해킹을 한 줄로 꿴다.

이 개념을 언급하는 페이지

이 페이지가 가리키는 개념