무작위 대조 시험(Randomized controlled trial)
처치를 받을 사람을 동전 던지기처럼 무작위로 정해, 교란을 끊고 처치의 인과(causation) 효과를 재는 실험.
새 치료가 회복을 돕는지 알고 싶습니다. 가장 쉬운 방법은 이미 그 치료를 받은 사람과 받지 않은 사람의 회복 점수를 비교하는 관찰 연구입니다. 문제는 누가 치료를 받았는지가 우연이 아니라는 점입니다. 원래 건강한 사람이 새 치료를 더 잘 찾아 받는다면(치우침
아래는 환자
위 문장의 '관찰 연구(observational study)'를 눌러 '무작위 배정(random assignment)'으로 바꿔 보세요. 무작위 대조 시험에서는 누가 치료를 받을지를 연구자도 환자도 아닌 동전이 정합니다. 동전은 건강 상태를 모르므로, 두 집단은 건강, 나이, 유전자, 생활 습관까지 쟀든 재지 않았든 모든 면에서 평균적으로 같아집니다. 그러면 두 집단의 체계적인 차이는 치료 하나뿐이고, 평균 차이의 기댓값(expected value)이 정확히 참 효과가 됩니다. 사람마다 효과가 다르다면 참 효과는 그 평균입니다. 원인 관계를 화살표로 그린 그래프로 말하면, 동전이 '건강 → 치료'라는 화살표를 끊어 버립니다.
물론 동전도 운이 나쁘면 한쪽에 건강한 사람을 몰아줄 수 있어서, 한 번의 시험은 흔들립니다. 아래는 같은 시험을 300번 되풀이해 얻은 추정값들의 분포입니다.
대조군이 막는 것은 교란만이 아닙니다. 증상이 심할 때 등록한 환자는 아무것도 하지 않아도 평균으로의 회귀(regression to the mean) 때문에 나아지고, 치료를 받는다는 믿음만으로 좋아지는 위약(placebo) 효과도 있습니다. 대조군도 같은 일을 겪으므로 두 집단의 차이에서는 이런 효과가 빠집니다. 그래서 대조군에는 흔히 가짜 약(위약)을 주고, 환자와 평가자 모두 누가 어느 집단인지 모르게 하는 이중맹검(double-blind)을 씁니다.
관찰된 차이가 우연인지는 어떻게 알까요? 효과가 전혀 없다면 치료군과 대조군이라는 이름표는 회복 점수와 아무 상관이 없습니다. 치료군을 n명 가운데 n/2명으로 정해 두었다면, 치료군을 고르는 모든 방법, 곧 이항계수(binomial coefficient)
가능한 배정 가운데 실제 차이만큼 또는 그보다 더 극단적인 차이를 내는 배정의 비율을 p값(p-value)이라 합니다. p값이 0.01이라면 '효과가 없다고 가정하면, 순전히 배정의 운으로 이만큼 또는 더 큰 차이가 나올 확률(probability)이 1%'라는 뜻입니다. 흔히 '효과가 없을 확률이 1%'로 읽지만 그렇지 않습니다. p값은 효과가 없다는 가정 아래서 계산한 데이터의 확률이지, 데이터를 본 뒤 그 가정이 참일 확률이 아닙니다. 둘은 베이즈 정리(Bayes' theorem)에서 조건의 방향이 뒤바뀐 두 확률만큼 다릅니다. p값이 작다고 효과가 크다는 뜻도 아닙니다. 환자가 아주 많으면 하찮게 작은 효과도 작은 p값을 냅니다. 배정을 모두 세어 보기는 어렵습니다. 20명만 돼도 배정의 수가
무작위 배정은 1920~30년대 로널드 피셔가 영국 로담스테드 농업 시험장의 밭 실험에서 체계화했고, 의학에서는 1948년 영국 의학연구위원회가 오스틴 브래드퍼드 힐의 설계로 발표한 스트렙토마이신 결핵 시험이 흔히 최초의 현대적 무작위 대조 시험으로 꼽힙니다.
이어지는 곳. 무작위 배정은 환자 집합(set)을 동전으로 둘로 나누는 일이라, 사람마다 동전을 던지면 치료군의 크기는 이항분포(binomial distribution)를 따릅니다. 부분마다와 전체의 결론이 엇갈리는 심슨의 역설(Simpson's paradox)은 집단마다 구성 비율이 달라서 생기는데, 무작위 배정에서는 그 비율이 평균적으로 같아집니다. 웹사이트가 두 디자인을 무작위로 보여 주고 비교하는 A/B 테스트도 같은 설계입니다. 학생의 희망과 학교의 우선순위를 맞춰 배정하는 제도(안정 매칭, stable matching)에서 같은 순위의 지원자를 추첨으로 가를 때는 그 추첨이 무작위 배정 노릇을 해서, 학교의 효과를 재는 자연 실험(natural experiment)이 되기도 합니다. 무작위 실험을 할 수 없을 때는 상관관계(correlation)에서 인과를 끌어내기 위해 교란을 하나하나 찾아 조정해야 합니다.
이 개념이 나오는 긴 글
이 개념을 언급하는 페이지
- 확률
… 교란 변수가 있을 수 있습니다. 원인 후보를 동전으로 정해 그런 요인과의 연결을 끊는 대표적인 방법이무작위 대조 시험입니다. 가능한 결과마다 확률을 얼마씩 나누어 주었는지를 적은 것을 확률분포 라고 합니다. 공정한 주사위의 …
- 상관관계
… 나누느냐에 따라 상관의 부호가 뒤집히는 심슨의 역설도 있습니다. 인과를 가장 확실하게 재는 방법은무작위 대조 시험처럼 원인을 직접 바꿔 보는 것입니다. 관찰 자료만으로 인과를 말하려면, 교란이 모두 고려되었다는 것 같은 …
- 평균으로의 회귀
… 보이기도 합니다. 효과를 가려내려면 똑같이 골랐지만 처치를 받지 않은 비교 집단이 있어야 하고, 그것이무작위 대조 시험의 대조군입니다. 이름은 1880년대 프랜시스 골턴의 유전 연구에서 왔습니다. 그는 키가 아주 큰 …
- 심슨의 역설
… 쪽이 옳은지는 표만으로 정해지지 않고, 무엇이 무엇의 원인인지를 알아야 합니다. 처치를 동전으로 정하는무작위 대조 시험에서는 두 집단의 구성이 평균적으로 같아지므로 이런 뒤집힘이 체계적으로 생기지 않습니다. 같은 일이 …
- 교란 변수
… 역설⟧이 바로 이 선택의 문제입니다. 모든 교란을 한꺼번에 끊는 방법은 X를 동전으로 정하는 것, 곧무작위 대조 시험입니다. 동전은 기온을 모르니 Z → X 화살표가 사라집니다. 이어지는 곳. 1950년대 흡연과 폐암 …
- 무작위 알고리즘
… 점이 같습니다. 이어지는 곳. 해시 테이블은 해시 함수를 무작위로 골라 일부러 만든 충돌 공격을 막고,무작위 대조 시험은 처치를 무작위로 배정해 교란, 곧 처치 말고 결과에 영향을 주는 다른 원인이 한쪽 무리에 몰리는 …
- 통계학
… 브래드퍼드 힐⟧은 환자를 무작위로 두 무리로 나눈 시험으로 결핵약 스트렙토마이신의 효과를 확인했습니다(무작위 대조 시험). 1950년에는 리처드 돌과 함께 흡연과 폐암의 관계를 밝혔습니다. 사람에게 담배를 억지로 피우게 …
- 라틴 방진
… 그래야 예상하지 못한 치우침까지 우연에 맡겨 끊고, 결과가 우연인지 따지는 확률의 근거를 얻습니다(무작위 대조 시험). 오늘날에도 순서의 영향이 있는 시험, 예컨대 참가자마다 네 가지 약을 서로 다른 순서로 먹게 하는 …