수학 개념 지도
인물

주디아 펄(Judea Pearl)

확률⁠(probability)⁠ 추론을 그래프 위의 계산으로 바꾼 베이즈 네트워크⁠(Bayesian network)⁠와, 관찰과 개입을 구별하는 인과 그래프⁠(causal graph)⁠와 do 연산을 세운 컴퓨터 과학자.

P(y∣do(x))=∑zP(y∣x,z) P(z)P\bigl(y \mid \mathrm{do}(x)\bigr) = \sum_z P(y \mid x, z)\, P(z)

주디아 펄은 1936년 영국 위임 통치 아래의 텔아비브에서 태어나 근처의 브네이브락에서 자랐습니다. 테크니온에서 전기 공학을 공부하고 1960년 미국으로 건너가 1965년 브루클린 폴리테크닉에서 박사 학위를 받았고, 전자 기억 장치를 연구하다 1970년 UCLA에 자리를 잡았습니다. 1970년대의 인공지능⁠(artificial intelligence)⁠은 '만약 A라면 B'라는 규칙을 이어 붙이는 전문가 시스템⁠(expert system)⁠의 시대였습니다. 그러나 의사의 진단처럼 증거가 불확실한 추론을 규칙으로 다루면 모순이 쌓였고, 확률을 쓰자니 계산이 불가능해 보였습니다. 참·거짓 변수 n개의 결합 분포⁠(joint distribution)⁠, 곧 값의 조합 2n2^n가지 하나하나에 확률을 적은 표에는 (모두 더해 1이라는 조건을 빼고도) 2n−12^n - 1개의 수가 필요하니, 변수가 30개만 되어도 10억 개가 넘습니다.

굵은 막대가 이 사람의 생애이고, 흰검은 점은 페이지 끝 연표에 적은 일들입니다. 가는 막대는 같은 시대를 산 이 위키의 인물들입니다. 나이를 끌어 보세요.

나이 세 ·

그의 첫 연구는 인공지능과 거리가 멀었습니다. 뉴저지의 RCA 연구소에서 그는 초전도체로 만든 기억 장치를 연구했고, 1964년 얇은 초전도막 속에서 자기 선속의 소용돌이가 어떻게 퍼지는지 계산한 결과는 지금도 '펄 소용돌이'라는 이름으로 초전도⁠(superconductivity)⁠ 연구에 남아 있습니다. 그러나 반도체 기억 장치가 빠르게 자라면서 초전도 기억 장치는 쓸모를 잃었습니다. UCLA에서 그는 컴퓨터가 체스나 길 찾기에서 수많은 가능성 가운데 유망한 쪽을 먼저 살피게 하는 휴리스틱 탐색⁠(heuristic search)⁠을 연구했고, 1984년 그 이론을 『휴리스틱』이라는 책으로 정리했습니다.

불확실한 추론에 대한 그의 답은 그래프였습니다. 변수들을 점으로, 직접적인 영향을 화살표로 그린 그래프에서 각 변수가 자기 부모(화살표가 들어오는 점)만 주어지면 자기 자손이 아닌 나머지 변수들과 무관하다고 가정하면, 결합 분포가 P(x1,…,xn)=∏iP(xi∣pai)P(x_1, \ldots, x_n) = \prod_i P(x_i \mid \mathrm{pa}_i)로 쪼개집니다. 여기서 pai\mathrm{pa}_i는 i의 부모들입니다. 부모가 적으면 필요한 수는 조건부 확률⁠(conditional probability)⁠의 작은 표 몇 개로 줄어듭니다. 1980년대 초 그는 이런 그래프 위에서 각 점이 이웃에게 '내가 보기에 너는 이럴 확률이 얼마'라는 메시지를 보내고 받으며 베이즈 정리⁠(Bayes' theorem)⁠를 국소적으로 되풀이하는 믿음 전파⁠(belief propagation)⁠ 알고리즘⁠(algorithm)⁠을 내놓았고, 화살표 방향을 무시해도 고리가 없는 트리⁠(tree)⁠ 모양 그래프에서는 이것이 정확한 답을 준다는 것을 보였습니다. 1985년 이 구조에 '베이즈 네트워크'라는 이름을 붙였고, 1988년 책 『지능 시스템의 확률적 추론』은 인공지능이 불확실성을 다루는 방식을 바꾸었습니다.

당시 인공지능 연구자 다수는 확률을 믿지 않았습니다. 1970년대의 의료 진단 시스템 MYCIN은 규칙마다 '확신도'라는 임시방편의 숫자를 붙였고, 퍼지 논리나 증거 이론 같은 대안이 경쟁했습니다. 확률은 계산이 너무 무겁고 사람의 생각과도 다르다는 것이 흔한 반론이었습니다. 펄은 사람의 추론도 전체 분포가 아니라 몇 개의 국소적인 관계로 이루어지며, 그래프가 바로 그 국소성을 담는다고 답했습니다. 믿음 전파는 1990년대에 뜻밖의 곳에서 다시 나타났습니다. 1998년 매켈리스, 매카이, 청은 섀넌의 한계에 바짝 다가간 터보 부호⁠(turbo code)⁠의 복호 방법이 사실 펄의 믿음 전파라는 것을 보였고, 고리가 있는 그래프에서도 이 계산이 대개 잘 맞는다는 것이 알려졌습니다(오류 정정 부호⁠(error-correcting code)⁠).

1990년대 그는 더 오래된 물음으로 방향을 돌렸습니다. 상관관계⁠(correlation)⁠는 인과⁠(causation)⁠가 아니라는 말은 누구나 알지만, 그렇다면 인과는 무엇이고 관찰 자료에서 언제 알아낼 수 있는가? 통계학⁠(statistics)⁠은 오랫동안 이 물음을 피했습니다. 피어슨은 1911년판 『과학의 문법』에서 인과를 상관의 극한⁠(limit)⁠으로 보았고, 골턴과 피어슨과 피셔의 통계학 이래 교과서들은 상관을 가르치고 인과는 실험에 맡겼습니다. 1921년 유전학자 수얼 라이트가 화살표 그림으로 요인들 사이의 영향을 푼 경로 분석⁠(path analysis)⁠은 통계학의 주류에서 오래 주변에 머물렀습니다. 펄은 이 경로 분석을 확률의 언어로 다시 세웠습니다. 가정을 인과 그래프로 적고, 관찰 P(y∣x)P(y \mid x)와 구별되는 개입 P(y∣do(x))P(y \mid \mathrm{do}(x)), 곧 X를 바깥에서 강제로 정했을 때의 Y의 분포를 정의했습니다. 개입은 그래프에서 X로 들어오는 화살표를 모두 끊는 것입니다. 피셔의 무작위 대조 시험⁠(randomized controlled trial)⁠이 강력한 까닭이 여기서 보입니다. 동전으로 처치를 정하면 처치로 들어오는 화살표가 모두 끊기기 때문입니다(무작위성).

동전을 던질 수 없을 때는 어떻게 할까요? X와 Y를 함께 움직이는 교란 변수⁠(confounding variable)⁠ Z를 잴 수 있다면, Z의 값마다 나누어 X와 Y의 관계를 본 뒤 Z의 전체 분포로 다시 평균⁠(mean)⁠ 내면 됩니다. 단, Z가 X와 Y의 공통 원인에서 오는 경로를 모두 막아야 하고 X의 결과(자손)여서는 안 됩니다. 그가 '뒷문 조정⁠(back-door adjustment)⁠'이라 부른 P(y∣do(x))=∑zP(y∣x,z) P(z)P(y \mid \mathrm{do}(x)) = \sum_z P(y \mid x, z)\,P(z)입니다. 중요한 것은 어떤 Z로 나누어야 하는지를 그래프가 정해 준다는 점입니다. 같은 숫자표도 인과 구조에 따라 나누어 보아야 할 때와 나누면 안 될 때가 있고, 심슨의 역설⁠(Simpson's paradox)⁠이 헷갈리는 까닭이 여기에 있습니다. 교란 변수를 잴 수 없더라도, 처치가 결과에 이르는 중간 단계를 잴 수 있으면 효과를 계산할 수 있는 경우도 있습니다. 1995년 그는 그래프에서 이런 계산을 기계적으로 해내는 규칙들, 곧 do 계산법⁠(do-calculus)⁠을 발표했고, 2000년의 책 『인과』에서 이론을 정리했습니다.

1995년 논문 「경험적 연구를 위한 인과 도표」는 공교롭게도 피어슨이 웰던, 골턴과 함께 1901년 세운 학술지 『바이오메트리카』에 여러 통계학자의 토론과 함께 실렸습니다. 가장 빨리 받아들인 것은 역학이었습니다. 1999년 그린랜드, 펄, 로빈스가 역학자들을 위해 쓴 인과 도표 해설 이후, 어떤 변수를 보정해야 하고 어떤 변수는 보정하면 오히려 편향이 생기는지를 그래프로 따지는 일은 역학 연구의 표준 도구가 되었습니다. 통계학에는 이미 도널드 루빈의 잠재적 결과⁠(potential outcomes)⁠라는 다른 언어가 있었습니다. 두 틀은 수학적으로 많은 부분이 서로 옮겨지지만, 가정을 그림으로 적는 것이 나은가 수식으로 적는 것이 나은가를 두고 두 진영은 오래 논쟁했고, 경제학자들도 대체로 조심스러웠습니다. 2006년에는 관찰 자료에서 계산할 수 있는 인과 효과라면 do 계산법의 규칙만으로 모두 찾아낼 수 있다는 완전성이 증명되었습니다.

2018년 대중서 『인과의 책』에서 그는 인과의 사다리를 세 칸으로 그렸습니다. 보는 것(연관), 하는 것(개입), 상상하는 것(반사실⁠, counterfactual⁠)입니다. 피어슨의 상관계수⁠(correlation coefficient)⁠는 첫 칸에, 피셔의 밭과 힐의 시험은 둘째 칸에 있고, "그 약을 먹지 않았더라면 나았을까?"를 물을 때 우리는 셋째 칸에 섭니다. 그는 자료에 곡선을 맞추는 데 머무는 오늘날의 기계 학습⁠(machine learning)⁠이 아직 첫 칸에 서 있다고 거듭 비판했습니다. 2002년 그는 『월스트리트 저널』 기자였던 아들 대니얼이 파키스탄에서 납치되어 살해되는 비극을 겪었고, 가족과 함께 문화 사이의 이해를 넓히려는 대니얼 펄 재단을 세웠습니다. 『인과』는 2001년 과학철학의 라카토슈상을 받았고, 그는 2011년 확률 추론과 인과 추론의 업적으로 튜링상⁠(Turing Award)⁠을 받았습니다.

이어지는 곳. 1854년 런던의 콜레라를 우물과 잇고 급수⁠(series)⁠ 회사를 비교한 스노의 조사는 동전 대신 자연이 처치를 나눠 준 자연 실험⁠(natural experiment)⁠이었고, 골턴이 찾은 평균으로의 회귀⁠(regression to the mean)⁠는 인과 없이도 생기는 변화입니다. 증거로 믿음을 고치는 계산은 라플라스의 역확률⁠(inverse probability)⁠에서, 사슬처럼 이어진 변수들의 가장 단순한 그래프는 마르코프 연쇄⁠(Markov chain)⁠와 은닉 마르코프 모델⁠(hidden Markov model)⁠에서 볼 수 있습니다. 두 변수가 서로에 대해 알려 주는 양은 상호 정보량⁠(mutual information)⁠으로 잽니다.

관계.

가운데가 이 사람, 둘레가 이어진 인물들입니다. 선의 색은 관계의 종류(초록 스승·제자, 파랑 함께 연구, 보라 편지, 빨강 논쟁, 주황 영향)이고, 다른 인물의 페이지에 적힌 관계도 함께 모았습니다.

  • 논쟁 칼 피어슨 — 펄은 인과를 상관의 한 극한으로 본 피어슨의 『과학의 문법』 이래의 전통이 통계학에서 인과라는 말을 몰아냈다고 비판하며, 인과를 다루는 별도의 수학이 필요하다고 주장했습니다.
  • 영향을 받음 로널드 피셔 — 펄은 피셔의 무작위 배정⁠(random assignment)⁠을 '처치로 들어오는 화살표를 모두 끊는 개입'으로 다시 읽고, 동전을 던질 수 없을 때 관찰 자료에서 같은 답을 얻는 조건을 물었습니다.
  • 영향을 받음 존 스노 — 펄은 『인과의 책』에서 스노가 두 급수 회사의 손님을 비교한 1850년대 콜레라 조사를, 자연이 처치를 나눠 준 도구 변수⁠(instrumental variable)⁠ 분석의 이른 예로 다시 읽었습니다.

연표.

  • 1960년 테크니온에서 전기 공학 학사 학위를 받고 미국으로 건너가다
  • 1964년 얇은 초전도막 속의 자기 소용돌이('펄 소용돌이')를 계산하다
  • 1965년 브루클린 폴리테크닉에서 전기 공학 박사 학위를 받다
  • 1970년 UCLA에 자리를 잡다
  • 1982년 그래프 위에서 믿음을 주고받는 추론 알고리즘을 발표하다
  • 1984년 『휴리스틱』을 펴내다
  • 1985년 '베이즈 네트워크'라는 이름을 쓰다
  • 1988년 『지능 시스템의 확률적 추론』을 펴내다
  • 1995년 인과 도표와 do 계산법을 발표하다
  • 2000년 『인과』를 펴내다
  • 2001년 『인과』로 과학철학의 라카토슈상을 받다
  • 2002년 아들 대니얼이 파키스탄에서 납치되어 살해되다
  • 2011년 튜링상을 받다
  • 2018년 『인과의 책』을 펴내다

이 인물이 나오는 긴 글

통계와 인과 담배와 폐암 상관관계는 인과관계가 아니라고들 한다. 그렇다면 담배가 폐암을 일으킨다는 것은 어떻게 알게 되었을까? 정보 이론과 압축 짧게 보내기 모스 부호는 왜 E를 점 하나로 보낼까? 섀넌의 엔트로피가 정한 압축의 한계와, 허프만 부호에서 JPEG까지 그 한계에 다가간 방법들. 반환과 동적 계획법 같은 계산, 다른 덧셈 가장 짧은 길, 길의 가짓수, 가장 그럴듯한 해석, 갈 수 있는지 없는지. 따로 태어난 알고리즘들이 사실은 한 계산이고, 달라지는 것은 더하기와 곱하기 자리에 무엇을 넣느냐뿐이다. 그렇게 바꿔 넣어도 되는 까닭은 분배법칙 하나다.

이 인물을 언급하는 페이지

이 페이지가 가리키는 개념