수학 개념 지도
정보 이론

최대 엔트로피 원리(Principle of maximum entropy)

아는 조건을 만족하는 확률분포⁠(probability distribution)⁠ 가운데 엔트로피⁠(entropy)⁠가 가장 큰 것을 고르라는 원리. 모르는 것을 가정하지 않는 선택이며, 평균⁠(mean)⁠만 정해지면 지수 모양(양의 실수⁠(real number)⁠ 위에서는 지수분포⁠(exponential distribution)⁠), 실수 전체에서 평균과 분산⁠(variance)⁠이 정해지면 정규분포⁠(normal distribution)⁠가 나온다.

max⁡p  H(p)   s.t.   ∑ipif(i)=m  ⟹  pi=eλf(i)Z(λ)\max_p\; H(p) \;\text{ s.t. }\; \sum_i p_i f(i) = m \;\Longrightarrow\; p_i = \frac{e^{\lambda f(i)}}{Z(\lambda)}

1957년 미국 물리학자 에드윈 제인스(E. T. Jaynes)는 논문 「정보 이론과 통계 역학(Information Theory and Statistical Mechanics)」에서 통계 역학을 추론의 문제로 다시 읽었습니다. 통계 역학은 수많은 분자의 운동을 하나하나 따라가는 대신 확률⁠(probability)⁠로 다루어 온도·압력 같은 성질을 설명하는 물리학입니다. 우리가 아는 것을 만족하는 확률분포는 대개 무수히 많습니다. 그 가운데 엔트로피가 가장 큰 것을 고르라는 것이 그의 제안입니다. 제인스의 논리는 이렇습니다. 엔트로피가 더 작은 분포를 고르면 가지고 있지 않은 정보를 가진 척하는 셈입니다. 가능한 값이 유한 개일 때 아무 조건이 없으면 답은 균등분포입니다. 그러니 모르면 똑같이 나누라는 오래된 '이유 불충분의 원리⁠(principle of insufficient reason)⁠'가 그 특별한 경우입니다. 야코프 베르누이와 라플라스가 확률을 매길 때 쓴 원리로, 1921년 케인스가 '무차별의 원리⁠(principle of indifference)⁠'라는 이름을 붙이기도 했습니다.

제인스가 브랜다이스 대학 강의에서 든 예라서 '브랜다이스 주사위 문제⁠(Brandeis dice problem)⁠'라 불리는 문제가 있습니다. 주사위를 아주 많이 굴렸더니 눈의 평균이 3.5가 아니라 4.5였다고 합시다. 각 눈의 확률은 얼마로 두어야 할까요? 평균이 4.5인 분포는 셀 수 없이 많습니다. 평균 m=m = 을 움직이며, 엔트로피가 가장 큰 분포와 평균이 같은 다른 분포를 견주어 보세요. 비교할 분포: .

조건이 '합이 1, 평균이 m' 둘뿐이면 최대 엔트로피 분포⁠(maximum entropy distribution)⁠는 언제나 pi∝eλip_i \propto e^{\lambda i} 모양입니다. 왼쪽 그림의 점선이 그 지수함수⁠(exponential function)⁠ 곡선입니다. 합이 1이고 평균이 m이라는 두 조건 아래에서 H=−∑pilog⁡piH = -\sum p_i \log p_i를 가장 크게 하는 최적화⁠(optimization)⁠ 문제를 라그랑주 승수법으로 풀면 이 모양이 나옵니다. 라그랑주 승수법은 조건마다 새 변수(승수)를 하나씩 붙여 조건 있는 문제를 조건 없는 문제로 바꾸는 방법입니다. 여기서는 각 pip_i로 미분⁠(differentiation)⁠해 0으로 둔 조건이 'log⁡pi\log p_i는 i의 일차식이어야 한다'가 되고, 그 일차식의 기울기⁠(slope)⁠가 λ입니다. 정규화 상수 Z(λ)=∑ieλiZ(\lambda) = \sum_i e^{\lambda i}를 분배 함수라 부릅니다. 평균은 λ가 커질수록 커지므로(평균을 λ로 미분하면 그 분포의 분산이 되어 늘 양수입니다), 원하는 평균이 나오는 λ를 이분법⁠(bisection method)⁠, 곧 λ의 범위를 반씩 좁혀 가는 방법(이진 탐색⁠(binary search)⁠과 같은 생각)으로 찾으면 됩니다. 지금 λ≈\lambda \approx 입니다. m = 3.5에서는 λ = 0이라 균등분포가 되고, 오른쪽 그림에서 곡선이 가장 높은 log⁡26≈2.585\log_2 6 \approx 2.585비트에 닿습니다.

왜 엔트로피가 큰 쪽이 옳을까요? 주사위를 N번 굴린 기록 가운데 각 눈이 NpiNp_i번씩 나오는 기록의 수는 다항계수⁠(multinomial coefficient)⁠ N!/∏i(Npi)!N!/\prod_i (Np_i)!입니다. N번의 결과를 여섯 무리로 나누는 방법의 수로, 두 무리로 나누는 이항계수⁠(binomial coefficient)⁠를 넓힌 것입니다. 이 수를 스털링 공식⁠(Stirling's formula)⁠으로 어림하면 지수 부분이 2NH(p)2^{N H(p)}입니다. 그래서 평균이 4.5인 기록들 가운데 압도적으로 많은 수가 최대 엔트로피 분포에 가까운 빈도를 보입니다. 기록 하나하나를 똑같이 그럴듯하다고 보면, 평균이 4.5라는 것만 아는 우리에게 가장 그럴듯한 빈도는 최대 엔트로피 분포 근처이고, N이 클수록 거의 확실히 그렇습니다. 큰 수의 법칙⁠(law of large numbers)⁠이 빈도를 확률 가까이로 모으듯, 이 셈은 조건을 만족하는 빈도들을 엔트로피가 가장 큰 쪽으로 모읍니다. KL 발산⁠(KL divergence)⁠으로 말하면 최대 엔트로피 분포는 균등분포 u에서 가장 가까운 분포입니다. D(p ∥ u)=log⁡26−H(p)D(p\,\|\,u) = \log_2 6 - H(p)이기 때문입니다. 균등분포 대신 자료를 보기 전에 가지고 있던 다른 믿음, 곧 사전 분포⁠(prior distribution)⁠ q에서 출발하면 같은 논리가 'KL 발산 최소화'가 됩니다.

같은 원리에서 익숙한 분포들이 나옵니다. 유한 개의 값이나 유한한 구간 위에서 아무 조건이 없으면 균등분포, 양의 실수 위에서 평균만 정해지면 지수분포, 실수 전체에서 평균과 분산이 정해지면 정규분포입니다. 중심극한정리⁠(central limit theorem)⁠에서 합이 정규분포로 다가가는 것도 분산을 지키며 엔트로피가 커지는 과정으로 볼 수 있습니다. 독립⁠(independence)⁠이고 같은 분포를 따르는 항들을 더해 분산이 1이 되게 맞추면, 그 합의 엔트로피는 더하는 개수가 늘수록 커지며 정규분포의 엔트로피로 다가간다는 것이 증명되어 있습니다. 물리에서는 주사위 눈 대신 에너지 준위 EiE_i(계가 가질 수 있는 에너지 값들)를, 평균 눈 대신 평균 에너지를 놓으면 pi∝e−Ei/kTp_i \propto e^{-E_i/kT}가 나옵니다. T는 절대 온도⁠(absolute temperature)⁠, k는 볼츠만 상수⁠(Boltzmann constant)⁠이고, 19세기 오스트리아 물리학자 루트비히 볼츠만의 이름을 따 볼츠만 분포라 합니다. 온도는 T=−1/(kλ)T = -1/(k\lambda)에 해당하므로, k = 1로 두고 눈을 에너지로 보면 지금 주사위의 온도는 입니다. 평균을 1 쪽으로 내리면 온도가 0으로 내려가 가장 낮은 준위에 모이고, 3.5로 올리면 온도가 무한대가 되어 모든 준위가 고르게 찹니다. 평균이 3.5를 넘으면 λ가 양수, 곧 온도가 음수입니다. 에너지 준위에 위쪽 한계가 있는 계에서는 이 '음의 온도⁠(negative temperature)⁠'가 실제로 쓰이는 개념입니다.

이어지는 곳. 열역학의 엔트로피와 정보의 엔트로피가 상수배와 로그의 밑을 빼면 같은 식인 것은 우연이 아니며, 정보를 지우는 데 드는 열을 따지는 맥스웰의 악마와 란다우어 원리⁠(Maxwell's demon and Landauer's principle)⁠가 두 세계를 잇습니다. 마르코프 연쇄⁠(Markov chain)⁠를 오래 돌리면 정상 분포⁠(stationary distribution)⁠에 대한 KL 발산이 줄어들고, 볼츠만 분포⁠(Boltzmann distribution)⁠를 정상 분포로 삼는 연쇄를 만들어 표본⁠(sample)⁠을 뽑는 것이 몬테카를로 방법⁠(Monte Carlo method)⁠의 한 갈래인 메트로폴리스 알고리즘(1953년 니컬러스 메트로폴리스 등)입니다. 특징들의 평균을 맞추는 최대 엔트로피 분포는 eλ⋅f/Ze^{\lambda \cdot f}/Z 꼴입니다. 점수마다 e의 거듭제곱을 씌운 뒤 합이 1이 되게 나눈 이 모양을 소프트맥스⁠(softmax)⁠라 하고, 신경망⁠(neural network)⁠의 마지막 층과 자연어 처리⁠(natural language processing)⁠의 '최대 엔트로피⁠(maximum entropy)⁠ 분류기'가 이 모양입니다. 제약이 상호 정보량⁠(mutual information)⁠이나 왜곡에 걸리면 율–왜곡 이론⁠(rate–distortion theory)⁠과 통로 용량⁠(channel capacity)⁠의 최적화 문제가 됩니다. 조건을 하나 더 걸면 가장 큰 엔트로피는 줄거나 그대로입니다. 무언가를 알면 불확실성이 평균적으로 줄거나 그대로라는 조건부 엔트로피⁠(conditional entropy)⁠의 성질과 닮았지만, 여기서 '조건'은 관측한 변수가 아니라 분포에 거는 제약입니다.

이 개념이 나오는 큰 생각가장 좋은 것 고르기

이 개념이 나오는 긴 글

통신과 잡음 잡음 너머로 대서양 바닥의 케이블은 왜 신호를 뭉갰을까? 잡음이 있어도 오류 없이 보낼 수 있다는 섀넌의 정리와, 그 한계를 50년 동안 쫓은 부호들. 언어 모델 다음 단어를 맞히는 기계 다음 낱말을 짐작하는 일만으로 어디까지 갈 수 있을까? 마르코프의 글자 세기에서 섀넌의 추측 게임, 트랜스포머와 규모의 법칙, 사람의 선호까지. 밑바닥에는 확률의 곱셈 규칙과 로그 하나가 있고, 그 수학은 모델이 왜 그럴듯하게 틀리는지도 말해 준다. 역문제 거꾸로 푸는 문제는 왜 어려운가 원인에서 결과를 계산하기는 쉽다. 흐린 사진, CT, 블랙홀 사진은 왜 결과에서 원인을 되찾기 어려웠을까? 작은 특잇값이 잡음을 키우는 벽과, 정규화·릿지 회귀·베이즈 사전확률이 사실은 같은 처방이라는 이야기.

이 개념을 언급하는 페이지

이 페이지가 가리키는 개념