최대 엔트로피 원리(Principle of maximum entropy)
아는 조건을 만족하는 확률분포(probability distribution) 가운데 엔트로피(entropy)가 가장 큰 것을 고르라는 원리. 모르는 것을 가정하지 않는 선택이며, 평균(mean)만 정해지면 지수 모양(양의 실수(real number) 위에서는 지수분포(exponential distribution)), 실수 전체에서 평균과 분산(variance)이 정해지면 정규분포(normal distribution)가 나온다.
1957년 미국 물리학자 에드윈 제인스(E. T. Jaynes)는 논문 「정보 이론과 통계 역학(Information Theory and Statistical Mechanics)」에서 통계 역학을 추론의 문제로 다시 읽었습니다. 통계 역학은 수많은 분자의 운동을 하나하나 따라가는 대신 확률(probability)로 다루어 온도·압력 같은 성질을 설명하는 물리학입니다. 우리가 아는 것을 만족하는 확률분포는 대개 무수히 많습니다. 그 가운데 엔트로피가 가장 큰 것을 고르라는 것이 그의 제안입니다. 제인스의 논리는 이렇습니다. 엔트로피가 더 작은 분포를 고르면 가지고 있지 않은 정보를 가진 척하는 셈입니다. 가능한 값이 유한 개일 때 아무 조건이 없으면 답은 균등분포입니다. 그러니 모르면 똑같이 나누라는 오래된 '이유 불충분의 원리(principle of insufficient reason)'가 그 특별한 경우입니다. 야코프 베르누이와 라플라스가 확률을 매길 때 쓴 원리로, 1921년 케인스가 '무차별의 원리(principle of indifference)'라는 이름을 붙이기도 했습니다.
제인스가 브랜다이스 대학 강의에서 든 예라서 '브랜다이스 주사위 문제(Brandeis dice problem)'라 불리는 문제가 있습니다. 주사위를 아주 많이 굴렸더니 눈의 평균이 3.5가 아니라 4.5였다고 합시다. 각 눈의 확률은 얼마로 두어야 할까요? 평균이 4.5인 분포는 셀 수 없이 많습니다. 평균
조건이 '합이 1, 평균이 m' 둘뿐이면 최대 엔트로피 분포(maximum entropy distribution)는 언제나
왜 엔트로피가 큰 쪽이 옳을까요? 주사위를 N번 굴린 기록 가운데 각 눈이
같은 원리에서 익숙한 분포들이 나옵니다. 유한 개의 값이나 유한한 구간 위에서 아무 조건이 없으면 균등분포, 양의 실수 위에서 평균만 정해지면 지수분포, 실수 전체에서 평균과 분산이 정해지면 정규분포입니다. 중심극한정리(central limit theorem)에서 합이 정규분포로 다가가는 것도 분산을 지키며 엔트로피가 커지는 과정으로 볼 수 있습니다. 독립(independence)이고 같은 분포를 따르는 항들을 더해 분산이 1이 되게 맞추면, 그 합의 엔트로피는 더하는 개수가 늘수록 커지며 정규분포의 엔트로피로 다가간다는 것이 증명되어 있습니다. 물리에서는 주사위 눈 대신 에너지 준위
이어지는 곳. 열역학의 엔트로피와 정보의 엔트로피가 상수배와 로그의 밑을 빼면 같은 식인 것은 우연이 아니며, 정보를 지우는 데 드는 열을 따지는 맥스웰의 악마와 란다우어 원리(Maxwell's demon and Landauer's principle)가 두 세계를 잇습니다. 마르코프 연쇄(Markov chain)를 오래 돌리면 정상 분포(stationary distribution)에 대한 KL 발산이 줄어들고, 볼츠만 분포(Boltzmann distribution)를 정상 분포로 삼는 연쇄를 만들어 표본(sample)을 뽑는 것이 몬테카를로 방법(Monte Carlo method)의 한 갈래인 메트로폴리스 알고리즘(1953년 니컬러스 메트로폴리스 등)입니다. 특징들의 평균을 맞추는 최대 엔트로피 분포는
이 개념이 나오는 긴 글
이 개념을 언급하는 페이지
- 정규분포
… 고르고 싶다면, 가장 예측하기 어려운 분포, 곧 엔트로피가 가장 큰 분포를 고르는 것이 원칙입니다(최대 엔트로피 원리). 실수 위의 연속분포 가운데 평균과 분산이 정해진 것들을 모아 보면, 엔트로피가 가장 큰 것이 바로 …
- 마르코프 연쇄
… 그 밖에는 아무것도 가정하지 않는 원천(엔트로피가 가장 큰 원천)을 고르면 바로 마르코프 연쇄가 나옵니다(최대 엔트로피 원리). 확률을 지우고 '어느 상태에서 어떤 기호를 읽으면 어디로 가는가'만 남기면 유한 오토마톤입니다. …
- 정보 엔트로피
… 엔트로피가 가장 큰 것이 정규분포이고, 아는 것만 지키고 나머지는 가장 모르는 채로 두라는 이 생각이최대 엔트로피 원리입니다. 잡음이 있는 통로로 믿을 만하게 보낼 수 있는 양의 한계는 통로 용량이고, 그 한계에 다가가는 …
- 쿨백–라이블러 발산
… 분포 가운데 균등분포와의 KL 발산이 가장 작은 것을 고르는 일이 곧 엔트로피가 가장 큰 것을 고르는최대 엔트로피 원리입니다. 확률 모형 q로 산술 부호화를 하면 기호당 거의 정확히 -\log_2 q_i 비트가 …
- 섀넌–하틀리 정리
… 따라 종 모양이 됩니다. 또 전력이 정해져 있을 때 엔트로피가 가장 큰 분포가 정규분포입니다(최대 엔트로피 원리). 그래서 상호 정보량 I(X;Y) = h(Y) - h(N) (h는 연속분포의 엔트로피)은 입력도 …
- 율–왜곡 이론
… 정규분포가 가장 압축하기 어렵습니다. 분산이 정해졌을 때 엔트로피가 가장 큰 분포이기 때문입니다(최대 엔트로피 원리). 가장 단순한 손실 압축은 표본 하나마다 R비트, 곧 2^R 개의 대표값 가운데 가장 가까운 것 하나를 …
- 맥스웰의 악마와 란다우어 원리
… 무작위 행보처럼 오가지만, 전체로는 엔트로피가 큰 쪽, 곧 고르게 섞인 쪽이 압도적으로 흔합니다(최대 엔트로피 원리). 1929년 헝가리 태생 물리학자 레오 실라르드는 악마를 가장 단순하게 줄였습니다. 분자 하나가 든 …
- 변분법
… 실수 위의 연속 분포 가운데 평균과 분산이 정해졌을 때 엔트로피가 가장 큰 분포가 정규분포라는최대 엔트로피원리도 그런 예입니다. 이어지는 곳. 변분법의 답은 대개 미분방정식이라서 선형 미분방정식과 …
- 소프트맥스와 교차 엔트로피
… 삼았습니다. 소프트맥스는 점수를 음의 에너지로 본 같은 식이고, '온도'라는 이름도 여기서 왔습니다.최대 엔트로피 원리로도 같은 모양이 나옵니다. 점수의 평균 \sum_k p_k z_k 가 정해진 분포 가운데 엔트로피가 가장 …
- 볼록 함수와 볼록 최적화
… 엔트로피는 순오목하고 '확률의 합이 1, 평균이 정해짐' 같은 제약은 볼록 집합을 이루므로,최대 엔트로피 원리의 답은 있다면 하나뿐입니다. 흙을 옮기는 비용을 최소로 하는 최적 수송은 칸토로비치의 선형 …
- 라그랑주 승수법
… 것을 찾으면 승수 두 개로 p_i \propto e^{\lambda x_i} 라는 지수 모양이 나오는데(최대 엔트로피 원리), 이것이 소프트맥스의 모양입니다. 인간 피드백 강화 학습에서 보상 r을 키우되 원래 모형 …
- 어텐션
… 소프트맥스의 성질은 디코딩에서 다음 토큰을 고를 때 다시 나오고, 소프트맥스가 왜 지수 꼴인지는최대 엔트로피 원리가 설명합니다. 쿼리와 키를 길이 1로 맞추면 점수는 코사인 유사도가 되고, 그때 온도를 0으로 보낸 …
- 디코딩: 온도, top-p, 빔 탐색
… 가장 큰 분포를 찾으면 라그랑주 승수법으로 p_i \propto e^{\beta z_i} 가 나옵니다(최대 엔트로피 원리). μ가 고른 분포에서의 평균과 가장 큰 로짓 사이에 있으면 β = 1/T는 양수입니다. 곧 온도를 …
- 인간 피드백 강화 학습과 정렬
… 그대로이고 그 원리는 최대 가능도입니다. 벌점 항은 KL 발산이며, 최적 정책이 지수 꼴인 까닭은최대 엔트로피 원리의 깁스 분포와 같은 계산에 있습니다. 같은 꼴은 소프트맥스와 디코딩의 온도에도 나옵니다. …