결합 엔트로피와 조건부 엔트로피(Joint and conditional entropy)
두 변수를 함께 볼 때의 불확실성 H(X,Y)와, X를 안 뒤에 Y에 남는 불확실성의 평균(mean) H(Y|X). 둘은 연쇄법칙(chain rule) H(X,Y) = H(X) + H(Y|X)로 이어진다.
1948년 클로드 섀넌은 잡음 섞인 통로를 다루면서, 받은 신호를 보고 난 뒤에도 보낸 신호에 대해 남는 불확실성에 '모호도(equivocation)'라는 이름을 붙였습니다. 오늘날 조건부 엔트로피라 부르는 양입니다. 스무고개(예/아니오 질문을 스무 번까지 던져 답을 맞히는 놀이)로 생각하면 쉽습니다. 예/아니오 질문 하나는 많아야 1비트를 알려 주니, 엔트로피(entropy)가 H비트인 답을 맞히려면 평균 H번 이상 물어야 하고, 질문을 잘 고르면 H + 1번 미만으로 끝낼 수 있습니다. 그래서 엔트로피를 '평균 질문 수'의 잣대로 읽어도 됩니다. 이제 맞힐 것이 둘이라고 합시다. 오늘 날씨 X와 내일 날씨 Y입니다. 짝 (x, y) 하나하나를 결과로 보고 계산한 엔트로피가 결합 엔트로피(joint entropy) H(X,Y), 곧 둘을 한꺼번에 맞히는 데 드는 질문 수의 잣대입니다. 오늘 날씨를 먼저 알아낸 다음 내일 날씨를 물을 수도 있습니다. 오늘 날씨가 x일 때 내일 날씨에 남은 불확실성 H(Y|X=x)를 오늘 날씨의 확률(probability)로 평균한 것이 조건부 엔트로피(conditional entropy) H(Y|X)입니다.
어느 도시는 맑은 날의 비율이
왼쪽 표의 네모 넓이(area)가 결합 확률 p(오늘, 내일)입니다. 지금 오늘 날씨의 엔트로피는 H(X) =
d를 0으로 내리면 내일이 오늘과 무관해져서 H(Y|X) = H(Y)이고, 오른쪽의 첫 두 막대 높이가 같아집니다. 서로 독립(independence)인 두 변수의 결합 엔트로피는 각자의 엔트로피의 합입니다. d를 1로 올리면 내일은 오늘의 복사본이라 H(Y|X) = 0이고, 두 날을 맞히는 데 오늘 하나를 맞히는 만큼의 질문이면 됩니다. 첫 막대와 둘째 막대의 차 H(X) + H(Y) − H(X,Y)는 오늘이 내일에 대해 알려 주는 정보의 양, 곧 상호 정보량(mutual information)입니다.
무언가를 알면 불확실성은 평균적으로 줄거나 그대로입니다(
조건부 엔트로피는 방향이 있습니다. 주사위 눈 X를 알면 홀짝 Y는 확실하니 H(Y|X) = 0이지만, 홀짝을 알아도 눈은 세 가지가 남아
이어지는 곳. 오늘이 내일을 정하는 규칙이 이 그림처럼 이어지는 과정이 마르코프 연쇄(Markov chain)이고, 정상 분포(이 그림에서는 기후)에서 출발했다면 한 걸음마다 새로 생기는 불확실성 H(Xn+1|Xn)이 그 엔트로피율입니다. 엔트로피율(entropy rate)은 원천 부호화 정리(source coding theorem)에서 압축의 한계가 되고, 앞 기호를 문맥으로 쓰는 산술 부호화(arithmetic coding)나 렘펠–지브 압축(Lempel–Ziv compression)이 그 한계에 다가갑니다. X를 알아서 줄어든 불확실성 H(Y) − H(Y|X)가 상호 정보량입니다. 잡음 통로(noisy channel)에서 보낸 신호의 불확실성 H(X)에서 모호도 H(X|Y)를 뺀 이 양을, 입력 분포를 바꿔 가며 가장 크게 만든 값이 통로 용량(channel capacity)입니다. 틀린 분포를 믿을 때 치르는 비용을 재는 쿨백–라이블러 발산(Kullback–Leibler divergence)으로도 같은 양들을 다시 쓸 수 있고, 은닉 마르코프 모델(hidden Markov model)은 보이지 않는 상태를 관측으로부터 추정할 때 이 조건부 구조를 그대로 씁니다. 질문 하나로 후보를 절반으로 줄이는 이진 탐색(binary search)은 스무고개 그대로이고, 허프만 부호(Huffman coding)의 나무는 갈림길 하나하나가 예/아니오 질문 하나인 스무고개 전략표로, 평균 질문 수를 가장 적게 하는 전략입니다.
이 개념이 나오는 긴 글
이 개념 위에 세워진 것
이 개념을 언급하는 페이지
- 조건부 확률
… 줄어드는지도 잴 수 있습니다. 불확실성은 엔트로피로 재고, B의 결과를 안 뒤에 남은 불확실성의 평균이조건부 엔트로피입니다. 어느 한 결과를 듣고 오히려 헷갈릴 수는 있지만, 평균으로는 결코 늘지 않습니다. A와 B가 …
- 정보 엔트로피
… 세어 풀 수 있습니다. 이어지는 곳. 변수가 둘이면 함께 본 불확실성과 하나를 안 뒤에 남는 불확실성(결합 엔트로피와 조건부 엔트로피)을 따질 수 있고, 둘의 차이가 한 변수가 다른 변수에 대해 알려 주는 양, 곧 상호 정보량입니다. …
- 원천 부호화 정리
… 예컨대 마르코프 연쇄에서는 엔트로피 대신 엔트로피율이 한계가 됩니다. 엔트로피율은 기호 n개의결합 엔트로피를 n으로 나눈 값이 n이 커질 때 다가가는 값입니다. 통계적 성질이 시간에 따라 바뀌지 않는 원천이라면, …
- 상호 정보량
… 두 사진을, 밝기 사이의 상호 정보량이 가장 커지도록 겹쳐 맞추기도 합니다. 이어지는 곳. 상호 정보량은조건부 엔트로피로 정의되고 쿨백–라이블러 발산의 특별한 경우입니다. 대역이 제한되고 정규분포 잡음이 더해지는 연속 …
- 쿨백–라이블러 발산
… 또 다른 방법으로, 확률 질량을 옮기는 비용을 재는 최적 수송 거리는 진짜 거리의 성질을 갖습니다.조건부 엔트로피와 엔트로피 자체도 KL 발산으로 다시 쓸 수 있습니다. 예컨대 결과가 n가지일 때 H(p) = …
- 최대 엔트로피 원리
… 더 걸면 가장 큰 엔트로피는 줄거나 그대로입니다. 무언가를 알면 불확실성이 평균적으로 줄거나 그대로라는조건부 엔트로피의 성질과 닮았지만, 여기서 '조건'은 관측한 변수가 아니라 분포에 거는 제약입니다.
- 통로 용량
… 전체이고(엔트로피), H(Y \mid X) 는 x를 알아도 남는 몫, 곧 잡음이 만든 불확실성입니다(조건부 엔트로피). 통로는 바꿀 수 없지만 보내는 쪽은 0과 1을 어떤 비율로 쓸지 고를 수 있습니다. 그 비율을 가장 …
- 산술 부호화
… 산술 부호화가 닿는 한계는 엔트로피율, 곧 앞의 글자들을 다 알 때 다음 글자에 남는 불확실성(조건부 엔트로피)이며, 마르코프 연쇄가 가장 단순한 예입니다. 되살릴 때 조금 달라져도 되는 손실 압축의 한계는 …
- 소프트맥스와 교차 엔트로피
… 어림하는 기법이 여럿 나왔습니다. 교차 엔트로피가 KL 발산과 엔트로피로 나뉜다는 사실은 상호 정보량과조건부 엔트로피를 다룰 때도 되풀이해 쓰입니다.
- 결정 트리와 랜덤 포레스트
… 답과 색 사이의 상호 정보량과 같습니다. 질문 전 불확실성 H(Y) 에서 답을 안 뒤의 평균 불확실성조건부 엔트로피H(Y \mid \text{답}) 를 뺀 것이 곧 I(\text{답}; Y) 이기 때문입니다. 엔트로피 …
- 언어 모델과 다음 토큰 예측
… 곳. 목표 함수의 두 조각은 엔트로피와 KL 발산이고, 문맥을 아는 만큼 줄어드는 불확실성은조건부 엔트로피로 잽니다. 마지막 층의 점수를 확률로 바꾸는 소프트맥스와 교차 엔트로피는 한 쌍으로 쓰이며, 분류 …