쿨백–라이블러 발산(Kullback–Leibler divergence)
실제 분포가 p인데 q라고 믿을 때 치르는 평균(mean) 비용. q에 맞춘 부호로 p의 자료를 적을 때 더 드는 비트 수이자, 관측 하나가 p와 q를 구별해 주는 평균 증거로, 늘 0 이상이고 비대칭이다.
1951년 미국 국가안보국에서 암호를 연구하던 두 수학자 솔로몬 쿨백과 리처드 라이블러는 논문 「정보와 충분성에 관하여(On Information and Sufficiency)」에서, 두 가설 가운데 어느 쪽이 참인지 가릴 때 관측 하나가 평균적으로 주는 정보를 정의했습니다. 참인 분포가 p이고 경쟁 가설이 q일 때 결과 i가 나오면, 두 가설의 확률(probability) 비(가능도비, likelihood ratio)의 로그
압축으로 보면 뜻이 더 또렷합니다. 원천 부호화 정리(source coding theorem)에 따르면 결과 i에 길이
파란 막대는 6이 절반의 확률로 나오는 조작된 주사위 p이고, 주황 막대는 우리가 믿는 모형 q입니다. 주황 막대 끝의 점을 끌어 q를 바꿔 보세요(나머지 면은 비율을 유지한 채 줄거나 늘어납니다).
지금
q를 어떻게 바꿔도 D는 음수가 되지 않고, q가 p와 같을 때만 0입니다. 미국 물리학자 깁스의 이름을 따 깁스 부등식(Gibbs' inequality)이라 부릅니다. 면마다의 항은 음수일 수 있지만 합은 그렇지 않습니다. 로그 곡선은 위로 볼록하게 휘어 있어서(오목), 여러 값의 평균에서 잰 로그가 로그들의 평균보다 크거나 같습니다(덴마크 수학자 요한 옌센의 이름을 딴 옌센 부등식(Jensen's inequality)). 그래서
증거로 돌아가 봅시다. 주사위를
오늘날 가장 많이 계산되는 KL 발산은 기계 학습(machine learning)의 손실 함수(loss function), 곧 모형이 얼마나 틀렸는지를 재어 줄여 나가는 값에 숨어 있습니다. 분류하는 신경망(neural network)은 정답 분포 p와 모형이 내놓는 분포 q 사이의 교차 엔트로피
이어지는 곳. 결합 분포(joint distribution)와 주변 분포의 곱 사이의 KL 발산이 상호 정보량(mutual information)이고, 조건을 만족하는 분포 가운데 균등분포와의 KL 발산이 가장 작은 것을 고르는 일이 곧 엔트로피(entropy)가 가장 큰 것을 고르는 최대 엔트로피 원리(principle of maximum entropy)입니다. 확률 모형 q로 산술 부호화(arithmetic coding)를 하면 기호당 거의 정확히
이 개념이 나오는 긴 글
이 개념 위에 세워진 것
이 개념을 언급하는 페이지
- 베이즈 정리
… 확률 ÷ H₂의 확률)의 로그를 H₁ 쪽으로 평균 얼마만큼 옮기는지가 두 가설이 예측하는 분포 사이의쿨백–라이블러 발산입니다. 두 가설이 예측하는 결과가 비슷할수록 이 값이 작아서 가려내는 데 관측이 많이 듭니다. 이 정리는 …
- 정보 엔트로피
… 서로 다른 자리의 개수, 곧 해밍 거리가 크도록 설계합니다. 언어 모형의 성능은 실제 글에 대한교차 엔트로피, 곧 모형이 매긴 확률로 부호를 만들어 실제 글을 적을 때 한 기호에 드는 평균 비트 수로 잽니다. …
- n-그램 언어 모델
… 짧은 문맥으로 물러섭니다. 좋은 언어 모델은 실제 글에 높은 확률을 줍니다. 그 정도는 글자나 낱말 하나당교차 엔트로피, 곧 실제 글의 각 기호에 모델이 매긴 확률 q로 -\log_2 q 를 구해 평균한 값으로 재고, …
- 신경망
… 국소 최솟값이나 거의 평평한 곳에 빠진 것입니다. 단위를 넉넉히 두면 이런 일이 드물어집니다. 가중치는교차 엔트로피손실(정답에 매긴 확률의 로그에 −를 붙여 평균한 값, 엔트로피와 같은 꼴)을 줄이도록 경사 하강법의 …
- 허프만 부호
… 봅니다. 빈도 q에 맞춘 이상적인 길이 -\log_2 q_i 를 실제 빈도가 p인 글에 쓰면 글자당 평균이쿨백–라이블러 발산D(p\,\|\,q) 만큼 길어지고, 정수로 올린 허프만 부호표도 대략 그만큼 손해를 봅니다.
- 원천 부호화 정리
… 위의 차에 쓰면 차가 0 이상임이 나옵니다. 같은 내용을 두 분포가 얼마나 다른지의 언어로 말한 것이,쿨백–라이블러 발산이 0 이상이라는 사실입니다. 이상적인 길이 -\log_2 p_i 는 보통 정수가 아니어서, 올림하면 …
- 결합 엔트로피와 조건부 엔트로피
… 입력 분포를 바꿔 가며 가장 크게 만든 값이 통로 용량입니다. 틀린 분포를 믿을 때 치르는 비용을 재는쿨백–라이블러 발산으로도 같은 양들을 다시 쓸 수 있고, 은닉 마르코프 모델은 보이지 않는 상태를 관측으로부터 추정할 때 …
- 상호 정보량
… 계산해도 , 결합 분포 p(x,y)가 두 변수가 독립일 때의 분포 p(x)p(y)에서 얼마나 먼지를쿨백–라이블러 발산으로 재도 비트로 같습니다. 마지막 식에서 두 성질이 바로 나옵니다. KL 발산은 음수가 될 수 없으니 …
- 최대 엔트로피 원리
… 빈도를 확률 가까이로 모으듯, 이 셈은 조건을 만족하는 빈도들을 엔트로피가 가장 큰 쪽으로 모읍니다.KL 발산으로 말하면 최대 엔트로피 분포는 균등분포 u에서 가장 가까운 분포입니다. D(p\,\|\,u) = …
- 통로 용량
… 함수⟧가 되어 두 문제가 짝을 이룹니다. 상호 정보량은 결합 분포가 독립인 분포에서 얼마나 먼지를 재는쿨백–라이블러 발산이기도 합니다. 용량이 전송의 한계라는 통로 부호화 정리는, 압축의 한계가 엔트로피라는 ⟦원천 …
- 산술 부호화
… -\log_2 q 를 구해 평균한 값입니다. 글자들이 서로 독립인 원천이라면, 모형이 틀린 만큼 글자당쿨백–라이블러 발산만큼의 비트를 엔트로피보다 더 냅니다. 다음 글자를 더 잘 맞히는 모형이 곧 더 좋은 압축기입니다. 앞 몇 …
- 통계학
… '본 자료에서 보지 못한 자료로 얼마나 넓혀 말할 수 있는가'입니다. 모형이 자료를 얼마나 잘 설명하는지는쿨백–라이블러 발산과 엔트로피 같은 정보의 양으로도 잽니다. 편향–분산 분해는 모형이 복잡할수록 표본마다 크게 …
- 최대가능도법
… 이고, 여기에 −1을 곱해 자료 수로 나누면 신경망이 줄이는 손실 함수인 교차 엔트로피가 됩니다(쿨백–라이블러 발산). 그러니 교차 엔트로피를 줄이도록 경사 하강법으로 학습하는 것은 최대가능도 추정을 하는 것과 …
- 기계 학습
… 대개 자료의 가능도를 키우는 것이어서, 분류기가 줄이는 교차 엔트로피 손실은 최대가능도법과 같습니다(쿨백–라이블러 발산). 베이즈 정리로 믿음을 고쳐 가는 방법, 거리로 이웃을 찾는 방법, 짧은 설명을 고르는 …
- 로지스틱 회귀
… 오차 p - y 만큼 모든 점에서 고칩니다. 로그 손실을 줄이는 것은 자료의 분포에서 모형까지의쿨백–라이블러 발산을 줄이는 것과 같아서 정보 이론과 이어집니다. 로그 손실을 띠 밖에서 정확히 0이 되는 힌지 손실로 …
- 소프트맥스와 교차 엔트로피
… 기호마다 -\log p_j 비트를 쓰는, p에 맞춘 부호로 적으면 평균 길이가 H(q, p) 가 되어쿨백–라이블러 발산만큼 더 듭니다(부호 길이를 정수로 반올림하는 효과는 무시했습니다). q는 자료가 정하니 H(q) 는 …
- EM 알고리즘과 가우스 혼합
… \theta)\bigr) 가 성립합니다. p(x, z)/p(z \mid x) = p(x) 이기 때문입니다.쿨백–라이블러 발산은 0 이상이므로 B는 로그 가능도의 하한(증거 하한)입니다. E 단계는 q를 사후 분포 p(z \mid …
- 볼록 함수와 볼록 최적화
… q(x)의 합이라 1 이하이므로 오른쪽 전체는 0 이상이 되고, 왼쪽은 \sum p\log(p/q) , 곧쿨백–라이블러 발산입니다. KL 발산이 음수가 될 수 없다는 깁스 부등식이 이렇게 한 줄로 나옵니다. 로그가 오목하다는 데서 …
- 라그랑주 승수법
… 모양입니다. 인간 피드백 강화 학습에서 보상 r을 키우되 원래 모형 \pi_{\text{ref}} 와의KL 발산에 벌점 β를 매기는 문제의 답도 같은 계산으로 \pi(y) \propto …
- 인공지능
… 것(최대가능도법)과 같습니다. 또 학습 자료가 보여 주는 분포와 모델 분포가 얼마나 다른지를 재는쿨백–라이블러 발산을 줄이는 것과도 같습니다. 둘의 차이는 모델과 상관없는 상수(자료 분포의 엔트로피)뿐이기 때문입니다. …
- 확산 모델
… 좋은 그림을 만들어 보였습니다. 이 손실은 자료의 로그 가능도에 대한 하한(증거 하한)을 정규분포 사이의쿨백–라이블러 발산항들로 풀어 쓴 뒤 항들의 가중치를 바꾼 것이기도 합니다. 열 방정식과의 관계. 당기지 않고 잡음만 …
- 오토인코더와 잠재 공간
… 디코더는 거기서 뽑은 z로 x를 되살립니다. 손실은 복원 오차에, 인코더가 낸 분포와 표준정규분포 사이의쿨백–라이블러 발산을 더한 것입니다. 1차원이면 이 항은 닫힌 식으로 계산되고, 좌표마다 독립인 여러 차원이면 좌표별 값을 …
- 언어 모델과 다음 토큰 예측
… 첫 항은 글 자체의 불확실성인 엔트로피라서 모델이 무엇을 하든 줄일 수 없습니다. 둘째 항KL 발산은 늘 0 이상이고 q = p일 때만 0입니다(깁스 부등식). 그러니 교차 엔트로피를 최소화하는 것은 …
- 인간 피드백 강화 학습과 정렬
… 는 출발점 모델, β > 0은 벌점의 세기입니다. 보상만 높이면 모델은 보상 모델의 허점을 파고듭니다.KL 발산벌점은 π가 \pi_{\text{ref}} 에서 멀어질수록 값을 치르게 합니다. π가 아무 분포나 될 수 …
- 추론 모델과 테스트 시점 계산
… 1+\varepsilon] 로 자르는 PPO식 클리핑과, 출발 모델에서 멀어지지 않게 하는KL 발산벌점입니다. 계산은 답 전체가 아니라 토큰마다 합니다. o1과 R1. 2024년 9월 12일 오픈AI는 …
- 언어 모델의 발전사: RLHF 이후
… InstructGPT의 세 단계, 곧 지도 미세조정, 로지스틱 회귀와 같은 손실로 학습한 보상 모델,KL 발산벌점을 둔 강화 학습입니다. 논문은 매개변수 13억 개의 InstructGPT의 답이 1,750억 개의 …
- 최소 기술 길이
… 저울질은 편향–분산 분해가 오차의 말로 하는 이야기와 닮았습니다. 부호 길이의 바탕인 엔트로피와KL 발산은 잘못된 모형을 쓸 때 몇 비트를 더 치르는지 알려 주고, 가능한 모든 프로그램으로 가설의 범위를 넓히면 …
- 굿하트의 법칙
… 기계 학습의 과적합은 학습 오차라는 대리 지표를 너무 잘 줄인 결과이고, 인간 피드백 강화 학습에서KL 발산벌점을 거는 것도 보상 모델이라는 대리 지표를 너무 세게 최적화하지 않으려는 장치입니다. 이어지는 곳. …