지프의 법칙(Zipf's law)
글에 나오는 낱말을 빈도순으로 늘어놓으면, r번째 낱말의 빈도가 대략 1/r에 비례한다는 경험 법칙. 로그–로그 그래프에서 기울기(slope) 약 −1의 직선이 된다.
책 한 권의 낱말을 모두 세어 가장 많이 나온 것부터 늘어놓아(정렬) 순위를 매기면 이상한 규칙이 보입니다. 2위 낱말은 1위의 절반쯤, 3위는 3분의 1쯤, 10위는 10분의 1쯤 나옵니다. 곧 순위 r인 낱말의 빈도가 대략
아래는 이 위키를 위해 쓴 짧은
영어 이야기는 the, a, and, of 같은 기능어(function word)가 맨 위를 차지하고, 1,300여 단어짜리 짧은 글치고는 기울기가 −1에 꽤 가깝습니다. 한국어 어절(띄어쓰기로 나뉜 덩어리)은 '말을', '말이', '말은'처럼 같은 낱말도 조사와 어미에 따라 따로 세어지므로 빈도가 여러 갈래로 나뉘고, 그래서 곡선이 더 완만합니다. 게다가 둘 다 짧은 글이라 낱말 종류의 절반 가까이 또는 그 이상이 한 번만 나옵니다. 그림 오른쪽 아래의 평평한 줄이 그것인데, 이 줄은 글의 길이에 따라 생기는 것이라 기울기를 잴 때는 뺐습니다. 수백만 단어짜리 말뭉치(연구용으로 모은 글 뭉치)에서는 직선이 몇 자릿수에 걸쳐 길게 뻗습니다. 1위 낱말부터 10위까지 빈도를 1위에 대한 비율로 그리고, 지프의 법칙이 예측하는
이 법칙은 확률 분포로서도 독특합니다. 정규분포(normal distribution)는 평균(mean) 근처에 몰려 있지만, 멱법칙은 드문 것들이 끝없이 길게 꼬리를 이룹니다. s = 1이고 낱말이 V가지라면 r위 낱말의 몫은
그렇다면 지프의 법칙은 언어의 깊은 성질일까요? 원숭이 곡선이 조심하라고 말해 줍니다. 무작위로 치면 길이 L인 낱말 하나가 나올 확률은 L에 대해 지수적으로 줄고, 길이 L인 낱말의 가짓수는 지수적으로 늘어납니다. 길이가 L 이하인 낱말의 가짓수가 L에 대해 지수적으로 늘어나니 순위 r은 대략
이어지는 곳. 도시 인구, 웹 페이지가 받는 링크 수, 소득의 윗부분도 멱법칙에 가깝다는 보고가 많습니다. 긴 꼬리 때문에 말뭉치(corpus)를 아무리 늘려도 처음 보는 낱말이 계속 나옵니다. 이것이 앞 낱말 몇 개로 다음 낱말을 맞히는 n-그램(n-gram) 모형이 겪는 희소성 문제, 곧 본 적 없는 낱말 묶음이 끝없이 나오는 문제의 뿌리입니다. 빈도가 치우친 만큼 글자나 낱말 하나가 주는 정보 엔트로피(information entropy)는 균등할 때보다 작고, 흔한 낱말에 짧은 부호를 주는 허프만 부호(Huffman coding) 같은 방법으로 글을 압축할 수 있습니다. 낱말을 벡터(vector)로 바꾸는 단어 임베딩(word embedding)을 학습할 때는 the, a 같은 너무 흔한 낱말이 학습을 독차지하지 않도록 일부러 덜 뽑기도 합니다. 언어 모델(language model)의 시험 손실이 매개변수(parameter) 수나 자료 양의 거듭제곱으로 줄어든다는 규모의 법칙(scaling laws)도 로그–로그 그래프에서 직선으로 보이는 멱법칙이지만, 측정한 범위 안에서 맞춘 경험식입니다.
이 개념이 나오는 긴 글
이 개념 위에 세워진 것
이 개념을 언급하는 페이지
- 조화급수
… 청혼 횟수의 평균이 대략 n\ln n 로 자라는데, 이것 역시 조화급수에서 나옵니다(안정 매칭).지프의 법칙에 따르면 k번째로 흔한 단어의 빈도는 1/k에 비례합니다. 어휘가 n개라면 모든 단어의 빈도 비율을 더해 …
- 중앙값
… 그래서 소득이나 집값처럼 드물지만 아주 큰 값들이 한쪽으로 길게 늘어선 자료(긴 꼬리가 있는 자료,지프의 법칙을 따르는 낱말 빈도가 그 예)에서는 중앙값이 "보통"을 더 잘 나타냅니다. 이렇게 이상값에 잘 흔들리지 …
- 정보 엔트로피
… 2^H 로 바꾼 퍼플렉시티도 쓰는데, '모형이 매번 몇 가지 후보 사이에서 망설이는 셈인가'를 뜻합니다.지프의 법칙처럼 치우친 분포일수록 엔트로피가 작아 압축이 잘 됩니다. 확률을 미리 모르는 채 앞에 나온 문자열을 …
- n-그램 언어 모델
… 기수법⟧), 말뭉치는 그 가운데 극히 일부만 담습니다. 차원의 저주와 닮은 현상이고,지프의 법칙의 긴 꼬리 때문에 말뭉치를 늘려도 쉽게 사라지지 않습니다. 한 번도 못 본 묶음에 확률 0을 주면 그것이 …
- 단어 임베딩
… 질문과 가까운 글을 찾아 언어 모델의 문맥에 넣어 주는 방법이 검색 증강 생성입니다. 낱말 빈도가지프의 법칙처럼 치우쳐 있으므로, 흔한 낱말이 너무 많이 학습되지 않도록 흔한 낱말을 덜 뽑기도 합니다.
- 허프만 부호
… 허프만 부호가 유리해집니다. 실제 글에서는 흔한 낱말과 글자가 몹시 흔하고 드문 것은 몹시 드문데(지프의 법칙), 그 치우침이 압축의 여지입니다. 빈도가 아니라 문자열 하나만 놓고 얼마나 줄일 수 있는지를 묻는 것은 …
- 렘펠–지브 압축
… 묶어 비교 언어학의 계통수와 비슷한 나무를 얻은 연구도 있습니다. 흔한 낱말이 압도적으로 자주 나오는지프의 법칙이 글이 잘 줄어드는 한 가지 이유입니다. LZMA(xz, 7-Zip)처럼 참조를 찾은 뒤 그 결과를 다시 …
- 토큰화와 BPE
… 글이 아주 길어집니다. 낱말 하나를 토큰 하나로 하면 글은 짧지만 목록이 아주 커집니다. 낱말의 빈도는지프의 법칙을 따라서, 한두 번밖에 안 나오는 낱말이 긴 꼬리를 이루기 때문입니다. 게다가 목록에 없는 새 …
- 언어 모델과 다음 토큰 예측
… 손실이 모델과 자료의 크기에 따라 어떻게 줄어드는지는 규모의 법칙이 경험적으로 요약합니다. 낱말 빈도가지프의 법칙처럼 치우쳐 있어 말뭉치를 아무리 키워도 처음 보는 문맥이 계속 나온다는 사실이 n-그램의 희소성 …
- 규모의 법칙
… 대 2.30)조차 읽기 어렵습니다. 거듭제곱 법칙은 로그 축에서 제 모습이 보이고, 낱말 빈도의지프의 법칙도 그렇습니다. 어디까지 믿을 수 있나. 이 식을 끝까지 믿으면 N → ∞에서 손실이 0으로 갑니다. …
- 프랙털 차원
… 흔히 정수가 아닌 차원을 가집니다(혼돈). 두 축 모두 로그 눈금에서 직선이 되는 거듭제곱 관계는지프의 법칙과 규모의 법칙에도 나오니, 그 지수를 읽는 법은 여기서 익힌 것과 같습니다. 해안선을 재는 이야기에서 …