n-그램 언어 모델
다음 낱말(또는 글자)의 확률(probability)을 바로 앞 n−1개만 보고 어림하는 언어 모델(language model). 말뭉치(corpus)에서 n개짜리 묶음을 세어 만들며, 마르코프 연쇄(Markov chain)를 언어에 적용한 것이다.
문장의 확률은 낱말 하나하나의 조건부 확률(conditional probability)을 곱해 적을 수 있습니다:
이 위키의 짧은 예문으로 모델을 만들어 글을 뽑아 봅시다. 단위는
왼쪽은 뽑은 글의 끝에서 모델이 다음 기호로 고려하는 후보들입니다. 지금 모델이 보는 문맥은
그러나 n을 더 올리면 모델은 새 글을 만들지 않고 예문을 통째로 베낍니다. 오른쪽 그림이 이유를 보여 줍니다. 예문의 뒤 15%를 떼어 두고 앞 85%로만 세었을 때, 떼어 둔 부분의 n-그램 가운데 한 번도 본 적 없는 것의 비율입니다. 가능한 n-그램은 기호가 V가지일 때
좋은 언어 모델은 실제 글에 높은 확률을 줍니다. 그 정도는 글자나 낱말 하나당 교차 엔트로피(cross-entropy), 곧 실제 글의 각 기호에 모델이 매긴 확률 q로
이어지는 곳. 맞춤법 교정과 음성 인식은 '들린 소리가 이러할 때 원래 문장은 무엇인가'를 베이즈 정리(Bayes' theorem)로 뒤집어 풉니다. 이때 소리를 듣기 전에 그 문장이 나올 확률(사전 확률, prior probability)을 n-그램이 줍니다. 겉으로 보이지 않는 품사열에 n-그램을 두고 낱말은 품사(part of speech)에서 확률적으로 나온다고 보면 은닉 마르코프 모델(hidden Markov model)이 됩니다. 신경망(neural network) 언어 모델은 낱말을 단어 임베딩(word embedding) 벡터(vector)로 바꿔 비슷한 낱말끼리 통계를 나누어 쓰며 희소성 문제를 누그러뜨렸습니다. 오늘날의 대형 언어 모델도 '앞 문맥으로 다음 토큰(낱말이나 낱말 조각)의 확률을 매긴다'는 틀은 같습니다. 다만 확률을 횟수로 세지 않고 신경망(트랜스포머, transformer)으로 계산하며, 문맥을 수천 토큰(token) 이상으로 늘렸습니다.
이 개념이 나오는 긴 글
이 개념 위에 세워진 것
이 개념을 언급하는 페이지
- 마르코프 연쇄
… 크게 다르다는 것을 보여 이 연쇄를 처음 실제 자료에 시험했습니다. 앞 단어 몇 개로 다음 단어를 고르는n-그램언어 모델도 같은 생각입니다. '앞 단어 몇 개'를 상태로 삼은 마르코프 연쇄이기 때문입니다. 상태 자체는 …
- 촘스키 위계
… 어디쯤일까요? 촘스키는 영어가 유한 상태 모형으로는 설명되지 않는다고 주장했고, 앞 단어 몇 개만 보는n-그램모형이 바로 그런 유한 상태 모형입니다. 1985년 미국의 컴퓨터 언어학자 스튜어트 시버는 스위스 독일어의 …
- 문맥 자유 문법
… 자유 문법이 되어, 중의적인 문장에서 가장 그럴듯한 트리를 고를 수 있습니다. 앞 단어 몇 개만 보는n-그램모형은 트리를 보지 못하고, 이것이 촘스키가 유한 상태 모형을 비판한 핵심이었습니다. 규칙에 문맥을 …
- 지프의 법칙
… 말뭉치를 아무리 늘려도 처음 보는 낱말이 계속 나옵니다. 이것이 앞 낱말 몇 개로 다음 낱말을 맞히는n-그램모형이 겪는 희소성 문제, 곧 본 적 없는 낱말 묶음이 끝없이 나오는 문제의 뿌리입니다. 빈도가 치우친 …
- 정보 엔트로피
… 포함 가지)로는 각각 , , 비트입니다. 앞을 많이 볼수록 다음 글자를 짐작하기 쉬워지는 것이n-그램모형의 바탕입니다. 다만 글이 짧아서 긴 문맥의 값은 실제보다 작게 나옵니다(본 적 있는 조합만 세기 …
- 은닉 마르코프 모델
… 위에 서 있었습니다. 이어지는 곳. 품사 전이 확률은 앞 품사로 다음 품사를 맞히는 것이니 품사열에 대한n-그램모델입니다. 은닉 마르코프 모델은 화살표마다 확률을 붙이고 상태를 감춘 유한 오토마톤으로 볼 수도 …
- 단어 임베딩
… k-평균 군집을 돌리면 뜻이 비슷한 낱말 무리가 나옵니다. 앞 낱말 몇 개로 다음 낱말을 맞히는n-그램모델은 본 적 없는 낱말 묶음이 끝없이 나오는 희소성 문제를 겪는데, 비슷한 낱말끼리 통계를 나누어 쓰게 …
- 신경망
… 벡터로 바꾸는 단어 임베딩은 작은 신경망이 배운 가중치이고, 앞 낱말들로 다음 낱말의 확률을 매기는n-그램 언어 모델을 신경망으로 바꾼 것이 오늘날 언어 모델의 뿌리입니다. 이미지를 다루는 신경망은 3×3 화소 같은 …
- 과적합
… 나타납니다. 최근접 이웃 분류에서 k = 1이면 예로 쓴 점은 모두 맞히지만 새 점에서는 못합니다.n-그램 언어 모델에서 n을 키우면 학습 문장은 통째로 외우지만 새 문장은 처음 보는 조합투성이가 됩니다. 특성의 수가 …
- 원천 부호화 정리
… 다음 글자를 맞히게 하는 실험으로 영어의 엔트로피율을 글자당 약 0.6~1.3비트로 어림했습니다. 오늘날n-그램이나 신경망 언어 모델의 성능도 같은 잣대로 잽니다. 모델이 실제 글에 준 확률로 잰 기호당 …
- 렘펠–지브 압축
… 글자짜리 조각마다 그것이 나왔던 자리들을 해시 테이블에 적어 둡니다. 세 글자짜리 조각은 n = 3인n-그램입니다. zip, gzip, PNG가 쓰는 DEFLATE는 거리를 32KB 안쪽으로 제한한 LZ77로 …
- 결합 엔트로피와 조건부 엔트로피
… 것이고, 앞을 더 많이 볼수록 각 항은 줄거나 그대로입니다. 앞 n − 1글자만 보고 다음 글자를 맞히는n-그램모형은 이 조건부 엔트로피를 문맥을 n − 1글자로 잘라 어림합니다. 섀넌은 1948년 논문에서 …
- 쿨백–라이블러 발산
… 모형⟧의 성능도 실제 글에 대한 교차 엔트로피 H로 재거나, 그것을 2^H 로 바꾼 퍼플렉시티로 잽니다(n-그램). 퍼플렉시티가 k라는 것은 모형이 매번 똑같이 그럴듯한 후보 k개 사이에서 고르는 것만큼 헷갈린다는 …
- 산술 부호화
… 더 냅니다. 다음 글자를 더 잘 맞히는 모형이 곧 더 좋은 압축기입니다. 앞 몇 글자로 다음 글자를 맞히는n-그램문맥 모형에 산술 부호화를 붙인 PPM(1984년 클리어리와 위튼. 부분 일치에 의한 예측이라는 …
- 최대가능도법
… 그러니 교차 엔트로피를 줄이도록 경사 하강법으로 학습하는 것은 최대가능도 추정을 하는 것과 같습니다.n-그램언어 모형에서 '이 낱말 다음에 저 낱말이 나온 횟수 ÷ 이 낱말이 나온 횟수'로 확률을 매기는 것도 …
- 기계 학습
… 최대가능도법, 베이즈 정리, 마르코프 연쇄, 은닉 마르코프 모델이고, 언어를 배우는 모형은n-그램과 단어 임베딩에서 토큰화, 어텐션, 트랜스포머, 언어 모델로 이어집니다. 분류 …
- 인공지능
… 있게 되었습니다. 음성 인식은 은닉 마르코프 모델으로, 기계 번역과 문장의 확률 모형은 말뭉치에서 센n-그램으로 옮겨 갔습니다. 1986년 데이비드 러멜하트, 제프리 힌턴, 로널드 윌리엄스는 여러 층의 …
- 순환 신경망과 LSTM
… 확률을 모은 벡터입니다. RNN의 상태는 실수 벡터이고 갱신은 비선형입니다. 바로 앞의 n − 1개만 보는n-그램과 달리 RNN의 기억에는 정해진 끝이 없지만, 실제로 쓸 수 있는 기억의 길이는 위의 고유값 이야기가 …
- 토큰화와 BPE
… 훨씬 강한 압축기가 됩니다. 앞의 토큰 몇 개가 이어 나온 횟수를 세어 다음 토큰을 맞히는 옛 언어 모델은n-그램입니다.
- 언어 모델과 다음 토큰 예측
… 때문입니다. 이것은 가정이 아니라 항등식입니다. 가정은 각 조건부 확률을 어떻게 계산하느냐에서 들어옵니다.n-그램은 바로 앞 n − 1개 토큰만 본다고 가정하고(마르코프 연쇄의 가정), 순환 신경망은 지금까지의 …