언어 모델과 다음 토큰 예측(Language model and next-token prediction)
앞의 토큰(token)들이 주어졌을 때 다음 토큰의 확률(probability) 분포를 내놓는 모델. 실제 글에 준 확률의 로그를 최대화하도록(교차 엔트로피(cross-entropy)를 최소화하도록) 학습한다.
"오늘 날씨가 정말 ___." 빈칸에 올 낱말은 하나로 정해지지 않지만 아무것이나 오지도 않습니다. '좋다'는 흔하고 '파랗다'는 드뭅니다. 언어 모델(language model)은 앞의 토큰들이 주어졌을 때 다음 토큰의 조건부 확률(conditional probability) 분포를 내놓는 함수입니다. 이것만으로 문장 전체의 확률도 정해집니다. 확률의 곱셈 규칙(chain rule of probability)을 거듭 쓰면 어떤 분포든
로 쪼개지기 때문입니다. 이것은 가정이 아니라 항등식입니다. 가정은 각 조건부 확률을 어떻게 계산하느냐에서 들어옵니다. n-그램(n-gram)은 바로 앞 n − 1개 토큰만 본다고 가정하고(마르코프 연쇄(Markov chain)의 가정), 순환 신경망(recurrent neural network)은 지금까지의 글을 고정된 크기의 벡터(vector) 하나에 요약하며, 트랜스포머(transformer)는 정해진 문맥 창 안의 모든 토큰을 어텐션(attention)으로 직접 봅니다.
무엇을 최소화하는가. 모델 q의 학습 목표는 실제 글의 토큰마다 모델이 준 확률의 로그를 더한 값을 가장 크게 하는 것, 곧 최대 가능도(likelihood)입니다. 부호를 바꾸고 토큰 수 N으로 나누면 토큰당 평균(mean) '놀람'
첫 항은 글 자체의 불확실성인 엔트로피(entropy)라서 모델이 무엇을 하든 줄일 수 없습니다. 둘째 항 KL 발산(KL divergence)은 늘 0 이상이고 q = p일 때만 0입니다(깁스 부등식, Gibbs' inequality). 그러니 교차 엔트로피를 최소화하는 것은 KL을 줄여 q를 p에 맞추는 것과 정확히 같은 일입니다. 아래에서 p는 설명을 위해 정한 가상의 '참' 분포입니다. 실제로는 아무도 p를 모르고, 글에서 뽑힌 표본(sample)으로 교차 엔트로피를 추정할 뿐입니다. 모델의 분포 q(청록 막대 위의 노란 손잡이)를 끌어 보세요. 한 막대를 올리면 나머지는 합이 1이 되도록 같은 비율로 줄어듭니다.
지금 H(p) =
퍼플렉시티. 교차 엔트로피 H비트를
섀넌의 맞히기 실험. 1951년 클로드 섀넌은 사람에게 영어 문장을 한 글자씩 맞히게 했습니다. 틀리면 맞을 때까지 다시 추측하게 하고, 몇 번 만에 맞혔는지 적었습니다. 앞 글자를 많이 볼수록 첫 추측이 맞는 일이 늘었습니다. 섀넌은 이 기록에서 앞의 100글자쯤을 아는 영어의 엔트로피에 아래 한계와 위 한계를 구해, 글자당 0.6비트와 1.3비트 사이라고 추정했습니다(알파벳 26자와 띄어쓰기를 고르게 찍으면
말뭉치에 '동생은 오늘'이라는 이어짐은 한 번도 없습니다. 그래서 바이그램은 '오늘'에 아주 작은 확률만 주어 5.7비트를 잃습니다(본 적 없는 쌍도 확률이 0이 되지 않도록 모든 횟수에 0.1을 더했습니다). 문맥을 둘로 늘린 트라이그램은 이 문장에서 오히려 나쁩니다. 문맥이 길수록 그 문맥을 말뭉치에서 본 적이 없을 가능성이 커지기 때문입니다. 반대로 말뭉치에 있던 문장으로 시험하면 트라이그램이 가장 좋아 보입니다. 이미 본 글로 모델을 평가하면 안 되는 까닭입니다(과적합, overfitting). 비슷한 낱말끼리 통계(statistics)를 나눠 쓰게 한 신경망(neural network) 언어 모델(2003년 요슈아 벤지오 등)과 단어 임베딩(word embedding)이 이 희소성 문제를 누그러뜨렸습니다.
예측은 곧 압축입니다. 다음 토큰에 확률 q를 주는 모델이 있으면 산술 부호화(arithmetic coding)로 글 전체를
은닉 마르코프 모델(hidden Markov model)은 눈에 보이지 않는 상태(예: 품사(part of speech))가 마르코프 연쇄로 바뀌고 각 상태가 낱말을 내놓는다고 보는 언어 모델입니다. 상태의 가짓수가 정해져 있어 과거 전체를 그 상태 하나로 요약합니다. 순환 신경망은 이 상태를 연속적인 벡터로 바꾼 것으로 볼 수 있고, 트랜스포머는 과거를 요약하지 않고 문맥 창 안의 토큰을 모두 들고 다닌다는 점에서 다릅니다.
다음 토큰 예측이 말해 주는 것과 말해 주지 않는 것. 학습 목표는 학습 자료의 분포를 흉내 내는 것뿐입니다. 자료에 흔한 오류는 모델에게도 확률이 높은 답이고, '사실인가'는 목표에 들어 있지 않습니다. 대화에 쓰는 모델은 여기에 사람의 선호로 다듬는 단계를 더합니다(인간 피드백 강화 학습(reinforcement learning)). 큰 모델이 이 단순한 목표만으로 번역, 요약, 코드 작성 같은 일을 상당히 해낸다는 것은 관찰된 사실이지만, 왜 그런지, 어디까지 가능한지에 대해 합의된 이론은 아직 없습니다. 모델 크기와 손실 사이의 경험적 관계는 규모의 법칙(scaling laws)에서 다룹니다.
1913년 안드레이 마르코프는 푸시킨의 『예브게니 오네긴』에서 모음과 자음이 이어지는 빈도를 세어 자기 이름이 붙은 연쇄를 글에 적용했고, 1948년 섀넌은 n-그램으로 영어를 흉내 낸 문장을 만들었습니다. 1970~80년대 IBM의 프레더릭 옐리넥 연구진은 음성 인식에 트라이그램을 써서 통계 언어 모델을 실용화했습니다. 2003년 벤지오 등의 신경망 언어 모델, 2010년 토마시 미콜로프의 순환 신경망 언어 모델을 거쳐, 2018년 이후 GPT 계열이 트랜스포머로 같은 목표를 큰 규모에서 학습시켰습니다.
이어지는 곳. 목표 함수(function)의 두 조각은 엔트로피와 KL 발산이고, 문맥을 아는 만큼 줄어드는 불확실성은 조건부 엔트로피(conditional entropy)로 잽니다. 마지막 층의 점수를 확률로 바꾸는 소프트맥스(softmax)와 교차 엔트로피는 한 쌍으로 쓰이며, 분류 문제의 로지스틱 회귀(logistic regression)가 같은 손실을 씁니다. 학습된 분포에서 실제로 글을 뽑는 규칙은 디코딩이 정하고, 손실이 모델과 자료의 크기에 따라 어떻게 줄어드는지는 규모의 법칙이 경험적으로 요약합니다. 낱말 빈도가 지프의 법칙(Zipf's law)처럼 치우쳐 있어 말뭉치를 아무리 키워도 처음 보는 문맥이 계속 나온다는 사실이 n-그램의 희소성 문제의 뿌리입니다. 2022년 이후 언어 모델에 일어난 일, 곧 선호 학습과 공개 가중치(open weights) 모델, 긴 문맥, 검색과 도구, 추론 모델은 언어 모델의 발전사에 날짜순으로 정리되어 있습니다.
이 개념이 나오는 긴 글
이 개념 위에 세워진 것
이 개념을 언급하는 페이지
- 조건부 확률
… \mid w_1 w_2) 처럼, 앞의 단어들이 주어졌을 때 다음 단어의 조건부 확률을 내놓는 것이언어 모델입니다. B가 일어났는지 아닌지를 알고 나면 A가 일어날지에 대한 불확실성이 평균적으로 얼마나 줄어드는지도 …
- 정보 엔트로피
… 부호는 부호어(부호로 쓰는 비트열)끼리 서로 다른 자리의 개수, 곧 해밍 거리가 크도록 설계합니다.언어 모형의 성능은 실제 글에 대한 교차 엔트로피, 곧 모형이 매긴 확률로 부호를 만들어 실제 글을 적을 때 …
- n-그램 언어 모델
… 단어 임베딩 벡터로 바꿔 비슷한 낱말끼리 통계를 나누어 쓰며 희소성 문제를 누그러뜨렸습니다. 오늘날의대형 언어 모델도 '앞 문맥으로 다음 토큰(낱말이나 낱말 조각)의 확률을 매긴다'는 틀은 같습니다. 다만 확률을 …
- 단어 임베딩
… 희소성 문제를 겪는데, 비슷한 낱말끼리 통계를 나누어 쓰게 하는 임베딩이 이를 누그러뜨렸습니다. 오늘날의언어 모델은 어텐션으로 앞뒤 낱말의 벡터를 섞어 문맥에 따라 벡터가 바뀌는 임베딩을 만들어, 과일 '배'와 타는 …
- 신경망
… 앞 낱말들로 다음 낱말의 확률을 매기는 n-그램 언어 모델을 신경망으로 바꾼 것이 오늘날언어 모델의 뿌리입니다. 이미지를 다루는 신경망은 3×3 화소 같은 작은 가중치 묶음 하나를 그림 곳곳에 옮겨 가며 …
- 원천 부호화 정리
… 실험으로 영어의 엔트로피율을 글자당 약 0.6~1.3비트로 어림했습니다. 오늘날 n-그램이나 신경망언어 모델의 성능도 같은 잣대로 잽니다. 모델이 실제 글에 준 확률로 잰 기호당 평균 비트 수(교차 엔트로피) …
- 쿨백–라이블러 발산
… 빈도)로 두면, 모형이 실제 자료에 매기는 확률(가능도)을 가장 크게 하는 최대가능도법과도 같습니다.언어 모형의 성능도 실제 글에 대한 교차 엔트로피 H로 재거나, 그것을 2^H 로 바꾼 퍼플렉시티로 …
- 산술 부호화
… 클리어리와 위튼. 부분 일치에 의한 예측이라는 뜻입니다)은 오랫동안 글 압축의 선두였고, 요즘은 신경망언어 모델의 예측을 산술 부호화에 넣어 더 줄이기도 합니다. 거꾸로 언어 모델의 퍼플렉시티는 이 압축 길이를 지수로 …
- 최대가능도법
… 같은 최대가능도 추정입니다. 두 갈래를 가르는 로지스틱 회귀도, 앞의 토큰들로 다음 토큰의 확률을 내는언어 모델도 이렇게 최대가능도로 학습합니다. 역사. 가장 그럴듯한 값을 고른다는 생각은 18세기에도 있었습니다. …
- 기계 학습
… 발표한 트랜스포머 구조(문장 속 낱말마다 다른 낱말을 얼마나 참고할지 계산하는 신경망)는 오늘날의 대형언어 모형의 바탕이 되었습니다. 이 위키의 학습 페이지들. 뉴런 하나와 학습 규칙은 퍼셉트론, 층을 쌓은 모형은 …
- 소프트맥스와 교차 엔트로피
… 줄였습니다. 온도는 확률의 순서를 바꾸지 않으므로 이 보정으로 정확도는 변하지 않습니다. 이어지는 곳.언어 모델은 다음 토큰의 확률을 수만에서 수십만 개 토큰 전체에 대한 소프트맥스로 내고, 교차 엔트로피로 …
- 특잇값 분해
… 벨트라미와 1874년 프랑스의 카미유 조르당이 정사각 행렬에 대해 따로 찾았습니다. 이어지는 곳. 대형언어 모델을 새 일에 맞춰 고칠 때 널리 쓰는 LoRA(2021년 마이크로소프트의 에드워드 후 등)는 d×k 가중치 …
- 자동 미분
… 기울기의 최근 평균으로 걸음 크기를 조절하는 그 변형 Adam이 가중치를 고칩니다. 트랜스포머로 만든언어 모델의 학습도 이 계산의 되풀이입니다. 뉴턴 방법: 방정식 여러 개를 함께 풀 때 필요한 야코비 행렬도 …
- 확률적 경사 하강법과 Adam
… 끝까지 줄이면 과적합이 생길 수 있어 검증 오차를 보며 멈추거나 정규화를 더합니다. 많은 대형언어 모델은 AdamW로 학습합니다. AdamW는 걸음마다 가중치를 조금씩 0 쪽으로 줄이는 가중치 감쇠를, …
- 인공지능
… 병렬 계산이 쉬워 아주 큰 모델을 학습시킬 수 있었고, 글을 토큰으로 쪼개 다음 토큰을 맞히는언어 모델을 인터넷 규모의 글로 학습시키는 방식이 자리 잡았습니다. 모델의 크기는 매개변수의 개수로 잽니다. …
- 순환 신경망과 LSTM
… 것입니다. 입력 x_t 로 들어가는 낱말 벡터는 단어 임베딩이고, 다음 낱말의 확률을 내는 모델 전체는언어 모델입니다. 확률로 상태를 따라가는 형제는 마르코프 연쇄와 은닉 마르코프 모델이고, 순환을 걷어 내고 …
- 확산 모델
… 몬테카를로 방법과 무작위성에서 이어집니다. 같은 생성 모델이지만 한 토큰씩 차례로 뽑는 방식은언어 모델입니다.
- 토큰화와 BPE
… 모델 안에서 임베딩 행렬의 한 행, 곧 단어 임베딩 같은 벡터로 바뀌어 트랜스포머에 들어갑니다.언어 모델이 배우는 것은 이 토큰 열의 확률이라서, 퍼플렉시티 같은 점수도 토크나이저에 따라 달라집니다. 압축의 …
- 어텐션
… 행마다 합이 1입니다. 빈 칸은 마스크로 가린 곳(가중치 0)입니다. 인과 마스크는 다음 토큰을 예측하는언어 모델이 쓰는 방식입니다. i번째 토큰은 자기와 그 앞만 볼 수 있도록 뒤쪽 점수를 −∞로 두어 가중치를 0으로 …
- 트랜스포머
… 이루어지고, 입력 토큰은 토큰화가 정합니다. 맨 끝의 소프트맥스 출력으로 학습하는 목표는언어 모델의 교차 엔트로피이고, 기울기는 역전파와 자동 미분으로 구해 확률적 경사 하강법과 Adam으로 …
- 디코딩: 온도, top-p, 빔 탐색
언어 모델은 다음 토큰의 확률 분포를 줄 뿐, 무엇을 쓸지는 정하지 않습니다. 분포에서 토큰 하나를 고르고, 그것을 …
- 규모의 법칙
… 오차(모델의 확률이 실제 글의 확률과 다른 만큼)를 더한 값이라서, 엔트로피 아래로는 내려갈 수 없습니다(언어 모델참고). 그러니 이 직선은 어딘가에서 꺾여야 하고, 논문 스스로도 그렇게 적었습니다. 또 이 관계는 특정한 …
- 인간 피드백 강화 학습과 정렬
다음 토큰을 예측하도록 학습한언어 모델은 학습 자료의 분포를 흉내 냅니다. 질문에 답하는 대신 질문을 이어 쓰기도 하고, 틀린 말도 자료에 …
- 증명 보조기
… 기계가 찾은 증명. 형식 증명은 기계로 확인할 수 있다는 점 때문에 인공지능 연구와도 이어집니다.언어 모델이 자연어로 쓴 증명은 그럴듯해도 틀릴 수 있지만, 커널을 통과한 형식 증명은 적어 넣은 명제에 관한 한 …
- 위치 인코딩의 변천
… 계산할 수는 있습니다. 그러나 2021년 프레스 등(아래 ALiBi의 저자들)이 재어 보니, 사인파를 쓴언어 모델은 학습 길이를 조금만 넘어도 퍼플렉시티가 크게 나빠졌습니다. 퍼플렉시티는 모델이 실제 다음 토큰에 매긴 …
- 추론 모델과 테스트 시점 계산
… 6개씩 든 상자 3개가 있고, 그중 2개를 먹었다. 남은 사과는 몇 개인가?" 답만 곧바로 말하라고 하면언어 모델은 첫 토큰부터 답을 내야 합니다. "3 × 6 = 18, 18 − 2 = 16"처럼 중간 계산을 먼저 …
- 검색 증강 생성
언어 모델이 아는 것은 학습 자료에 있던 것뿐입니다. 2024년까지의 글로 학습한 모델에게 "2024년도 튜링상은 …
- 언어 모델의 발전사: RLHF 이후
… 벡터의 방향으로 글을 찾는 코사인 유사도, 여러 번 뽑아 고르는 표본과 검증, 그리고 모든 것의 바탕인다음 토큰 예측과 확률적 경사 하강법입니다. 조심할 것도 그대로입니다. 벤치마크는 금방 포화되고, 공개된 문제는 학습 …
- 페르마의 마지막 정리
… 사람들이 함께 증명 보조기 Lean으로 옮기는 5년짜리 계획을 시작했습니다. 그런데 앤트로픽은 자사의언어 모델Claude 에이전트 여럿이 2026년 8월 7일부터 11일 동안 증명 전체를 Lean으로 옮겼다고 …