전문가 혼합(Mixture of experts)
입력마다 여러 '전문가' 신경망(neural network) 가운데 몇 개만 골라 쓰는 구조. 라우터(router)가 소프트맥스(softmax)로 전문가별 점수를 매겨 상위 k개만 계산하므로 매개변수(parameter)는 많아도 토큰(token) 하나에 드는 계산은 적다. 몇몇 전문가에게 일이 몰리지 않도록 부하 균형(load balancing) 장치가 필요하다.
언어 모델(language model)은 클수록 대개 더 똑똑하지만, 그만큼 글 한 조각을 처리할 때마다 드는 계산도 커집니다. 모델은 키우면서 계산은 그대로 둘 수 없을까요? 먼저 용어 셋을 정합니다. 언어 모델은 글을 잘게 자른 조각(토큰, 대개 낱말이나 낱말의 일부)을 하나씩 처리합니다. 매개변수는 학습으로 값이 정해지는 수들이고, 그 개수가 모델의 크기입니다. 트랜스포머(transformer)는 같은 모양의 블록을 여러 겹 쌓은 것인데, 블록마다 토큰끼리 정보를 주고받는 부분(어텐션, attention)과, 토큰마다 따로 큰 계산을 하는 부분(피드포워드 층)이 있습니다. 매개변수는 대부분 피드포워드 층에 있습니다.
이제 블록마다 피드포워드 층 하나를 여덟 벌로 늘리고, 토큰마다 그 가운데 두 벌만 쓴다고 합시다. 피드포워드 층의 매개변수는 여덟 배가 되지만, 토큰 하나를 처리하는 계산은 두 벌어치입니다. 2023년 12월 미스트랄 AI가 공개한 Mixtral 8x7B가 이런 구조입니다. 전체 매개변수는 467억 개인데 토큰 하나를 처리할 때 쓰는 것은 약 129억 개입니다. 이름대로라면 8 × 70억 = 560억이어야 할 것 같지만, 어텐션 같은 나머지 부분은 모든 전문가가 함께 쓰므로 그보다 적습니다. 여기서 각 피드포워드 층을 '전문가'라 부르고, 토큰마다 어느 전문가를 쓸지 정하는 작은 층을 라우터(또는 게이트)라 합니다. 이 구조가 전문가 혼합(mixture of experts, MoE)입니다.
생각의 뿌리는 1991년 로버트 제이컵스, 마이클 조던, 스티븐 놀런, 제프리 힌턴의 「적응적 국소 전문가 혼합」입니다. 입력이 놓일 수 있는 공간을 여러 영역으로 나눠 영역마다 다른 작은 신경망(전문가)이 맡고, 게이트 신경망이 입력마다 누구의 말을 얼마나 들을지 정하게 하자는 것이었습니다. 제목의 '국소'는 각 전문가가 공간의 한 부분만 맡는다는 뜻입니다. 확률(probability)로 쓰면 이렇습니다.
EM 알고리즘(algorithm), 베이즈 정리(Bayes' theorem)와의 관계
이 식은 EM 알고리즘으로 학습하는 가우스 혼합(여러 종 모양 분포를 섞은 분포)과 닮았습니다. 가우스 혼합(Gaussian mixture)에서는 섞는 비율이 상수이고 여기서는 입력 x에 따라 바뀐다는 점이 다릅니다. 실제로 1994년 조던과 제이컵스는 전문가를 나무 모양으로 쌓은 계층적 전문가 혼합을 EM으로 학습시켰습니다. EM의 첫 단계(E 단계)에서는 자료점마다 '이 점은 전문가 i가 맡았을 확률'희소하게 고르기. 1991년의 모형은 모든 전문가를 계산한 뒤 섞습니다. 전문가를 수천 개로 늘리려면 계산하지 않을 전문가를 미리 골라내야 합니다. 2017년 노엄 셰이저 등은 라우터 점수 가운데 상위 k개만 남기고 나머지를 −∞(음의 무한대)로 둔 뒤 소프트맥스를 하는 희소 게이트를 제안했습니다. 소프트맥스는 점수를 지수 함수(function)에 넣어 비율을 내는데, −∞를 넣으면 0이 나옵니다. 그래서 뽑히지 않은 전문가의 게이트 값은 정확히 0이고, 그 전문가는 계산할 필요가 없습니다. 이를테면 점수가 (2, 1, 0, −1)이고 k = 2이면 (2, 1, −∞, −∞)로 소프트맥스를 해서 게이트 값은 약 (0.73, 0.27, 0, 0)입니다.
이들은 글을 순서대로 읽는 순환 신경망(recurrent neural network)의 한 종류인 LSTM의 층 사이에 이런 층을 끼워, 전문가를 최대 13만 개 넘게, 매개변수를 1,370억 개까지 늘렸습니다.
라우터는 어떻게 배울까요? 신경망은 역전파(backpropagation)로 배웁니다. 출력이 얼마나 틀렸는지에서 거꾸로 거슬러 가며, 각 매개변수를 조금 바꾸면 오차가 어떻게 변하는지(기울기, slope)를 계산해 고치는 방법입니다. 고르는 일(상위 k) 자체는 점수를 조금 바꿔도 대개 결과가 그대로이다가 어느 순간 뒤바뀌므로 이 방식으로 다룰 수 없습니다. 그러나 뽑힌 전문가의 게이트 값은 소프트맥스라서 점수를 조금 바꾸면 조금 변하고, 그 변화를 통해 라우터도 학습됩니다. 단, k = 1일 때 뽑힌 하나만으로 소프트맥스를 하면 게이트 값이 늘 1입니다. 그러면 라우터 점수를 조금 바꿔도 출력이 변하지 않아, 라우터가 무엇을 고쳐야 할지 신호를 받지 못합니다. 그래서 상위 1개만 쓰는 스위치 트랜스포머(아래)는 전체 전문가에 대한 소프트맥스 확률
아래는 설명을 위한 2차원 장난감입니다. 점 28개가 토큰이고, 크기가 다른 세 무리(14개, 9개, 5개)로 모여 있습니다. 전문가 네 명의 라우터 벡터(vector)
1순위 영역의 경계는 두 점수가 같아지는 직선
이렇게 쏠리면 무엇이 문제일까요? 한 전문가가 받을 수 있는 토큰 수에는 보통 상한(용량, capacity)이 있습니다. 전문가 N명, 토큰 T개, 상위 k일 때 용량은
쏠림과 보조 손실(auxiliary loss). 학습을 그냥 두면 쏠림이 스스로 강해집니다. 많이 뽑힌 전문가는 그만큼 많이 학습해서 더 나아지고, 라우터는 더 나은 전문가를 더 자주 고르기 때문입니다. 2017년 논문도 이 현상을 적었습니다. 2021년 윌리엄 페더스, 배럿 조프, 셰이저의 스위치 트랜스포머는 이것을 손실로 막았습니다. 손실은 모델이 얼마나 틀렸는지를 잰 값이고, 학습은 손실을 줄이는 쪽으로 매개변수를 고치는 일입니다. 그러니 쏠림에 벌점을 매겨 본래의 손실에 더하면(보조 손실), 학습이 쏠림도 함께 줄입니다. 이들이 더한 보조 손실은 다음과 같습니다(α = 0.01).
f는 실제로 나눠 준 비율이고, P는 라우터 확률
이 손실이 왜 고른 분배에서 가장 작을까요? 라우팅이 확률과 들어맞아 f ≈ P라면
'보조 손실로 5걸음'은 이 손실(α를 뺀 부분)만으로 라우터 벡터를 경사 하강법(gradient descent)으로 다섯 번 고칩니다(f는 1순위로 셉니다). 처음 값 1.299가 한 번 누르면 1.040으로 내려가고, 세 번쯤 누르면 f가 모두 1/N = 0.25가 되어 정확히 1이 됩니다. 이때 P는 1/N 근처에 머물 뿐 꼭 1/N이 되지는 않습니다. f가 모두 1/N이면 P와 상관없이
보조 손실 없이. 보조 손실이 크면 본래의 목표를 방해합니다. 2024년 12월 딥시크의 DeepSeek-V3는 전문가마다 편향
규모. 이 구조로 모델은 얼마나 커졌을까요? 2020년 구글의 GShard는 상위 2개 게이트로 매개변수 6,000억 개가 넘는 번역 모델을 학습시켰습니다. 2021년 스위치 트랜스포머는 상위 1개만 쓰는 방식으로 매개변수 1.6조 개, 전문가 2,048개의 모델을 학습시켰습니다. 이 논문은 구글의 기존 트랜스포머 모델 T5와 견주어, 같은 계산 자원으로 사전학습이 최대 7배 빨라졌다고 보고했습니다. 사전학습은 특정 과제를 가르치기 전에 많은 글로 다음 토큰 맞히기 같은 일반적인 일을 먼저 배우는 단계입니다. 2024년 1월 DeepSeekMoE는 전문가를 잘게 쪼개 많이 두고, 모든 토큰이 늘 거치는 공유 전문가를 따로 두는 설계를 내놓았습니다. DeepSeek-V3는 층마다 공유 전문가 1개와 라우팅 전문가 256개 가운데 8개를 써서, 전체 6,710억 개 가운데 토큰당 370억 개의 매개변수만 씁니다. 2025년 이후 공개된 큰 모델에는 전문가 혼합이 흔합니다. 아래에서 '활성'은 토큰 하나를 처리할 때 실제로 쓰는 매개변수 수입니다.
- 메타의 Llama 4 Maverick: 전체 4,000억·활성 170억, 라우팅 전문가 128개.
- 오픈AI의 gpt-oss-120b: 전체 1,170억·활성 51억, 전문가 128개 중 4개.
- 알리바바의 Qwen3-235B-A22B: 이름대로 전체 2,350억·활성 220억.
- 문샷의 Kimi K2: 전체 1조·활성 320억, 전문가 384개 중 8개.
GPT-4가 전문가 혼합이라는 이야기가 돌았지만 오픈AI는 GPT-4의 구조를 공식적으로 밝힌 적이 없습니다.
오해하기 쉬운 것. 첫째, '전문가'가 주제별 전문가는 아닙니다. Mixtral 논문은 arXiv 논문, 생물의학 초록, 철학 논문처럼 분야가 다른 글을 넣어 보았지만 분야에 따라 전문가가 뚜렷이 나뉘는 양상을 찾지 못했고, 오히려 들여쓰기나 특정 낱말 같은 문법적 단위, 연달아 오는 토큰이 같은 전문가로 가는 경향을 보고했습니다. 둘째, 활성 매개변수가 적다고 가벼운 모델은 아닙니다. 어느 토큰이 어느 전문가를 부를지 모르니 전체 매개변수를 모두 메모리에 올려 두어야 하고, 전문가들을 여러 GPU에 나눠 두면 토큰을 주고받는 통신이 병목이 됩니다. 셋째, '전체 N개' 전문가 혼합 모델과 '매개변수 N개' 밀집 모델의 성능은 같지 않습니다. 같은 활성 매개변수의 밀집 모델보다는 대개 낫고, 같은 전체 매개변수의 밀집 모델보다는 대개 못하다는 것이 흔한 관찰이지만, 얼마나 차이 나는지는 설정에 따라 다릅니다. 모델을 비교할 때는 전체와 활성 매개변수를 함께 적어야 하는 까닭입니다.
이어지는 곳.
- 소프트맥스와 내적: 게이트는 소프트맥스이고, 점수는 입력과 라우터 벡터의 내적입니다.
- EM 알고리즘과 베이즈 정리: 입력마다 섞는 비율이 바뀌는 혼합 분포를 학습하는 방법과, 담당 확률의 계산.
- 결정 트리와 보로노이 다이어그램(Voronoi diagram): 입력 공간을 영역으로 나눠 맡긴다는 점이 닮았습니다.
- 경사 하강법: 부하 균형 손실을 줄이는 방법. 그 최솟값이 균등 분배라는 것은 코시–슈바르츠 부등식에서 나옵니다.
- 트랜스포머: 전문가 층이 끼어 있는 자리인 피드포워드 층.
- 규모의 법칙(scaling laws): 전체 매개변수와 계산량을 따로 셀 때의 저울질.
- 추론 모델: DeepSeek-V3를 바탕으로 한 추론 모델.
- 언어 모델의 발전사: 전문가 혼합 모델들이 나온 순서.
- 힌턴: 1991년 논문의 저자 가운데 한 사람.
이 개념이 나오는 긴 글
이 개념을 언급하는 페이지
- 베이즈 정리
… 부분의 비율이 집단마다 다르면 심슨의 역설 같은 함정이 생깁니다. 입력마다 여러 '전문가' 모형을 섞는전문가 혼합을 EM 알고리즘으로 학습할 때 '이 자료점은 전문가 i가 맡았을 확률'을 구하는 계산도, 게이트 값을 …
- k-평균 군집
… 달리 초승달처럼 길쭉한 무리도 찾아냅니다. 입력 공간을 영역으로 나눠 영역마다 담당자를 두는 생각은전문가 혼합의 라우터와 닮았는데, 거기서는 중심까지의 거리 대신 학습된 벡터와의 내적으로 담당 '전문가'를 고르고, …
- 보로노이 다이어그램
… 중심점들의 보로노이 다이어그램을 쓰는 것입니다(검색 증강 생성). 내적 점수가 가장 큰 전문가를 고르는전문가 혼합의 라우터도 입력 공간을 이와 닮은 볼록한 영역들로 나눕니다. 유클리드 거리에서 영역이 변을 맞댄 …
- 소프트맥스와 교차 엔트로피
… 소프트맥스를 거친 가중치에는 e^{-md} 가 곱해져 먼 단어일수록 지수적으로 덜 참고하게 됩니다.전문가 혼합의 라우터도 전문가별 점수를 소프트맥스로 비율로 바꾸고, 그 가운데 상위 몇 개만 계산합니다. 단어를 …
- 결정 트리와 랜덤 포레스트
… 경계의 모양은 축에 매이지 않습니다. 입력 공간을 영역으로 나눠 영역마다 따로 답하게 한다는 점에서전문가 혼합도 결정 트리를 닮았는데, 거기서는 딱 잘린 문턱 대신 소프트맥스 점수로 몇 개의 '전문가' 신경망을 …
- EM 알고리즘과 가우스 혼합
… KL 발산으로 나뉘는 것과 같은 계산입니다. 1991년 제이컵스, 조던, 놀런, 힌턴이 내놓은전문가 혼합은 섞는 비율 자체가 입력에 따라 소프트맥스로 바뀌는 혼합 모형이고, 1994년 조던과 제이컵스는 그 …
- 인공지능
… 그 뒤 몇 해 사이에 학습된 가중치를 누구나 내려받게 공개한 모델, 입력마다 모델의 일부만 쓰는전문가 혼합, 한 번에 아주 긴 글을 읽는 모델, 답하기 전에 풀이를 길게 적어 보는 추론 모델이 차례로 나왔습니다. …
- 트랜스포머
… 쓰는 규칙은 디코딩에서 다룹니다. 블록 안의 MLP를 여러 개 두고 토큰마다 몇 개만 골라 쓰는 방법은전문가 혼합에, 어텐션 대신 고정된 크기의 상태를 선형으로 갱신하는 대안은 상태 공간 모형에 있습니다.
- 규모의 법칙
… 보장이 되지 못합니다. 인간 피드백 강화 학습: 보상 모델을 지나치게 최적화할 때의 경험 법칙.전문가 혼합: 토큰마다 전문가 몇 개만 쓰는 모델에서는 전체 매개변수 수와 실제로 계산에 쓰이는 매개변수 수가 달라, …
- 상태 공간 모형과 선형 순환
… Jamba(2024년 3월)는 트랜스포머 층과 Mamba 층을 1 : 7 비율로 섞어 쌓고 일부 층에전문가 혼합을 넣어 256k토큰 문맥을 보고했습니다. 2024년 6월 엔비디아 연구진은 같은 데이터(최대 3.5조 …
- 추론 모델과 테스트 시점 계산
… 공개했습니다. 이 논문은 2025년 9월 『네이처』에 동료 심사를 거쳐 실렸습니다. R1의 바탕인 V3는전문가 혼합모델입니다. 테스트 시점 계산. 이제 계산을 학습에 쓸지 답할 때 쓸지 고를 수 있습니다. 답할 때 계산을 …
- 언어 모델의 발전사: RLHF 이후
… 서비스는 별도 허가), 9월의 Mistral 7B는 아파치 2.0으로, 12월의 Mixtral 8x7B는전문가 혼합으로 나왔습니다. '공개 가중치'는 '오픈 소스'와 다릅니다. 가중치는 받을 수 있어도 학습 자료와 학습 …