수학 개념 지도
딥러닝과 언어 모델

상태 공간 모형과 선형 순환(State space models)

상태 h를 h_t = Āh_{t−1} + B̄u_t로 선형으로 갱신하고 y_t = Ch_t로 읽는 수열 모형. 같은 계산을 되풀이(추론)로도 합성곱(학습)으로도 할 수 있고, 기억의 길이는 Ā의 고유값⁠(eigenvalue)⁠이 정한다. S4(2021)가 긴 수열에서 가능성을 보였고, Mamba(2023)는 갱신을 입력에 따라 바꿔 언어 모델⁠(language model)⁠에 다가갔으며, 지금은 어텐션⁠(attention)⁠ 층 몇 개와 섞은 하이브리드가 많이 연구된다.

ht=Aˉ ht−1+Bˉ ut,yt=C hth_t = \bar A\, h_{t-1} + \bar B\, u_t, \qquad y_t = C\, h_t

가장 작은 예부터 봅시다. 수열 u0,u1,…u_0, u_1, \dots를 읽으며 ht=0.9 ht−1+0.1 uth_t = 0.9\,h_{t-1} + 0.1\,u_t로 값을 하나 고쳐 가는 규칙입니다(주가 차트의 지수 이동 평균⁠(mean)⁠이 이것입니다). 처음에 한 번만 u0=1u_0 = 1이고 나머지가 0이면, h는 0.1, 0.09, 0.081, …로 매번 0.9배가 됩니다. 이 규칙은 두 가지로 읽을 수 있습니다. 하나는 방금 쓴 대로 이전 값만 들고 한 걸음씩 가는 점화식⁠(recurrence relation)⁠이고, 다른 하나는 이것을 풀어 쓴 가중합입니다.

ht=∑j=0t0.1⋅0.9 j  ut−jh_t = \sum_{j=0}^{t} 0.1\cdot 0.9^{\,j}\; u_{t-j}

정해진 가중치 (0.1, 0.09, 0.081, …)를 입력에 밀어 가며 곱해 더하는 것, 곧 합성곱입니다. 합성곱 신경망⁠(convolutional neural network)⁠이 이미지 위로 필터⁠(filter)⁠를 미는 것과 같은 연산을 시간 축에서, 끝없이 긴 필터로 하는 셈입니다. 이 페이지의 모든 것은 이 예를 벡터⁠(vector)⁠와 행렬⁠(matrix)⁠로 키운 것입니다.

연속 시간에서 온 모형. 제어 공학과 신호 처리에서는 1960년 루돌프 칼만 이래로 계를 상태 공간⁠(state space)⁠ 꼴로 적습니다. 입력 u(t)가 상태 벡터 h(t)를 움직이고, 출력은 상태를 읽은 것입니다.

h′(t)=A h(t)+B u(t),y(t)=C h(t)+D u(t)h'(t) = A\,h(t) + B\,u(t), \qquad y(t) = C\,h(t) + D\,u(t)

선형 미분방정식⁠(linear differential equation)⁠이므로 해가 h(t)=etAh(0)+∫0te(t−s)AB u(s) dsh(t) = e^{tA}h(0) + \int_0^t e^{(t-s)A}B\,u(s)\,ds로 정확히 나옵니다. 입력을 간격 Δ마다 한 번씩 받고 그 사이에는 일정하다고 둡시다(영차 유지⁠, zero-order hold⁠). 그러면 이 해를 한 간격만큼 계산한 것이 다음 점화식이 됩니다(아래 Bˉ\bar B의 닫힌 꼴은 A가 가역일 때 성립합니다).

ht=Aˉ ht−1+Bˉ ut,Aˉ=eΔA,Bˉ=A−1(eΔA−I)Bh_t = \bar A\, h_{t-1} + \bar B\, u_t, \qquad \bar A = e^{\Delta A}, \qquad \bar B = A^{-1}\bigl(e^{\Delta A} - I\bigr)B

A = −1, B = 1인 1차원이면 Aˉ=e−Δ\bar A = e^{-\Delta}, Bˉ=1−e−Δ\bar B = 1 - e^{-\Delta}이고, Δ = ln(1/0.9) ≈ 0.105로 두면 처음의 이동 평균 0.9와 0.1이 그대로 나옵니다. 행렬 지수⁠(matrix exponential)⁠ eΔAe^{\Delta A}는 지수함수⁠(exponential function)⁠를 행렬로 늘린 것입니다. D u는 입력을 출력으로 곧장 넘기는 항이라 아래에서는 생략합니다. 이 점화식에 정규분포⁠(normal distribution)⁠ 잡음을 더한 모형은 상태가 연속값인 은닉 마르코프 모델⁠(hidden Markov model)⁠으로 볼 수 있습니다. 관측으로부터 보이지 않는 상태를 추정하는 칼만 필터⁠(Kalman filter)⁠는 그 모형에서 은닉 마르코프 모델의 전향 알고리즘⁠(forward algorithm)⁠이 하는 일을 합니다.

되풀이와 합성곱⁠(convolution)⁠은 같은 계산이다. h−1=0h_{-1} = 0에서 시작해 점화식을 풀면 yt=∑jCAˉjBˉ ut−jy_t = \sum_{j} C\bar A^{j}\bar B\, u_{t-j}이므로, 출력은 입력과 핵 K=(CBˉ,  CAˉBˉ,  CAˉ2Bˉ,… )K = (C\bar B,\; C\bar A\bar B,\; C\bar A^2\bar B, \dots)의 합성곱입니다. 학습할 때는 수열 전체가 한꺼번에 주어지므로 K를 한 번 구해 합성곱으로 계산합니다. 합성곱은 주파수 쪽에서 보면 곱셈이 되므로, 고속 푸리에 변환⁠(fast Fourier transform)⁠을 쓰면 길이 n에 대해 nlog⁡nn\log n에 비례하는 계산으로 끝납니다(이산 푸리에 변환⁠, discrete Fourier transform⁠). 글을 한 토큰씩 만들 때는 되풀이로 계산합니다. 되풀이는 걸음마다 고정된 크기의 상태만 들고 갑니다. 그래서 지나온 모든 토큰⁠(token)⁠의 키와 값을 쌓아 두어야 하는 트랜스포머⁠(transformer)⁠와 달리 메모리가 길이에 따라 늘지 않습니다.

아래 그림은 상태가 복소수⁠(complex number)⁠ 하나인 가장 작은 경우입니다(ht=λht−1+uth_t = \lambda h_{t-1} + u_t, yt=Re⁡hty_t = \operatorname{Re} h_t). 복소수 λ를 곱하는 것은 고유값이 λ와 그 켤레 λˉ\bar\lambda인 2×2 실수⁠(real number)⁠ 행렬(회전⁠(rotation)⁠과 확대)을 곱하는 것과 같습니다. 왼쪽의 λ를 단위원⁠(unit circle)⁠ 안에서 끌어 보세요. |λ|를 1에 가깝게 하면 출력이 오래 남고, 각도를 키우면 출력이 빠르게 출렁입니다. 어느 경우에도 청록 선과 주황 점은 겹칩니다. 입력:

왼쪽: 복소평면⁠(complex plane)⁠의 λ(노랑)와 그 거듭제곱 1, λ, λ², …(작은 점). 핵은 이 점들의 실수부입니다. 오른쪽: 회색 막대가 입력, 청록 선이 되풀이로 계산한 출력, 주황 점이 합성곱으로 계산한 출력입니다(보기 좋게 세로 배율을 맞춤).

기억의 길이는 고유값이 정한다. Aˉ\bar A를 대각화⁠(diagonalization)⁠할 수 있다면 상태는 서로 섞이지 않는 성분들로 나뉘고, 성분마다 고유값 λ의 거듭제곱 λj\lambda^j로 과거를 잊습니다(고유벡터⁠, eigenvector⁠). 연속 시간의 고유값 a=−α+iωa = -\alpha + i\omega는 λ=eΔa=e−αΔ eiωΔ\lambda = e^{\Delta a} = e^{-\alpha\Delta}\,e^{i\omega\Delta}가 되므로(오일러 공식⁠, Euler's formula⁠), 복소평면의 왼쪽 반평면은 단위원 안으로 옮겨집니다. 크기 ∣λ∣<1|\lambda| \lt 1이면 안정하고, 1에 가까울수록 오래 기억하며, 각도는 그 성분이 매 걸음 도는 양, 곧 그 성분이 귀 기울이는 진동수입니다(극형식⁠, polar form⁠). 1,000걸음 전의 입력이 1/100 이상 남으려면 ∣λ∣1000≥0.01|\lambda|^{1000} \ge 0.01, 곧 ∣λ∣≥0.011/1000≈0.9954|\lambda| \ge 0.01^{1/1000} \approx 0.9954여야 합니다. 순환 신경망⁠(recurrent neural network)⁠의 기울기 소실⁠(vanishing gradient)⁠과 같은 수학이지만, 여기서는 갱신이 선형이라 고유값을 학습이 우연히 만들어 내기를 기다리지 않고 직접 정하거나 범위를 묶어 둘 수 있습니다. 매 걸음 각도 ωΔ만큼 도는 복소 성분은 위치 인코딩⁠(positional encoding)⁠의 RoPE가 쿼리⁠(query)⁠와 키를 위치마다 돌리는 것과 같은 종류의 회전입니다. 다만 여기서는 도는 동안 크기도 줄어듭니다.

S4 (2021). 어떤 A를 쓸 것인가에 대한 한 답이 2020년 앨버트 구 등의 HiPPO입니다. 지나온 입력 전체를 다항식(르장드르 다항식⁠, Legendre polynomials⁠)으로 가장 잘 근사했을 때(지나온 시간 전체에 고르게 무게를 둔 제곱오차 기준)의 계수들을 상태가 늘 들고 있도록 A를 고르는 것입니다. 긴 기억을 근사 이론⁠(approximation theory)⁠의 문제로 바꾼 셈입니다. 문제는 계산이었습니다. 이 HiPPO 행렬을 그대로 대각화하면 고유벡터 행렬의 성분이 상태 크기에 대해 지수적으로 커져서 수치적으로 쓸 수 없습니다. 2021년 10월 구, 카란 고엘, 크리스토퍼 레의 S4(ICLR 2022)는 이 행렬을 '정규 행렬(서로 직교⁠(orthogonality)⁠하는 고유벡터로 안정하게 대각화되는 행렬) + 랭크가 낮은 보정'으로 적어 이 문제를 풀고, 핵 K를 빠르게 계산하는 방법을 내놓았습니다. S4는 긴 수열 벤치마크(Long Range Arena)의 모든 과제에서 가장 좋은 결과를 냈고, 논문은 그때까지 모든 방법이 실패하던 길이 16,384의 Path-X 과제를 처음 풀었다고 보고했습니다. 곧이어 A를 복소 대각 행렬⁠(diagonal matrix)⁠로 두어도 거의 같은 성능이 나온다는 것이 알려져(DSS, S4D, 2022) 구현이 훨씬 단순해졌습니다. 그러나 언어 모델링에서는 트랜스포머에 뒤졌습니다.

선택: Mamba (2023). 까닭은 시간 불변성에 있습니다. 핵 K는 입력이 무엇이든 같습니다. '이 토큰은 중요하니 적어 두고, 이 토큰은 군더더기이니 흘려보내라'는 결정을 내용에 따라 내릴 수 없습니다. 어텐션은 가중치⁠(weight)⁠가 쿼리와 키의 내적⁠(dot product)⁠, 곧 내용에 달려 있어서 이것을 합니다. 2023년 12월 구와 트리⁠(tree)⁠ 다오의 Mamba는 Δ, B, C를 입력의 함수⁠(function)⁠로 만들었습니다. A의 고유값은 음수로 두므로, Δt\Delta_t가 크면 Aˉt=eΔtA≈0\bar A_t = e^{\Delta_t A} \approx 0이 되어 옛 상태를 지우고 지금 입력을 적고, Δt\Delta_t가 작으면 Aˉt≈I\bar A_t \approx I가 되어 입력을 흘려보내고 상태를 지킵니다. LSTM의 게이트(순환 신경망)를 선형 점화식 안에 넣은 모양이고, Mamba 논문도 상태가 1차원이고 A = −1, B = 1인 경우가 게이트 달린 순환 ht=(1−gt)ht−1+gtuth_t = (1 - g_t)h_{t-1} + g_t u_t와 같음을 보였습니다. 아래는 1차원 상태(A = −1, B = 1)로 흉내 낸 장난감입니다. 32개 토큰 가운데 노란 두 개만 중요하고 나머지는 잡음이며, 할 일은 가장 최근의 중요한 값을 들고 있는 것(회색 점선)입니다. 파란 선은 모든 토큰에 같은 Δ = 를 쓰는 시간 불변 모형이고, 청록 선은 중요한 토큰에서 Δ = 4, 잡음에서 Δ = 0.02를 쓰는 선택적 모형입니다. 실제 Mamba에서는 이 Δ를 입력에서 계산하는 규칙을 학습하지만, 여기서는 손으로 정했습니다.

막대 = 입력 토큰(노랑이 중요한 토큰), 회색 점선 = 들고 있어야 할 값, 파랑 = 고정된 Δ, 청록 = 입력에 따라 바뀌는 Δ. 막대에 올리면 그 걸음의 값이 나옵니다.

Δ를 크게 하면 중요한 값을 빨리 잡지만 뒤따르는 잡음도 그만큼 빨리 적어 넣고, 작게 하면 잡음은 막지만 중요한 값도 거의 적지 못합니다. 고정된 Δ 하나로는 둘을 함께 할 수 없습니다. 이 그림의 입력에서는 Δ를 0.02부터 3까지 어떻게 골라도 고정 Δ의 오차가 약 0.76 밑으로 내려가지 않지만(가장 좋은 Δ ≈ 0.24), 선택적 모형의 오차는 약 0.13입니다.

대가는 계산에 있습니다. 걸음마다 Aˉt\bar A_t가 다르니 핵이 하나로 정해지지 않고, 합성곱으로 한꺼번에 계산하는 길이 막힙니다. 그래도 갱신은 여전히 선형입니다. 한 걸음을 쌍 (a, b), 곧 '곱하고 더하기' h↦ah+bh \mapsto ah + b로 보면 두 걸음을 합치는 연산 (a2,b2)∘(a1,b1)=(a2a1,  a2b1+b2)(a_2, b_2)\circ(a_1, b_1) = (a_2a_1,\; a_2b_1 + b_2)가 결합법칙⁠(associativity)⁠을 만족하므로, 수열을 반씩 나눠 합치는 병렬 스캔⁠(parallel scan)⁠으로, 프로세서가 충분하면 길이 n을 약 log⁡2n\log_2 n단계에 계산할 수 있습니다(분할 정복⁠, divide and conquer⁠). 결합법칙이 있어야 어느 이웃끼리 먼저 합쳐도 답이 같기 때문입니다. Mamba는 여기에 상태를 GPU의 빠른 메모리 안에서만 펼치는 구현을 더했습니다. 논문은 트랜스포머보다 생성 처리량이 5배 높고, 30억 매개변수⁠(parameter)⁠ Mamba가 같은 크기의 트랜스포머보다 낫고 두 배 크기의 트랜스포머와 비슷했다고 보고했습니다(논문 자체의 평가입니다).

어텐션과의 쌍대성⁠(duality)⁠: Mamba-2 (2024). 2024년 다오와 구는 Aˉt\bar A_t를 스칼라 곱 atIa_t I로 제한하면 모형 전체를 행렬 하나로 적을 수 있음을 보였습니다. 점화식을 풀면

yi=∑j≤i(CiTBj) (aiai−1⋯aj+1) uj,y=(L∘CBT) u,Lij={ai⋯aj+1j≤i0j>iy_i = \sum_{j \le i} \bigl(C_i^{\mathsf T} B_j\bigr)\, \bigl(a_i a_{i-1}\cdots a_{j+1}\bigr)\, u_j, \qquad y = \bigl(L \circ C B^{\mathsf T}\bigr)\, u, \quad L_{ij} = \begin{cases} a_i\cdots a_{j+1} & j \le i \\ 0 & j \gt i \end{cases}

입니다(∘는 칸끼리의 곱). 인과⁠(causation)⁠ 어텐션 softmax⁡(QKT+마스크)V\operatorname{softmax}(QK^{\mathsf T} + \text{마스크})V와 나란히 놓으면 C가 쿼리, B가 키, u가 값 자리에 있고, 소프트맥스⁠(softmax)⁠ 대신 곱해진 감쇠 마스크 L이 있습니다. 소프트맥스 없는 '선형 어텐션⁠(linear attention)⁠'에 감쇠를 붙인 것입니다. 이 쌍대성 덕분에 짧은 구간 안에서는 GPU가 잘하는 행렬 곱으로, 구간 사이에서는 되풀이로 계산할 수 있고, 논문은 Mamba의 선택적 스캔보다 2–8배 빠르다고 보고했습니다. RetNet, GLA, DeltaNet 같은 선형 어텐션 계열도 상태가 행렬이고 걸음마다 선형으로 갱신되는 점화식 St=AtSt−1+ktvtTS_t = A_t S_{t-1} + k_t v_t^{\mathsf T}로 쓸 수 있습니다(kt,vtk_t, v_t는 그 걸음의 키와 값, AtA_t는 모형마다 다른 감쇠나 수정). 그래서 이제 이들은 한 집안으로 연구됩니다.

고정된 상태의 한계. 상태의 크기가 정해져 있다는 것이 장점이자 한계입니다. 상태가 실수 N개이고 각 수를 b비트로 저장하면 상태에는 많아야 Nb비트가 들어갑니다. 어휘가 V개인 무작위 토큰 n개를 그대로 베끼려면 nlog⁡2Vn\log_2 V비트가 필요합니다. nlog⁡2V>Nbn\log_2 V \gt Nb가 되면 가능한 입력(VnV^n가지)이 가능한 상태(2Nb2^{Nb}가지)보다 많습니다. 그러면 비둘기집 원리⁠(pigeonhole principle)⁠에 따라 서로 다른 두 입력이 같은 상태에 이르므로, 모든 입력을 옳게 베낄 수는 없습니다(평균적으로 얼마나 틀리는지는 엔트로피⁠(entropy)⁠로 셉니다). 2024년 사미 옐라시 등은 이것을 정리로 다듬었습니다. 2층 트랜스포머는 모형의 차원에 비해 지수적으로 긴 무작위 문자열도 높은 확률⁠(probability)⁠로 베낄 수 있지만, 상태 크기가 고정된 모형은 그럴 수 없다는 것입니다. 실제 언어 모델에서도 문맥 속 정보를 베끼거나 찾는 과제에서 트랜스포머가 크게 앞섰다고 보고했습니다.

상태를 추적하는 능력에도 한계가 있습니다. 비트열의 1의 개수가 짝수인지 홀수인지(패리티⁠, parity⁠)는 ht=(−1)ut ht−1h_t = (-1)^{u_t}\, h_{t-1}이라는 두 상태 유한 오토마톤⁠(finite automaton)⁠으로 풀리는데, 이 갱신은 고유값 −1을 요구합니다. Mamba처럼 A가 음의 실수이면 Aˉ=eΔA\bar A = e^{\Delta A}의 고유값은 늘 0과 1 사이라 부호를 뒤집을 수 없습니다. 2024년 리카르도 그라치 등은 고유값이 모두 양수인 유한 정밀도⁠(precision)⁠ 선형 순환망이 패리티를 풀 수 없음을 증명하고, 고유값을 [−1, 1]로 넓히면 풀린다는 것을 보였습니다. 같은 해 윌리엄 메릴 등은 이런 모형이 트랜스포머와 같은 복잡도 한계 안에 있다고 논증했습니다. 그 한계는 TC⁰, 곧 깊이가 입력 길이와 상관없이 일정한 다수결 회로로 풀 수 있는 문제들의 부류입니다. 그래서 이런 모형은 다섯 원소⁠(element)⁠의 치환을 차례로 합성해 결과를 추적하는 것(군의 곱 추적) 같은 일반적인 상태 추적⁠(state tracking)⁠을 할 수 없습니다. 다만 이것은 TC⁰가 더 큰 부류 NC¹과 다르다는, 널리 믿어지지만 증명되지 않은 가정 아래에서의 결론입니다. 2026년 3월의 Mamba-3(라호티 등, ICLR 2026)는 복소수 상태 갱신을 도입했습니다. 논문은 이것이 B와 C에 입력에 따라 달라지는 RoPE를 적용하는 것과 같음을 보였고, Mamba-2도, 보통의 RoPE를 붙인 변형도 풀지 못한 패리티 같은 과제를 풀었다고 보고했습니다. 고유값을 단위원 위에서 돌리는 것, 곧 회전이 여기서 다시 나옵니다.

하이브리드. 그래서 최근의 흐름은 어느 한쪽을 고르기보다 섞는 것입니다. 어텐션 층 몇 개가 정확한 찾기와 베끼기를 맡고, 나머지 층은 싼 선형 순환이 맡습니다. AI21의 Jamba(2024년 3월)는 트랜스포머 층과 Mamba 층을 1 : 7 비율로 섞어 쌓고 일부 층에 전문가 혼합⁠(mixture of experts)⁠을 넣어 256k토큰 문맥을 보고했습니다. 2024년 6월 엔비디아 연구진은 같은 데이터(최대 3.5조 토큰)로 80억 매개변수 모델들을 비교했습니다. 순수 Mamba 계열은 많은 과제에서 트랜스포머와 비슷하거나 나았지만 베끼기, 문맥 속 학습, 긴 문맥 추론에서 뒤졌고, Mamba-2 층 43%, 어텐션 층 7%, MLP 층 50%로 섞은 모형은 12개 표준 과제 평균에서 트랜스포머보다 2.65점 높았으며 생성은 최대 8배 빠를 것으로 추정했습니다. 이후 엔비디아 Nemotron-H(2025년 4월, 어텐션 층 대부분을 Mamba 층으로 교체, 추론 최대 3배 빠름 보고), IBM Granite 4.0(2025년 10월, Mamba-2와 어텐션을 9 : 1로 섞고 위치 인코딩 없음, 회사 발표), 알리바바 Qwen3-Next(2025년 9월, Mamba가 아닌 Gated DeltaNet 선형 층과 어텐션을 3 : 1로 섞음)가 나왔습니다. 이 수치들은 대부분 만든 곳이 직접 잰 것이고, 가장 큰 규모에서도 하이브리드가 트랜스포머를 대신할지는 아직 열린 문제입니다.

이어지는 곳. 모형의 뼈대는 선형 미분방정식을 간격 Δ로 이산화한 점화식이고, 행렬 지수와 지수함수가 둘을 잇습니다. 기억이 얼마나 오래가는지는 고유벡터와 대각화가, 고유값이 단위원 안에서 어떻게 돌며 줄어드는지는 극형식과 오일러 공식이 설명하고, 같은 수학이 순환 신경망의 기울기 소실과 마르코프 연쇄⁠(Markov chain)⁠가 처음을 잊는 빠르기에도 나옵니다. 되풀이를 풀어 쓴 합성곱은 합성곱 신경망의 필터를 시간 축으로 옮긴 것이고, 그 빠른 계산은 고속 푸리에 변환에 기댑니다(이산 푸리에 변환). 상태가 과거를 다항식⁠(polynomial)⁠ 계수로 요약한다는 HiPPO의 생각은 근사 이론에서, 선택적 모형의 병렬 계산은 분할 정복에서 볼 수 있습니다. Mamba-2의 행렬 꼴은 어텐션과 트랜스포머를 새로 보게 하고, 복소 성분의 회전은 위치 인코딩의 RoPE와 같은 종류의 회전입니다. 고정된 상태가 무엇을 할 수 없는지는 유한 오토마톤과 비둘기집 원리가 알려 주고, 하이브리드 모델이 어디쯤 놓이는지는 언어 모델의 발전사에서 이어집니다.

이 개념이 나오는 긴 글

언어 모델 다음 단어를 맞히는 기계 다음 낱말을 짐작하는 일만으로 어디까지 갈 수 있을까? 마르코프의 글자 세기에서 섀넌의 추측 게임, 트랜스포머와 규모의 법칙, 사람의 선호까지. 밑바닥에는 확률의 곱셈 규칙과 로그 하나가 있고, 그 수학은 모델이 왜 그럴듯하게 틀리는지도 말해 준다.

이 개념을 언급하는 페이지

이 페이지가 가리키는 개념