상태 공간 모형과 선형 순환(State space models)
상태 h를 h_t = Āh_{t−1} + B̄u_t로 선형으로 갱신하고 y_t = Ch_t로 읽는 수열 모형. 같은 계산을 되풀이(추론)로도 합성곱(학습)으로도 할 수 있고, 기억의 길이는 Ā의 고유값(eigenvalue)이 정한다. S4(2021)가 긴 수열에서 가능성을 보였고, Mamba(2023)는 갱신을 입력에 따라 바꿔 언어 모델(language model)에 다가갔으며, 지금은 어텐션(attention) 층 몇 개와 섞은 하이브리드가 많이 연구된다.
가장 작은 예부터 봅시다. 수열
정해진 가중치 (0.1, 0.09, 0.081, …)를 입력에 밀어 가며 곱해 더하는 것, 곧 합성곱입니다. 합성곱 신경망(convolutional neural network)이 이미지 위로 필터(filter)를 미는 것과 같은 연산을 시간 축에서, 끝없이 긴 필터로 하는 셈입니다. 이 페이지의 모든 것은 이 예를 벡터(vector)와 행렬(matrix)로 키운 것입니다.
연속 시간에서 온 모형. 제어 공학과 신호 처리에서는 1960년 루돌프 칼만 이래로 계를 상태 공간(state space) 꼴로 적습니다. 입력 u(t)가 상태 벡터 h(t)를 움직이고, 출력은 상태를 읽은 것입니다.
선형 미분방정식(linear differential equation)이므로 해가
A = −1, B = 1인 1차원이면
되풀이와 합성곱(convolution)은 같은 계산이다.
아래 그림은 상태가 복소수(complex number) 하나인 가장 작은 경우입니다(
기억의 길이는 고유값이 정한다.
S4 (2021). 어떤 A를 쓸 것인가에 대한 한 답이 2020년 앨버트 구 등의 HiPPO입니다. 지나온 입력 전체를 다항식(르장드르 다항식, Legendre polynomials)으로 가장 잘 근사했을 때(지나온 시간 전체에 고르게 무게를 둔 제곱오차 기준)의 계수들을 상태가 늘 들고 있도록 A를 고르는 것입니다. 긴 기억을 근사 이론(approximation theory)의 문제로 바꾼 셈입니다. 문제는 계산이었습니다. 이 HiPPO 행렬을 그대로 대각화하면 고유벡터 행렬의 성분이 상태 크기에 대해 지수적으로 커져서 수치적으로 쓸 수 없습니다. 2021년 10월 구, 카란 고엘, 크리스토퍼 레의 S4(ICLR 2022)는 이 행렬을 '정규 행렬(서로 직교(orthogonality)하는 고유벡터로 안정하게 대각화되는 행렬) + 랭크가 낮은 보정'으로 적어 이 문제를 풀고, 핵 K를 빠르게 계산하는 방법을 내놓았습니다. S4는 긴 수열 벤치마크(Long Range Arena)의 모든 과제에서 가장 좋은 결과를 냈고, 논문은 그때까지 모든 방법이 실패하던 길이 16,384의 Path-X 과제를 처음 풀었다고 보고했습니다. 곧이어 A를 복소 대각 행렬(diagonal matrix)로 두어도 거의 같은 성능이 나온다는 것이 알려져(DSS, S4D, 2022) 구현이 훨씬 단순해졌습니다. 그러나 언어 모델링에서는 트랜스포머에 뒤졌습니다.
선택: Mamba (2023). 까닭은 시간 불변성에 있습니다. 핵 K는 입력이 무엇이든 같습니다. '이 토큰은 중요하니 적어 두고, 이 토큰은 군더더기이니 흘려보내라'는 결정을 내용에 따라 내릴 수 없습니다. 어텐션은 가중치(weight)가 쿼리와 키의 내적(dot product), 곧 내용에 달려 있어서 이것을 합니다. 2023년 12월 구와 트리(tree) 다오의 Mamba는 Δ, B, C를 입력의 함수(function)로 만들었습니다. A의 고유값은 음수로 두므로,
Δ를 크게 하면 중요한 값을 빨리 잡지만 뒤따르는 잡음도 그만큼 빨리 적어 넣고, 작게 하면 잡음은 막지만 중요한 값도 거의 적지 못합니다. 고정된 Δ 하나로는 둘을 함께 할 수 없습니다. 이 그림의 입력에서는 Δ를 0.02부터 3까지 어떻게 골라도 고정 Δ의 오차가 약 0.76 밑으로 내려가지 않지만(가장 좋은 Δ ≈ 0.24), 선택적 모형의 오차는 약 0.13입니다.
대가는 계산에 있습니다. 걸음마다
어텐션과의 쌍대성(duality): Mamba-2 (2024). 2024년 다오와 구는
입니다(∘는 칸끼리의 곱). 인과(causation) 어텐션
고정된 상태의 한계. 상태의 크기가 정해져 있다는 것이 장점이자 한계입니다. 상태가 실수 N개이고 각 수를 b비트로 저장하면 상태에는 많아야 Nb비트가 들어갑니다. 어휘가 V개인 무작위 토큰 n개를 그대로 베끼려면
상태를 추적하는 능력에도 한계가 있습니다. 비트열의 1의 개수가 짝수인지 홀수인지(패리티, parity)는
하이브리드. 그래서 최근의 흐름은 어느 한쪽을 고르기보다 섞는 것입니다. 어텐션 층 몇 개가 정확한 찾기와 베끼기를 맡고, 나머지 층은 싼 선형 순환이 맡습니다. AI21의 Jamba(2024년 3월)는 트랜스포머 층과 Mamba 층을 1 : 7 비율로 섞어 쌓고 일부 층에 전문가 혼합(mixture of experts)을 넣어 256k토큰 문맥을 보고했습니다. 2024년 6월 엔비디아 연구진은 같은 데이터(최대 3.5조 토큰)로 80억 매개변수 모델들을 비교했습니다. 순수 Mamba 계열은 많은 과제에서 트랜스포머와 비슷하거나 나았지만 베끼기, 문맥 속 학습, 긴 문맥 추론에서 뒤졌고, Mamba-2 층 43%, 어텐션 층 7%, MLP 층 50%로 섞은 모형은 12개 표준 과제 평균에서 트랜스포머보다 2.65점 높았으며 생성은 최대 8배 빠를 것으로 추정했습니다. 이후 엔비디아 Nemotron-H(2025년 4월, 어텐션 층 대부분을 Mamba 층으로 교체, 추론 최대 3배 빠름 보고), IBM Granite 4.0(2025년 10월, Mamba-2와 어텐션을 9 : 1로 섞고 위치 인코딩 없음, 회사 발표), 알리바바 Qwen3-Next(2025년 9월, Mamba가 아닌 Gated DeltaNet 선형 층과 어텐션을 3 : 1로 섞음)가 나왔습니다. 이 수치들은 대부분 만든 곳이 직접 잰 것이고, 가장 큰 규모에서도 하이브리드가 트랜스포머를 대신할지는 아직 열린 문제입니다.
이어지는 곳. 모형의 뼈대는 선형 미분방정식을 간격 Δ로 이산화한 점화식이고, 행렬 지수와 지수함수가 둘을 잇습니다. 기억이 얼마나 오래가는지는 고유벡터와 대각화가, 고유값이 단위원 안에서 어떻게 돌며 줄어드는지는 극형식과 오일러 공식이 설명하고, 같은 수학이 순환 신경망의 기울기 소실과 마르코프 연쇄(Markov chain)가 처음을 잊는 빠르기에도 나옵니다. 되풀이를 풀어 쓴 합성곱은 합성곱 신경망의 필터를 시간 축으로 옮긴 것이고, 그 빠른 계산은 고속 푸리에 변환에 기댑니다(이산 푸리에 변환). 상태가 과거를 다항식(polynomial) 계수로 요약한다는 HiPPO의 생각은 근사 이론에서, 선택적 모형의 병렬 계산은 분할 정복에서 볼 수 있습니다. Mamba-2의 행렬 꼴은 어텐션과 트랜스포머를 새로 보게 하고, 복소 성분의 회전은 위치 인코딩의 RoPE와 같은 종류의 회전입니다. 고정된 상태가 무엇을 할 수 없는지는 유한 오토마톤과 비둘기집 원리가 알려 주고, 하이브리드 모델이 어디쯤 놓이는지는 언어 모델의 발전사에서 이어집니다.
이 개념이 나오는 긴 글
이 개념을 언급하는 페이지
- 지수함수 eˣ
… + \cdots 는 연속 시간의 선형 규칙을 간격 Δ짜리 한 걸음 규칙으로 바꾸는데, 언어 모델에도 쓰이는상태 공간 모형이 이렇게 만들어집니다.
- 오일러 공식
… θ = 2πk/n(k = 0, 1, …, n − 1)에 놓인 n개의 점은 n제곱하면 1이 되는 수들입니다.상태 공간 모형: 크기가 1보다 작은 복소수 \lambda = e^{-\alpha + i\omega} ( \alpha > …
- 고유벡터와 고유값
… 크기가 1보다 작은지가 같은 역할을 합니다. 입력을 h_t = Ah_{t-1} + Bu_t 로 읽어 가는상태 공간 모형에서는 A의 고유값의 크기가 1에 가까울수록 오래전 입력이 오래 남습니다.
- 대각화와 행렬 거듭제곱
… 그 페이지의 점수이고, 이것이 링크 행렬의 고유값 1에 속한 고유벡터이기 때문입니다. 언어 모델에도 쓰이는상태 공간 모형은 상태를 h_t = \bar A h_{t-1} + \bar B u_t 로 갱신합니다. \bar A 를 …
- 선형 미분방정식
… B u_t , \bar A = e^{\Delta A} 가 됩니다. 이것이 최근 언어 모델에도 쓰이는상태 공간 모형의 뼈대이고, 기억이 얼마나 오래가는지를 A의 고유값이 정합니다. 실수 부분이 음수이고 0에 가까울수록 옛 …
- 푸리에 급수
… 푸리에 급수와 닮았지만, 진동수가 정수배가 아니라 등비수열로 줄어든다는 점이 다릅니다. 또 일부상태 공간 모형은 긴 수열 위로 긴 필터를 미는 합성곱을 고속 푸리에 변환으로 빠르게 계산합니다.
- 비둘기집 원리
… 힘을 가진 정규 표현식으로 적을 수 없습니다. 같은 셈이 언어 모델에도 걸립니다. 상태의 크기가 고정된상태 공간 모형은 상태에 담을 수 있는 비트 수가 정해져 있으므로, 충분히 긴 무작위 토큰열을 그대로 베낄 수 없습니다.
- 유한 오토마톤
… 언어의 부류들을 유한 모노이드의 부류들로 분류하는 이론을 세웠습니다. 입력에 따라 상태를 선형으로 갱신하는상태 공간 모형을 이 눈으로 보면 한계가 드러납니다. 1의 개수의 홀짝(패리티)은 두 상태 오토마톤 하나로 알아볼 수 …
- 점화식
… 벡터와 행렬로 키우고 입력을 더한 h_t = Ah_{t-1} + Bu_t 는 언어 모델에도 쓰이는상태 공간 모형의 뼈대이고, 과거를 얼마나 오래 기억하는지는 A의 고유값이 정합니다.
- 분할 정복
… 앞뒤 반을 따로 계산해 잇기를 되풀이하면 일꾼이 충분할 때 약 \log n 단계에 끝납니다.상태 공간 모형의 하나인 Mamba가 학습 때 이 방법을 씁니다. 점화식과 수학적 귀납법: T(n) = …
- 근사 이론
… 서로 직교하는 다항식들)으로 가장 잘 근사하는 계수를 기억으로 들고 다니게 했고, 이 생각이상태 공간 모형S4의 출발점이 되었습니다. 근사는 맞춰 본 구간 안에서만 믿을 수 있습니다. 그래서 언어 모델이 학습 …
- 동역학계
… Ah_{t-1} + Bu_t 는 제어 공학의 상태 공간 꼴이고, 최근에는 언어 모델의 층으로도 쓰입니다(상태 공간 모형). 궤도들의 전체 모양을 다루는 위상수학은 푸앵카레가 이런 문제를 이해하려고 다듬은 도구이기도 …
- 합성곱 신경망
… B,\; C\bar A^2\bar B,\; \dots) 의 1차원 합성곱입니다. 그래서 S4 같은상태 공간 모형은 학습 때 이 긴 합성곱을 한꺼번에 계산합니다. 역전파로 학습한 합성곱 신경망으로 손글씨를 읽어 이 …
- 순환 신경망과 LSTM
… h_{t-1} + B x_t 의 고유값을 1 안쪽에 조심스럽게 두어 긴 기억과 병렬 학습을 함께 얻으려는상태 공간 모형(S4, Mamba 등)이 다시 연구되고 있습니다. 위 그림의 고유값 문제가 그 설계의 한가운데에 …
- 트랜스포머
… 몇 개만 골라 쓰는 방법은 전문가 혼합에, 어텐션 대신 고정된 크기의 상태를 선형으로 갱신하는 대안은상태 공간 모형에 있습니다.
- 위치 인코딩의 변천
… 따른 것입니다. 긴 문맥을 위치 인코딩이 아닌 다른 길로 다루는 방법으로는 상태를 고정된 크기로 접어 두는상태 공간 모형과, 필요한 부분만 찾아 넣는 검색 증강 생성이 있습니다. 이 기법들이 언제 어느 모델에 들어갔는지는 …
- 언어 모델의 발전사: RLHF 이후
… 함께 학습했다는 구글의 제미나이 1.0과, 어텐션 대신 입력에 따라 바뀌는 선형 순환을 쓰는 Mamba(상태 공간 모형)가 나왔습니다. 2024: 긴 문맥, 실시간 멀티모달, 그리고 o1. 2월 제미나이 1.5 Pro가 …