수학 개념 지도
데이터와 학습(Data and learning)

신경망(Neural network)

퍼셉트론⁠(perceptron)⁠ 같은 단위를 층으로 쌓고 사이에 비선형 함수⁠(function)⁠를 끼운 함수. 숨은 층⁠(hidden layer)⁠이 있으면 XOR처럼 직선 하나로 가를 수 없는 것도 배운다.

y^=σ(v⃗⋅tanh⁡(Wx⃗+b⃗)+c),σ(s)=11+e−s\hat y = \sigma\bigl(\vec v\cdot\tanh(W\vec x + \vec b) + c\bigr), \qquad \sigma(s) = \frac{1}{1+e^{-s}}
먼저 보면 좋은 개념퍼셉트론행렬의 곱함수

퍼셉트론 하나는 평면을 직선 하나로 가를 뿐입니다. 신경망은 이런 단위를 여러 개 나란히 놓아 층을 만들고, 그 출력을 다음 층의 입력으로 씁니다. 아래 신경망에서는 숨은 층의 단위 H = 개가 입력 (x1,x2)(x_1, x_2)를 받아 각자 w⃗j⋅x⃗+bj\vec w_j\cdot\vec x + b_j를 계산하고, 그 값을 tanh(쌍곡탄젠트⁠(hyperbolic tangent)⁠: 0 근처에서는 거의 그대로 두고 큰 양수는 1 가까이, 큰 음수는 −1 가까이로 누르는 S자 함수)로 구부려 −1과 1 사이의 값을 냅니다. 출력 단위는 그 값들을 다시 가중합한 뒤, 지수함수⁠(exponential function)⁠로 만든 시그모이드⁠(sigmoid)⁠ σ(s)=1/(1+e−s)\sigma(s) = 1/(1+e^{-s})로 0과 1 사이의 수를 냅니다. 이 수를 '노랑일 확률⁠(probability)⁠'로 읽습니다.

자료: · 학습시키기 100걸음 새로 시작

배경 색은 신경망이 매긴 확률(파랑 0 … 노랑 1), 흰검은 선은 확률 1/2인 경계, 흐린 점선은 숨은 단위 각자의 직선입니다.
신경망의 모양. 선의 굵기는 가중치⁠(weight)⁠의 크기, 청록은 양수, 분홍은 음수입니다.

지금 손실은 , 정확도는 , 걸음 학습했습니다. H = 0이면 숨은 층 없이 출력 단위 하나만 남아 매끄러운 퍼셉트론(로지스틱 회귀⁠, logistic regression⁠)이 되고, XOR 자료에서는 어떤 직선도 소용없어 정확도가 절반 근처에 머뭅니다. H = 2로 놓고 학습시켜 보세요. 숨은 단위 둘은 각자 직선 하나씩을 긋고, 출력 단위는 '두 직선 사이의 띠'처럼 그 조각들을 조합합니다. '원 안과 밖' 자료에서는 가운데를 둘러싸야 하므로 H가 적어도 3은 되어야 합니다(직선 셋으로 삼각형). H를 늘리면 경계가 더 둥글어집니다.

'새로 시작'은 다른 무작위 가중치에서 출발합니다. H = 2의 XOR에서는 가끔 한쪽 무리를 놓친 채 더 나아지지 않는데, 경사 하강법⁠(gradient descent)⁠이 국소 최솟값⁠(local minimum)⁠이나 거의 평평한 곳에 빠진 것입니다. 단위를 넉넉히 두면 이런 일이 드물어집니다. 가중치는 교차 엔트로피⁠(cross-entropy)⁠ 손실(정답에 매긴 확률의 로그에 −를 붙여 평균⁠(mean)⁠한 값, 엔트로피⁠(entropy)⁠와 같은 꼴)을 줄이도록 경사 하강법의 변형인 Adam으로 고치고, 모든 가중치에 대한 기울기⁠(slope)⁠는 역전파⁠(backpropagation)⁠가 한꺼번에 계산합니다. 학습은 버튼을 누를 때만 하고, 손실이 0.02 아래로 내려가거나 더 줄지 않으면 스스로 멈춥니다.

왜 tanh 같은 비선형 함수가 꼭 필요할까요? 층 하나는 행렬⁠(matrix)⁠ W를 곱하고 벡터⁠(vector)⁠ b를 더하는 일입니다. 구부리는 함수 없이 층을 쌓으면 행렬의 곱⁠(matrix multiplication)⁠은 다시 행렬 하나이므로, 몇 층을 쌓아도 선형변환⁠(linear transformation)⁠ 하나(와 평행이동)와 다를 바가 없습니다. 층 사이에 비선형 함수를 끼워야 쌓는 의미가 생깁니다. 요즘은 음수를 0으로 자르는 ReLU, max⁡(0,s)\max(0, s)와 그 변형들을 널리 씁니다.

숨은 단위를 충분히 많이 두면 숨은 층 하나로도, 경계를 포함한 유계인 범위(예를 들어 테두리까지 포함한 정사각형) 위의 연속인 함수를 그 범위의 모든 점에서 한꺼번에 원하는 만큼 가깝게 흉내 낼 수 있다는 것이 보편 근사 정리입니다. 시그모이드에 대해서는 1989년 미국의 수학자 조지 시벤코의 증명이 잘 알려져 있고, 뒤에 구부리는 함수가 다항식⁠(polynomial)⁠만 아니면 된다는 것까지 밝혀졌습니다. 그 범위 바깥에서의 값에 대해서는 아무것도 보장하지 않습니다. 사인파⁠(sinusoid)⁠를 더해 주기 함수⁠(periodic function)⁠를 짓는 푸리에 급수⁠(Fourier series)⁠처럼, 단순한 '구부러진 조각'을 가중합해 복잡한 함수를 짓는 셈입니다. 다만 이 정리는 그런 가중치가 있다는 것만 말할 뿐, 찾는 방법이나 필요한 단위 수는 말하지 않습니다. 흔히 '신경망은 무엇이든 배울 수 있다'로 읽지만, 이 정리는 학습이 그 가중치를 찾아낸다는 것도, 적은 자료에서 배운 것이 새 자료에 들어맞는다는 것도 말하지 않습니다. 실제로는 층을 여러 겹 쌓은 깊은 신경망(딥러닝⁠, deep learning⁠)이 같은 수의 가중치로 훨씬 많은 것을 표현하는 경우가 많습니다. 가중치가 자료보다 훨씬 많으면 잡음까지 외울 수 있어 과적합⁠(overfitting)⁠을 조심해야 합니다.

이어지는 곳. '신경망'이라는 이름은 1943년 맥컬러와 피츠가 뇌의 신경세포를 켜짐·꺼짐 단위로 본 모형에서 왔지만, 오늘날의 신경망은 뇌를 흉내 낸 것이라기보다 미분⁠(differentiation)⁠할 수 있는 함수를 층층이 이어 붙인 것입니다. 1986년 역전파가 널리 알려지며 여러 층을 학습시킬 수 있게 되었고, 2012년 힌턴의 연구실이 만든 깊은 신경망이 페이페이 리가 연 대규모 이미지 인식 대회(ImageNet)에서 다른 방법들을 큰 차이로 이기면서 딥러닝이 기계 학습⁠(machine learning)⁠의 중심이 되었습니다. 낱말을 수의 벡터로 바꾸는 단어 임베딩⁠(word embedding)⁠은 작은 신경망이 배운 가중치이고, 앞 낱말들로 다음 낱말의 확률을 매기는 n-그램⁠(n-gram)⁠ 언어 모델⁠(language model)⁠을 신경망으로 바꾼 것이 오늘날 언어 모델의 뿌리입니다. 이미지를 다루는 신경망은 3×3 화소 같은 작은 가중치 묶음 하나를 그림 곳곳에 옮겨 가며 되풀이해 씁니다(합성곱 신경망⁠, convolutional neural network⁠). 그래서 고양이 귀가 그림의 어디에 있든 같은 가중치로 알아봅니다. 2017년에 나온 트랜스포머⁠(transformer)⁠는 문장의 낱말 벡터들을 각각 변환한 벡터들 사이의 내적⁠(dot product)⁠으로 각 낱말이 다른 낱말에 얼마나 주목할지를 정하는(어텐션⁠, attention⁠) 신경망이고, 오늘날 대형 언어 모델의 뼈대입니다. 2022년 이후 이 뼈대 위에서 일어난 일, 곧 선호 학습, 전문가 혼합⁠(mixture of experts)⁠, 긴 문맥, 추론 모델은 언어 모델의 발전사에 날짜순으로 정리되어 있습니다.

이 개념이 나오는 긴 글

미분에서 회전까지 · 1편 · 미분 순간의 속도 속도계는 '지금 이 순간'의 속도를 보여 준다. 순간에는 시간이 흐르지 않는데, 무엇을 재는 걸까? 최소제곱과 선형대수 잃어버린 소행성 1801년, 발견 몇 주 만에 태양 뒤로 사라진 세레스. 스물네 살의 가우스는 흩어진 관측값에서 궤도를 되찾았다. 계산 이론 기계가 풀 수 없는 문제 모든 수학 문제를 기계적으로 풀 수 있을까? 러셀의 역설에서 괴델과 튜링까지, 그 질문에 대한 답은 '아니오'였고, 그 증명이 컴퓨터를 낳았다. 계산언어학 말을 세는 기계 문법은 규칙일까, 확률일까? 파니니의 문법에서 촘스키의 위계, 섀넌의 영어 엔트로피, 오늘날의 언어 모델까지. 신경망과 기계 학습 배우는 기계 예를 보여 주면 규칙을 스스로 찾는 기계. 1958년의 퍼셉트론에서 오늘의 심층 신경망까지, 그 밑바닥에는 미분과 연쇄법칙이 있다. 언어 모델 다음 단어를 맞히는 기계 다음 낱말을 짐작하는 일만으로 어디까지 갈 수 있을까? 마르코프의 글자 세기에서 섀넌의 추측 게임, 트랜스포머와 규모의 법칙, 사람의 선호까지. 밑바닥에는 확률의 곱셈 규칙과 로그 하나가 있고, 그 수학은 모델이 왜 그럴듯하게 틀리는지도 말해 준다. 게임과 증명 이기는 쪽이 존재한다 "이 판은 백이 이겼다"는 흑이 어떻게 두든 백에게 답이 있다는 말이다. 체스의 체르멜로 정리, ε–δ, 님의 이진법, 폰 노이만의 최소최대와 쌍대성, 논리의 한계를 재는 게임, 끝나지 않는 게임과 선택공리, 대화로 읽는 증명, 겨루며 배우는 신경망까지. 수학의 참을 두 사람의 게임으로 읽는다.

이 개념 위에 세워진 것

이 개념을 언급하는 페이지

이 페이지가 가리키는 개념