수학 개념 지도
인물

요슈아 벤지오(Yoshua Bengio)

순환 신경망⁠(recurrent neural network)⁠에서 기울기⁠(slope)⁠가 사라지는 까닭을 밝히고, 낱말을 벡터⁠(vector)⁠로 바꾸어 다음 낱말을 맞히는 신경망⁠(neural network)⁠ 언어 모형과 기계 번역⁠(machine translation)⁠의 어텐션⁠(attention)⁠을 제자들과 내놓은 프랑스 태생의 캐나다 컴퓨터 과학자.

P(wt∣wt−n+1,…,wt−1)=softmax⁡(f(C(wt−n+1),…,C(wt−1)))wtP(w_t \mid w_{t-n+1}, \dots, w_{t-1}) = \operatorname{softmax}\bigl(f(C(w_{t-n+1}), \dots, C(w_{t-1}))\bigr)_{w_t}

요슈아 벤지오는 1964년 프랑스 파리에서 태어나 캐나다 몬트리올에서 자랐습니다. 그가 박사 과정을 밟던 1980년대 말, 역전파⁠(backpropagation)⁠로 여러 층의 신경망을 학습시킬 수 있게 되자 사람들은 같은 방법을 말소리나 글처럼 시간 순서가 있는 자료에 쓰려 했습니다. 앞의 상태를 다음 단계로 넘기는 순환 신경망이 그 도구였는데, 실제로 돌려 보면 몇 걸음 전의 입력에서는 배워도 수십 걸음 전의 입력에서는 배우지 못했습니다. 벤지오는 그 까닭을 수학으로 밝혔고, 뒤에는 낱말을 벡터로 바꾸어 다음 낱말을 맞히는 신경망, 번역할 때 원문의 어디를 볼지 스스로 고르는 어텐션을 제자들과 내놓았습니다. 오늘날의 언어 모델⁠(language model)⁠으로 가는 길에 놓인 돌들입니다.

굵은 막대가 이 사람의 생애이고, 흰검은 점은 페이지 끝 연표에 적은 일들입니다. 가는 막대는 같은 시대를 산 이 위키의 인물들입니다. 나이를 끌어 보세요.

나이 세 ·

그는 맥길 대학에서 컴퓨터 공학과 컴퓨터 과학을 공부해 1991년 박사 학위를 받았습니다. MIT에서 마이클 조던의 박사후 연구원으로, 1992–93년에는 벨 연구소에서 르쿤과 함께 일했습니다. 1993년 몬트리올 대학 교수가 된 그는 연구실을 키워, 이 연구실은 오늘날 많은 대학의 연구자가 함께하는 퀘벡 인공지능⁠(artificial intelligence)⁠ 연구소 밀라(Mila)가 되었습니다.

1994년 파트리스 시마르, 파올로 프라스코니와 함께 쓴 논문은 기울기 소실⁠(vanishing gradient)⁠의 문제를 정확히 적었습니다. 순환 신경망이 TT걸음 전의 입력에서 배우려면, 오차의 기울기가 연쇄 법칙을 따라 TT번 거꾸로 곱해져야 합니다. 매 걸음 곱해지는 양이 대략 0.9라면 50걸음 뒤에는 0.950≈0.0050.9^{50} \approx 0.005로 사라지고, 1.1이라면 1.150≈1171.1^{50} \approx 117로 터집니다(여러 차원이면 곱해지는 것은 야코비 행렬⁠(Jacobian matrix)⁠이고, 크기는 그 고윳값이나 특잇값⁠(singular value)⁠이 정합니다). 논문의 요점은 이것이 우연한 불운이 아니라는 데 있습니다. 신경망이 정보를 잡음에 흔들리지 않게 오래 담아 두려면 상태가 작은 흔들림을 줄여 가는 쪽이어야 하는데, 바로 그 성질이 기울기를 작게 만듭니다. 오래 기억하는 것과 먼 과거에서 배우는 것 사이에 맞바꿈이 있다는 정리입니다. 같은 시기 독일의 제프 호크라이터도 1991년 학위 논문에서 같은 현상을 분석했고, 이 문제를 비켜 가는 구조가 1997년의 LSTM입니다.

2000년 발표하고 2003년 학술지에 실은 「신경망 확률⁠(probability)⁠ 언어 모형」은 다른 오래된 문제를 풀었습니다. 다음 낱말의 확률을 앞의 몇 낱말로 어림하는 n-그램⁠(n-gram)⁠ 모형은 본 적 없는 낱말 조합에 확률을 줄 방법이 없습니다. 논문의 계산으로는 낱말 10만 개짜리 언어에서 연속된 열 낱말의 분포를 표로 적으려면 10000010=1050100000^{10} = 10^{50}개의 칸이 필요합니다. 이것이 차원의 저주⁠(curse of dimensionality)⁠입니다. 벤지오와 동료들은 낱말마다 수십 개의 실수⁠(real number)⁠ 성분으로 된 벡터 C(w)C(w)를 두고, 앞 낱말들의 벡터를 신경망 ff에 넣어 어휘 전체에 대한 확률을 소프트맥스⁠(softmax)⁠로 내게 했습니다(위의 식). 벡터와 신경망은 함께 학습됩니다. 그러면 비슷한 자리에 쓰이는 낱말들이 비슷한 벡터를 갖게 되어, 논문의 예처럼 "고양이가 침실에서 걷고 있다"를 본 모형이 "개가 방에서 뛰고 있다"에도 알맞은 확률을 줄 수 있습니다. 이 낱말 벡터가 단어 임베딩⁠(word embedding)⁠의 출발점입니다.

2014년 그의 연구실에서는 두 가지가 나왔습니다. 이언 굿펠로 등과 쓴 생성적 적대 신경망(GAN)은 가짜를 만드는 신경망과 가짜를 가려내는 신경망을 겨루게 해 그럴듯한 그림을 만들어 내는 방법으로, 뒤의 확산 모델⁠(diffusion model)⁠ 이전에 그림 생성의 중심이었습니다. 드미트리 바다나우, 조경현과 쓴 기계 번역 논문은 원문 전체를 벡터 하나로 눌러 담던 방식의 병목을 풀었습니다. 번역문의 낱말을 하나 낼 때마다 원문의 각 낱말에 점수를 매기고, 그 점수를 소프트맥스로 합이 1인 가중치⁠(weight)⁠로 바꾸어 원문 벡터들의 가중 평균⁠(mean)⁠을 봅니다. 어디를 볼지 스스로 고르는 이 방식이 어텐션이고, 3년 뒤 트랜스포머⁠(transformer)⁠는 순환 구조⁠(cycle type)⁠를 버리고 어텐션만으로 신경망을 짜게 됩니다.

2016년 그는 이언 굿펠로, 에런 쿠르빌과 교과서 『딥러닝⁠(deep learning)⁠』을 펴냈고, 2018년도 튜링상⁠(Turing Award)⁠을 힌턴, 르쿤과 함께 받았습니다. 2020년대 들어 그는 연구의 무게를 인공지능의 안전으로 옮겼습니다. 여러 나라 정부가 의뢰한 국제 AI 안전 보고서의 의장을 맡아 2025년 1월 보고서를 발표했고, 같은 해 비영리 연구 기관 로제로(LawZero)를 세웠습니다. 보고서는 무엇이 알려져 있고 무엇이 불확실한지를 나누어 적는 형식을 택했는데, 위험의 크기에 대해서는 연구자들 사이에 의견이 크게 갈린다는 것도 보고서가 직접 적고 있습니다.

이어지는 곳. 기울기가 곱해지며 사라지거나 터지는 계산은 순환 신경망과 연쇄 법칙에서, 그 곱의 크기를 정하는 양은 야코비 행렬과 특잇값 분해⁠(singular value decomposition)⁠에서 볼 수 있습니다. 낱말 벡터는 단어 임베딩과 코사인 유사도⁠(cosine similarity)⁠로, 다음 낱말의 확률은 n-그램, 소프트맥스, 언어 모델로 이어집니다. 원문의 어디를 볼지 고르는 가중 평균은 어텐션과 트랜스포머의 한가운데에 있고, 낱말을 나누는 단위는 토큰화에서 다룹니다.

관계.

가운데가 이 사람, 둘레가 이어진 인물들입니다. 선의 색은 관계의 종류(초록 스승·제자, 파랑 함께 연구, 보라 편지, 빨강 논쟁, 주황 영향)이고, 다른 인물의 페이지에 적힌 관계도 함께 모았습니다.

  • 함께 연구 얀 르쿤 — 1992–93년 벨 연구소에서 르쿤과 함께 일했고, 1998년 LeNet-5 논문의 공저자가 되었습니다.
  • 함께 연구 제프리 힌턴 — 힌턴이 이끈 캐나다 고등연구원의 신경망 연구 프로그램에 함께했고, 세 사람은 2018년도 튜링상을 함께 받았습니다.

연표.

  • 1991년 맥길 대학에서 컴퓨터 과학 박사 학위를 받고, MIT에서 마이클 조던의 박사후 연구원이 되다
  • 1992년 AT&T 벨 연구소의 박사후 연구원이 되다
  • 1993년 몬트리올 대학 교수가 되어 뒤에 밀라(Mila)가 될 연구실을 꾸리다
  • 1994년 시마르, 프라스코니와 기울기를 따라 긴 의존 관계를 배우기 어려운 까닭을 밝히다
  • 2000년 신경망 확률 언어 모형을 발표하다(학술지판 2003년)
  • 2014년 제자들과 생성적 적대 신경망과 기계 번역의 어텐션을 발표하다
  • 2016년 굿펠로, 쿠르빌과 교과서 『딥러닝』을 펴내다
  • 2019년 힌턴, 르쿤과 함께 2018년도 튜링상 수상자로 발표되다
  • 2025년 국제 AI 안전 보고서를 의장으로서 발표하고, 비영리 연구 기관 로제로(LawZero)를 세우다

이 인물이 나오는 긴 글

계산언어학 말을 세는 기계 문법은 규칙일까, 확률일까? 파니니의 문법에서 촘스키의 위계, 섀넌의 영어 엔트로피, 오늘날의 언어 모델까지. 신경망과 기계 학습 배우는 기계 예를 보여 주면 규칙을 스스로 찾는 기계. 1958년의 퍼셉트론에서 오늘의 심층 신경망까지, 그 밑바닥에는 미분과 연쇄법칙이 있다. 언어 모델 다음 단어를 맞히는 기계 다음 낱말을 짐작하는 일만으로 어디까지 갈 수 있을까? 마르코프의 글자 세기에서 섀넌의 추측 게임, 트랜스포머와 규모의 법칙, 사람의 선호까지. 밑바닥에는 확률의 곱셈 규칙과 로그 하나가 있고, 그 수학은 모델이 왜 그럴듯하게 틀리는지도 말해 준다.

이 인물을 언급하는 페이지

이 페이지가 가리키는 개념