요슈아 벤지오(Yoshua Bengio)
순환 신경망(recurrent neural network)에서 기울기(slope)가 사라지는 까닭을 밝히고, 낱말을 벡터(vector)로 바꾸어 다음 낱말을 맞히는 신경망(neural network) 언어 모형과 기계 번역(machine translation)의 어텐션(attention)을 제자들과 내놓은 프랑스 태생의 캐나다 컴퓨터 과학자.
요슈아 벤지오는 1964년 프랑스 파리에서 태어나 캐나다 몬트리올에서 자랐습니다. 그가 박사 과정을 밟던 1980년대 말, 역전파(backpropagation)로 여러 층의 신경망을 학습시킬 수 있게 되자 사람들은 같은 방법을 말소리나 글처럼 시간 순서가 있는 자료에 쓰려 했습니다. 앞의 상태를 다음 단계로 넘기는 순환 신경망이 그 도구였는데, 실제로 돌려 보면 몇 걸음 전의 입력에서는 배워도 수십 걸음 전의 입력에서는 배우지 못했습니다. 벤지오는 그 까닭을 수학으로 밝혔고, 뒤에는 낱말을 벡터로 바꾸어 다음 낱말을 맞히는 신경망, 번역할 때 원문의 어디를 볼지 스스로 고르는 어텐션을 제자들과 내놓았습니다. 오늘날의 언어 모델(language model)으로 가는 길에 놓인 돌들입니다.
나이
그는 맥길 대학에서 컴퓨터 공학과 컴퓨터 과학을 공부해 1991년 박사 학위를 받았습니다. MIT에서 마이클 조던의 박사후 연구원으로, 1992–93년에는 벨 연구소에서 르쿤과 함께 일했습니다. 1993년 몬트리올 대학 교수가 된 그는 연구실을 키워, 이 연구실은 오늘날 많은 대학의 연구자가 함께하는 퀘벡 인공지능(artificial intelligence) 연구소 밀라(Mila)가 되었습니다.
1994년 파트리스 시마르, 파올로 프라스코니와 함께 쓴 논문은 기울기 소실(vanishing gradient)의 문제를 정확히 적었습니다. 순환 신경망이
2000년 발표하고 2003년 학술지에 실은 「신경망 확률(probability) 언어 모형」은 다른 오래된 문제를 풀었습니다. 다음 낱말의 확률을 앞의 몇 낱말로 어림하는 n-그램(n-gram) 모형은 본 적 없는 낱말 조합에 확률을 줄 방법이 없습니다. 논문의 계산으로는 낱말 10만 개짜리 언어에서 연속된 열 낱말의 분포를 표로 적으려면
2014년 그의 연구실에서는 두 가지가 나왔습니다. 이언 굿펠로 등과 쓴 생성적 적대 신경망(GAN)은 가짜를 만드는 신경망과 가짜를 가려내는 신경망을 겨루게 해 그럴듯한 그림을 만들어 내는 방법으로, 뒤의 확산 모델(diffusion model) 이전에 그림 생성의 중심이었습니다. 드미트리 바다나우, 조경현과 쓴 기계 번역 논문은 원문 전체를 벡터 하나로 눌러 담던 방식의 병목을 풀었습니다. 번역문의 낱말을 하나 낼 때마다 원문의 각 낱말에 점수를 매기고, 그 점수를 소프트맥스로 합이 1인 가중치(weight)로 바꾸어 원문 벡터들의 가중 평균(mean)을 봅니다. 어디를 볼지 스스로 고르는 이 방식이 어텐션이고, 3년 뒤 트랜스포머(transformer)는 순환 구조(cycle type)를 버리고 어텐션만으로 신경망을 짜게 됩니다.
2016년 그는 이언 굿펠로, 에런 쿠르빌과 교과서 『딥러닝(deep learning)』을 펴냈고, 2018년도 튜링상(Turing Award)을 힌턴, 르쿤과 함께 받았습니다. 2020년대 들어 그는 연구의 무게를 인공지능의 안전으로 옮겼습니다. 여러 나라 정부가 의뢰한 국제 AI 안전 보고서의 의장을 맡아 2025년 1월 보고서를 발표했고, 같은 해 비영리 연구 기관 로제로(LawZero)를 세웠습니다. 보고서는 무엇이 알려져 있고 무엇이 불확실한지를 나누어 적는 형식을 택했는데, 위험의 크기에 대해서는 연구자들 사이에 의견이 크게 갈린다는 것도 보고서가 직접 적고 있습니다.
이어지는 곳. 기울기가 곱해지며 사라지거나 터지는 계산은 순환 신경망과 연쇄 법칙에서, 그 곱의 크기를 정하는 양은 야코비 행렬과 특잇값 분해(singular value decomposition)에서 볼 수 있습니다. 낱말 벡터는 단어 임베딩과 코사인 유사도(cosine similarity)로, 다음 낱말의 확률은 n-그램, 소프트맥스, 언어 모델로 이어집니다. 원문의 어디를 볼지 고르는 가중 평균은 어텐션과 트랜스포머의 한가운데에 있고, 낱말을 나누는 단위는 토큰화에서 다룹니다.
관계.
- 함께 연구 얀 르쿤 — 1992–93년 벨 연구소에서 르쿤과 함께 일했고, 1998년 LeNet-5 논문의 공저자가 되었습니다.
- 함께 연구 제프리 힌턴 — 힌턴이 이끈 캐나다 고등연구원의 신경망 연구 프로그램에 함께했고, 세 사람은 2018년도 튜링상을 함께 받았습니다.
연표.
- 1991년 맥길 대학에서 컴퓨터 과학 박사 학위를 받고, MIT에서 마이클 조던의 박사후 연구원이 되다
- 1992년 AT&T 벨 연구소의 박사후 연구원이 되다
- 1993년 몬트리올 대학 교수가 되어 뒤에 밀라(Mila)가 될 연구실을 꾸리다
- 1994년 시마르, 프라스코니와 기울기를 따라 긴 의존 관계를 배우기 어려운 까닭을 밝히다
- 2000년 신경망 확률 언어 모형을 발표하다(학술지판 2003년)
- 2014년 제자들과 생성적 적대 신경망과 기계 번역의 어텐션을 발표하다
- 2016년 굿펠로, 쿠르빌과 교과서 『딥러닝』을 펴내다
- 2019년 힌턴, 르쿤과 함께 2018년도 튜링상 수상자로 발표되다
- 2025년 국제 AI 안전 보고서를 의장으로서 발표하고, 비영리 연구 기관 로제로(LawZero)를 세우다
이 인물이 나오는 긴 글
이 인물을 언급하는 페이지
- 교차 검증과 일반화
… 그림의 표준오차 막대도 어림일 뿐입니다. 조각들이 자료를 나눠 쓰므로 서로 독립이 아니고, 2004년벤지오와 그랑발레는 k겹 교차 검증 추정값의 분산을 편향 없이 추정하는 방법은 일반적으로 없다는 것을 …
- 인공지능
… 트리 탐색⟧, 강화 학습을 엮어 이세돌 9단을 4 대 1로 이겼습니다. 2018년도 튜링상은 힌턴, 르쿤,요슈아 벤지오에게 돌아갔습니다. 트랜스포머와 대형 언어 모델(2017년–). 2017년 구글 연구자들은 순환 구조 없이 …
- 순환 신경망과 LSTM
… 가중치를 크게 망가뜨립니다. 1991년 제프 호흐라이터의 디플롬 논문(독일 대학의 졸업 논문)과 1994년요슈아 벤지오와 동료들의 논문이 이 문제를 분석했습니다. 대칭이 아닌 W는 고유값이 복소수일 수 있는데, 이때도 W^k …
- 어텐션
… 온 과정은 위치 인코딩에 따로 모아 두었습니다. 어텐션은 2014년 드미트리 바흐다나우, 조경현,요슈아 벤지오가 기계 번역에 도입했습니다. 그전의 순환 신경망 번역기는 원문 전체를 고정된 길이의 벡터 하나에 눌러 …
- 언어 모델과 다음 토큰 예측
… 안 되는 까닭입니다(과적합). 비슷한 낱말끼리 통계를 나눠 쓰게 한 신경망 언어 모델(2003년요슈아 벤지오등)과 단어 임베딩이 이 희소성 문제를 누그러뜨렸습니다. 예측은 곧 압축입니다. 다음 토큰에 확률 q를 …