제프리 힌턴(Geoffrey Hinton)
통계(statistics) 물리학의 볼츠만 분포(Boltzmann distribution)로 배우는 신경망(neural network)인 볼츠만 머신(Boltzmann machine)을 만들고, 역전파(backpropagation)가 숨은 층(hidden layer)에 쓸모 있는 표현을 배우게 한다는 것을 보였으며, 2012년 알렉스넷으로 딥러닝(deep learning)의 시대를 연 영국 태생의 캐나다 컴퓨터 과학자.
제프리 힌턴은 1947년 영국 런던에서 태어났습니다. 논리학자 조지 불이 그의 고조할아버지입니다. 그가 대학을 다닌 1960년대 말, 뇌를 흉내 낸 학습 기계는 인기를 잃고 있었습니다. 로젠블랫의 퍼셉트론(perceptron)은 학습하는 층이 하나뿐이라 곧은 경계로만 가를 수 있었고, 1969년 민스키와 패퍼트는 그 한계를 정리로 증명했습니다. 층을 여러 개 쌓으면 된다는 것은 알려져 있었지만, 입력도 출력도 아닌 가운데 층, 곧 숨은 층의 연결을 무엇을 기준으로 고쳐야 하는지에 대해서는 널리 받아들여진 방법이 없었습니다. 힌턴은 40년 넘게 이 물음을 붙들었고, 그의 답들이 오늘날의 신경망과 딥러닝의 바탕이 되었습니다.
나이
그는 케임브리지 킹스 칼리지에서 실험심리학을 공부해 1970년 졸업하고, 1978년 에든버러 대학에서 크리스토퍼 롱깃히긴스의 지도로 인공지능(artificial intelligence) 박사 학위를 받았습니다. 당시 인공지능의 주류는 지식을 기호와 규칙으로 적는 쪽이었고, 그는 지식이 수많은 연결의 세기에 흩어져 담긴다는 '분산 표현(distributed representation)'의 편에 섰습니다. 캘리포니아 대학 샌디에이고에서 데이비드 럼멜하트 등과 함께한 병렬 분산(variance) 처리(PDP) 연구 모임이 이 생각의 중심이었고, 1982년 카네기 멜런 대학으로 옮긴 뒤에도 연구는 이어졌습니다.
1983–85년 그는 테런스 세즈노스키, 데이비드 애클리와 함께 볼츠만 머신을 만들었습니다. 켜짐(1)과 꺼짐(0)만 있는 단위들이 대칭인 연결
볼츠만 머신은 원리가 아름다웠지만 모형이 스스로 도는 단계가 너무 느렸습니다. 더 빠른 답은 역전파였습니다. 출력의 오차를 연쇄 법칙으로 한 층씩 거꾸로 전해 모든 연결의 기울기(slope)를 한 번에 얻는 이 방법은 1970년 세포 린나인마의 역방향 자동 미분(automatic differentiation), 1974년 폴 워보스의 박사 논문 등 앞선 선례가 있습니다. 1986년 럼멜하트, 힌턴, 로널드 윌리엄스가 『네이처』에 실은 논문의 공헌은 이 방법을 처음 만든 데 있지 않고, 숨은 층이 누구도 가르쳐 주지 않은 쓸모 있는 표현을 스스로 배운다는 것을 보인 데 있습니다. 논문의 한 예는 영국인 가족과 이탈리아인 가족의 가계도 두 개였습니다. '누구의 무엇은 누구인가'라는 사실 104개 가운데 100개로 학습시키자, 숨은 단위들이 국적, 세대, 가계도의 어느 갈래인지 같은 특징을 나누어 맡게 되었고, 보지 않은 나머지 네 문제도 대부분 맞혔습니다. 사람은 이 특징들을 알려 준 적이 없습니다.
1987년 토론토 대학으로 옮긴 그는 신경망이 다시 인기를 잃은 1990년대와 2000년대 초에도 연구를 이었습니다. 1991년 로버트 제이컵스, 마이클 조던, 스티븐 놀런과 함께 낸 논문은 입력마다 여러 작은 망 가운데 누구에게 맡길지를 게이트 망이 정하는 '전문가 혼합(mixture of experts)'을 내놓았는데, 이 생각은 30년 뒤 큰 언어 모델(language model)에서 전문가 혼합 구조로 되살아났습니다. 1998년부터 3년 동안은 런던에 개츠비 계산 신경과학 연구소를 세워 이끌었습니다. 2004년 무렵 캐나다 고등연구원(CIFAR)의 지원으로 신경망 연구 프로그램을 꾸려 르쿤, 벤지오 등과 함께했습니다. 2006년 그는 제한된 볼츠만 머신을 한 층씩 쌓아 미리 학습시킨 뒤 전체를 역전파로 다듬는 심층 믿음망을 발표했고, 깊은 신경망도 학습시킬 수 있다는 이 결과가 '딥러닝'이라는 말이 퍼지는 계기가 되었습니다. 그 무렵 그의 학생들은 이 방법을 음성 인식에 적용해 오랜 방법인 은닉 마르코프 모델(hidden Markov model)과 가우스 혼합(Gaussian mixture)의 조합을 넘어섰습니다.
전환점은 2012년에 왔습니다. 제자 알렉스 크리젭스키, 일리야 수츠케버와 만든 합성곱 신경망(convolutional neural network) 알렉스넷이 페이페이 리 연구진이 만든 이미지넷 대회에서 1,000가지 범주(category)의 사진을 분류해, 다섯 번 추측 안에 정답이 없는 비율(상위 5 오류율, top-5 error rate)을 15.3%로 낮추었습니다. 2위는 26.2%였습니다. 새 이론이 있었던 것은 아닙니다. 그래픽 처리 장치(GPU) 두 개로 많은 계산을 돌리고, 학습 중에 뒤쪽 층의 숨은 단위를 절반씩 무작위로 꺼 두어 단위들이 서로에게 기대지 않게 하는 드롭아웃(dropout)으로 과적합(overfitting)을 줄였으며, 기울기가 잘 사라지지 않는 활성화 함수(ReLU)를 쓴 것이 요점이었습니다. 그 뒤 몇 해 사이에 시각, 음성, 번역의 거의 모든 분야가 깊은 신경망으로 옮겨 갔습니다. 2013년 그는 구글에 합류했습니다.
그 밖에도 고차원 자료를 2차원 그림으로 펼쳐 보는 t-SNE(2008, 로런스 판데르마턴과 함께), 큰 모형의 출력 확률을 작은 모형이 흉내 내게 하는 지식 증류(2015) 같은 그의 방법들이 널리 쓰입니다. 그는 2018년도 튜링상(Turing Award)을 벤지오, 르쿤과 함께 받았고, 2024년 존 홉필드와 함께 노벨 물리학상을 받았습니다. 2023년 그는 구글을 떠나며, 인공지능이 가져올 수 있는 위험에 대해 회사에 매이지 않고 말하기 위해서라고 밝혔습니다. 이 위험의 크기와 시기에 대해서는 그와 같은 튜링상 수상자인 르쿤처럼 다르게 보는 연구자도 많고, 과학계의 합의된 답은 아직 없습니다.
이어지는 곳. 숨은 층을 학습시키는 계산은 역전파와 연쇄 법칙에서 손으로 따라가 볼 수 있고, 그 계산을 컴퓨터가 기계적으로 하는 방법이 자동 미분입니다. 볼츠만 머신의 확률 분포는 최대 엔트로피와 KL 발산에, 층층이 쌓아 자료를 압축하는 생각은 오토인코더(autoencoder)에 이어집니다. 알렉스넷의 뼈대는 합성곱 신경망이고, 그 학습은 확률적 경사 하강법(stochastic gradient descent)으로 합니다. 신경망 연구의 앞 세대는 로젠블랫과 퍼셉트론에, 그 한계를 증명한 쪽은 민스키에 있습니다.
관계.
- 제자 얀 르쿤 — 르쿤은 1987–88년 토론토 대학에서 힌턴의 박사후 연구원으로 지낸 뒤 벨 연구소로 가서 합성곱 신경망을 만들었습니다.
- 함께 연구 요슈아 벤지오 — 캐나다 고등연구원(CIFAR)의 신경망 연구 프로그램을 힌턴이 이끌고 벤지오와 르쿤이 참여했으며, 세 사람은 2018년도 튜링상을 함께 받았습니다.
- 논쟁 마빈 민스키 — 민스키와 패퍼트는 1988년 『퍼셉트론』 증보판의 후기에서, 힌턴이 참여한 1986년 『병렬 분산 처리』의 연결주의(connectionism)가 1969년 책이 짚은 한계를 넘지 못했다고 비판했습니다.
연표.
- 1970년 케임브리지 킹스 칼리지에서 실험심리학 학사 학위를 받다
- 1978년 에든버러 대학에서 인공지능으로 박사 학위를 받다
- 1982년 카네기 멜런 대학으로 옮기다
- 1985년 애클리, 세즈노스키와 볼츠만 머신의 학습 규칙을 발표하다
- 1986년 럼멜하트, 윌리엄스와 역전파 논문을 『네이처』에 싣다
- 1987년 토론토 대학으로 옮기다
- 1998년 런던 대학 칼리지에 개츠비 계산 신경과학 연구소를 세우고 초대 소장을 맡다
- 2006년 층층이 미리 학습시키는 심층 믿음망을 발표하다
- 2012년 제자 크리젭스키, 수츠케버와 만든 알렉스넷이 이미지넷 대회에서 우승하다
- 2013년 구글에 합류하다
- 2019년 벤지오, 르쿤과 함께 2018년도 튜링상 수상자로 발표되다
- 2023년 구글을 떠나다
- 2024년 존 홉필드와 함께 노벨 물리학상을 받다
이 인물이 나오는 긴 글
이 인물을 언급하는 페이지
- 신경망
… 이어 붙인 것입니다. 1986년 역전파가 널리 알려지며 여러 층을 학습시킬 수 있게 되었고, 2012년힌턴의 연구실이 만든 깊은 신경망이 페이페이 리가 연 대규모 이미지 인식 대회(ImageNet)에서 다른 …
- 역전파
… 신경망 학습에 쓰자고 제안했으며, 1986년 미국의 심리학자 데이비드 러멜하트, 영국 출신 컴퓨터 과학자제프리 힌턴, 로널드 윌리엄스가 『네이처』에 낸 논문이 숨은 층이 쓸모 있는 특징을 스스로 배운다는 것을 보여 주면서 …
- 기계 학습
… 층짜리 퍼셉트론의 한계를 엄밀히 보인 뒤 신경망 연구는 한동안 가라앉았고, 1986년 데이비드 러멜하트,제프리 힌턴, 로널드 윌리엄스가 여러 층의 신경망을 역전파로 학습시키는 방법을 널리 알리면서 되살아났습니다. …
- EM 알고리즘과 가우스 혼합
… 엔트로피⟧가 엔트로피와 KL 발산으로 나뉘는 것과 같은 계산입니다. 1991년 제이컵스, 조던, 놀런,힌턴이 내놓은 전문가 혼합은 섞는 비율 자체가 입력에 따라 소프트맥스로 바뀌는 혼합 모형이고, 1994년 …
- 자동 미분
… 방법은 1980년대에 신경망 학습에 쓰이며 역전파라는 이름으로 널리 퍼졌고, 특히 1986년 러멜하트,힌턴, 윌리엄스의 논문이 계기가 되었습니다. 이어지는 곳. 오늘날의 딥러닝 도구: 사용자가 앞으로 계산만 …
- 확률적 경사 하강법과 Adam
… 디데릭 킹마와 지미 바가 발표했습니다. 좌표마다 기울기 제곱의 이동 평균의 제곱근으로 나누는 부분은제프리 힌턴이 2012년 강의에서 소개한 RMSprop과 같고, Adam은 여기에 모멘텀을 합친 셈입니다. '비스듬한 …
- 인공지능
… 번역과 문장의 확률 모형은 말뭉치에서 센 n-그램으로 옮겨 갔습니다. 1986년 데이비드 러멜하트,제프리 힌턴, 로널드 윌리엄스는 여러 층의 신경망을 역전파로 학습시키는 방법을 널리 알렸고, 1989년 ⟦벨 …
- 오토인코더와 잠재 공간
… 여러 층의 신경망으로 바꾸면 직선이나 평면이 아닌 휘어진 면을 따라 압축할 수 있습니다. 2006년제프리 힌턴과 루슬란 살라후트디노프는 깊은 오토인코더로 손글씨 숫자와 얼굴 사진을 30차원으로 줄여, 같은 차원의 …
- 트랜스포머
… 크기가 층마다 들쭉날쭉하지 않도록 맞춰 주어 학습을 안정시킵니다(2016년 지미 바, 제이미 키로스,제프리 힌턴). 평균은 빼지 않고 제곱평균의 제곱근으로만 나누는 RMSNorm도 많이 씁니다. MLP. 폭 d의 …
- 전문가 혼합
… experts, MoE)입니다. 생각의 뿌리는 1991년 로버트 제이컵스, 마이클 조던, 스티븐 놀런,제프리 힌턴의 「적응적 국소 전문가 혼합」입니다. 입력이 놓일 수 있는 공간을 여러 영역으로 나눠 영역마다 다른 작은 …
- 언어 모델의 발전사: RLHF 이후
… 개로 LLaMA 7B를 미세조정했습니다. 큰 모델의 출력으로 작은 모델을 가르치는 방식은 2015년힌턴등의 지식 증류(큰 모델의 출력 확률을 작은 모델의 학습 목표로 삼는 것)와 같은 계열이고, 뒤에 R1의 …