수학 개념 지도
인물

제프리 힌턴(Geoffrey Hinton)

통계⁠(statistics)⁠ 물리학의 볼츠만 분포⁠(Boltzmann distribution)⁠로 배우는 신경망⁠(neural network)⁠인 볼츠만 머신⁠(Boltzmann machine)⁠을 만들고, 역전파⁠(backpropagation)⁠가 숨은 층⁠(hidden layer)⁠에 쓸모 있는 표현을 배우게 한다는 것을 보였으며, 2012년 알렉스넷으로 딥러닝⁠(deep learning)⁠의 시대를 연 영국 태생의 캐나다 컴퓨터 과학자.

Δwij=ε(⟨sisj⟩자료−⟨sisj⟩모형)\Delta w_{ij} = \varepsilon\bigl(\langle s_i s_j\rangle_{\text{자료}} - \langle s_i s_j\rangle_{\text{모형}}\bigr)

제프리 힌턴은 1947년 영국 런던에서 태어났습니다. 논리학자 조지 불이 그의 고조할아버지입니다. 그가 대학을 다닌 1960년대 말, 뇌를 흉내 낸 학습 기계는 인기를 잃고 있었습니다. 로젠블랫의 퍼셉트론⁠(perceptron)⁠은 학습하는 층이 하나뿐이라 곧은 경계로만 가를 수 있었고, 1969년 민스키와 패퍼트는 그 한계를 정리로 증명했습니다. 층을 여러 개 쌓으면 된다는 것은 알려져 있었지만, 입력도 출력도 아닌 가운데 층, 곧 숨은 층의 연결을 무엇을 기준으로 고쳐야 하는지에 대해서는 널리 받아들여진 방법이 없었습니다. 힌턴은 40년 넘게 이 물음을 붙들었고, 그의 답들이 오늘날의 신경망과 딥러닝의 바탕이 되었습니다.

굵은 막대가 이 사람의 생애이고, 흰검은 점은 페이지 끝 연표에 적은 일들입니다. 가는 막대는 같은 시대를 산 이 위키의 인물들입니다. 나이를 끌어 보세요.

나이 세 ·

그는 케임브리지 킹스 칼리지에서 실험심리학을 공부해 1970년 졸업하고, 1978년 에든버러 대학에서 크리스토퍼 롱깃히긴스의 지도로 인공지능⁠(artificial intelligence)⁠ 박사 학위를 받았습니다. 당시 인공지능의 주류는 지식을 기호와 규칙으로 적는 쪽이었고, 그는 지식이 수많은 연결의 세기에 흩어져 담긴다는 '분산 표현⁠(distributed representation)⁠'의 편에 섰습니다. 캘리포니아 대학 샌디에이고에서 데이비드 럼멜하트 등과 함께한 병렬 분산⁠(variance)⁠ 처리(PDP) 연구 모임이 이 생각의 중심이었고, 1982년 카네기 멜런 대학으로 옮긴 뒤에도 연구는 이어졌습니다.

1983–85년 그는 테런스 세즈노스키, 데이비드 애클리와 함께 볼츠만 머신을 만들었습니다. 켜짐(1)과 꺼짐(0)만 있는 단위들이 대칭인 연결 wijw_{ij}로 이어져 있고, 전체 상태 ss에 에너지 E(s)=−∑i<jwijsisj−∑ibisiE(s) = -\sum_{i\lt j} w_{ij} s_i s_j - \sum_i b_i s_i를 줍니다. 단위들은 확률적으로 켜지고 꺼지며, 충분히 오래 돌리면 상태 ss가 나올 확률⁠(probability)⁠이 e−E(s)/Te^{-E(s)/T}에 비례하게 됩니다. 기체 분자의 상태가 따르는 볼츠만 분포와 같은 모양이고, 평균⁠(mean)⁠ 에너지가 정해졌을 때 최대 엔트로피⁠(maximum entropy)⁠의 원리가 고르는 분포이기도 합니다. 학습 규칙은 위의 식처럼 국소적입니다. 연결 wijw_{ij}를 고칠 때 그 연결의 두 끝, 단위 ii와 jj의 통계만 씁니다. 보이는 단위들을 자료에 고정하고 돌렸을 때 두 단위가 함께 켜지는 빈도와, 아무것도 고정하지 않고 모형이 스스로 돌 때의 빈도의 차이만큼 연결을 고칩니다. 그러면 모형이 만들어 내는 분포가 자료의 분포에 다가갑니다. 두 분포의 차이를 KL 발산⁠(KL divergence)⁠으로 재고 그것을 줄이는 경사 하강이 바로 이 규칙이라는 것이 증명의 요점입니다. 2024년 노벨 물리학상은 존 홉필드의 연상 기억 신경망과 함께 이 연구를 들어, 두 사람에게 "인공 신경망⁠(artificial neural network)⁠으로 기계 학습⁠(machine learning)⁠을 가능하게 한 기초적 발견과 발명"의 공로를 돌렸습니다.

볼츠만 머신은 원리가 아름다웠지만 모형이 스스로 도는 단계가 너무 느렸습니다. 더 빠른 답은 역전파였습니다. 출력의 오차를 연쇄 법칙으로 한 층씩 거꾸로 전해 모든 연결의 기울기⁠(slope)⁠를 한 번에 얻는 이 방법은 1970년 세포 린나인마의 역방향 자동 미분⁠(automatic differentiation)⁠, 1974년 폴 워보스의 박사 논문 등 앞선 선례가 있습니다. 1986년 럼멜하트, 힌턴, 로널드 윌리엄스가 『네이처』에 실은 논문의 공헌은 이 방법을 처음 만든 데 있지 않고, 숨은 층이 누구도 가르쳐 주지 않은 쓸모 있는 표현을 스스로 배운다는 것을 보인 데 있습니다. 논문의 한 예는 영국인 가족과 이탈리아인 가족의 가계도 두 개였습니다. '누구의 무엇은 누구인가'라는 사실 104개 가운데 100개로 학습시키자, 숨은 단위들이 국적, 세대, 가계도의 어느 갈래인지 같은 특징을 나누어 맡게 되었고, 보지 않은 나머지 네 문제도 대부분 맞혔습니다. 사람은 이 특징들을 알려 준 적이 없습니다.

1987년 토론토 대학으로 옮긴 그는 신경망이 다시 인기를 잃은 1990년대와 2000년대 초에도 연구를 이었습니다. 1991년 로버트 제이컵스, 마이클 조던, 스티븐 놀런과 함께 낸 논문은 입력마다 여러 작은 망 가운데 누구에게 맡길지를 게이트 망이 정하는 '전문가 혼합⁠(mixture of experts)⁠'을 내놓았는데, 이 생각은 30년 뒤 큰 언어 모델⁠(language model)⁠에서 전문가 혼합 구조로 되살아났습니다. 1998년부터 3년 동안은 런던에 개츠비 계산 신경과학 연구소를 세워 이끌었습니다. 2004년 무렵 캐나다 고등연구원(CIFAR)의 지원으로 신경망 연구 프로그램을 꾸려 르쿤, 벤지오 등과 함께했습니다. 2006년 그는 제한된 볼츠만 머신을 한 층씩 쌓아 미리 학습시킨 뒤 전체를 역전파로 다듬는 심층 믿음망을 발표했고, 깊은 신경망도 학습시킬 수 있다는 이 결과가 '딥러닝'이라는 말이 퍼지는 계기가 되었습니다. 그 무렵 그의 학생들은 이 방법을 음성 인식에 적용해 오랜 방법인 은닉 마르코프 모델⁠(hidden Markov model)⁠과 가우스 혼합⁠(Gaussian mixture)⁠의 조합을 넘어섰습니다.

전환점은 2012년에 왔습니다. 제자 알렉스 크리젭스키, 일리야 수츠케버와 만든 합성곱 신경망⁠(convolutional neural network)⁠ 알렉스넷이 페이페이 리 연구진이 만든 이미지넷 대회에서 1,000가지 범주⁠(category)⁠의 사진을 분류해, 다섯 번 추측 안에 정답이 없는 비율(상위 5 오류율⁠, top-5 error rate⁠)을 15.3%로 낮추었습니다. 2위는 26.2%였습니다. 새 이론이 있었던 것은 아닙니다. 그래픽 처리 장치(GPU) 두 개로 많은 계산을 돌리고, 학습 중에 뒤쪽 층의 숨은 단위를 절반씩 무작위로 꺼 두어 단위들이 서로에게 기대지 않게 하는 드롭아웃⁠(dropout)⁠으로 과적합⁠(overfitting)⁠을 줄였으며, 기울기가 잘 사라지지 않는 활성화 함수(ReLU)를 쓴 것이 요점이었습니다. 그 뒤 몇 해 사이에 시각, 음성, 번역의 거의 모든 분야가 깊은 신경망으로 옮겨 갔습니다. 2013년 그는 구글에 합류했습니다.

그 밖에도 고차원 자료를 2차원 그림으로 펼쳐 보는 t-SNE(2008, 로런스 판데르마턴과 함께), 큰 모형의 출력 확률을 작은 모형이 흉내 내게 하는 지식 증류(2015) 같은 그의 방법들이 널리 쓰입니다. 그는 2018년도 튜링상⁠(Turing Award)⁠을 벤지오, 르쿤과 함께 받았고, 2024년 존 홉필드와 함께 노벨 물리학상을 받았습니다. 2023년 그는 구글을 떠나며, 인공지능이 가져올 수 있는 위험에 대해 회사에 매이지 않고 말하기 위해서라고 밝혔습니다. 이 위험의 크기와 시기에 대해서는 그와 같은 튜링상 수상자인 르쿤처럼 다르게 보는 연구자도 많고, 과학계의 합의된 답은 아직 없습니다.

이어지는 곳. 숨은 층을 학습시키는 계산은 역전파와 연쇄 법칙에서 손으로 따라가 볼 수 있고, 그 계산을 컴퓨터가 기계적으로 하는 방법이 자동 미분입니다. 볼츠만 머신의 확률 분포는 최대 엔트로피와 KL 발산에, 층층이 쌓아 자료를 압축하는 생각은 오토인코더⁠(autoencoder)⁠에 이어집니다. 알렉스넷의 뼈대는 합성곱 신경망이고, 그 학습은 확률적 경사 하강법⁠(stochastic gradient descent)⁠으로 합니다. 신경망 연구의 앞 세대는 로젠블랫과 퍼셉트론에, 그 한계를 증명한 쪽은 민스키에 있습니다.

관계.

가운데가 이 사람, 둘레가 이어진 인물들입니다. 선의 색은 관계의 종류(초록 스승·제자, 파랑 함께 연구, 보라 편지, 빨강 논쟁, 주황 영향)이고, 다른 인물의 페이지에 적힌 관계도 함께 모았습니다.

  • 제자 얀 르쿤 — 르쿤은 1987–88년 토론토 대학에서 힌턴의 박사후 연구원으로 지낸 뒤 벨 연구소로 가서 합성곱 신경망을 만들었습니다.
  • 함께 연구 요슈아 벤지오 — 캐나다 고등연구원(CIFAR)의 신경망 연구 프로그램을 힌턴이 이끌고 벤지오와 르쿤이 참여했으며, 세 사람은 2018년도 튜링상을 함께 받았습니다.
  • 논쟁 마빈 민스키 — 민스키와 패퍼트는 1988년 『퍼셉트론』 증보판의 후기에서, 힌턴이 참여한 1986년 『병렬 분산 처리』의 연결주의⁠(connectionism)⁠가 1969년 책이 짚은 한계를 넘지 못했다고 비판했습니다.

연표.

  • 1970년 케임브리지 킹스 칼리지에서 실험심리학 학사 학위를 받다
  • 1978년 에든버러 대학에서 인공지능으로 박사 학위를 받다
  • 1982년 카네기 멜런 대학으로 옮기다
  • 1985년 애클리, 세즈노스키와 볼츠만 머신의 학습 규칙을 발표하다
  • 1986년 럼멜하트, 윌리엄스와 역전파 논문을 『네이처』에 싣다
  • 1987년 토론토 대학으로 옮기다
  • 1998년 런던 대학 칼리지에 개츠비 계산 신경과학 연구소를 세우고 초대 소장을 맡다
  • 2006년 층층이 미리 학습시키는 심층 믿음망을 발표하다
  • 2012년 제자 크리젭스키, 수츠케버와 만든 알렉스넷이 이미지넷 대회에서 우승하다
  • 2013년 구글에 합류하다
  • 2019년 벤지오, 르쿤과 함께 2018년도 튜링상 수상자로 발표되다
  • 2023년 구글을 떠나다
  • 2024년 존 홉필드와 함께 노벨 물리학상을 받다

이 인물이 나오는 긴 글

신경망과 기계 학습 배우는 기계 예를 보여 주면 규칙을 스스로 찾는 기계. 1958년의 퍼셉트론에서 오늘의 심층 신경망까지, 그 밑바닥에는 미분과 연쇄법칙이 있다. 언어 모델 다음 단어를 맞히는 기계 다음 낱말을 짐작하는 일만으로 어디까지 갈 수 있을까? 마르코프의 글자 세기에서 섀넌의 추측 게임, 트랜스포머와 규모의 법칙, 사람의 선호까지. 밑바닥에는 확률의 곱셈 규칙과 로그 하나가 있고, 그 수학은 모델이 왜 그럴듯하게 틀리는지도 말해 준다.

이 인물을 언급하는 페이지

이 페이지가 가리키는 개념