수학 개념 지도
인물

리처드 서튼(Richard S. Sutton)

지금의 예측을 조금 뒤의 예측 쪽으로 고치는 시간차 학습⁠(temporal-difference learning)⁠을 정식화하고, 스승 앤드루 바토와 함께 강화 학습⁠(reinforcement learning)⁠의 개념과 알고리즘⁠(algorithm)⁠의 기초⁠(basics)⁠를 놓아 2024년도 튜링상⁠(Turing Award)⁠을 받은 미국 태생의 캐나다 컴퓨터 과학자.

V(s)←V(s)+α [r+γV(s′)−V(s)]V(s) \leftarrow V(s) + \alpha\,\bigl[r + \gamma V(s') - V(s)\bigr]

리처드 서튼은 1950년대 후반 미국 오하이오주 톨레도에서 태어났습니다. 그가 연구를 시작한 1970년대 말, 기계 학습⁠(machine learning)⁠의 주류는 정답이 붙은 예에서 배우는 쪽이었습니다. 사진마다 '고양이', '개'라는 이름표가 있으면 틀린 만큼 고치면 됩니다. 그런데 동물은 대부분 그렇게 배우지 않습니다. 행동을 하고, 한참 뒤에 좋거나 나쁜 결과를 겪고, 그 결과로 앞선 행동들을 고칩니다. 정답 대신 보상만 있고, 보상은 늦게 옵니다. 서튼은 스승 앤드루 바토와 함께 이런 배움, 곧 강화 학습을 하나의 계산 이론⁠(theory of computation)⁠으로 세웠고, 두 사람은 이 공로로 2024년도 튜링상을 받았습니다.

굵은 막대가 이 사람의 생애이고, 흰검은 점은 페이지 끝 연표에 적은 일들입니다. 가는 막대는 같은 시대를 산 이 위키의 인물들입니다. 나이를 끌어 보세요.

나이 세 ·

그는 1978년 스탠퍼드 대학에서 심리학 학사 학위를 받았습니다. 동물이 보상을 예측하며 배운다는 심리학의 이론에 끌린 그는 매사추세츠 대학 애머스트로 가서 바토와 함께 연구했고, 1984년 박사 학위를 받았습니다. 논문의 주제는 민스키가 1961년 이름 붙인 공로 배분 문제⁠(credit assignment problem)⁠의 시간 쪽 절반이었습니다. 긴 행동의 끝에 한 번 보상이 오면, 그 보상을 앞선 수많은 결정 가운데 어디에 얼마나 돌려야 할까요? 1983년 바토, 서튼, 찰스 앤더슨은 움직이는 수레 위에 막대를 세우는 문제에서, 행동을 고르는 부분(행위자)과 상황이 얼마나 좋은지 예측하는 부분(비평자)을 나누어 함께 학습시키는 구조를 보였습니다. 이 행위자–비평자⁠(actor–critic)⁠ 구조는 오늘날에도 강화 학습의 기본 설계입니다.

1988년 논문 「시간차의 방법으로 예측하기를 배우기」는 비평자가 하는 일을 따로 떼어 정식화했습니다. 상태 ss의 가치 V(s)V(s)를 '여기서부터 앞으로 받을 보상의 기댓값⁠(expected value)⁠'의 예측이라 합시다. 끝까지 기다렸다가 실제로 받은 보상으로 예측을 고치는 대신, 한 걸음 가서 받은 보상 rr과 도착한 상태의 예측 V(s′)V(s')를 더한 값을 임시 정답으로 삼아 지금의 예측을 고칩니다(위의 식, γ\gamma는 먼 보상을 조금 깎는 할인율⁠(discount factor)⁠). 괄호 안의 양, 곧 이어지는 두 예측의 차이가 '시간차 오차'입니다. 이것은 새뮤얼의 체커 프로그램이 30년 전에 쓴 생각을 일반적인 예측 문제로 옮긴 것이고, 서튼은 논문에서 그 선례를 밝혔습니다.

논문과 뒤의 교과서에 나오는 예는 다섯 칸짜리 무작위 걷기였습니다. 칸 A, B, C, D, E가 한 줄로 있고 가운데 C에서 출발해 매번 반반의 확률⁠(probability)⁠로 왼쪽이나 오른쪽으로 갑니다. A의 왼쪽 끝으로 나가면 보상 0, E의 오른쪽 끝으로 나가면 보상 1입니다. 그러면 각 칸의 참된 가치는 오른쪽 끝으로 나갈 확률이고, 도박꾼의 파산⁠(gambler's ruin)⁠ 문제와 같은 계산으로 A부터 차례로 1/6, 2/6, 3/6, 4/6, 5/6입니다. 모든 예측을 0.5로 두고 시작해 봅시다(α=0.1\alpha = 0.1, γ=1\gamma = 1). E에서 오른쪽 끝으로 나가 보상 1을 받으면 V(E)V(E)는 0.5+0.1(1−0.5)=0.550.5 + 0.1(1 - 0.5) = 0.55가 됩니다. 다음 판에 D에서 E로 가면 보상은 0이지만 V(E)=0.55V(E) = 0.55가 임시 정답이 되어 V(D)V(D)가 0.5+0.1(0.55−0.5)=0.5050.5 + 0.1(0.55 - 0.5) = 0.505로 바뀝니다. 끝에서 알게 된 것이 한 칸씩 거꾸로 번져 갑니다. 서튼은 이 문제에서 시간차 방법이 끝까지 기다리는 방법보다 같은 경험으로 더 정확한 예측에 이른다는 것을 실험으로 보였고, 일정한 조건에서 참된 가치로 수렴⁠(convergence)⁠한다는 것도 증명했습니다.

시간차 학습이 왜 통하는지는 동적 계획법⁠(dynamic programming)⁠과 나란히 놓으면 보입니다. 리처드 벨먼의 동적 계획법은 '지금의 가치 = 한 걸음의 보상 + 다음 상태 가치의 기댓값'이라는 방정식을 모든 상태에 대해 풀어 가치를 구하는데, 그러려면 환경이 어떤 확률로 움직이는지를 알아야 합니다. 시간차 학습은 그 기댓값을 실제로 겪은 한 걸음으로 바꾸어 표본⁠(sample)⁠ 하나로 어림합니다. 모형 없이 경험만으로 벨먼 방정식을 푸는 셈이고, 여러 번 겪으면 평균⁠(mean)⁠이 기댓값에 다가간다는 점에서 큰 수의 법칙⁠(law of large numbers)⁠과 몬테카를로 방법⁠(Monte Carlo method)⁠에 기대고 있습니다. 1992년 IBM의 제럴드 테사우로는 이 방법으로 스스로와 백개먼을 두게 한 신경망⁠(neural network)⁠ TD-개먼을 만들어 세계 정상급 선수에 가까운 수준에 이르렀고, 뒤의 알파고와 알파제로도 스스로 둔 대국에서 가치와 정책을 배웠습니다(게임 트리⁠(game tree)⁠ 탐색).

그는 1985년부터 GTE 연구소, AT&T 연구소 등에서 일하며 연구를 넓혔습니다. 1990년의 다이나는 겪은 경험으로 환경의 모형을 배우고 그 모형으로 상상 속 경험을 만들어 다시 배우는 구조이고, 1999년에는 여러 걸음짜리 행동 묶음을 하나의 행동처럼 다루는 '옵션'의 틀과, 정책 자체를 매개변수⁠(parameter)⁠로 두고 그 기울기⁠(slope)⁠를 따라 고치는 정책 기울기⁠(policy gradient)⁠ 정리를 동료들과 발표했습니다. 정책 기울기는 오늘날 언어 모델⁠(language model)⁠을 사람의 선호에 맞추는 인간 피드백 강화 학습에도 쓰입니다. 1998년 바토와 함께 펴낸 『강화 학습 입문』(2018년 2판)은 이 분야의 표준 교과서입니다. 2003년 캐나다 앨버타 대학으로 옮겼고, 2017년부터 2023년까지 딥마인드의 앨버타 연구소를 이끌었습니다.

2019년 그는 짧은 에세이 「쓰라린 교훈」을 발표했습니다. 70년의 인공지능⁠(artificial intelligence)⁠ 연구를 돌아보면, 사람의 지식을 정성껏 넣은 방법보다 계산이 늘어날수록 함께 좋아지는 일반적인 방법, 곧 탐색과 학습이 결국 이겨 왔다는 주장이고, 체스, 바둑, 음성 인식, 컴퓨터 시각을 예로 들었습니다. 풀이를 여러 번 뽑아 고르고, 채점할 수 있는 보상으로 강화 학습을 하는 오늘날의 추론 모델은 이 두 갈래를 언어 모델에 함께 쓴 경우로 볼 수 있습니다. 이 글은 규모의 법칙⁠(scaling laws)⁠을 둘러싼 논의에서 자주 인용되지만, 과거의 사례에서 끌어낸 한 연구자의 해석이지 증명된 법칙은 아니라는 점을 구분해야 합니다. 서튼 자신도 오늘날의 언어 모델이 경험에서 스스로 배우는 대신 사람이 쓴 글을 흉내 내는 데 머문다고 비판하며, 행동하고 겪으며 배우는 쪽이 앞으로의 길이라고 주장해 왔습니다.

이어지는 곳. 보상을 거꾸로 번져 가게 하는 계산은 강화 학습에서 직접 한 걸음씩 돌려 볼 수 있고, 그 바탕의 벨먼 방정식은 동적 계획법과 마르코프 연쇄⁠(Markov chain)⁠에 있습니다. 다섯 칸 무작위 걷기의 참값은 무작위 걷기와 도박꾼의 파산에서, 예측이 기댓값에 다가가는 까닭은 기댓값과 큰 수의 법칙에서 확인할 수 있습니다. 스스로 두며 배우는 게임 프로그램의 계보는 새뮤얼과 게임 트리 탐색으로, 오늘날 언어 모델에 쓰이는 갈래는 인간 피드백 강화 학습으로 이어집니다.

관계.

가운데가 이 사람, 둘레가 이어진 인물들입니다. 선의 색은 관계의 종류(초록 스승·제자, 파랑 함께 연구, 보라 편지, 빨강 논쟁, 주황 영향)이고, 다른 인물의 페이지에 적힌 관계도 함께 모았습니다.

  • 영향을 받음 아서 새뮤얼 — 1988년 시간차 학습 논문에서 새뮤얼의 체커 프로그램이 현재 국면의 평가를 몇 수 앞을 읽은 평가 쪽으로 고친 방식을 이 방법의 이른 선례로 들었습니다.
  • 영향을 받음 마빈 민스키 — 민스키가 1961년 이름 붙인 공로 배분 문제, 곧 마지막 결과를 앞선 결정들에 어떻게 나누어 줄지가 그의 박사 논문 「강화 학습의 시간적 공로 배분」의 주제였습니다.

연표.

  • 1978년 스탠퍼드 대학에서 심리학 학사 학위를 받다
  • 1983년 바토, 앤더슨과 행위자–비평자 구조로 막대 세우기를 배우는 논문을 내다
  • 1984년 매사추세츠 대학 애머스트에서 바토의 지도로 박사 학위를 받다
  • 1985년 GTE 연구소에 들어가다
  • 1988년 「시간차의 방법으로 예측하기를 배우기」를 발표하다
  • 1990년 배운 모형으로 상상 속 경험을 만들어 배우는 다이나(Dyna)를 발표하다
  • 1998년 바토와 교과서 『강화 학습 입문』을 펴내다
  • 2003년 앨버타 대학 교수가 되다
  • 2017년 딥마인드 앨버타 연구소를 이끌다
  • 2018년 『강화 학습 입문』 2판을 펴내다
  • 2019년 에세이 「쓰라린 교훈」을 발표하다
  • 2021년 영국 왕립학회 회원이 되다
  • 2025년 바토와 함께 2024년도 튜링상 수상자로 발표되다

이 인물을 언급하는 페이지

이 페이지가 가리키는 개념