수학 개념 지도
인물

아서 새뮤얼(Arthur Samuel)

스스로 둔 대국에서 배워 자신을 이기게 된 체커 프로그램을 만들고, 1959년 논문 제목으로 '기계 학습⁠(machine learning)⁠'이라는 말을 널리 알린 미국의 공학자이자 컴퓨터 과학자.

wi←wi+α (V탐색−V현재) xiw_i \leftarrow w_i + \alpha\,\bigl(V_{\text{탐색}} - V_{\text{현재}}\bigr)\, x_i

아서 새뮤얼은 1901년 미국 캔자스주 엠포리아에서 태어났습니다. 그가 프로그램을 짜기 시작한 1950년대 초, 컴퓨터는 사람이 적어 준 순서를 그대로 따르는 기계였고, 기계가 무엇을 잘하게 되려면 사람이 그 방법을 알고 적어 주어야 했습니다. 새뮤얼은 사람이 이기는 방법을 다 적어 주지 않아도 기계가 대국을 되풀이하며 스스로 나아지게 할 수 있는지를 체커(서양 장기의 한 가지)로 시험했고, 그의 프로그램은 결국 만든 사람보다 잘 두게 되었습니다. 1959년 그가 쓴 논문의 제목 「체커를 이용한 기계 학습의 몇 가지 연구」는 기계 학습이라는 말을 널리 알렸습니다.

굵은 막대가 이 사람의 생애이고, 흰검은 점은 페이지 끝 연표에 적은 일들입니다. 가는 막대는 같은 시대를 산 이 위키의 인물들입니다. 나이를 끌어 보세요.

나이 세 ·

그는 1926년 MIT에서 전기공학 석사 학위를 받고, 1928년부터 1946년까지 벨 연구소에서 진공관을 연구했습니다. 2차 세계대전 동안에는 레이더에 쓰이는 고주파 진공관을 만들었습니다. 1946년 일리노이 대학의 교수가 된 그는 학교가 짓던 컴퓨터가 할 수 있는 일을 보여 주려고 체커 프로그램을 구상했는데, 컴퓨터가 완성되기 전에 1949년 IBM으로 옮겼습니다. IBM의 첫 상업용 과학 계산기 IBM 701에서 그의 프로그램이 처음 돈 것이 1952년입니다. 1956년 2월 이 프로그램이 텔레비전으로 시연되었을 때 IBM의 주가가 크게 올랐다는 이야기가 전하는데, 이것은 인과⁠(causation)⁠를 확인할 수 없는 일화로 보아야 합니다.

프로그램의 뼈대는 섀넌이 1950년 체스 프로그램을 위해 제안한 틀과 같습니다. 지금 국면에서 둘 수 있는 수들을 몇 수 앞까지 나무처럼 펼치고, 나무의 끝 국면마다 점수를 매긴 뒤, 내 차례에는 가장 큰 점수를, 상대 차례에는 가장 작은 점수를 골라 거꾸로 올라옵니다. 이것이 미니맥스⁠(minimax)⁠이고 게임 트리⁠(game tree)⁠ 탐색 페이지에서 직접 따라가 볼 수 있습니다. 끝 국면의 점수를 매기는 함수⁠(function)⁠를 평가 함수라 부릅니다. 새뮤얼의 평가 함수⁠(evaluation function)⁠는 말 수의 차이, 움직일 수 있는 수의 개수, 가운데 칸의 장악처럼 국면에서 셀 수 있는 특징 xix_i들에 가중치⁠(weight)⁠ wiw_i를 곱해 더한 선형 식 V=∑iwixiV = \sum_i w_i x_i였습니다. 그는 후보 특징 서른여덟 가지 가운데 열여섯 가지를 골라 쓰고, 기여가 가장 작은 특징을 대기 중인 다른 특징과 바꾸어 가며 시험했습니다.

배움은 두 가지 방식으로 일어났습니다. 첫째는 외우기입니다. 탐색으로 점수를 얻은 국면을 기억해 두었다가 같은 국면이 다시 나오면 그 점수를 바로 씁니다. 외운 국면의 점수 자체가 몇 수 앞을 읽은 결과이므로, 탐색의 깊이가 실제로 늘어나는 효과가 있습니다. 둘째가 더 중요한 가중치 고치기입니다. 지금 국면을 평가 함수로 바로 매긴 점수 V현재V_{\text{현재}}와, 몇 수 앞까지 읽어 끝 국면들의 점수에서 거꾸로 올라온 점수 V탐색V_{\text{탐색}}는 보통 다릅니다. 앞을 더 많이 본 뒤쪽이 더 믿을 만하니, 새뮤얼은 평가 함수가 뒤쪽 값에 가까워지도록 가중치를 고쳤습니다. 오늘날의 말로 적으면 위의 식과 같습니다(그의 실제 규칙은 특징과 차이의 상관을 쓰는 조금 다른 형태였습니다). 예를 들어 현재 점수가 0.2, 탐색 점수가 0.5이면 차이는 0.3이고, 이 국면에서 값이 1인 특징의 가중치는 α=0.1\alpha = 0.1일 때 0.03만큼 커집니다.

이 규칙의 요점은 대국이 끝나 승패가 나기를 기다리지 않는다는 데 있습니다. 한 수를 둘 때마다 '조금 뒤의 내 판단'을 정답 삼아 '지금의 내 판단'을 고칩니다. 민스키가 이름 붙인 공로 배분 문제⁠(credit assignment problem)⁠, 곧 마지막 승패를 앞선 수많은 수에 어떻게 나누어 줄지에 대한 이른 답이기도 합니다. 30년 뒤 서튼은 이 생각을 시간차 학습⁠(temporal-difference learning)⁠으로 정식화하며 새뮤얼의 프로그램을 선례로 들었고, 이것이 강화 학습⁠(reinforcement learning)⁠의 중심 방법이 되었습니다. 새뮤얼은 또 프로그램 두 벌을 맞붙여, 한쪽이 가중치를 고치며 두고 이기면 다른 쪽이 그 가중치를 물려받게 했습니다. 스스로와 두어 배우는 이 방식은 뒤에 백개먼의 TD-개먼, 바둑의 알파고 제로에서 다시 중심이 됩니다. 탐색 쪽에서는 이미 더 나쁜 것으로 드러난 가지를 끝까지 읽지 않는, 오늘날 알파–베타 가지치기라 부르는 생각의 이른 형태도 그의 프로그램에 들어 있었습니다.

성과를 정확히 적어 둘 필요가 있습니다. 1962년 프로그램은 코네티컷주의 강자 로버트 닐리와의 한 판에서 이겼고, 이 소식은 기계가 사람 고수를 이겼다는 말로 널리 퍼졌습니다. 그러나 닐리는 최정상급 선수가 아니었고, 이듬해 다시 둔 대국에서는 닐리가 앞섰습니다. 1966년 세계 정상급 선수들과의 대국에서도 프로그램은 졌습니다. 프로그램은 1970년대 중반까지 수준 높은 아마추어 정도에 이르렀다고 평가됩니다. 체커는 2007년 캐나다의 조너선 섀퍼 연구진이 양쪽이 최선을 다하면 무승부라는 것을 컴퓨터로 증명해 '풀린' 게임이 되었습니다. 새뮤얼의 의의는 이긴 대국 수보다, 기계가 경험에서 자기 평가를 고칠 수 있다는 것을 작동하는 프로그램으로 처음 보여 준 사람들 가운데 하나라는 데 있습니다.

흔히 그의 말로 인용되는 "명시적으로 프로그래밍하지 않고도 컴퓨터가 배울 수 있게 하는 연구 분야"라는 기계 학습의 정의는, 1959년 논문에 그 문장 그대로 나오지는 않고 뒤에 그의 생각을 풀어 쓴 말로 보는 것이 정확합니다. 논문 첫머리의 취지는 비슷합니다. 그는 사람이 해야 할 일을 정확히 적어 주는 데 드는 수고를 덜려면, 기계가 경험에서 배우게 해야 한다고 썼습니다. 1966년 IBM에서 은퇴한 뒤 그는 스탠퍼드 대학으로 옮겨 음성 인식을 연구했고, 80대에도 프로그램을 짜며 크누스의 TeX 프로젝트를 도왔습니다. 1990년 세상을 떠났습니다.

이어지는 곳. 몇 수 앞을 읽고 거꾸로 올라오는 계산은 게임 트리 탐색에서, 지금의 판단을 조금 뒤의 판단 쪽으로 고치는 규칙은 강화 학습과 서튼의 시간차 학습에서 이어집니다. 특징에 가중치를 곱해 더한 평가 함수는 선형 회귀와 퍼셉트론⁠(perceptron)⁠과 같은 모양이고, 가중치를 오차 쪽으로 조금씩 옮기는 일은 경사 하강법⁠(gradient descent)⁠의 원형입니다. 그가 이름을 알린 분야 전체는 기계 학습에서, 그 뒤의 큰 줄기는 인공지능⁠(artificial intelligence)⁠에서 볼 수 있습니다.

관계.

가운데가 이 사람, 둘레가 이어진 인물들입니다. 선의 색은 관계의 종류(초록 스승·제자, 파랑 함께 연구, 보라 편지, 빨강 논쟁, 주황 영향)이고, 다른 인물의 페이지에 적힌 관계도 함께 모았습니다.

  • 영향을 줌 리처드 서튼 — 새뮤얼의 체커 프로그램이 현재 국면의 평가를 몇 수 앞을 읽은 평가 쪽으로 고친 방식을, 서튼은 1988년 시간차 학습 논문에서 그 방법의 이른 선례로 들었습니다.
  • 함께 연구 도널드 크누스 — IBM에서 은퇴한 뒤 스탠퍼드에서 80대까지 프로그램을 짜며 크누스의 TeX 프로젝트에 참여했고, 그 설명서 일부를 쓰는 일을 도왔습니다.

연표.

  • 1926년 MIT에서 전기공학 석사 학위를 받다
  • 1928년 벨 연구소에 들어가 진공관을 연구하다
  • 1946년 일리노이 대학 교수가 되어 체커 프로그램을 구상하다
  • 1949년 IBM으로 옮기다
  • 1952년 IBM 701에서 체커 프로그램이 처음 돌다
  • 1956년 체커 프로그램이 텔레비전으로 시연되다
  • 1959년 「체커를 이용한 기계 학습의 몇 가지 연구」를 발표하다
  • 1962년 체커 프로그램이 로버트 닐리와의 대국에서 이기다
  • 1966년 IBM에서 은퇴하고 스탠퍼드 대학으로 옮기다
  • 1987년 IEEE 컴퓨터 선구자상을 받다

이 인물이 나오는 긴 글

신경망과 기계 학습 배우는 기계 예를 보여 주면 규칙을 스스로 찾는 기계. 1958년의 퍼셉트론에서 오늘의 심층 신경망까지, 그 밑바닥에는 미분과 연쇄법칙이 있다. 게임과 증명 이기는 쪽이 존재한다 "이 판은 백이 이겼다"는 흑이 어떻게 두든 백에게 답이 있다는 말이다. 체스의 체르멜로 정리, ε–δ, 님의 이진법, 폰 노이만의 최소최대와 쌍대성, 논리의 한계를 재는 게임, 끝나지 않는 게임과 선택공리, 대화로 읽는 증명, 겨루며 배우는 신경망까지. 수학의 참을 두 사람의 게임으로 읽는다.

이 인물을 언급하는 페이지

이 페이지가 가리키는 개념