노엄 촘스키(Noam Chomsky)
문법을 유한한 규칙의 되풀이로 보고 형식 문법을 네 층의 위계로 정리해, 언어학과 컴퓨터 과학 모두의 틀을 바꾼 미국 언어학자.
노엄 촘스키는 1928년 필라델피아에서 히브리어 학자의 아들로 태어났습니다. 펜실베이니아 대학에서 언어학자 젤리그 해리스에게 배웠고, 하버드의 소사이어티 오브 펠로스를 거쳐 1955년부터 MIT에서 가르쳤습니다. 1950년대 미국의 언어학은 말을 모으고 분류하는 구조주의(structuralism)가, 심리학은 자극과 반응으로 행동을 설명하는 행동주의가 이끌고 있었습니다. 그리고 MIT에는 섀넌의 정보 이론이 불러온 흥분이 있었습니다. 말도 앞의 낱말로 다음 낱말을 고르는 확률(probability) 기계로 설명할 수 있으리라는 기대였습니다. 촘스키는 이 흐름들에 맞섰습니다.
나이
스승 해리스는 말뭉치(corpus)에서 낱말과 형태소(morpheme)가 어떤 환경에 나타나는지를 체계적으로 분류하는 방법을 다듬고 있었고, 촘스키도 처음에는 현대 히브리어의 형태를 연구했습니다. 그러나 그는 점점 분류의 절차가 아니라, 말하는 사람이 들어 본 적 없는 새 문장을 끝없이 만들고 알아듣는 능력을 설명하는 이론을 찾게 되었습니다. 1955년 무렵 쓴 거대한 원고 『언어 이론의 논리적 구조』는 너무 낯설어 책으로 나오지 못하다가 1975년에야 출판되었습니다. 같은 1955년 그는 MIT 전자 공학 연구소의 기계 번역(machine translation) 과제에 연구원으로 들어갔는데, 이 연구소는 군의 연구비로 돌아가고 있었습니다. 그는 기계 번역에는 회의적이었지만 이곳에서 음운론자 모리스 할레와 평생의 동료가 되었고, 두 사람은 1961년 MIT에 언어학 대학원 과정을 세웠습니다.
1957년의 얇은 책 『통사 구조』에서 그는 영어 문장 두 개를 나란히 적었습니다. "Colorless green ideas sleep furiously"와, 같은 낱말을 거꾸로 늘어놓은 문장입니다. 둘 다 뜻이 통하지 않고 누구도 써 본 적 없었을 문장이지만, 영어를 하는 사람은 첫째는 이상해도 문장이고 둘째는 낱말 더미라고 느낍니다. 문장이 문법에 맞는가는 뜻과도, 얼마나 자주 나오는가와도 다른 문제이니, 말하는 사람의 머릿속에는 빈도표가 아니라 규칙이 있어야 한다는 것이 그의 결론이었습니다. 한 해 앞서 MIT의 정보 이론 심포지엄에서 발표한 「세 가지 언어 모형」은 더 날카로웠습니다. 영어에는 "만약 …라면 …이다"처럼 서로의 안에 들어갈 수 있는 짝이 있어서, 괄호처럼 열린 것을 순서대로 닫으려면 몇 겹이 열렸는지 기억해야 합니다. 그는 실제로 말할 수 있는 깊이는 기억력이 제한할 뿐 문법 자체는 겹침을 얼마든지 허용한다고 보았습니다. 이 가정 아래에서, 상태가 k개뿐인 기계에 k겹보다 깊은 문장을 넣으면 비둘기집 원리(pigeonhole principle)에 따라 서로 다른 두 깊이에서 같은 상태에 놓이고, 기계는 둘을 구별하지 못합니다. 그러니 마르코프 연쇄(Markov chain)나 n-그램(n-gram) 같은 유한 상태 모형으로는 영어를 다 적을 수 없습니다.
「세 가지 언어 모형」이 발표된 1956년 9월 11일의 심포지엄은 뒤에 인지 과학의 생일로 불리게 됩니다. 같은 날 앨런 뉴얼과 허버트 사이먼은 논리학의 정리를 스스로 증명하는 프로그램 '논리 이론가'를, 심리학자 조지 밀러는 사람이 한 번에 붙들 수 있는 항목이 일곱 개 안팎이라는 연구를 발표했고, 밀러는 그날 마음을 연구하는 새 학문이 시작되었다는 확신을 안고 돌아왔다고 회고했습니다. 『통사 구조』는 헤이그의 작은 출판사에서 나왔지만, 로버트 리스가 학술지 『랭귀지』에 쓴 긴 서평이 이 책을 단숨에 언어학의 중심으로 밀어 올렸습니다.
유한 상태 모형 대신 그는 문장을 규칙으로 다시 써 나가는 나무로 보았습니다. S → NP VP(문장은 명사구와 동사구로 이루어진다)처럼 기호 하나를 기호열로 바꾸는 규칙들 가운데, 문장 안에 다시 문장이 들어가는 규칙이 자기 자신을 부르면서(재귀, recursion) 유한한 규칙이 무한히 많은 문장을 만듭니다. 1959년 그는 규칙의 모양에 따라 문법을 네 층으로 나누었습니다. 가장 좁은 정규 문법은 유한 오토마톤(finite automaton)과 정규 표현식(regular expression)이 다루는 언어를, 문맥 자유 문법(context-free grammar)은 스택(맨 나중에 넣은 것을 맨 먼저 꺼내는 기억 장치) 하나를 가진 푸시다운 오토마톤(pushdown automaton)이 알아보는 언어를, 문맥 의존 문법(context-sensitive grammar)은 입력 길이만큼의 테이프를 가진 기계의 언어를, 제한 없는 문법은 튜링 기계(Turing machine)가 알아보는 언어를 만듭니다. 이 촘스키 위계(Chomsky hierarchy)는 언어학보다 컴퓨터 과학에서 더 오래 살아남았습니다. 1960년 프로그래밍 언어 알골 60의 보고서에서 문법을 적은 배커스–나우르 표기법(존 배커스와 페테르 나우르의 이름을 땄습니다)은 사실상 문맥 자유 문법이었고, 1962년에는 알골의 구문 규칙과 문맥 자유 문법이 정확히 같은 힘을 가진다는 것이 증명되었습니다. 1963년 촘스키는 프랑스의 수학자 마르셀폴 쉬첸베르제와 함께 문맥 자유 언어(context-free language)에서 길이마다 문장이 몇 개인지를 생성함수(generating function)로 세는 대수적 이론을 내놓았습니다. 문장마다 분석 나무가 하나뿐인 모호하지 않은 문법이라면, 그 생성함수는 다항식(polynomial) 방정식의 해인 대수 함수(function)가 됩니다. 프로그램 글을 문법 구조로 쪼개는 오늘날 프로그래밍 언어의 구문 분석기(parser)는 대부분 문맥 자유 문법을 뼈대로 삼고, 변수를 선언했는지 같은 나머지 조건을 따로 검사합니다.
이 모든 것의 밑에는 오래된 물음이 있습니다. 머리는 유한한데 말할 수 있는 문장은 끝이 없습니다. 촘스키는 19세기 초 독일의 언어학자 빌헬름 폰 훔볼트가 언어를 "유한한 수단의 무한한 사용"이라 한 말을 자주 인용했습니다. 유한한 규칙의 되풀이로 무한한 대상을 다루는 것은 수학적 귀납법(mathematical induction)이나 재귀적 정의가 하는 일과 같고, 수학이 무한을 길들이는 방법과 언어학이 한 사람의 머릿속을 설명하는 방법이 여기서 만납니다(무한을 다루는 법).
그의 언어학은 여러 번 크게 바뀌었지만 방향은 일관되었습니다. 1959년 행동주의 심리학자 B. F. 스키너의 『언어 행동』을 길게 비판한 서평은 행동주의에서 인지 과학으로 무게가 옮겨 가는 상징이 되었고, 1965년에는 머릿속 규칙에 대한 지식인 언어 능력(linguistic competence)과, 기억의 한계와 말실수가 섞인 언어 수행(linguistic performance)을 나누었습니다. 아이가 듣는 말은 너무 적고 불완전해서 그것만으로는 문법을 배울 수 없으니 모든 언어에 공통된 보편 문법(universal grammar)이 타고난다는 주장, 이른바 자극의 빈곤(poverty of the stimulus) 논증은 가장 큰 논쟁을 불렀습니다. 그는 17세기 포르루아얄 문법과 데카르트의 합리론을 자기 생각의 선구로 꼽았고, 1990년대에는 문법을 가능한 한 적은 원리로 줄이려는 최소주의 프로그램(Minimalist Program)을 내놓았습니다. 규칙으로 언어를 적는 전통의 먼 조상으로는 흔히 고대 인도의 파니니가 꼽힙니다.
그의 이론은 언어학 안에서도 늘 논쟁의 한가운데였습니다. 1960년대 말 그의 제자와 동료였던 레이코프, 로스, 매콜리 등이 뜻을 문법의 출발점으로 삼는 생성 의미론(generative semantics)을 내세우며 그와 부딪혔고, 이 '언어학 전쟁'은 1970년대까지 이어졌습니다. 촘스키는 1981년 모든 언어에 공통된 원리와, 언어마다 스위치처럼 값이 정해지는 몇 개의 매개변수(parameter)로 문법을 설명하는 틀을 내놓았습니다. 2002년에는 하우저, 피치와 함께 재귀가 사람의 언어 능력에만 있는 핵심일 수 있다고 제안했는데, 2005년 언어학자 대니얼 에버렛이 아마존의 피라항어에는 문장 안에 문장을 넣는 구조가 없다고 주장하면서 격렬한 논쟁이 벌어졌습니다. 타고난 보편 문법이 있느냐는 물음은 지금도 언어학과 심리학에서 가장 뜨거운 물음의 하나입니다.
확률 쪽과의 논쟁은 끝나지 않았습니다. 1980–90년대부터 말뭉치의 빈도로 배우는 통계적 방법이 음성 인식과 기계 번역을 휩쓸었고(은닉 마르코프 모델(hidden Markov model), 단어 임베딩(word embedding)), IBM 음성 인식 팀의 프레더릭 옐리네크가 언어학자를 한 명 내보낼 때마다 인식률이 오른다고 말했다는 이야기가 전할 정도였습니다. 2011년 MIT의 한 심포지엄에서 촘스키가 통계적 모형은 과학적 설명이 아니라고 비판하자, 구글의 연구 책임자 피터 노빅은 긴 글로 반박했습니다. 2023년 촘스키는 동료들과 『뉴욕 타임스』에 쓴 글에서, 방대한 글로 다음 낱말을 맞히도록 훈련한 신경망(neural network)인 큰 언어 모델(language model)은 통계적 패턴을 찾을 뿐 설명을 내놓지 못하며 가능한 언어와 불가능한 언어를 가리지 못한다고 비판했습니다. 반대편에서는 이런 모델이야말로 타고난 문법 없이 자료에서 문법을 배울 수 있다는 증거라고 반박합니다.
언어학 밖에서 그는 1967년 에세이 「지식인의 책임」으로 베트남 전쟁을 비판한 뒤, 미국 외교 정책과 언론에 대한 가장 널리 알려진 비판자의 한 사람이 되었습니다. 1988년 에드워드 허먼과 함께 쓴 『여론 조작』은 언론 보도가 소유 구조와 광고와 권력의 이해에 따라 걸러진다는 '선전 모델(propaganda model)'을 내놓았습니다. 군의 연구비로 돌아가던 연구소에서 반전 운동의 대표적인 목소리가 나왔다는 사실은 그 자신도 자주 언급했습니다. 1976년 MIT의 인스티튜트 교수가 되었고, 2017년 애리조나 대학으로 옮겼습니다.
이어지는 곳. 촘스키가 반박한 유한 상태 모형은 마르코프가 시의 글자를 세며 시작하고 섀넌이 영어에 적용한 것이었고, 위계의 맨 위층은 튜링의 기계입니다. 문맥 자유 문법으로 문장을 분석하는 CYK 알고리즘(CYK algorithm)은, 문장의 짧은 조각부터 어떤 문법 기호로 묶일 수 있는지를 표에 채워 가며 긴 조각의 답을 짧은 조각의 답으로 구하는 동적 계획법(dynamic programming)의 대표적인 예입니다. 그 알고리즘(algorithm)이 쓰는, 모든 규칙을 A → BC나 A → a 꼴로 고친 촘스키 표준형(Chomsky normal form)도 그의 이름을 땄습니다. 그가 비판한 확률 쪽의 이야기는 글자 하나가 평균(mean) 몇 비트의 정보를 담는지 재는 정보 엔트로피(information entropy)와, 낱말의 빈도가 순위에 대략 반비례한다는 지프의 법칙(Zipf's law)으로 이어집니다. 그가 문법의 규칙을 머릿속에서 찾았다면, 여러 언어의 소리 대응으로 사라진 조상 언어를 되살리는 쪽의 규칙 찾기는 비교 언어학(comparative linguistics)에 있습니다.
관계.
- 논쟁 클로드 섀넌 — 1956년 MIT 정보 이론 심포지엄에서 촘스키는 섀넌이 영어를 흉내 내는 데 쓴 유한 상태 모형으로는 영어의 문장 구조를 다 적을 수 없다고 논증했습니다.
- 영향을 받음 르네 데카르트 — 1966년 책 『데카르트 언어학』에서 촘스키는 사람이 새 문장을 끝없이 만들어 내는 능력에 주목한 데카르트와 포르루아얄 학파의 합리론을 자기 생각의 선구로 꼽았습니다.
- 영향을 받음 파니니 — 촘스키는 규칙을 차례로 적용해 산스크리트 낱말과 문장을 만들어 내는 파니니의 문법을 생성 문법(generative grammar)의 먼 조상으로 인정했습니다.
연표.
- 1949년 펜실베이니아 대학을 졸업하다
- 1951년 하버드의 소사이어티 오브 펠로스에 들어가다
- 1955년 박사 학위를 받고 MIT에서 가르치기 시작하다
- 1956년 「세 가지 언어 모형」을 발표하다
- 1957년 『통사 구조』를 펴내다
- 1959년 문법의 위계를 정리하고 스키너의 『언어 행동』을 비판하다
- 1961년 할레와 함께 MIT에 언어학 대학원 과정을 세우다
- 1965년 『통사 이론의 여러 측면』에서 언어 능력과 언어 수행을 나누다
- 1967년 「지식인의 책임」으로 베트남 전쟁을 비판하다
- 1975년 1955년의 원고 『언어 이론의 논리적 구조』가 책으로 나오다
- 1976년 MIT의 인스티튜트 교수가 되다
- 1981년 원리와 매개변수로 문법을 설명하는 틀을 내놓다
- 1988년 허먼과 함께 『여론 조작』을 펴내다
- 1995년 『최소주의 프로그램』을 펴내다
- 2017년 애리조나 대학으로 옮기다
- 2023년 『뉴욕 타임스』에 큰 언어 모델을 비판하는 글을 쓰다