수학 개념 지도
언어와 계산(Language and computation)

비교 언어학(Comparative linguistics)

여러 언어의 낱말을 나란히 놓고 규칙적인 소리 대응을 찾아, 기록이 남지 않은 공통 조상 언어(조어)를 재구성하는 방법. 그림의 법칙⁠(Grimm's law)⁠과 인도유럽어⁠(Indo-European languages)⁠ 연구가 대표적이다.

라틴어 p:영어 f (pater : father, ped- : foot),t:θ,k:h\text{라틴어 } p : \text{영어 } f \ (\text{pater : father, ped- : foot}), \qquad t : \theta, \qquad k : h
먼저 보면 좋은 개념함수집합

라틴어 pater와 영어 father, 라틴어 trēs와 영어 three는 닮았습니다. 그러나 닮은 낱말 몇 쌍으로는 아무것도 증명할 수 없습니다. 두 언어의 낱말이 수천 개씩이면 우연히 닮은 쌍도 꽤 나오기 때문입니다. 스물세 명만 모여도 생일이 같은 두 사람이 있을 확률⁠(probability)⁠이 절반을 넘는 생일 문제⁠(birthday problem)⁠와 같은 이치입니다. 비교 방법⁠(comparative method)⁠의 핵심은 닮음이 아니라 규칙적인 대응입니다. 라틴어의 낱말 첫머리 p가 영어 고유어에서 한두 번이 아니라 거의 언제나 f로 나타난다면, 그것은 우연이 아니라 한 조상 언어에서 갈라진 뒤 소리가 규칙적으로 바뀐 흔적입니다. 영어 paternal처럼 p로 시작하는 낱말은 대부분 나중에 라틴어에서 빌려 온 것이라 이 비교에서 뺍니다.

아래 표는 인도유럽어의 잘 알려진 동족어⁠(cognate)⁠들입니다. 소리 대응을 골라 보세요: . 뜻 칸을 누르면 그 낱말의 재구형⁠(reconstructed form)⁠이 나옵니다.

산스크리트어·그리스어·라틴어는 로마자로 옮겨 적었고, 격 어미에 가려지는 자음은 어간(-)으로 적었습니다. 색칠한 글자가 서로 대응하는 소리입니다. 독일어는 뒤에 한 번 더 자음이 바뀌어(고지 독일어 자음 추이⁠(High German consonant shift)⁠ 등) t가 z나 ß, þ가 d로 나타납니다.

게르만어(고트어·영어·독일어)만 다른 언어들과 어긋나고, 그 어긋남이 체계적입니다. 다른 언어의 p·t·k가 게르만어에서는 f·θ(영어 th의 소리)·h로, d가 t로, bʰ(b를 내며 숨을 함께 내뱉는 소리)가 b로 나타납니다. 1822년 동화 수집가 그림 형제의 형이자 언어학자인 야코프 그림이 이 대응을 정리했고(덴마크 언어학자 라스무스 라스크가 몇 해 앞서 알아챘습니다) 그림의 법칙이라 부릅니다. 대응을 소리에서 소리로 가는 함수⁠(function)⁠로 보면, 조어의 한 소리가 각 언어에서 어떤 소리가 되는지 정해 주는 사상이고, 이 사상이 여러 낱말에 걸쳐 일관되어야 한다는 것이 방법의 뼈대입니다. 이제 거꾸로, 모든 언어의 대응을 설명하는 조어의 형태를 추론할 수 있습니다. '아버지'의 인도유럽 조어 형태 *ph₂tḗr가 그런 재구형입니다. 별표는 기록으로 확인된 형태가 아니라 추론한 형태라는 표시이고, h₂는 오늘날의 언어들에서는 사라진 목구멍소리(후두음⁠, laryngeal⁠) 하나를 적는 기호입니다.

규칙에는 예외가 보였습니다. 표에서 '아버지'의 고트어는 규칙대로라면 þ가 나와야 할 자리에 d(fadar)가 있습니다. 1875년 무렵 덴마크 언어학자 카를 베르너는 이것이 조어의 강세 위치에 따라 갈린 결과임을 보였습니다. 그림의 법칙으로 생긴 f·θ·h는 낱말 첫머리가 아니고 조어에서 바로 앞 음절에 강세가 없을 때 다시 울림소리(성대가 떨리는 소리)로 바뀌었다는 것입니다(베르너의 법칙⁠, Verner's law⁠). *ph₂tḗr는 강세가 t 뒤의 음절에 있으므로 t가 θ를 거쳐 울림소리가 되었고, 고트어 fadar의 d가 그 흔적입니다. 예외처럼 보이던 것도 더 정밀한 규칙으로 설명된다는 것이 드러났고, 이 일은 '소리 변화에는 예외가 없다'는 원칙에 힘을 실었습니다. 이 원칙을 내건 이들이 19세기 말 라이프치히를 중심으로 모인 젊은 독일 언어학자들, 곧 소장문법학파입니다. 어떤 대응이 게르만어 전체에 공통으로 나타난다는 사실 자체가, 게르만어들이 한 조상(게르만 조어)을 공유한다는 증거가 됩니다.

간추린 계통도입니다. 그림의 법칙이 일어난 곳은 게르만 조어로 가는 가지(노랑)이므로, 그 아래의 언어들은 모두 같은 대응을 물려받습니다.

이런 계통도는 순환이 없는 그래프인 나무이고, 오늘날에는 기본 낱말 목록에서 동족어를 공유하는 비율(일종의 자카드 지수⁠(Jaccard index)⁠)이나 낱말 사이의 편집 거리⁠(edit distance)⁠를 재어, 생물의 계통수⁠(phylogenetic tree)⁠를 만드는 알고리즘⁠(algorithm)⁠으로 언어의 나무를 추정하기도 합니다. 다만 비교 방법이 거슬러 올라갈 수 있는 깊이는 대체로 수천 년에서 1만 년 남짓으로 여겨지고, 그보다 오래되면 규칙적 대응이 너무 희미해집니다. 한국어의 계통이 그런 예입니다. 한국어를 튀르크어·몽골어·만주퉁구스어와 함께 알타이어족⁠(Altaic languages)⁠으로 묶는 가설이 있었지만 규칙적인 대응이 충분히 입증되지 않아 지금은 널리 받아들여지지 않습니다. 한국어는 다른 언어와의 계통 관계가 입증되지 않은 고립어(제주어를 따로 세면 작은 한국어족)로 보는 견해가 많습니다.

이어지는 곳. 'p → f / 낱말 첫머리'('낱말 첫머리에서 p를 f로 바꾼다') 같은 소리 변화 규칙은 문맥을 적는 다시 쓰기 규칙이라 촘스키 위계⁠(Chomsky hierarchy)⁠의 문맥 의존 규칙⁠(context-sensitive rule)⁠ 모양을 하고 있습니다. 하지만 실제로 쓰이는 음운 규칙들은 그보다 훨씬 약한 기계, 곧 유한 오토마톤⁠(finite automaton)⁠이 글자를 읽을 때마다 글자를 내놓게 한 유한 상태 변환기⁠(finite-state transducer)⁠로 표현할 수 있다는 것이 알려져 있습니다. 규칙이 자기가 방금 바꾼 자리에 거듭 적용되지 않는다는 조건에서 성립하는 결과입니다(미국 언어학자 C. 더글러스 존슨 1972, 로널드 캐플런과 마틴 케이 1994). 대응을 찾는 일은 한 언어의 소리 집합⁠(set)⁠에서 다른 언어의 소리 집합으로 가는 짝짓기를 찾는 일입니다. 또 앞에서 본 생일 문제처럼 우연한 닮음이 얼마나 자주 생기는지를 따져야 진짜 대응을 가려낼 수 있으니, 이것은 확률의 문제이기도 합니다. 인도 캘커타에서 판사로 일하던 영국의 언어학자 윌리엄 존스가 1786년 산스크리트어와 그리스어·라틴어가 한 뿌리에서 나왔다고 지적한 강연이 인도유럽어 비교 연구의 출발점으로 흔히 꼽힙니다.

이 개념이 나오는 긴 글

계산언어학 말을 세는 기계 문법은 규칙일까, 확률일까? 파니니의 문법에서 촘스키의 위계, 섀넌의 영어 엔트로피, 오늘날의 언어 모델까지.

이 개념을 언급하는 페이지

이 페이지가 가리키는 개념