비교 언어학(Comparative linguistics)
여러 언어의 낱말을 나란히 놓고 규칙적인 소리 대응을 찾아, 기록이 남지 않은 공통 조상 언어(조어)를 재구성하는 방법. 그림의 법칙(Grimm's law)과 인도유럽어(Indo-European languages) 연구가 대표적이다.
라틴어 pater와 영어 father, 라틴어 trēs와 영어 three는 닮았습니다. 그러나 닮은 낱말 몇 쌍으로는 아무것도 증명할 수 없습니다. 두 언어의 낱말이 수천 개씩이면 우연히 닮은 쌍도 꽤 나오기 때문입니다. 스물세 명만 모여도 생일이 같은 두 사람이 있을 확률(probability)이 절반을 넘는 생일 문제(birthday problem)와 같은 이치입니다. 비교 방법(comparative method)의 핵심은 닮음이 아니라 규칙적인 대응입니다. 라틴어의 낱말 첫머리 p가 영어 고유어에서 한두 번이 아니라 거의 언제나 f로 나타난다면, 그것은 우연이 아니라 한 조상 언어에서 갈라진 뒤 소리가 규칙적으로 바뀐 흔적입니다. 영어 paternal처럼 p로 시작하는 낱말은 대부분 나중에 라틴어에서 빌려 온 것이라 이 비교에서 뺍니다.
아래 표는 인도유럽어의 잘 알려진 동족어(cognate)들입니다. 소리 대응을 골라 보세요:
게르만어(고트어·영어·독일어)만 다른 언어들과 어긋나고, 그 어긋남이 체계적입니다. 다른 언어의 p·t·k가 게르만어에서는 f·θ(영어 th의 소리)·h로, d가 t로, bʰ(b를 내며 숨을 함께 내뱉는 소리)가 b로 나타납니다. 1822년 동화 수집가 그림 형제의 형이자 언어학자인 야코프 그림이 이 대응을 정리했고(덴마크 언어학자 라스무스 라스크가 몇 해 앞서 알아챘습니다) 그림의 법칙이라 부릅니다. 대응을 소리에서 소리로 가는 함수(function)로 보면, 조어의 한 소리가 각 언어에서 어떤 소리가 되는지 정해 주는 사상이고, 이 사상이 여러 낱말에 걸쳐 일관되어야 한다는 것이 방법의 뼈대입니다. 이제 거꾸로, 모든 언어의 대응을 설명하는 조어의 형태를 추론할 수 있습니다. '아버지'의 인도유럽 조어 형태 *ph₂tḗr가 그런 재구형입니다. 별표는 기록으로 확인된 형태가 아니라 추론한 형태라는 표시이고, h₂는 오늘날의 언어들에서는 사라진 목구멍소리(후두음, laryngeal) 하나를 적는 기호입니다.
규칙에는 예외가 보였습니다. 표에서 '아버지'의 고트어는 규칙대로라면 þ가 나와야 할 자리에 d(fadar)가 있습니다. 1875년 무렵 덴마크 언어학자 카를 베르너는 이것이 조어의 강세 위치에 따라 갈린 결과임을 보였습니다. 그림의 법칙으로 생긴 f·θ·h는 낱말 첫머리가 아니고 조어에서 바로 앞 음절에 강세가 없을 때 다시 울림소리(성대가 떨리는 소리)로 바뀌었다는 것입니다(베르너의 법칙, Verner's law). *ph₂tḗr는 강세가 t 뒤의 음절에 있으므로 t가 θ를 거쳐 울림소리가 되었고, 고트어 fadar의 d가 그 흔적입니다. 예외처럼 보이던 것도 더 정밀한 규칙으로 설명된다는 것이 드러났고, 이 일은 '소리 변화에는 예외가 없다'는 원칙에 힘을 실었습니다. 이 원칙을 내건 이들이 19세기 말 라이프치히를 중심으로 모인 젊은 독일 언어학자들, 곧 소장문법학파입니다. 어떤 대응이 게르만어 전체에 공통으로 나타난다는 사실 자체가, 게르만어들이 한 조상(게르만 조어)을 공유한다는 증거가 됩니다.
이런 계통도는 순환이 없는 그래프인 나무이고, 오늘날에는 기본 낱말 목록에서 동족어를 공유하는 비율(일종의 자카드 지수(Jaccard index))이나 낱말 사이의 편집 거리(edit distance)를 재어, 생물의 계통수(phylogenetic tree)를 만드는 알고리즘(algorithm)으로 언어의 나무를 추정하기도 합니다. 다만 비교 방법이 거슬러 올라갈 수 있는 깊이는 대체로 수천 년에서 1만 년 남짓으로 여겨지고, 그보다 오래되면 규칙적 대응이 너무 희미해집니다. 한국어의 계통이 그런 예입니다. 한국어를 튀르크어·몽골어·만주퉁구스어와 함께 알타이어족(Altaic languages)으로 묶는 가설이 있었지만 규칙적인 대응이 충분히 입증되지 않아 지금은 널리 받아들여지지 않습니다. 한국어는 다른 언어와의 계통 관계가 입증되지 않은 고립어(제주어를 따로 세면 작은 한국어족)로 보는 견해가 많습니다.
이어지는 곳. 'p → f / 낱말 첫머리'('낱말 첫머리에서 p를 f로 바꾼다') 같은 소리 변화 규칙은 문맥을 적는 다시 쓰기 규칙이라 촘스키 위계(Chomsky hierarchy)의 문맥 의존 규칙(context-sensitive rule) 모양을 하고 있습니다. 하지만 실제로 쓰이는 음운 규칙들은 그보다 훨씬 약한 기계, 곧 유한 오토마톤(finite automaton)이 글자를 읽을 때마다 글자를 내놓게 한 유한 상태 변환기(finite-state transducer)로 표현할 수 있다는 것이 알려져 있습니다. 규칙이 자기가 방금 바꾼 자리에 거듭 적용되지 않는다는 조건에서 성립하는 결과입니다(미국 언어학자 C. 더글러스 존슨 1972, 로널드 캐플런과 마틴 케이 1994). 대응을 찾는 일은 한 언어의 소리 집합(set)에서 다른 언어의 소리 집합으로 가는 짝짓기를 찾는 일입니다. 또 앞에서 본 생일 문제처럼 우연한 닮음이 얼마나 자주 생기는지를 따져야 진짜 대응을 가려낼 수 있으니, 이것은 확률의 문제이기도 합니다. 인도 캘커타에서 판사로 일하던 영국의 언어학자 윌리엄 존스가 1786년 산스크리트어와 그리스어·라틴어가 한 뿌리에서 나왔다고 지적한 강연이 인도유럽어 비교 연구의 출발점으로 흔히 꼽힙니다.
이 개념이 나오는 긴 글
이 개념을 언급하는 페이지
- 생일 문제
… 왔다고 말하려면 몇몇 닮은 낱말이 아니라, 우연으로는 설명되지 않는 규칙적인 소리 대응이 필요합니다(비교 언어학).
- 동치관계와 분할
… 5가지뿐입니다. '같은 조상 낱말에서 왔다'는 관계는 여러 언어의 낱말들을 동족어 무리로 나눕니다(비교 언어학).
- 편집 거리
… 언어학자들은 두 언어의 낱말을 비교할 때 글자 거리만 보지 않고, 규칙적인 소리 대응을 찾습니다(비교 언어학). 글자가 조금 닮은 것은 우연으로도 흔하지만, 규칙적인 대응은 한 조상에서 온 낱말을 가려내 줍니다.
- 트리
… 갈라져 나온 언어나 생물의 계통수도 트리입니다. 옛 언어를 뿌리로, 그 후손 언어들을 가지로 그리는비교 언어학의 어족 나무가 그 예입니다.
- 렘펠–지브 압축
… 얼마나 줄어드는지로 글 사이의 거리를 잴 수도 있습니다. 여러 언어로 된 같은 글을 이런 거리로 묶어비교 언어학의 계통수와 비슷한 나무를 얻은 연구도 있습니다. 흔한 낱말이 압도적으로 자주 나오는 지프의 법칙이 …