수학 개념 지도
인물

폴 자카드(Paul Jaccard)

알프스와 쥐라 산지의 식물 목록을 비교하며, 두 집합⁠(set)⁠의 교집합⁠(intersection)⁠ 크기를 합집합⁠(union)⁠ 크기로 나눈 '공동체 계수'(오늘날의 자카드 지수⁠(Jaccard index)⁠)를 내놓은 스위스의 식물학자.

J(A,B)=∣A∩B∣∣A∪B∣J(A, B) = \frac{|A \cap B|}{|A \cup B|}

폴 자카드는 1868년 스위스 서부 보 주에서 태어난 식물학자입니다. 로잔에서 공부하고 가르쳤고, 뒤에 취리히 연방 공과대학(ETH)에서 식물학을 가르치며 식물의 분포와 목재의 구조를 연구했습니다. 그의 시대 식물학의 큰 질문 하나는 '어떤 식물이 왜 거기서 자라는가'였습니다. 19세기 초 훔볼트가 산의 높이에 따라 식물대가 바뀐다는 것을 보인 뒤, 제네바의 드 캉돌 집안 같은 스위스 식물학자들은 식물 지리학을 한 분야로 세웠습니다. 알프스는 그 천연 실험실이었습니다. 빙하가 물러난 뒤 식물이 어떻게 산으로 다시 퍼졌는지, 이웃한 골짜기의 식물상이 닮은 것은 환경이 비슷해서인지 아니면 씨앗이 옮겨 가기 쉬워서인지가 논쟁거리였습니다. 같은 무렵 영국에서는 골턴과 피어슨이 생물의 변이를 상관계수⁠(correlation coefficient)⁠로 재고 있었습니다. 자카드는 키나 무게 같은 측정값이 아니라 '있다, 없다'만 적힌 목록을 비교하는 방법이 필요했고, 그렇게 오늘날 가장 널리 쓰이는 유사도⁠(similarity)⁠ 가운데 하나를 만들었습니다.

굵은 막대가 이 사람의 생애이고, 흰검은 점은 페이지 끝 연표에 적은 일들입니다. 가는 막대는 같은 시대를 산 이 위키의 인물들입니다. 나이를 끌어 보세요.

나이 세 ·

그는 서부 알프스의 드랑스 강 유역과 이웃한 여러 지역, 그리고 쥐라 산지의 몇몇 구역을 돌며 구역마다 어떤 식물 종이 자라는지 목록을 만들었습니다. 이런 자료에서 각 구역은 종들의 집합입니다. 몇 포기가 자라는지는 적지 않고, 어떤 종이 있는지만 적습니다. 문제는 두 목록을 어떻게 비교하느냐였습니다. 함께 있는 종의 개수만 세면 공정하지 않습니다. 종이 많은 큰 구역끼리는 우연히도 겹치는 종이 많을 테니까요.

1901년 로잔의 보 자연과학회 회보에 실린 두 논문에서 그는 '공동체 계수⁠(coefficient of community)⁠'를 썼습니다. 두 구역에 함께 있는 종의 수를, 두 구역 가운데 적어도 한 곳에 있는 종의 수로 나누어 백분율로 적은 것입니다. 집합의 말로 하면 교집합의 크기를 합집합의 크기로 나눈 값, 곧 오늘날의 자카드 지수입니다. 구역 A에 30종, 구역 B에 40종이 자라고 그 가운데 20종이 겹친다면, 합집합은 30 + 40 − 20 = 50종이고(포함배제 원리⁠, inclusion–exclusion principle⁠) 계수는 20/50 = 40%입니다. 두 목록이 똑같으면 100%, 겹치는 종이 하나도 없으면 0%입니다. 이 계수에는 한 가지 의도된 성질이 있습니다. 두 구역 어디에도 없는 종은 셈에 넣지 않는다는 것입니다. 알프스 어디에도 없는 열대 식물이 두 구역에 모두 '없다'고 해서 두 구역이 닮았다고 할 수는 없기 때문입니다.

그가 얻은 계수는 뜻밖에 낮았습니다. 서로 가깝고 환경도 비슷해 보이는 구역끼리도 함께 가진 종의 비율이 생각보다 작았습니다. 1902년의 긴 논문 「고산대의 식물 분포 법칙」과 1908년의 후속 연구에서 그는 이 결과를, 한 구역의 식물상이 그곳의 흙, 볕, 물기 같은 생태 조건이 얼마나 다양한가에 크게 좌우된다는 뜻으로 해석했습니다. 조건이 다양한 구역일수록 종이 많고, 두 구역의 조건이 닮을수록 공동체 계수가 커진다는 것입니다. 1912년 그는 이 연구를 영국의 식물학 학술지 『뉴 파이톨로지스트』에 영어로 소개했고, 이 논문을 통해 그의 계수가 영어권 생태학자들에게 알려졌습니다.

그는 비슷한 방법으로 한 구역의 종 수를 속(屬) 수와 비교하는 '속 계수'도 따졌습니다. 좁은 구역일수록 한 속에서 종이 하나씩만 나타나는 경향이 있다는 관찰이었는데, 이것이 비슷한 종끼리의 경쟁을 보여 주는 흔적인지, 아니면 표본⁠(sample)⁠이 작을 때 저절로 생기는 착시인지는 뒤에 생태학의 오랜 논쟁거리가 되었습니다. 1940년대 영국의 생태학자 엘턴은 이 비율을 경쟁의 증거로 읽었고, 통계학자들은 무작위로 종을 뽑아도 비슷한 비율이 나온다고 반박했습니다. 목록을 비교하는 수를 해석할 때는 우연만으로 기대되는 값과 견주어야 한다는 교훈이 여기서 나왔습니다(통계학⁠(statistics)⁠).

그의 계수는 곧 여러 사촌을 얻었습니다. 1945년 미국 미시간의 생태학자 다이스와 1948년 덴마크의 식물학자 쇠렌센은 따로따로 교집합의 두 배를 두 집합 크기의 합으로 나눈 계수에 이르렀습니다(쇠렌센–다이스 계수⁠, Sørensen–Dice coefficient⁠). 두 계수는 D = 2J/(1 + J)로 이어져 있어서 어느 쪽으로 순위를 매기든 순서는 같습니다. 1958년 IBM의 타니모토는 0과 1로 적은 비트열에서 같은 값을 정의했고, 이 '타니모토 계수⁠(Tanimoto coefficient)⁠'는 지금도 분자 구조의 닮음을 재는 화학 정보학의 표준입니다. 1963년 소칼과 스니스는 생물을 형질의 유무로 분류하는 수치 분류학⁠(numerical taxonomy)⁠을 세우며 자카드의 계수를 기본 도구 가운데 하나로 삼았습니다.

수학적으로도 이 계수는 좋은 성질을 가졌습니다. 1에서 자카드 지수를 뺀 값은 거리 함수⁠(metric)⁠의 세 규칙, 곧 자기 자신과는 0, 순서를 바꿔도 같음, 삼각부등식⁠(triangle inequality)⁠을 모두 지킵니다. 반면 1에서 다이스 계수⁠(Dice coefficient)⁠를 뺀 값은 삼각부등식을 어길 수 있습니다. A = {a}, B = {a, b}, C = {b}라면 다이스로는 A와 C 사이가 1인데 A–B와 B–C는 각각 1/3이어서 돌아가는 길이 더 짧아집니다. 자카드로는 1 ≤ 1/2 + 1/2로 가까스로 규칙을 지킵니다. 두 집합을 0과 1의 줄로 적으면, 한쪽에만 있는 원소⁠(element)⁠의 수는 두 줄의 해밍 거리⁠(Hamming distance)⁠이고, 자카드 거리는 그것을 합집합의 크기로 나눈 것입니다.

한 세기 뒤 이 계수는 인터넷 규모의 문제를 풀었습니다. 1997년 검색 엔진 알타비스타에서 일하던 브로더는 거의 똑같은 웹 문서를 가려내려고, 문서를 연이은 낱말 몇 개씩의 조각(n-그램⁠, n-gram⁠)의 집합으로 보고 그 자카드 지수를 빠르게 어림하는 방법을 만들었습니다. 모든 조각을 무작위 순서로 한 줄로 세운 뒤, 각 문서에서 가장 앞에 오는 조각을 봅니다. 두 문서의 합집합에서 가장 앞에 오는 조각은 합집합의 원소 가운데 어느 것이든 똑같은 확률⁠(probability)⁠로 뽑히고, 두 문서의 '가장 앞 조각'이 같아지는 것은 그 조각이 교집합에 있을 때뿐입니다. 그러니 두 문서의 가장 앞 조각이 같을 확률은 정확히 |A∩B|/|A∪B|, 곧 자카드 지수입니다. 무작위 순서 대신 해시 함수⁠(hash function)⁠ 수백 개를 쓰고 일치하는 비율을 세면, 긴 문서를 통째로 비교하지 않고도 닮음을 어림할 수 있습니다. MinHash라 불리는 이 방법은 무작위 알고리즘⁠(randomized algorithm)⁠과 최근접 이웃⁠(nearest neighbor)⁠ 탐색의 고전이 되었고, 2016년에는 유전체를 짧은 염기 조각의 집합으로 보고 수많은 유전체 사이의 거리를 재는 도구로도 쓰였습니다(무작위성).

오늘날 그의 이름은 식물학보다 컴퓨터 과학에서 더 자주 불립니다. 컴퓨터 비전은 예측한 영역과 정답 영역이 얼마나 겹치는지를 자카드 지수(IoU, 교집합 나누기 합집합)로 평가하고, 추천 시스템은 두 사용자가 산 물건의 집합으로 닮은 사람을 찾으며, 언어학자들은 두 언어가 기본 낱말 목록에서 공유하는 동족어⁠(cognate)⁠의 비율로 언어의 계통을 추정합니다. 알프스의 골짜기 하나를 식물 이름의 목록으로 바꾼 그의 발상은, 무엇이든 '무엇을 가졌는가'의 집합으로 적으면 같은 자로 잴 수 있다는 표현 바꾸기의 좋은 예입니다. 그는 1944년 취리히에서 세상을 떠났습니다.

이어지는 곳. 그의 계수는 자카드 지수와 쇠렌센–다이스 계수로, 그 바탕은 집합, 집합 연산, 포함배제 원리로 이어집니다. 거리로서의 성질은 거리 함수와 해밍 거리에서, 빠른 어림은 무작위 알고리즘과 최근접 이웃에서 볼 수 있습니다. 동족어 목록으로 언어의 족보를 그리는 이야기는 야코프 그림과 비교 언어학⁠(comparative linguistics)⁠에 있습니다.

연표.

  • 1901년 알프스와 쥐라의 식물 분포를 비교한 두 논문에서 공동체 계수를 쓰다
  • 1902년 알프스 고산대의 식물 분포 법칙에 관한 긴 논문을 내다
  • 1908년 식물 분포에 관한 새 연구를 발표하다
  • 1912년 영국의 학술지 『뉴 파이톨로지스트』에 연구를 영어로 소개하다

이 인물이 나오는 긴 글

거리와 유사도 까마귀와 택시 까마귀는 곧장 날고 택시는 블록을 돌아간다. '얼마나 먼가'에는 답이 하나가 아니고, 어떤 거리를 고르느냐가 통계와 기계 학습의 답을 바꾼다.

이 인물을 언급하는 페이지

이 페이지가 가리키는 개념