수학 개념 지도
데이터와 학습(Data and learning)

쇠렌센–다이스 계수(Sørensen–Dice coefficient)

두 집합⁠(set)⁠의 겹침을 2|A∩B| ÷ (|A|+|B|)로 잰 값. 자카드 지수⁠(Jaccard index)⁠와 한쪽이 커지면 다른 쪽도 커지는 관계지만, 1에서 뺀 값은 삼각부등식⁠(triangle inequality)⁠을 어긴다. 의료 영상 분할의 표준 점수다.

D(A,B)=2 ∣A∩B∣∣A∣+∣B∣,D=2J1+J,J=D2−DD(A,B) = \frac{2\,|A\cap B|}{|A|+|B|}, \qquad D = \frac{2J}{1+J}, \quad J = \frac{D}{2-D}
먼저 보면 좋은 개념집합의 연산자카드 지수

아래 격자는 48×32 픽셀짜리 영상입니다. 의사가 표시한 정답 영역 A와 모델이 예측한 영역 B(분홍 원)를 픽셀의 집합으로 봅니다. 원의 중심을 끌고, 반지름 r=r = 을 바꿔 보세요. 표적은 입니다. 둘 다 표시한 픽셀(청록)은 개, 정답에만 있는 픽셀(노랑)은 개, 예측에만 있는 픽셀(분홍)은 개입니다.

청록은 A∩B, 노랑은 A에만, 분홍은 B에만 있는 픽셀입니다. 흰검은 점을 끌면 반지름이 바뀝니다.

쇠렌센–다이스 계수는 겹친 부분을 두 번 세어 두 크기의 합과 비교합니다. 지금 D=D = 입니다. 같은 그림의 자카드 지수(영상에서는 IoU라고 부릅니다)는 겹친 부분을 한 번 세어 합집합⁠(union)⁠과 비교하고, J=J = 입니다. 포함배제 원리⁠(inclusion–exclusion principle)⁠ ∣A∪B∣=∣A∣+∣B∣−∣A∩B∣|A\cup B| = |A|+|B|-|A\cap B|를 넣으면 둘은 D=2J/(1+J)D = 2J/(1+J)로 묶이는 한 쌍입니다.

D = 2J/(1+J). 점선은 D = J인 대각선이고, 점은 지금의 (J, D)입니다.

이 함수⁠(function)⁠는 늘 커지기만 하므로, 여러 예측을 좋은 순서로 줄 세우면 D로 하든 J로 하든 순서가 같습니다. 다만 D는 0과 1 사이에서 언제나 J보다 크거나 같아서, 같은 예측도 D로 적으면 더 좋아 보입니다. 결정적인 차이는 거리로 쓸 때 나옵니다. A={1}A=\{1\}, B={2}B=\{2\}, C={1,2}C=\{1,2\}에서 1−D1-D는 A와 B 사이가 1인데, C를 거치면 13+13=23\tfrac13+\tfrac13=\tfrac23밖에 안 됩니다. 삼각부등식이 깨지니 진짜 거리 함수⁠(metric)⁠가 아닙니다. 같은 세 집합에서 자카드 거리는 1≤12+121 \le \tfrac12+\tfrac12로 규칙을 지킵니다.

영상 분할에서 픽셀 정확도 대신 D를 쓰는 까닭은 표적을 '작은 표적'으로 바꾸고 원을 작게 줄여 보면 보입니다. 표적이 영상의 2%쯤이라서, 원이 표적을 완전히 놓쳐 D가 0이어도 픽셀 정확도는 로 높게 나옵니다. 아무 픽셀도 표시하지 않는 예측조차 정확도가 98%쯤입니다. 배경 픽셀을 맞힌 것까지 세기 때문입니다. D와 J는 두 집합 어디에도 없는 픽셀을 세지 않아서 이런 속임수가 통하지 않습니다. D는 정밀도(예측 가운데 맞은 비율)와 재현율(정답 가운데 찾은 비율)의 조화평균(두 수의 역수⁠(inverse)⁠를 평균⁠(mean)⁠ 내어 다시 뒤집은 값), 곧 기계 학습⁠(machine learning)⁠에서 F1 점수라 부르는 값과 같습니다. 두 비율은 모두 조건부 확률⁠(conditional probability)⁠입니다. 정밀도⁠(precision)⁠는 '예측했다는 조건 아래 정답일 확률⁠(probability)⁠', 재현율⁠(recall)⁠은 '정답이라는 조건 아래 예측될 확률'입니다. 2010년대 중반부터 신경망⁠(neural network)⁠은 학습하면서 줄여 나갈 '틀린 정도'(손실)로 1−D1-D를 씁니다. 픽셀마다 0이나 1 대신 확률을 넣어 매끄럽게 바꾼 뒤 최적화⁠(optimization)⁠하는데, 이것이 다이스 손실입니다.

이어지는 곳. 이름은 두 생태학자에게서 왔습니다. 미국의 리 다이스가 1945년에 두 생물 종이 함께 나타나는 정도를 재려고, 덴마크의 식물학자 토르발 쇠렌센이 1948년에 여러 곳의 식물 군락을 비교하려고 같은 식을 썼습니다. 집합을 0과 1의 벡터⁠(vector)⁠로 적으면 D=2 a⃗⋅b⃗/(∣a⃗∣2+∣b⃗∣2)D = 2\,\vec a\cdot\vec b/(|\vec a|^2+|\vec b|^2)이고, 분모의 산술평균을 기하평균 ∣a⃗∣∣b⃗∣|\vec a||\vec b|으로 바꾸면 코사인 유사도⁠(cosine similarity)⁠가 됩니다. 한쪽에만 있는 것의 개수 FP + FN은 해밍 거리⁠(Hamming distance)⁠입니다. 철자가 비슷한 단어를 찾을 때는 두 글자씩 자른 조각의 다이스 계수⁠(Dice coefficient)⁠를 편집 거리⁠(edit distance)⁠ 대신 쓰기도 합니다.

관련 인물폴 자카드

이 개념이 나오는 긴 글

거리와 유사도 까마귀와 택시 까마귀는 곧장 날고 택시는 블록을 돌아간다. '얼마나 먼가'에는 답이 하나가 아니고, 어떤 거리를 고르느냐가 통계와 기계 학습의 답을 바꾼다.

이 개념을 언급하는 페이지

이 페이지가 가리키는 개념