로지스틱 회귀(Logistic regression)
직선 wx + b를 S자 곡선(시그모이드, sigmoid)에 넣어 'y = 1일 확률(probability)'을 내는 모형. 최대가능도로 맞춘다. 그 손실(로그 손실, log loss)은 볼록해서 엉뚱한 골짜기가 없고, 가장 낮은 곳이 있으면 기울기(slope)를 따라 내려가 찾을 수 있다. 다만 두 무리가 완전히 갈린 자료에서는 가장 낮은 곳이 없다.
시험 전날 평소보다 더 공부한 시간(음수면 덜 공부한 시간)을 x라 하고, 합격하면 y = 1, 떨어지면 y = 0이라 적어 봅시다. 아래 점 14개 가운데 위쪽 줄의 노란 점이 합격, 아래쪽 줄의 파란 점이 불합격입니다. 점들 사이로 직선을 긋는 최소제곱 회귀(least-squares regression)를 그대로 쓰면 예측값이 0보다 작거나 1보다 커질 수 있어서 확률로 읽을 수 없습니다. 로지스틱 회귀는 직선
w =
어떤 w, b가 좋은지는 최대가능도로 정합니다. 모형이 옳다면 점 i의 답이 실제로 나온 대로 나올 확률은
지금 L =
최소제곱(least squares)과 달리 L을 가장 작게 하는 w, b를 한 번에 주는 공식은 없습니다. 대신 좋은 성질이 있습니다. 시그모이드는
최소제곱의 기울기
둘째 그림은 (w, b) 평면에 그린 L의 등고선이고,
계수 w에는 깔끔한 뜻이 있습니다. 확률 p 대신 오즈(odds)
로 로그 오즈(log-odds)가 x의 일차식입니다. 그래서 x가 1 늘 때마다 오즈가
왜 하필 시그모이드일까요? 한 가지 답은 베이즈 정리(Bayes' theorem)에서 나옵니다. 합격자의 x는 평균
주의할 경우가 하나 있습니다. 점을 끌어 모든 노란 점이 모든 파란 점보다 오른쪽에 오게 해 보세요. 두 무리가 완전히 갈리면 경계를 그 틈에 둔 채 w를 키울수록 곡선이 계단에 가까워지고 손실은 계속 줄어듭니다. L은 0에 한없이 다가가지만 닿지 않으므로, 가장 좋은 w는 존재하지 않습니다. 등고선에서도 바닥이 그림 밖으로 끝없이 달아납니다. 이때 '맞추기' 단추는 경계를 틈의 한가운데에 둔 채 w를 그림의 끝(노랑이 오른쪽이면 6, 왼쪽이면 −2)까지만 옮깁니다. 실제로는 w가 커지는 데 벌점을 주는 정규화로 답을 하나로 정합니다.
S자 곡선에 '로지스틱'이라는 이름을 붙인 사람은 벨기에의 수학자 피에르프랑수아 페르휠스트입니다. 그는 1838년 논문에서 처음에는 지수적으로 늘다가 한계에 다가가며 느려지는 인구를 이 곡선으로 나타냈고, 1845년 논문에서 이 곡선을 '로지스틱'이라 불렀습니다. 이 인구 모형을 한 세대씩 끊어 적은 식이 로지스틱 사상(logistic map)입니다. 1944년 미국의 통계학자 조지프 버크슨은 로그 오즈를 '로짓(logit)'이라 부르며 약물의 효과를 분석하는 데 썼고, 1958년 영국의 통계학자 데이비드 콕스가 0과 1로 된 자료의 회귀로 정리했습니다.
이어지는 곳. 퍼셉트론(perceptron)은 틀린 점에서만
이 개념이 나오는 긴 글
이 개념 위에 세워진 것
이 개념을 언급하는 페이지
- 지수함수 eˣ
… 1이 되게 나누면 확률이 됩니다. 이것이 소프트맥스이고, 점수가 둘일 때 두 점수의 차를 x라 하면로지스틱 회귀의 S자 곡선 1/(1 + e^{-x}) 가 됩니다. 같은 급수에 정사각행렬을 넣은 행렬 지수 …
- 최소제곱 회귀
… 아니라 예/아니오라면 직선을 그대로 맞추는 대신, 직선의 값을 S자 곡선에 넣어 '예일 확률'로 바꾸는로지스틱 회귀를 씁니다.
- 퍼셉트론
… 함수를 매끄러운 S자 곡선인 시그모이드 1/(1+e^{-s}) 로 바꾸면, 출력을 '노랑일 확률'로 읽는로지스틱 회귀가 됩니다. 매끄러우니 미분할 수 있고, 그래서 역전파로 학습하는 신경망의 부품이 됩니다. 두 무리 …
- 신경망
… , 정확도는 , 걸음 학습했습니다. H = 0이면 숨은 층 없이 출력 단위 하나만 남아 매끄러운 퍼셉트론(로지스틱 회귀)이 되고, XOR 자료에서는 어떤 직선도 소용없어 정확도가 절반 근처에 머뭅니다. H = 2로 놓고 …
- 최대가능도법
… 이 낱말이 나온 횟수'로 확률을 매기는 것도 동전의 k/n과 같은 최대가능도 추정입니다. 두 갈래를 가르는로지스틱 회귀도, 앞의 토큰들로 다음 토큰의 확률을 내는 언어 모델도 이렇게 최대가능도로 학습합니다. 역사. 가장 …
- 기계 학습
… 답이 스팸/정상처럼 몇 가지 가운데 하나면 분류, 집값처럼 수이면 회귀라 부릅니다. 최소제곱 회귀,로지스틱 회귀, 퍼셉트론, 결정 트리, 서포트 벡터 머신, 최근접 이웃 분류, 신경망이 여기 …
- 소프트맥스와 교차 엔트로피
… + e^{z_2}) = 1/(1 + e^{-(z_1 - z_2)}) = \sigma(z_1 - z_2) 로로지스틱 회귀의 시그모이드가 됩니다. 그래서 부류마다 점수를 특성의 일차식으로 두고 소프트맥스를 씌운 모형은 로지스틱 …
- 정규화: 릿지와 라소
… 대응은 라그랑주 승수법과 볼록 최적화의 쌍대성으로 정확해집니다. 두 무리가 완전히 갈려 답이 없던로지스틱 회귀도 벌점을 붙이면 답이 하나로 정해집니다. 서포트 벡터 머신이 최소화하는 …
- 서포트 벡터 머신과 커널
… 1보다 작게 줄여 보세요. 띠가 넓어지고 서포트 벡터가 늘어납니다. 손실을 나란히 놓으면 차이가 보입니다.로지스틱 회귀의 손실은 \log(1 + e^{-yf}) , 퍼셉트론은 \max(0, -yf) , 힌지는 \max(0, …
- 볼록 함수와 볼록 최적화
… 문제라 합니다. 선형 계획법(일차식 목표, 일차 부등식으로 잘라 낸 볼록 다면체), 최소제곱법,로지스틱 회귀의 손실, 계수의 절댓값 합에 벌점을 매기는 라소 같은 정규화, 서포트 벡터 머신이 모두 여기에 …
- 인공지능
… 배우는 고전적인 방법. 점들에 가장 잘 맞는 직선을 찾는 최소제곱 회귀, 예/아니요의 확률을 내는로지스틱 회귀, 가장 가까운 예를 따르는 최근접 이웃 분류, 비슷한 점끼리 묶는 k-평균 군집, 자료가 가장 …
- 언어 모델과 다음 토큰 예측
… 잽니다. 마지막 층의 점수를 확률로 바꾸는 소프트맥스와 교차 엔트로피는 한 쌍으로 쓰이며, 분류 문제의로지스틱 회귀가 같은 손실을 씁니다. 학습된 분포에서 실제로 글을 뽑는 규칙은 디코딩이 정하고, 손실이 모델과 …
- 인간 피드백 강화 학습과 정렬
… - r_B), \qquad \sigma(t) = \frac{1}{1 + e^{-t}} σ는로지스틱 회귀의 시그모이드 함수입니다. 1952년 랠프 브래들리와 밀턴 테리가 짝 비교 실험을 분석하려고 제안했고, …
- 검색 증강 생성
… e^{\,q\cdot p_j}} 구절 B개를 '보기'로 삼은 소프트맥스분류의 교차 엔트로피입니다. 다른 질문의 짝 구절이 공짜 오답 역할을 해서, 묶음 안 음성 …
- 언어 모델의 발전사: RLHF 이후
… 2022년 10월의 Flan-T5). 다른 하나가 InstructGPT의 세 단계, 곧 지도 미세조정,로지스틱 회귀와 같은 손실로 학습한 보상 모델, KL 발산 벌점을 둔 강화 학습입니다. 논문은 매개변수 13억 개의 …