자주 하는 실수와 요약
자주 하는 실수
| 실수 | 나온 문제 | 바로잡는 법 |
|---|---|---|
| 곱해 가는 비의 평균을 더하기 평균(1.56배)으로 냄 | 1 | 곱의 평균은 로그로 낸다. 한 번에 0.223, 곧 1.25배씩. 100배까지 약 21번 |
| KL 발산 계산 중 음수 항이 나오면 틀렸다고 봄 | 2 | 0 이상이라는 약속은 합 전체에 대한 것. |
| 데이터와 똑같은 모델이면 교차 엔트로피가 0이라고 봄 | 3 | 교차 엔트로피 = |
| 좌표 |
4 | 눈금은 피셔 계량이 정한다. |
| 한 좌표에서 구한 계량 성분에 다른 좌표의 변위를 넣음 | 4 | 좌표를 바꾸면 계량 성분도 바뀐다. |
| 확률을 같은 양만큼 옮기면 KL도 같다고 봄 | 5 | 피셔 계량은 칸마다 |
| 섞인 분포의 분산을 봉우리 하나의 분산(1)으로 봄 | 6 | 봉우리 사이 거리도 분산에 들어간다: |
| 좌우대칭인 문제의 답은 대칭인 점 하나라고 봄 | 6 | 대칭인 것은 답들의 모임. |
| 직각이 아닌 삼각형에도 피타고라스 정리를 씀 | 7 | 남는 항 |
| 경사 하강으로 비중(확률벡터)을 음수로 만듦 | 9 | 성분마다 |
요약
KL 발산은 두 분포를 관측으로 얼마나 잘 구별할 수 있는지를 재는 양으로, 관측 하나가 쌓는 증거의 평균이다. 대칭성과 삼각부등식이 없어 거리는 아니다. 그러나 가까운 두 점 사이에서는 2차 항만 남아 비대칭이 사라지고, 그 계수가 리만 계량(KL이면 피셔 계량)이 된다. 비대칭은 3차 항에서 나타난다. 발산이 비대칭이므로 부분매니폴드로의 사영도 두 가지(m-사영, e-사영)이고, 두 봉우리 분포를 정규분포로 근사하면 하나는 넓게 덮고 하나는 한쪽 봉우리에 붙는다. 쌍대 평탄 공간에서는 사영에 대해 일반화된 피타고라스 정리가 성립한다. 볼록함수와 그 접선 사이의 틈으로 정의하는 브레그만 발산은 KL 발산과 유클리드 거리의 제곱을 함께 만들어 내고, 세 점의 틈을 풀면 남는 항 하나가 쌍대 직교를 잰다. EM 알고리즘이 뒷걸음질하지 않는 이유도 두 사영의 교대에서 나온다.
연결되는 세계들
| 분야 | 연결 |
|---|---|
| 기계학습 | EM 알고리즘 = e-사영과 m-사영의 교대 반복 |
| 강화학습 | RLHF의 KL 페널티: 어느 분포를 앞에 두느냐(영어로 forward / reverse KL) |
| 변분추론 | 변분 추론 = 근사 분포를 앞에 둔 KL 최소화 = e-사영 |
| 최적화 | 미러 디센트 = 브레그만 사영의 반복 |
| 정보이론 | 블라후트-아리모토 알고리즘 = 두 묶음 변수의 교대 최적화 |
막힌 곳
정규분포족은 m-평탄하지 않아서, 두 봉우리 분포의 e-사영은 하나로 정해지지 않고