거리 아닌 거리, 직선 아닌 직선

자주 하는 실수와 요약

자주 하는 실수

실수 나온 문제 바로잡는 법
곱해 가는 비의 평균을 더하기 평균(1.56배)으로 냄 1 곱의 평균은 로그로 낸다. 한 번에 0.223, 곧 1.25배씩. 100배까지 약 21번
KL 발산 계산 중 음수 항이 나오면 틀렸다고 봄 2 0 이상이라는 약속은 합 전체에 대한 것. p<qp < q인 칸의 항은 음수가 될 수밖에 없다
데이터와 똑같은 모델이면 교차 엔트로피가 0이라고 봄 3 교차 엔트로피 = H(p)+D(p∣q)H(p) + D(p | q). 반반 동전이면 바닥이 log⁡2≈0.693\log 2 \approx 0.693
좌표 (μ,σ)(\mu, \sigma)를 유클리드 눈금으로 보고 계량을 단위행렬로 둠 4 눈금은 피셔 계량이 정한다. g=diag(1/σ2, 2/σ2)g = \text{diag}(1/\sigma^2,\ 2/\sigma^2)
한 좌표에서 구한 계량 성분에 다른 좌표의 변위를 넣음 4 좌표를 바꾸면 계량 성분도 바뀐다. v=σ2v = \sigma^2이면 gvv=1/(2v2)g_{vv} = 1/(2v^2)
확률을 같은 양만큼 옮기면 KL도 같다고 봄 5 피셔 계량은 칸마다 1/pi1/p_i로 잰다. 확률 0.1인 칸을 건드린 쪽이 0.0117로 제약 0.01을 넘는다
섞인 분포의 분산을 봉우리 하나의 분산(1)으로 봄 6 봉우리 사이 거리도 분산에 들어간다: 1+32=101 + 3^2 = 10. N(0,1)N(0, 1)은 봉우리 근처에서 qq가 거의 0이라 D(p∣q)≈3.8D(p | q) \approx 3.8
좌우대칭인 문제의 답은 대칭인 점 하나라고 봄 6 대칭인 것은 답들의 모임. D(q∣p)D(q | p)의 최소점은 μ≈±2.98\mu \approx \pm 2.98 두 곳
직각이 아닌 삼각형에도 피타고라스 정리를 씀 7 남는 항 2⟨H−G, G−S⟩=42\langle H - G,\, G - S\rangle = 4. 수선의 발에서만 0
경사 하강으로 비중(확률벡터)을 음수로 만듦 9 성분마다 exp⁡\exp를 곱하는 미러 디센트는 0 아래로 가지 않는다

요약

KL 발산은 두 분포를 관측으로 얼마나 잘 구별할 수 있는지를 재는 양으로, 관측 하나가 쌓는 증거의 평균이다. 대칭성과 삼각부등식이 없어 거리는 아니다. 그러나 가까운 두 점 사이에서는 2차 항만 남아 비대칭이 사라지고, 그 계수가 리만 계량(KL이면 피셔 계량)이 된다. 비대칭은 3차 항에서 나타난다. 발산이 비대칭이므로 부분매니폴드로의 사영도 두 가지(m-사영, e-사영)이고, 두 봉우리 분포를 정규분포로 근사하면 하나는 넓게 덮고 하나는 한쪽 봉우리에 붙는다. 쌍대 평탄 공간에서는 사영에 대해 일반화된 피타고라스 정리가 성립한다. 볼록함수와 그 접선 사이의 틈으로 정의하는 브레그만 발산은 KL 발산과 유클리드 거리의 제곱을 함께 만들어 내고, 세 점의 틈을 풀면 남는 항 하나가 쌍대 직교를 잰다. EM 알고리즘이 뒷걸음질하지 않는 이유도 두 사영의 교대에서 나온다.

연결되는 세계들

분야 연결
기계학습 EM 알고리즘 = e-사영과 m-사영의 교대 반복
강화학습 RLHF의 KL 페널티: 어느 분포를 앞에 두느냐(영어로 forward / reverse KL)
변분추론 변분 추론 = 근사 분포를 앞에 둔 KL 최소화 = e-사영
최적화 미러 디센트 = 브레그만 사영의 반복
정보이론 블라후트-아리모토 알고리즘 = 두 묶음 변수의 교대 최적화

막힌 곳

정규분포족은 m-평탄하지 않아서, 두 봉우리 분포의 e-사영은 하나로 정해지지 않고 μ≈±2.98\mu \approx \pm 2.98 두 곳으로 갈라졌다. 변분추론이 실제로 어느 봉우리에 닿을지는 무엇이 정하는가? EM 알고리즘도 뒷걸음질은 하지 않지만 국소적으로 가장 가까운 점에서 멈출 수 있었다. 발산의 기하학은 "한 걸음이 나빠지지 않는다"는 것까지는 보장하지만, 어디서 출발해야 가장 가까운 점에 닿는지는 아직 말해 주지 않는다.