전환 — 도구를 들고 세계로

지도가 완성되었다.

심플렉스(합이 1인 확률들의 영역) 위의 점에서 출발해, 두 개의 길을 걷고, 놀라움을 재고,
볼록함수의 쌍대(한쪽이 정해지면 다른 쪽이 정해지는 짝)를 넘어 지수족에 도달하고, 사영의 교대로 수렴을 보았다.
하나의 곡선이 여섯 개의 얼굴을 가지고 있었고,
거리의 세 이름이 하나의 구조를 가리키고 있었다.
이 도구들은 지수족 안에서 완벽하게 작동한다.

그런데 세상의 분포는 대부분 지수족이 아니다.

신경망이 표현하는 분포, 이미지의 분포, 언어의 분포 —
이것들은 지수족의 깔끔한 골격을 따르지 않는다.
파라미터가 수억 개이고, F(θ)가 닫힌꼴(식 하나)로 쓰이지 않는다.
θ와 η가 공간 전체에서 서로를 비추는 전역 쌍대평탄 구조, 곧 θ 직선과 η 직선이 어디서나 둘 다 곧은 길이 되는 구조도 없다.
피셔 계량(곳마다 작은 걸음의 길이를 재는 규칙)은 여전히 정의되지만, 신경망에서는 퇴화한다.
서로 다른 파라미터가 같은 분포를 내놓는 방향이 많아서, 피셔 행렬이 역행렬을 갖지 않는 점이 흔하다.
Watanabe가 "특이 모형"이라 부르며 따로 이론을 세운 세계다.

그러면 우리가 배운 것이 쓸모없는가?

아니다. 지도 전체가 아니라 연장 하나하나를 들고 가면 된다.
정확한 등식 몇 개는 두고 가야 하지만,
다음 연장들은 지수족 밖에서도 살아남는다.

연장 지수족 밖에서 쓰이는 곳
KL 발산 한 분포를 다른 분포로 대신할 때 치르는 손해라서, 어떤 두 분포 사이에서도 그대로 정의된다. 방향의 의미(누구의 눈으로 재는가)도 그대로다. 디퓨전의 학습 목표, RLHF(사람 피드백으로 하는 강화학습)의 KL 벌칙
m-사영 = 최대우도 우도(모형이 데이터에 준 확률)를 키우는 교차엔트로피 학습은 여전히 KL(p̂‖q)를 줄이는 m-사영(m은 mixture. 덧셈의 길로 내려찍기)이다. 다만 답이 하나라는 보장은 사라진다. 사전학습, SFT(지도 미세조정)
e-사영 = 봉우리(모드) 찾기 KL(q‖p)를 줄이는 e-사영(e는 exponential. 곱셈의 길로 내려찍기)은 여전히 봉우리 하나를 고르는 경향이 있다. 변분추론, 정책 최적화
피셔 계량 국소적으로는 여전히 KL의 발밑이다. 퇴화한 방향을 조심하며, 근사(대각, 블록)로 쓴다. 자연 기울기(피셔 계량으로 보정한 경사하강), 최적화기 설계
데이터에 대한 스코어 ∇ₓlog p 정규화 상수(합이 1이 되게 나누는 수)를 몰라도 계산된다. log의 기울기가 주인공이 된다. 스코어 매칭과 디퓨전
지수 기울이기 기준 분포에 exp(보상/β)를 곱하고 합이 1이 되게 다시 나누는 한 줄은 어떤 기준 분포에서도 성립한다. 보상 최적 정책의 닫힌꼴

두고 가야 하는 것도 적어 둔다.
피타고라스의 정확한 등식은 착지하는 면이 평탄할 때만 성립한다.
KL = 브레그만은 F가 있는 곳에서만 성립한다.
볼록성이 주던 "답은 하나"라는 보장은 대부분 사라진다.

전략을 바꾸면 된다.
정확한 답 대신 올바른 질문을 던지는 것.
“이 문제를 정보기하학의 관점에서 보면 무엇이 보이는가?”

이 한 마디는 마법처럼 작동한다.
이제 그것을 실제 문제 앞에서 확인할 차례다.