자주 하는 실수와 요약
자주 하는 실수
| 실수 | 나온 문제 | 바로잡는 법 |
|---|---|---|
| 작은 계의 칸이 여럿인데 열원의 경우의 수만 셈 | 1 | 작은 계 쪽 경우의 수를 곱한다. 가장 흔한 값이 0에서 옮겨 간다 |
| 덩어리가 세 배면 β도 3분의 1이라고 봄 | 2 | 비 m/(m + N_B − 1)로 계산. 반비례는 덩어리가 칸보다 훨씬 많을 때만 |
| 온도를 에너지와 β에 두 번 넣음 | 3 | E = −로짓에 β = 1/τ, 또는 E′ = −로짓/τ에 β = 1. 둘 중 하나만 |
| 온도를 에너지에 흡수해도 잃는 것이 없다고 봄 | 3 | E는 계의 것, β는 열원의 것. 나눠 두어야 같은 모델을 다른 온도에서 쓴다 |
| 온도를 올릴수록 확률이 에너지에 더 민감하다고 봄 | 4 | 민감도 βp₀p₁은 한 상태에 몰려도, 너무 뜨거워도 작다. 간격이 kT의 1.5배쯤에서 가장 크다 |
| 가치 어림이 흔들리는데 탐색 온도를 0 가까이 내림 | 5 | 얼어붙으면 다른 행동을 시험하지 않아 어림을 고칠 수 없다. 경험이 쌓인 뒤 낮춘다 |
| 로그 눈금 값(dB)을 그대로 더하거나 평균 냄 | 6 | 에너지로 되돌려 더한 뒤 다시 로그. 합은 가장 큰 값 근처 |
| 가장 큰 로짓을 뺀 뒤 ln Z에 다시 더하지 않음 | 7 | 기준점을 옮긴 흔적은 Z에만 남는다. 뺀 만큼 ln Z에 더한다 |
| 라벨별 sigmoid 출력을 합이 1이 되게 다시 나눔 | 8 | 라벨마다 따로 정규화된 2준위계다 |
| 라벨 조합의 softmax와 라벨별 sigmoid가 늘 같다고 봄 | 8 | 에너지가 라벨별 합일 때만 Z가 곱으로 쪼개진다 |
| 열원이 그네 몇 개뿐인데 볼츠만 분포의 극한값을 그대로 씀 | 9 | 그네 N개면 한 그네의 분포는 (1 − E₁/NT)^(N−2). 지수 분포는 N이 클 때의 극한이다 |
| 볼츠만 인자를 확률로 읽거나 Z = 1로 둠 | 10 | 득표수와 득표율. 표준정규분포의 Z는 (2π)^(d/2) |
| 노이즈에 곱한 배율을 온도로 읽음 | 10 | 온도는 분산 자리. 0.7을 곱하면 온도 0.49 |
| 분자 하나의 질량 자리에 몰 질량을 넣음 | 11 | k는 분자 하나에 대한 상수. 아보가드로수로 나누고 단위로 검산한다 |
| 에너지 기준점을 옮기면 확률이 바뀐다고 봄 | 11 | 모든 볼츠만 인자와 Z에 같은 인자가 곱해져 사라진다 |
| 해밀턴 흐름이 e^(−ℋ)를 보존하니 궤적 하나로 충분하다고 봄 | 12 | 궤적 하나는 등고선 하나에 갇힌다. 운동량 다시 뽑기가 열원이다 |
| 운동량 분포와 운동에너지를 따로 정함 | 12 | K = −ln(운동량 분포). 열원의 온도는 하나로 맞춘다 |
| 에너지 기반 모델의 기울기에서 모델 쪽 평균 항(ln Z(θ)의 미분)을 뺌 | 13 | Z는 θ의 함수다. 기울기는 「데이터 − 모델」 |
요약
큰 열원과 에너지를 주고받는 작은 계가 어떤 미시상태에 있을 확률은 그 상태에서 열원이 가질 수 있는 경우의 수에 비례하고, 열원의 ln W는 에너지를 내줄 때마다 거의 같은 비율 β로 줄어든다. 그래서 확률은 e^(−βE)에 비례하며, 이것을 정규화한 것이 볼츠만 분포 pᵢ = e^(−βEᵢ)/Z이고 정규화 합 Z가 분배함수다. 확률은 에너지의 차이만 보므로 에너지의 기준점은 마음대로 옮길 수 있고, 독립인 부분들로 이루어진 계는 Z가 곱으로 쪼개진다. 에너지가 고정된 계의 등고선 위의 균등 분포에서 작은 부분 하나를 떼어 보면 나머지가 열원 노릇을 해서 볼츠만 분포가 나오며, 위상공간에서는 e^(−βℋ)가 위치와 운동량으로 쪼개져 맥스웰의 속도 분포와 기압 공식을 준다. ML에서는 softmax가 에너지 −z, 역온도 1/τ인 볼츠만 분포이고, 어텐션 점수를 나누는 √d_k는 에너지가 퍼진 폭에 맞춘 온도이며, KL로 묶인 최적 정책에서는 기준 정책이 축퇴도 자리에 선다. HMC는 목표 분포를 온도 1의 볼츠만 분포로 읽고 운동량 다시 뽑기로 열원과 에너지를 주고받으며, 에너지 기반 모델은 「데이터에서 내리고 모델 샘플에서 올리는」 두 항으로 에너지를 배운다.
막힌 곳
이제 우리는 지수함수가 어디서 오는지 안다. 큰 열원의 경우의 수가 에너지를 내줄 때마다 같은 비율로 줄어들기 때문이고, 에너지가 고정된 전체를 등고선 위에 고르게 뿌린 뒤 한 부분만 떼어 보아도 같은 지수가 나온다. 그런데 이 장 곳곳에서 어색한 숫자가 하나씩 남았다. 2준위 입자 세 개에서 미시상태 하나하나로는 에너지 0인 상태가 가장 흔했지만, 에너지 값으로 묶으면 ε가 가장 흔했다. d차원 표준정규분포를 볼츠만 분포로 보면 확률이 가장 높은 상태는 에너지가 0인 원점인데, 실제로 뽑은 샘플의 에너지는 거의 언제나 d/2 근처에 있다. 상태 하나의 확률은 에너지가 정하지만, 어떤 에너지가 관찰될지는 에너지와 그 에너지를 가진 상태의 개수가 서로 반대 방향으로 당기며 함께 정한다. 이 경쟁의 승자를 한 번에 알려 주는 양은 무엇일까? 그리고 우리가 정규화 상수라며 매번 나눠 버린 Z는 이 경쟁에 대해 무엇을 알고 있을까?