자주 하는 실수와 요약
자주 하는 실수
| 실수 | 나온 문제 | 바로잡는 법 |
|---|---|---|
| 자리를 고르는 방법을 순서까지 따져 두 번 셈 | 1 | 순서만 바꾼 같은 자리 묶음은 하나다. C(6, 2) = 15 |
| 전체 미시상태 수를 W로 착각 | 2 | W는 어느 거시상태의 것인지 먼저 정한다 |
| 정확도가 같으면 같은 예제를 틀렸다고 봄 | 3 | 같은 거시상태 뒤에도 미시상태가 여럿이다 |
| 합계의 흔들림으로 평균(평점·비율)의 정밀도를 판단 | 4 | 평균의 흔들림은 1/√N으로 줄어든다 |
| 독립인 흔들림의 표준편차를 그대로 더함 | 5 | 더해지는 것은 분산이다. 표준편차는 √N배 |
| 흔들림과 견주지 않고 차이의 크기만 봄 | 6 | 차이를 흔들림 1/(2√N)과 견준다 |
| 확률이 다른데 단순 평균 | 7 | ⟨E⟩ = Σᵢ pᵢEᵢ, 학점 평균처럼 가중한다 |
| ⟨E²⟩ = ⟨E⟩²로 둠 | 7 | 모두 같은 값일 때만 성립한다. 분산이 0이 나오면 의심한다 |
| 묶어서 더할 때 g(E) 누락 | 8 | Σᵢ f(Eᵢ) = Σ_E g(E) f(E). 달랑베르의 2/3 |
| 종류별로 묶은 loss에서 나온 횟수 누락 | 9 | 횟수가 축퇴도 자리. 횟수 × −ln p |
| 유도 중 항 누락 | 10 | n = 0 같은 경계값을 넣어 확인한다 |
| 작은 N으로 근사식 검증 | 10 | N을 키우며 비율로 확인한다 |
| 확률을 곱해서 문장 확률 계산 | 11 | 로그 확률을 더한다 |
| 넓은 고리가 이긴다는 결론을 표준편차가 다른 선수에게 그대로 씀 | 12 | 고리까지의 거리를 표준편차와 견준다. 확률 = 밀도 × 넓이 |
| 비율이 가장 흔한 결과를 가장 그럴듯한 결과 하나로 착각 | 13 | 하나의 확률과 묶음의 확률을 구별한다 |
| greedy 문장을 모델의 전형적인 출력으로 봄 | 14 | greedy 문장은 샘플에 거의 나오지 않는다 |
| 두께의 비율을 부피의 비율로 봄 | 15 | 속의 부피가 0.9^d로 줄어든다 |
| 평균 위치와 크기를 혼동 | 16 | 좌표 평균이 0이어도 노름은 √d |
| ‖x‖²의 흔들림을 ‖x‖의 흔들림으로 씀 | 16 | 제곱을 벗기면 흔들림도 Δ/(2‖x‖)로 바뀐다 |
| 고차원 직선 보간 | 17 | 중간점은 껍질 안쪽. 구면 보간을 쓴다 |
| 길이가 섞인 거리로 고차원 벡터의 비슷함을 잼 | 18 | 껍질 위에서 거리는 각도의 함수다. 길이로 나눈 코사인 유사도로 잰다 |
요약
이 장의 출발점은 거시적으로 관찰되는 값이 미시상태를 세는 데서 나온다는 것이었다. 입자가 N개면 경우의 수는 N에 대해 지수적으로 커지고, 그 결과 가장 경우의 수가 많은 거시상태 근처에 거의 모든 미시상태가 몰리며 흔들림은 1/√N으로 줄어든다. 또 어떤 영역의 확률은 밀도가 아니라 "밀도 × 그런 경우의 개수"로 정해진다. 그러므로 고차원 정규분포의 샘플은 밀도가 가장 높은 원점이 아니라 반지름 √d의 얇은 껍질에 있다.
막힌 곳
이제 우리는 경우의 수를 세고, 어떤 거시상태가 관찰될지 말할 수 있다. 그런데 W는 기체 1몰이면 10^(10²³) 같은 수라서, 로그를 씌워야 겨우 다룰 수 있었다. 그렇다면 그 로그값 자체는 무엇을 뜻할까? 이 질문에는 아직 답하지 못했다.
또 하나, 이 장에서 경우의 수만 세어 확률을 말한 동전은 모두 공정했다. 앞면이 90% 나오는 동전이라면 미시상태들의 확률이 같지 않으므로, 등확률 가정에 기대어 경우의 수만 세는 방법은 그대로 통하지 않는다. 그때는 무엇을 세야 하는가?