2장 — 엔트로피

자주 하는 실수와 요약

자주 하는 실수

실수 나온 문제 바로잡는 법
흐른 열이 같으면 엔트로피 합의 변화도 같다고 봄 1 내준 쪽과 받은 쪽의 Q/T를 따로 적는다. 온도 차가 작을수록 합이 작다
독립된 두 계의 경우의 수를 더함 2 경우의 수는 곱, 엔트로피는 합
로그 대신 다른 함수를 써도 된다고 생각 2 곱을 합으로 바꾸는 연속 함수는 c ln뿐
미니배치마다 낸 평균 loss를 다시 단순 평균함 3 loss는 합으로 모은 뒤 전체 토큰 수로 나눈다
카드 수가 늘면 기다리는 시간도 비례해서 는다고 봄 4 순서의 수는 n × (n − 1) × ⋯ × 1 = n!로 곱해 불어난다
입자 하나의 경우만 셈 5 N개가 독립이면 2ᴺ배
비가역 과정에 Q/T를 그대로 씀 5 엔트로피는 상태 함수. 같은 처음과 끝을 잇는 가역 과정으로 잰다
ln 값에 bit라는 단위를 붙임 6 1 bit = ln 2 nat. 값에는 항상 단위를 쓴다
조건을 무시하고 전체 엔트로피를 답함 6 무엇을 알고 난 뒤의 값인지 먼저 정한다
nat으로 잰 NLL을 bit 단위의 논문 값과 비교 7 ln 2로 나눠 bits per dim으로 바꾼다
−Σ p ln p의 마이너스 누락 8 엔트로피는 음수가 될 수 없다. 각 항을 "놀라움"으로 읽는다
고르지 않은 확률에 ln W를 씀 8 ln W는 균등할 때의 값이자 상한
가장 높은 확률만 보고 예측의 불확실성을 잼 9 엔트로피는 모든 클래스의 퍼짐을 본다. 무엇을 불확실하다고 부를지 먼저 정한다
글자 하나가 알려 주는 양이 큰 언어가 정보를 더 빽빽하게 전한다고 봄 10 글자를 쪼개는 방식에 따라 달라진다. 같은 뜻의 문장 전체에 드는 비트로 비교한다
확률을 무시하고 후보 수로 질문 수를 셈 11 평균 질문 수의 한계는 H
“평균이 정수여야 한다” 11 한 판은 정수, 여러 판의 평균은 실수
토큰 확률을 평균한 뒤 로그를 씀 12 문장의 확률은 토큰 확률의 곱, 비트는 토큰마다 구해 더한다
가장 흔한 답에 확률을 몰아주면 loss가 준다고 봄 13 드물다고 한 답이 나오면 −ln q가 크다. KL은 q = p에서만 0
로그로 잰 놀라움을 그대로 후보 수로 읽음 14 bit면 2^H, nat이면 e^H로 되돌린다
nat loss에 2^loss 15 거듭제곱의 밑 = 로그의 밑. nat이면 e^loss
loss가 0까지 내려가야 한다고 기대 15 바닥은 데이터의 엔트로피 H(p)

요약

엔트로피는 열기관에서 Q/T로 먼저 측정되었고, 볼츠만은 그것이 거시상태에 속한 경우의 수의 로그 k ln W임을 보였다. 로그여야 하는 이유는 경우의 수는 곱해지는데 측정값은 더해지기 때문이며, 이 조건을 만족하는 함수는 로그뿐이다. 확률이 고르지 않으면 엔트로피는 −Σ p ln p, 곧 평균 놀라움이 되는데, 이것이 섀넌의 정보 엔트로피이자 cross-entropy loss의 바닥이다. loss가 그 바닥 아래로 내려가지 않는 것은 나머지 몫인 KL 발산이 언제나 0 이상이기 때문이다. 그리고 perplexity e^loss는 볼츠만의 W를 거꾸로 계산한 "유효 후보 수"다.

이 장에 나온 엔트로피 식 네 개와 그 사이의 연결. 화살표 옆 글은 한 식에서 다음 식으로 넘어가는 조건이다.
이 장에 나온 엔트로피 식 네 개와 그 사이의 연결. 화살표 옆 글은 한 식에서 다음 식으로 넘어가는 조건이다.

막힌 곳

이제 우리는 엔트로피를 세고, 단위를 바꾸고, loss와 perplexity를 읽을 수 있다. 그런데 한 가지가 설명되지 않은 채 남아 있다. 클라우지우스의 Q/T에는 온도계로 잰 T가 아무 설명 없이 들어 있다는 점이다.

왜 하필 열을 온도로 나눠야 경우의 수와 맞는 것일까? 경우의 수만으로 이야기해 온 이 장의 언어로는, 온도가 무엇인지에 대해 아직 한 마디도 할 수 없다.