목줄을 풀면 정책은 멀리 갈 수 있다. 그런데 멀리 가는 길이 한 가지로만 좁아지면 어떻게 될까? DAPO가 처음 본 증상, 곧 엔트로피 붕괴가 KL을 뺀 뒤의 다음 문제다.
엔트로피가 얼마나 빨리 줄 수 있는지 감을 잡아 보자. 두 토큰을 반반(0.5, 0.5)으로 고르는 정책의 엔트로피는 ln2≈0.693이다. 좋은 보상을 받은 쪽이 0.9까지 오르면 엔트로피는 0.325로 절반 아래가 되고, 0.99까지 오르면 0.056이다.
확률이 높은 쪽이 계속 보상을 받으면 새로운 답을 시도할 여지가 빠르게 사라진다. 실제 학습에서도 그랬다. 「추론 언어모델 RL의 엔트로피 메커니즘」(Cui et al., arXiv:2505.22617, 2025년 5월)은 열한 가지 모델을 2,400스텝씩 학습한 기록에서, 엔트로피 감소의 73%와 성능 향상의 76%가 학습 초반 200스텝에 몰린다는 것을 관찰했다. 그리고 엔트로피 H와 성능 R 사이의 경험 법칙 R=−aeH+b 를 제시했다(a, b는 모델과 데이터마다 맞추는 상수). 엔트로피가 바닥나면(H=0) 성능도 −a+b 라는 천장에 닿는다.
왜 엔트로피는 줄어들기만 할까? 논문은 한 걸음 업데이트에서의 엔트로피 변화를 다음처럼 근사했다(자연 그래디언트로 한 걸음 갈 때의 꼴).
엔트로피를 줄이는 것은 행동의 로그확률과 어드밴티지의 공분산(Cov — 둘이 함께 크고 함께 작은 정도)이다. 처방은 공분산이 큰 소수의 토큰만 골라 그래디언트를 끊거나(Clip-Cov) KL 벌점을 주는(KL-Cov) 것이다. Qwen2.5-32B에서 KL-Cov로 AIME 2024가 21.8 → 36.8로 올랐다.
분기 토큰. 그렇다면 엔트로피는 모든 토큰에서 똑같이 지켜야 할까? 긴 사고에서 풀이의 방향을 가르는 소수의 토큰이 분기 토큰이다. 「80/20 규칙 너머」(Wang et al., arXiv:2506.01939, 2025년 6월)는 엔트로피 상위 20% 토큰에만 정책 그래디언트를 흘렸더니, Qwen3-8B 베이스 모델에서는 전체 토큰으로 학습한 것과 비슷했고 Qwen3-32B에서는 오히려 앞섰다(AIME’24 +7.71, AIME’25 +11.04). 반대로 엔트로피 하위 80% 토큰만으로 학습하면 성능이 크게 떨어졌다. 탐색을 지키는 일은 모든 토큰이 아니라 갈림길에서 해야 한다는 뜻이다.
다만 엔트로피가 높다고 곧 갈림길은 아니다. 「그리고」와 「또」 사이의 망설임은 엔트로피가 커도 결론을 바꾸지 않는다. 반대로 확률 0.98 대 0.02로 거의 정해진 자리에서 그 0.02가 풀이 전체를 뒤집기도 한다. 「텍스트 생성의 갈림길」(Bigelow et al., “Forking Paths in Neural Text Generation”, arXiv:2412.07961, 2024년 12월)은 생성 도중 특정 자리에서만 다시 뽑아 보는 방법으로, 거기서 다시 뽑을 때만 결과가 크게 달라지는 토큰이 네 분야 일곱 가지 과제에서 여럿 있음을 보였다. 그중에는 구두점처럼 뜻밖의 토큰도 있었다. 갈림길인지는 다음 토큰의 흩어짐이 아니라 결말이 얼마나 흔들리는가로 정해진다.
결말이 크게 바뀐다
결말이 거의 안 바뀐다
엔트로피 높음
진짜 갈림길
표현의 자유 (동의어, 어순)
엔트로피 낮음
숨은 갈림길 — 엔트로피 기준으로 거르면 놓친다
확정 구간 (대부분의 토큰)
엔트로피로 분기 토큰을 고르는 방법은 값싸지만 왼쪽 아래 칸을 보지 못한다. 그 칸을 찾으려면 그 자리에서 여러 번 이어 써 보고 결말을 재는 수밖에 없다.
문제 11 — 정답을 올리면 언제나 쏠릴까
한 자리에서 정책이 두 토큰을 확률 (0.8,0.2)로 고른다. 위의 근사식으로 한 걸음 업데이트의 엔트로피 변화를 보자. (가) 흔한 토큰 쪽이 좋은 결과를 낸다: 어드밴티지 A=(+0.2,−0.8). (나) 드문 토큰 쪽이 좋은 결과를 낸다: A=(−0.2,+0.8). 각각 공분산 Cov(logπθ,A)의 값과 엔트로피가 오르는지 내리는지 쓰시오. (어드밴티지의 확률 평균은 둘 다 0이다.)
맞아요. 논문도 학습 내내 공분산이 거의 양수로 머문다고 봤어요. Clip-Cov와 KL-Cov는 이 공분산이 특히 큰 소수의 토큰만 덜 밀어서 줄어드는 속도를 늦추는 거고요.
김민준
조별 발표 때마다 늘 하던 사람만 칭찬받으니까, 다음에도 그 사람만 발표하게 되는 거랑 같네요.
정리 (가) Cov≈+0.222 → 엔트로피 감소. (나) Cov≈−0.222 → 엔트로피 증가. 정답 쪽을 올린다고 늘 쏠리는 것이 아니라, 이미 흔한 토큰이 좋은 결과를 낼 때 쏠린다. 흔한 토큰이 자주 뽑혀 보상을 받으므로 실제 학습에서는 공분산이 대체로 양수이고, 엔트로피가 줄기만 한다.