17. RL이 작동하는 조건 — 스펙트럼, 적정 난이도, 그리고 한계
자주 하는 실수와 요약
자주 하는 실수
| 실수 | 나온 문제 | 바로잡는 법 |
|---|---|---|
| 좋은 점수를 받으면 그 답의 몫이 늘어난다고 봄 | 1 | 곱하고 다시 나누면 몫은 남과 견준 배수가 정한다. 덜 받은 쪽은 좋은 점수를 받아도 몫이 준다 |
| 소프트맥스 확률은 0이 아니니 RL은 어떤 답이든 강화할 수 있다고 봄 | 2 | 현실적인 샘플 수 안에서 한 번도 뽑히지 않는 답은 그래디언트에 등장하지 않는다. 실질적인 스펙트럼은 "뽑히는 답"의 범위다 |
| 역방향 KL 벌점이 작으니 꼬리를 거의 안 잃는다고 봄 | 3 | 작은 벌점은 꼬리를 싸게 버릴 수 있다는 뜻이다. 확률 0.55의 꼬리를 버려도 역방향 KL은 0.80, 순방향 KL은 한없이 커진다 |
| 데이터셋(도메인)별로 순방향·역방향을 고르면 된다고 봄 | 4 | 같은 도메인 안에서도 토큰마다 교사의 확신이 다르다. 나눔의 단위는 토큰이다 — 교사 엔트로피가 낮은 토큰만 역방향 증류 |
| "적어도 하나는 맞힌다"를 시그널(답이 갈림)로 봄 | 5 | 시그널에는 정답과 오답이 모두 필요하다. |
| 그룹을 두 배로 늘리면 “전부 정답” 확률이 절반이 된다고 봄 | 6 | 그 확률은 |
| 쉬운 문제도 그룹만 키우면 된다고 봄 | 6 | 시그널을 그룹 크기로 사면 비싸다. 같은 비용으로 적정 난이도 문제를 고른다 |
| 평균 성공확률 하나로 pass@k를 셈 | 7 | 성공확률이 0인 문제가 숨는다. 문제마다 |
| pass@256이 낮으니 RLVR 모델이 더 나쁘다고 봄 | 8 | 한 번에 맞히기(pass@1)는 늘고 여러 번 시도할 때의 폭은 줄었다. 어느 쪽이 중요한지는 용도가 정한다 |
| 8 | 성공확률이 0인 문제는 몇 번을 시도해도 0이다. 극한은 성공확률이 0보다 큰 문제의 비율이다 | |
| 무작위 보상의 효과를 잡음·평가 오차로만 봄 | 9 | GRPO의 그래디언트는 클리핑 때문에 |
요약
모델이 정보를 얻는 길은 둘이다. 데이터를 섞어 스펙트럼을 넓히는 합의 길(프리트레인·SFT)과, 그 스펙트럼 위에서 특정 방향을 키우는 곱의 길(RLHF·DPO·GRPO). 정책 그래디언트는 실제로 뽑힌 답에만 작용하므로 곱의 길은 없는 것을 만들지 못하고, RL의 상한은 프리트레인과 SFT가 정한다. 어느 길이 맞는지는 목표 분포의 엔트로피가 정한다. 이름처럼 봉우리가 한 토큰 안에서 끝나고 꼬리가 상품인 자리는 덮는 순방향(SFT)으로, 풀이 경로처럼 봉우리 사이가 오답인 자리는 고르는 역방향(RL·증류)으로 가르친다. 그 단위는 데이터셋이 아니라 토큰이다. 한 문제 단위에서는 정답과 오답이 섞여야 시그널이 있고, 그 확률은