16. RLVR과 GRPO — 비평가를 내려놓다

자주 하는 실수와 요약

자주 하는 실수
실수 나온 문제 바로잡는 법
표준화한 어드밴티지는 대개 ±2 안에 든다고 봄 2 ±2는 정규분포의 이야기다. 0/1 보상에서 G\textcolor{#5f970c}{G}개 중 하나만 맞히면 그 답은 G−1\sqrt{\textcolor{#5f970c}{G}-1}을 받는다(G=64\textcolor{#5f970c}{G} = 64면 7.94)
0.1점 차이를 크게 미는 것은 손해가 아니라고 봄 4 (r−μ)/σ(\textcolor{#d9670b}{r}-\textcolor{#00897b}{\mu})/\textcolor{#008deb}{\sigma} 는 스케일에 불변이라, 혼자 문제를 푼 답과 같은 크기의 신호가 0.1점 차이나 잡음에 쓰인다
분모에 아주 작은 수를 더하면 작은 σG\textcolor{#008deb}{\sigma_G} 문제가 풀린다고 봄 4 그 수는 0으로 나누기만 막는다. σG\textcolor{#008deb}{\sigma_G} 가 작아도 0이 아니면 부풀림은 그대로다
마지막 답 하나만 꺼내게 고치면 검증기를 속일 틈이 없다고 봄 6 판정하는 명제(「마지막에 쓴 답이 정답과 같다」)와 바라는 명제(「옳게 풀었다」)가 아직 다르다. 찍기와 표기 차이가 그 틈이다
보상 모델을 다시 들이면 비평가도 돌아와야 한다고 봄 7 그룹 평균은 점수가 어디서 왔든 계산된다. 검증기와 그룹 평균은 서로 독립인 대체다
보상 모델도 강화학습 동안 업데이트된다고 봄 7 보상 모델은 강화학습 전에 학습해 얼려 둔다. 강화학습 동안 업데이트되는 것은 정책뿐이다
요약

GRPO는 PPO의 비평가를 같은 프롬프트에서 뽑은 G\textcolor{#5f970c}{G}개 답의 통계로 바꾼다. 그룹 평균 μG\textcolor{#00897b}{\mu_G} 가 가치 추정이 되고, 어드밴티지는 (Ri−μG)/σG(\textcolor{#d9670b}{R_i} - \textcolor{#00897b}{\mu_G})/\textcolor{#008deb}{\sigma_G} 로 응답 안의 모든 토큰에 같은 값이 붙는다. 모두 맞히거나 모두 틀린 그룹은 어드밴티지가 0이라 아무것도 배우지 않고, 드물게 맞힌 답 하나는 아주 큰 몫을 받는다. 목적함수는 PPO의 클리핑을 그대로 쓰고 KL 항을 늘 0 이상인 k3 어림으로 손실에 직접 더하며, 길이와 표준편차로 나누는 두 부품을 품고 있다. 특히 표준편차 나누기는 아주 작은 보상 차이도 표준 크기로 부풀린다. RLVR은 보상 모델을 규칙 기반 검증기로 바꿔, 정답을 자동 판정할 수 있는 도메인에서 사람 라벨 없이 온라인 학습을 가능하게 한다. 검증기는 속일 틈이 좁지만 없지는 않고, 보상이 희소하면 배울 그룹이 거의 남지 않는다. 두 대체는 서로 독립이라 GRPO는 보상 모델과도, RLVR은 비평가가 있는 PPO와도 짝지을 수 있다. DeepSeek-R1은 이 조합이 수학·코드 너머의 단계적 추론 습관까지 강화할 수 있음을 보였다.