17. RL이 작동하는 조건 — 스펙트럼, 적정 난이도, 그리고 한계
가짜 보상: 무작위 보상으로도 점수가 오르는 이유
RLVR의 효과가 원래 있던 능력을 더 자주 꺼내게 하는 것이라면, 극단적인 실험을 해 볼 수 있다. 보상이 정답과 아무 상관이 없어도 점수가 오를까? 오른다면, 무엇이 올린 것일까?
사례: 틀린 라벨과 무작위 보상
“가짜 보상” (Shao et al., “Spurious Rewards: Rethinking Training Signals in RLVR”, arXiv:2506.10947, 2025년 6월, 2026년 2월 개정)은 더 기묘한 결과를 냈다. Qwen2.5-Math-7B를 GRPO로 학습시키되 보상을 바꿔 가며 MATH-500(수학 벤치마크 MATH에서 고른 500문제) 정확도 향상폭을 쟀다.
틀린 답에 상을 줘도, 동전을 던져 상을 줘도 정답 보상 효과의 대부분이 나왔다. 하지만 같은 실험을 Llama3나 OLMo2 계열에 하면 이 효과가 나타나지 않았다. Qwen2.5-Math는 원래 실행하지도 않을 파이썬 코드를 써 가며 추론하는 버릇이 있었고(학습 전 응답의 65%), 이 버릇이 든 답의 정확도가 더 높았다. 무작위 보상으로 학습하는 동안 이 비율이 90% 이상으로 올랐다. 논문은 보상이 아무 정보도 주지 않는데 이 버릇이 커진 원인을 GRPO 목적함수의 한 부품에서 찾았고, 그 부품을 빼자 무작위 보상의 이득도 사라졌다. 어느 부품이고 왜 그런지는 아래 문제에서 직접 따져 본다.
ML에서: 이미 있던 모드를 끌어올린다
앞의 pass@k 결과와 합치면 이 장의 결론과 맞아떨어진다. RLVR의 효과 상당 부분은 프리트레인이 깔아둔 스펙트럼에서 이미 있던 모드를 표면으로 끌어올리는 것이다. 보상이 정확하면 올바른 모드가, 보상이 무의미하면 원래 우세하던 모드가 올라온다. 그리고 어느 모드가 우세한지는 프리트레인이 정한다.
이것이 RL을 폄하하는 결론은 아니다. “여덟 번에 한 번 맞히던 것을 한 번에 맞히게” 하는 것은 실제 사용에서 엄청난 차이다. 다만 RL로 모델의 천장을 뚫으려면 다른 무엇 — 학습을 아주 길게 끌면서 탐색이 꺼지지 않게 붙드는 시도, 더 나은 프리트레인, 증류 — 이 필요하다는 뜻이다.
문제 9 — (킬러) 동전 던지기 보상
보상이 응답과 독립적인 무작위 값이라면, 정책 그래디언트의 기대값은 0이어야 한다. 그런데 “가짜 보상” 연구에서는 Qwen2.5-Math-7B의 MATH-500 점수가 21.4%p 올랐다. (가) 기대값이 0이라는 논증을 쓰시오. (나) 이 논증은 GRPO의 어느 부분에서 깨지는가? (다) 같은 실험이 Llama 계열에서 재현되지 않은 것은 무엇을 말해주는가?














정리 (가)
이면 . (나) GRPO의 그래디언트는 클리핑 때문에 꼴(선형)이 아니다. 잘리는 조건이 토큰 확률에 의존해(클립 폭 0.2에서 확률 0.02인 토큰은 0.024에서 잘리지만 0.85인 토큰은 위로 잘리지 않는다) 무작위 보상에서도 원래 우세한 행동이 증폭된다(클리핑 편향). (다) 무엇이 증폭될지는 프리트레인이 정한다. Qwen2.5-Math에는 "코드로 추론하기"라는 유용한 모드가 있었고, Llama3·OLMo2에는 없었다.