17. RL이 작동하는 조건 — 스펙트럼, 적정 난이도, 그리고 한계

가짜 보상: 무작위 보상으로도 점수가 오르는 이유

RLVR의 효과가 원래 있던 능력을 더 자주 꺼내게 하는 것이라면, 극단적인 실험을 해 볼 수 있다. 보상이 정답과 아무 상관이 없어도 점수가 오를까? 오른다면, 무엇이 올린 것일까?

사례: 틀린 라벨과 무작위 보상

“가짜 보상” (Shao et al., “Spurious Rewards: Rethinking Training Signals in RLVR”, arXiv:2506.10947, 2025년 6월, 2026년 2월 개정)은 더 기묘한 결과를 냈다. Qwen2.5-Math-7B를 GRPO로 학습시키되 보상을 바꿔 가며 MATH-500(수학 벤치마크 MATH에서 고른 500문제) 정확도 향상폭을 쟀다.

Qwen2.5-Math-7B 의 MATH-500 향상폭 (%p) 정답 보상 +29.1 다수결 답을 정답으로 +27.1 문제 하나로만 RL +26.0 틀린 라벨 +24.1 무작위 보상 +21.4 형식만 맞으면 보상 +13.8

틀린 답에 상을 줘도, 동전을 던져 상을 줘도 정답 보상 효과의 대부분이 나왔다. 하지만 같은 실험을 Llama3나 OLMo2 계열에 하면 이 효과가 나타나지 않았다. Qwen2.5-Math는 원래 실행하지도 않을 파이썬 코드를 써 가며 추론하는 버릇이 있었고(학습 전 응답의 65%), 이 버릇이 든 답의 정확도가 더 높았다. 무작위 보상으로 학습하는 동안 이 비율이 90% 이상으로 올랐다. 논문은 보상이 아무 정보도 주지 않는데 이 버릇이 커진 원인을 GRPO 목적함수의 한 부품에서 찾았고, 그 부품을 빼자 무작위 보상의 이득도 사라졌다. 어느 부품이고 왜 그런지는 아래 문제에서 직접 따져 본다.

ML에서: 이미 있던 모드를 끌어올린다

앞의 pass@k 결과와 합치면 이 장의 결론과 맞아떨어진다. RLVR의 효과 상당 부분은 프리트레인이 깔아둔 스펙트럼에서 이미 있던 모드를 표면으로 끌어올리는 것이다. 보상이 정확하면 올바른 모드가, 보상이 무의미하면 원래 우세하던 모드가 올라온다. 그리고 어느 모드가 우세한지는 프리트레인이 정한다.

이것이 RL을 폄하하는 결론은 아니다. “여덟 번에 한 번 맞히던 것을 한 번에 맞히게” 하는 것은 실제 사용에서 엄청난 차이다. 다만 RL로 모델의 천장을 뚫으려면 다른 무엇 — 학습을 아주 길게 끌면서 탐색이 꺼지지 않게 붙드는 시도, 더 나은 프리트레인, 증류 — 이 필요하다는 뜻이다.

문제 9 — (킬러) 동전 던지기 보상

보상이 응답과 독립적인 무작위 값이라면, 정책 그래디언트의 기대값은 0이어야 한다. 그런데 “가짜 보상” 연구에서는 Qwen2.5-Math-7B의 MATH-500 점수가 21.4%p 올랐다. (가) 기대값이 0이라는 논증을 쓰시오. (나) 이 논증은 GRPO의 어느 부분에서 깨지는가? (다) 같은 실험이 Llama 계열에서 재현되지 않은 것은 무엇을 말해주는가?

선생님 (평상)
선생님
서연 학생, 무작위 보상일 때 기대 그래디언트가 0이라는 걸 보여줄 수 있어요?
이서연 (평상)
이서연
보상 R이 응답 y와 독립이면 E[R · ∇log π(y)] = E[R] · E[∇log π(y)]고, E[∇log π] = ∇Σπ = 0이니까 0이에요. 베이스라인을 빼도 마찬가지고요.
김민준 (자신만만)
김민준
기대값이 0이어도 실제로는 잡음이 섞인 업데이트를 많이 하잖아요. 그 잡음이 규제(regularization)처럼 작용해서 좋아진 거 아닐까요? 드롭아웃처럼요.
선생님 (질문)
선생님
민준 학생, 드롭아웃 잡음으로 수학 점수가 21%p 오른 적 있어요?
김민준 (당황)
김민준
…없죠. 그 정도면 잡음이 아니라 방향이 있는 거네요.
이서연 (평상)
이서연
그럼 제 논증이 맞으니까, 결국 데이터 오염(평가 문제가 학습 데이터에 섞여 들어간 것)이나 평가 오차일 수밖에 없어요. 기대값이 0인 업데이트로는 체계적인 변화가 안 생기니까요.
선생님 (질문)
선생님
서연 학생 논증은 "그래디언트가 R · ∇log π 꼴이다"를 전제로 했어요. GRPO 목적함수에서 그래디언트가 정말 그 꼴인가요?
이서연 (생각)
이서연
아니요. min(r·Â, clip(r)·Â)가 있어요. 비율 r이 범위를 벗어나면 그 토큰의 그래디언트가 0이 되고요. 그러면 그래디언트가 ∇log π에 선형이 아니에요.
이서연 (깨달음)
이서연
클립 폭이 0.2면, 확률 0.02이던 토큰은 0.024만 넘어도 잘리는데 0.85이던 토큰은 1.02를 넘어야 잘려요. 확률은 1을 못 넘으니 이 토큰은 위로는 아예 안 잘리고요. 원래 확률이 낮은 토큰은 조금만 올라가도 잘리고 높은 토큰은 안 잘리면… 보상이 무작위여도 평균적으로 원래 자주 하던 행동 쪽으로 기울어지겠네요. 독립이라는 가정은 맞는데 선형이라는 가정이 틀렸어요.
선생님 (평상)
선생님
바로 그게 논문이 찾은 "클리핑 편향"이에요. 클리핑을 빼면 무작위 보상의 효과도 사라졌어요.
김민준 (평상)
김민준
그럼 (다)는… Qwen2.5-Math는 원래 코드로 푸는 습관이 있었고 그게 증폭돼서 점수가 오른 거고, Llama는 증폭할 좋은 습관이 없었던 거네요.
선생님 (평상)
선생님
그래요. 무엇이 증폭될지는 보상이 아니라 프리트레인이 정해요. 곱의 길이죠.
이서연 (평상)
이서연
증명에서 "선형이면"이라는 가정을 조용히 쓴 거였네요. 선형대수 시험에서 선형성 확인 안 하고 중첩 원리 쓴 거랑 같아요.
김민준 (평상)
김민준
채점 기준이 엉망이어도 원래 잘하던 과제 스타일로 쓰면 점수가 오르는 거랑 비슷하네요. 조교님 말로는 그게 제일 위험하댔어요. 잘하는 게 아니라 익숙한 걸 하는 거라서.

정리 (가) R⊥yR \perp y이면 E[R ∇log⁡π]=E[R] E[∇log⁡π]=0\mathbb{E}[R\,\nabla\log\pi] = \mathbb{E}[R]\,\mathbb{E}[\nabla\log\pi] = 0. (나) GRPO의 그래디언트는 클리핑 때문에 R ∇log⁡πR\,\nabla\log\pi 꼴(선형)이 아니다. 잘리는 조건이 토큰 확률에 의존해(클립 폭 0.2에서 확률 0.02인 토큰은 0.024에서 잘리지만 0.85인 토큰은 위로 잘리지 않는다) 무작위 보상에서도 원래 우세한 행동이 증폭된다(클리핑 편향). (다) 무엇이 증폭될지는 프리트레인이 정한다. Qwen2.5-Math에는 "코드로 추론하기"라는 유용한 모드가 있었고, Llama3·OLMo2에는 없었다.