17. RL이 작동하는 조건 — 스펙트럼, 적정 난이도, 그리고 한계
pass@k 역전: 한 번에 맞히기는 늘고, 폭은 준다
RLVR을 거친 모델은 수학 벤치마크 점수가 수십 %p씩 오른다. 이 숫자를 보면 묻게 된다. RL은 모델을 더 똑똑하게 만드는가, 원래 할 줄 알던 것을 더 자주 하게 만드는가? 답을 예측해 보기 전에 조건 하나를 더 모으자. RL은 파라미터를 얼마나 바꾸는가?
파라미터 공간에서: 원포인트 레슨
사람이 배울 때도 처음부터 모든 것을 익히는 것과, 이미 할 줄 아는 사람이 버릇 하나를 고치는 것은 다르다. 골프를 처음 배울 때는 그립·스탠스·백스윙·다운스윙·팔로스루를 모두 익혀야 한다. 하지만 라운딩을 할 줄 아는 중급자에게 프로가 해주는 레슨은 다르다. “임팩트 순간에 왼쪽 손목이 꺾여요. 이것만 고치세요.” 이미 갖춰진 스윙에서 습관 하나만 바꾸는 원포인트 레슨이다.
| 단계 | 골프에 비유하면 | 모델에게 하는 일 |
|---|---|---|
| 프리트레인 | 수천 시간의 연습 — 모든 기본기 | 언어 구조, 세상 지식, 다양한 문제 유형 |
| SFT | 코스 매니지먼트 교육 | "이런 형식으로 답하라"는 실전 규범 |
| RL | 원포인트 레슨 | “반복 루프에 빠지지 마라”, “검산하라” 같은 특정 습관 교정 |
RL도 실제로 그만큼 적게 바꿀까? 두 가지 측정이 있다.
하나는 RL이 받아들이는 정보의 양이다. 정책 그래디언트가 응답 하나에서 얻는 것은 사실상 "맞았다/틀렸다"에 가까운 점수 하나다. 존 슐먼(John Schulman)과 Thinking Machines 팀은 글 「LoRA Without Regret」(2025년 9월)에서, 수학 문제 약 1만 개에 문제당 응답 32개로 학습하면 응답 하나가 1비트씩만 준다고 쳐도 모델이 받아들일 정보는 32만 비트뿐이라고 셈했다. 그리고 실제로 LoRA(파라미터 행렬은 얼려 두고 그 옆에 붙인 아주 가는 행렬 두 개의 곱만 학습하는 방법)를 가장 가늘게 붙여도(랭크 1: 붙인 변화가 한 가지 패턴의 배수로만 이루어진 꼴) RL에서는 전체 미세조정과 같은 학습 성능이 나왔다고 보고했다.
다른 하나는 실제로 움직인 파라미터다. 무케르지(Sagnik Mukherjee)와 동료들(「Reinforcement Learning Finetunes Small Subnetworks in Large Language Models」, arXiv:2505.11711, 2025)은 RL로 다듬은 공개 모델 여럿을 원래 모델과 견주어, 파라미터의 5–30%만 바뀌고 나머지는 사실상 그대로임을 보였다. 다만 바뀐 부분이 몇몇 방향에 몰린 것은 아니었다. 행렬마다 바뀐 칸은 적어도 그 변화는 거의 모든 방향에 퍼져 있었다. 그러니 "RL은 적게 바꾼다"는 측정으로 받쳐지지만, "몇 개 방향만 바꾼다"는 아직 받쳐지지 않는다.
사례: pass@k로 다시 잰 RLVR
여기까지의 조건을 모두 합치면 껄끄러운 예측이 나온다. RL이 곱의 길이고, 스펙트럼 밖을 만들 수 없고, 파라미터를 조금만 바꾼다면 — RLVR은 새로운 추론 능력을 만드는 것이 아니라, 원래 있던 능력을 더 자주 꺼내 쓰게 하는 것 아닐까? 이 물음을 재려면 한 번에 맞히는 비율만으로는 모자란다. 원래 모델이 여러 번 시도하면 맞히던 문제를 RL 모델도 여전히 맞히는지를 봐야 한다.
그래서 쓰는 잣대가 pass@k다. 문제 하나에 답을
맞힐 확률이 작은 문제도 시도를 늘리면 통과 확률이 차츰 1에 다가간다. 그래서 pass@1은 「한 번에 맞히는 힘」을, 큰
“RL이 정말 추론 능력을 넘어서게 하는가” (Yue et al., “Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?”, arXiv:2504.13837, 2025년 4월, NeurIPS 2025)는 베이스 모델과 RLVR 모델을 pass@k로 비교했다.
가 작을 때(pass@1)는 RLVR 모델이 크게 앞선다. 를 크게 키우면(이 연구는 256까지, 일부 실험은 1024까지) 여러 벤치마크에서 베이스 모델이 따라잡고 앞선다. - RL 모델의 풀이는 이미 베이스 모델의 분포 안에서 높은 확률을 갖는 풀이였다(퍼플렉시티 분석: 베이스 모델이 그 풀이를 얼마나 그럴듯하게 보는지를 잰 것).
- 여섯 가지 RLVR 알고리즘이 모두 비슷한 양상을 보였다. 반면 더 강한 모델의 답을 보고 따라 배우는 증류(distillation)는 pass@k 곡선 전체를 끌어올렸다.
위 그림은 같은 연구의 표 4를 다시 그린 것이다. Qwen2.5-7B를 GRPO로 학습시키는 동안 pass@1은 9.9%에서 42.5%로 오르고, pass@256은 67.2%에서 64.3%로 조금씩 내려간다.
해석은 이렇다. RLVR은 “여덟 번 시도하면 풀던 문제를 한 번에 풀게” 만든다 — 탐색 효율의 향상이다. 그 대가로 드물게만 시도하던 풀이 경로를 잃어, 아주 많이 시도할 때의 다양성은 오히려 줄어든다.
위 위젯은 논문의 수치가 아니라 이 해석을 옮긴 예시 모델이다. RL이 성공 경로를
문제 7 — 다시 풀 기회가 세 번인 시험
네 단원이 한 문제씩 나오는 시험이다. 친구 A는 1·2단원만 깊게 공부해서 그 두 문제는 각각 0.9의 확률로 맞히고, 3·4단원 문제는 전혀 못 푼다(확률 0). 친구 B는 네 단원을 고루 공부해서 1·2단원 문제는 0.5, 3·4단원 문제는 0.3의 확률로 맞힌다. (가) 한 번만 풀 수 있을 때 맞힌 문제 비율의 기댓값은 누가 높은가? (나) 문제마다 세 번까지 다시 풀 수 있고 한 번이라도 맞히면 정답으로 칠 때는?







정리 (가) A 0.45, B 0.40. (나) A
, B . 기회가 여러 번이면 순위가 뒤집힌다. 맞힐 확률이 0인 문제는 몇 번을 풀어도 0이라, 문제마다 따로 계산한 뒤 평균을 내야 한다.
문제 8 — pass@k 교차의 해석
문제 100개를 성공확률에 따라 네 무리로 나눴다(무리마다 25개). 베이스 모델의 문제당 성공확률은 무리마다 0.6, 0.2, 0.02, 0이다. RLVR 모델은 같은 무리에서 0.95, 0.7, 0, 0이다. (가) 두 모델의 pass@1과 pass@256을 구하고, "pass@256이 낮으니 RLVR 모델이 더 나쁘다"는 결론이 옳은지 말하시오. (나)











정리 (가) pass@1: 베이스
, RLVR . pass@256: 베이스 , RLVR . 결론은 옳지 않다. 한 번에 맞히기(pass@1)는 늘고, 여러 번 시도할 때의 폭(pass@256)은 줄었다. 용도에 따라 평가가 달라진다. (나) 두 곡선의 극한은 1이 아니라 각 모델에서 성공확률이 0보다 큰 문제의 비율이다(베이스 0.75, RLVR 0.5). (다) 성공확률 0.02를 0으로 만든 셋째 무리. 역전은 RLVR이 일부 문제를 잃었다는 뜻이다.