17. RL이 작동하는 조건 — 스펙트럼, 적정 난이도, 그리고 한계

pass@k 역전: 한 번에 맞히기는 늘고, 폭은 준다

RLVR을 거친 모델은 수학 벤치마크 점수가 수십 %p씩 오른다. 이 숫자를 보면 묻게 된다. RL은 모델을 더 똑똑하게 만드는가, 원래 할 줄 알던 것을 더 자주 하게 만드는가? 답을 예측해 보기 전에 조건 하나를 더 모으자. RL은 파라미터를 얼마나 바꾸는가?

파라미터 공간에서: 원포인트 레슨

사람이 배울 때도 처음부터 모든 것을 익히는 것과, 이미 할 줄 아는 사람이 버릇 하나를 고치는 것은 다르다. 골프를 처음 배울 때는 그립·스탠스·백스윙·다운스윙·팔로스루를 모두 익혀야 한다. 하지만 라운딩을 할 줄 아는 중급자에게 프로가 해주는 레슨은 다르다. “임팩트 순간에 왼쪽 손목이 꺾여요. 이것만 고치세요.” 이미 갖춰진 스윙에서 습관 하나만 바꾸는 원포인트 레슨이다.

단계 골프에 비유하면 모델에게 하는 일
프리트레인 수천 시간의 연습 — 모든 기본기 언어 구조, 세상 지식, 다양한 문제 유형
SFT 코스 매니지먼트 교육 "이런 형식으로 답하라"는 실전 규범
RL 원포인트 레슨 “반복 루프에 빠지지 마라”, “검산하라” 같은 특정 습관 교정

RL도 실제로 그만큼 적게 바꿀까? 두 가지 측정이 있다.

하나는 RL이 받아들이는 정보의 양이다. 정책 그래디언트가 응답 하나에서 얻는 것은 사실상 "맞았다/틀렸다"에 가까운 점수 하나다. 존 슐먼(John Schulman)과 Thinking Machines 팀은 글 「LoRA Without Regret」(2025년 9월)에서, 수학 문제 약 1만 개에 문제당 응답 32개로 학습하면 응답 하나가 1비트씩만 준다고 쳐도 모델이 받아들일 정보는 32만 비트뿐이라고 셈했다. 그리고 실제로 LoRA(파라미터 행렬은 얼려 두고 그 옆에 붙인 아주 가는 행렬 두 개의 곱만 학습하는 방법)를 가장 가늘게 붙여도(랭크 1: 붙인 변화가 한 가지 패턴의 배수로만 이루어진 꼴) RL에서는 전체 미세조정과 같은 학습 성능이 나왔다고 보고했다.

다른 하나는 실제로 움직인 파라미터다. 무케르지(Sagnik Mukherjee)와 동료들(「Reinforcement Learning Finetunes Small Subnetworks in Large Language Models」, arXiv:2505.11711, 2025)은 RL로 다듬은 공개 모델 여럿을 원래 모델과 견주어, 파라미터의 5–30%만 바뀌고 나머지는 사실상 그대로임을 보였다. 다만 바뀐 부분이 몇몇 방향에 몰린 것은 아니었다. 행렬마다 바뀐 칸은 적어도 그 변화는 거의 모든 방향에 퍼져 있었다. 그러니 "RL은 적게 바꾼다"는 측정으로 받쳐지지만, "몇 개 방향만 바꾼다"는 아직 받쳐지지 않는다.

사례: pass@k로 다시 잰 RLVR

여기까지의 조건을 모두 합치면 껄끄러운 예측이 나온다. RL이 곱의 길이고, 스펙트럼 밖을 만들 수 없고, 파라미터를 조금만 바꾼다면 — RLVR은 새로운 추론 능력을 만드는 것이 아니라, 원래 있던 능력을 더 자주 꺼내 쓰게 하는 것 아닐까? 이 물음을 재려면 한 번에 맞히는 비율만으로는 모자란다. 원래 모델이 여러 번 시도하면 맞히던 문제를 RL 모델도 여전히 맞히는지를 봐야 한다.

그래서 쓰는 잣대가 pass@k다. 문제 하나에 답을 kk번 뽑아 한 번이라도 맞히면 통과(pass)로 치고, 통과한 문제의 비율을 잰다. 「pass at k(패스 앳 케이)」라고 읽고, @는 「k번 시도에서」라는 뜻으로 붙인 기호다. 한 번 시도에 맞힐 확률이 qq인 문제라면 kk번 안에 한 번이라도 맞힐 확률은 1−(1−q)k1-(1-q)^k이다.

0 0.5 1 1 4 16 64 256 q = 0.5 q = 0.1 q = 0.02 시도 횟수 k (한 칸에 4배) pass@k = 1 − (1 − q)k

맞힐 확률이 작은 문제도 시도를 늘리면 통과 확률이 차츰 1에 다가간다. 그래서 pass@1은 「한 번에 맞히는 힘」을, 큰 kk의 pass@k는 「여러 번 시도하면 닿을 수 있는 범위」를 잰다. 2025년의 두 연구가 이 잣대로 RLVR을 정면으로 다뤘다. 먼저 시도 횟수를 늘려 가며 잰 연구다.

“RL이 정말 추론 능력을 넘어서게 하는가” (Yue et al., “Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?”, arXiv:2504.13837, 2025년 4월, NeurIPS 2025)는 베이스 모델과 RLVR 모델을 pass@k로 비교했다.

0 20 40 60 80 베이스 150 300 450 67.2 66.3 65.3 64.3 9.9 26.1 33.6 42.5 pass@256 pass@1 GRPO 학습 스텝 (Omni-MATH 학습 문제, 단위 %)

위 그림은 같은 연구의 표 4를 다시 그린 것이다. Qwen2.5-7B를 GRPO로 학습시키는 동안 pass@1은 9.9%에서 42.5%로 오르고, pass@256은 67.2%에서 64.3%로 조금씩 내려간다.

해석은 이렇다. RLVR은 “여덟 번 시도하면 풀던 문제를 한 번에 풀게” 만든다 — 탐색 효율의 향상이다. 그 대가로 드물게만 시도하던 풀이 경로를 잃어, 아주 많이 시도할 때의 다양성은 오히려 줄어든다.

위 위젯은 논문의 수치가 아니라 이 해석을 옮긴 예시 모델이다. RL이 성공 경로를 mm배 압축하고, 성공확률이 문턱 τ\tau보다 낮은 문제를 잃는다고 가정했다. τ=0\tau = 0으로 두면 두 곡선이 어떻게 달라지는지 보라. 왜 그런지는 아래 문제에서 따져 본다.

문제 7 — 다시 풀 기회가 세 번인 시험

네 단원이 한 문제씩 나오는 시험이다. 친구 A는 1·2단원만 깊게 공부해서 그 두 문제는 각각 0.9의 확률로 맞히고, 3·4단원 문제는 전혀 못 푼다(확률 0). 친구 B는 네 단원을 고루 공부해서 1·2단원 문제는 0.5, 3·4단원 문제는 0.3의 확률로 맞힌다. (가) 한 번만 풀 수 있을 때 맞힌 문제 비율의 기댓값은 누가 높은가? (나) 문제마다 세 번까지 다시 풀 수 있고 한 번이라도 맞히면 정답으로 칠 때는?

김민준 (평상)
김민준
(가)는 평균이죠. A는 (0.9 + 0.9 + 0 + 0)/4 = 0.45, B는 (0.5 + 0.5 + 0.3 + 0.3)/4 = 0.4. A가 높아요.
김민준 (자신만만)
김민준
(나)도 같은 식으로 하면 돼요. A의 평균 0.45로 1 − 0.55³ = 0.834, B는 1 − 0.6³ = 0.784. 여전히 A가 높네요.
선생님 (질문)
선생님
민준 학생, A가 3단원 문제를 세 번 풀면 맞힐 확률이 얼마예요?
김민준 (난처함)
김민준
0이요. 몇 번을 풀어도 0이네요. 평균 0.45로 계산하면 3단원에서도 0.45씩 맞힌다고 친 셈이에요.
이서연 (평상)
이서연
문제마다 따로 하고 나서 평균을 내야지. A는 1·2단원이 1 − 0.1³ = 0.999, 3·4단원은 0이라 (0.999 × 2)/4 ≈ 0.50. B는 1·2단원이 1 − 0.5³ = 0.875, 3·4단원이 1 − 0.7³ = 0.657이라 (0.875 × 2 + 0.657 × 2)/4 ≈ 0.77이야.
선생님 (평상)
선생님
그래요. 한 번 풀 때는 A, 세 번 풀 때는 B가 높아요. 순위가 뒤집혔죠.
이서연 (평상)
이서연
1 − (1 − q)³ 같은 오목함수에는 평균을 먼저 넣으면 값이 커진다는 옌센 부등식이네요. 평균을 먼저 넣으면 0인 문제가 숨어 버려요.

정리 (가) A 0.45, B 0.40. (나) A (2×(1−0.13)+0)/4≈0.50(2 \times (1-0.1^3) + 0)/4 \approx 0.50, B (2×(1−0.53)+2×(1−0.73))/4≈0.77(2 \times (1-0.5^3) + 2 \times (1-0.7^3))/4 \approx 0.77. 기회가 여러 번이면 순위가 뒤집힌다. 맞힐 확률이 0인 문제는 몇 번을 풀어도 0이라, 문제마다 따로 계산한 뒤 평균을 내야 한다.

문제 8 — pass@k 교차의 해석

문제 100개를 성공확률에 따라 네 무리로 나눴다(무리마다 25개). 베이스 모델의 문제당 성공확률은 무리마다 0.6, 0.2, 0.02, 0이다. RLVR 모델은 같은 무리에서 0.95, 0.7, 0, 0이다. (가) 두 모델의 pass@1과 pass@256을 구하고, "pass@256이 낮으니 RLVR 모델이 더 나쁘다"는 결론이 옳은지 말하시오. (나) k→∞k \to \infty이면 두 곡선은 어디로 가는가? (다) 역전을 만든 것은 어느 무리인가?

김민준 (평상)
김민준
코드로 돌렸어요. pass@1은 베이스 0.205, RLVR 0.4125. pass@256은 베이스 0.749, RLVR 0.5예요. pass@256에서 25%p 가까이 낮으니까 RLVR 모델이 더 나쁜 거죠. 결국 풀 수 있는 문제가 줄었잖아요.
선생님 (질문)
선생님
민준 학생이 사용자라면, 한 번 물어보고 답을 받나요, 256번 물어보나요?
김민준 (생각)
김민준
한 번이요. 그럼 사용자 입장에서는 pass@1이 중요하고, 거기선 20%p나 좋아진 거네요.
김민준 (평상)
김민준
무조건 나쁘다가 아니라, 한 번에 맞히는 능력은 늘고 여러 번 시도할 때의 폭은 줄었다고 말해야겠네요.
이서연 (평상)
이서연
(나)는 쉬워. k→∞k \to \infty면 1−(1−q)k1 - (1-q)^k가 1로 가니까 둘 다 1로 가야지.
선생님 (질문)
선생님
모든 문제에서요?
이서연 (의심)
이서연
아… q가 0인 문제는 몇 번을 시도해도 0이에요. 그러니까 극한은 1이 아니라 "성공확률이 0보다 큰 문제의 비율"이에요. 베이스와 RLVR이 그 비율이 다르면 극한도 다르고요.
이서연 (평상)
이서연
역전이 생긴다는 건 RLVR 쪽 극한이 더 낮다는 뜻이네요. RL이 일부 문제의 성공확률을 사실상 0으로 만든 거고요.
김민준 (평상)
김민준
(다)는 셋째 무리예요. 베이스가 0.02로 드물게 맞히던 문제를 RLVR이 0으로 만들었어요. 아까 시험 문제의 A가 3·4단원을 버린 거랑 같네요.
선생님 (평상)
선생님
맞아요. 위젯에서 τ를 0으로 두면 역전이 사라지는 것도 그 때문이에요. 잃는 문제가 없으면 압축만 남으니까요.
이서연 (평상)
이서연
해석학에서 점별수렴 극한을 구할 때 x마다 극한을 따로 보라던 게 이거였어요. 한꺼번에 1이라고 쓰면 q = 0인 점을 놓치죠.

정리 (가) pass@1: 베이스 (0.6+0.2+0.02)/4=0.205(0.6 + 0.2 + 0.02)/4 = 0.205, RLVR (0.95+0.7)/4≈0.413(0.95 + 0.7)/4 \approx 0.413. pass@256: 베이스 ≈0.749\approx 0.749, RLVR 0.50.5. 결론은 옳지 않다. 한 번에 맞히기(pass@1)는 늘고, 여러 번 시도할 때의 폭(pass@256)은 줄었다. 용도에 따라 평가가 달라진다. (나) 두 곡선의 극한은 1이 아니라 각 모델에서 성공확률이 0보다 큰 문제의 비율이다(베이스 0.75, RLVR 0.5). (다) 성공확률 0.02를 0으로 만든 셋째 무리. 역전은 RLVR이 일부 문제를 잃었다는 뜻이다.