16. RLVR과 GRPO — 비평가를 내려놓다

DeepSeek-R1: 정답 보상이 추론 습관을 키웠다

비평가는 그룹 평균으로, 보상 모델은 검증기로 바뀌었다. 학습하는 동안 올려 두는 모델만 세면 정책과 레퍼런스, DPO와 똑같이 둘이다.

graph LR
    subgraph ppo["PPO (RLHF)"]
        direction LR
        P1["π_θ<br/>정책"] ~~~ P2["π_ref<br/>레퍼런스"]
        P3["r_ψ<br/>보상 모델"] ~~~ P4["V_φ<br/>비평가"]
    end
    subgraph grpo["GRPO + RLVR"]
        direction LR
        G1["π_θ<br/>정책"] ~~~ G2["π_ref<br/>레퍼런스"]
        G3["검증기<br/>(규칙)"] ~~~ G4["그룹 통계<br/>(샘플 평균)"]
    end
    ppo -->|"학습 중 올려 두는 모델 4개 → 2개"| grpo

    class P3 m-red
    class P4 m-red
    class G3 m-green
    class G4 m-green

그렇다면 무엇이 달라서 이 조합이 추론 모델의 판도를 바꿨을까? DPO와 나란히 놓아 보자.

측면 DPO GRPO + RLVR
데이터 미리 만든 고정 선호쌍 매 스텝 현재 모델이 생성
비교 구조 쌍 (ywy_w vs yly_l) 그룹 (G\textcolor{#5f970c}{G}개 중 상대 위치)
보상 출처 사람 라벨 (암묵적 보상) 검증기
베이스라인 레퍼런스 마진 Δref\Delta_\text{ref} 그룹 평균 μG\textcolor{#00897b}{\mu_G}
분포 이동 학습이 진행될수록 커짐 없음 (온폴리시)
학습 중 필요한 모델 정책 + 레퍼런스 정책 + 레퍼런스
탐색 없음 있음
쓸 수 있는 도메인 선호를 모을 수 있는 모든 곳 정답을 자동 판정할 수 있는 곳
데이터 큐레이션 필수 (필터링·정제 파이프라인) 문제 난이도 조절 정도

모델 수는 같다. 차이는 데이터가 어디서 오는가다. GRPO는 고정 데이터·탐색 부재라는 DPO의 구조적 한계를 대부분 넘어선다. 대가는 "정답이 있는 도메인"이라는 전제와, 매 스텝 G\textcolor{#5f970c}{G}개씩 생성하는 비용이다.

역사: “ResNet 모먼트”

DPO의 변형들을 CNN의 역사에 비유해 보자. IPO, KTO, ORPO, SimPO는 AlexNet에서 GoogLeNet까지처럼 각자 의미 있는 개선이지만, "오프라인 고정 데이터"라는 틀은 같았다. ResNet은 달랐다. 잔차 연결이라는 단순한 아이디어 하나가 CNN만의 문제가 아니라 깊은 신경망 전체의 문제(그래디언트 소실)를 풀었고, 이후 거의 모든 아키텍처에 들어갔다.

GRPO + RLVR의 알고리즘 자체는 새롭지 않다 — 같은 프롬프트의 다른 답들로 베이스라인을 잡는 발상은 REINFORCE의 베이스라인에서 이어지는 것이고 같은 시기의 RLOO(자기를 뺀 나머지 답의 평균을 베이스라인으로 쓰는 방법, 2024년 2월)도 같은 발상이며, 정답 보상도 오래된 아이디어다. 이것을 ResNet에 비유할 만한 이유는 DeepSeek-R1(2025년 1월)이 보여준 파급력이다.

역사: SFT 없이 정답 보상만으로

GRPO + RLVR의 부품은 하나하나 새롭지 않았다. 같은 입력에 대한 다른 답으로 베이스라인을 잡는 발상은 캡션 모델의 SCST와 RLOO에, 정답 검사를 보상으로 쓰는 일은 툴루 3에 이미 있었다. 이 조합을 널리 알린 것은 2025년 1월 DeepSeek-R1 논문의 한 실험이다.

DeepSeek 팀은 프리트레인만 마친 베이스 모델 DeepSeek-V3-Base에 SFT(정답 예시를 그대로 따라 쓰게 하는 지도 미세조정)를 전혀 하지 않고 곧바로 GRPO를 돌렸다. 이 모델을 R1-Zero라 불렀다. 주문은 「생각을 <think> 태그 안에 먼저 쓰고 답을 써라」는 틀 하나뿐이었다. 반성하라거나 특정한 풀이법을 쓰라는 말은 일부러 넣지 않았다고 논문은 적었다. 보상도 규칙 둘뿐이었다. 수학은 정해진 상자 안에 쓴 최종 답이 맞는지, 코드는 테스트를 통과하는지를 보는 정확도 보상, 그리고 생각을 태그 안에 썼는지 보는 형식 보상이다.

학습이 진행되자 미국 고교 수학 경시대회 AIME 2024 문제의 정답률(문제마다 16번 답하게 해 맞힌 비율의 평균)이 15.6%에서 71.0%로 올랐다. 한 번에 맞히는 71.0%는 같은 표에 실린 OpenAI o1-0912의 74.4%에 가깝고, 64번 답하게 해 가장 많이 나온 답을 고르면 86.7%로 그보다 높았다. 응답은 수백 토큰에서 수천 토큰으로 길어졌고, 자기 풀이를 되돌아보며 다시 따지는 행동과 다른 풀이를 시도하는 행동이 저절로 나타났다. 논문에 실린 중간 모델의 풀이에는 「Wait, wait. Wait. That’s an aha moment I can flag here.(잠깐, 잠깐. 여기가 깨달음의 순간이라고 표시해 둘 만하다)」라는 문장이 있다. 연구진은 이 장면을 자기들에게도 깨달음의 순간이었다고 적었다. 학습 보상은 수학 답 비교와 코드 테스트 같은 규칙 채점이었는데, 대학원 수준 과학 객관식 모음 GPQA Diamond에서도 73.3%를 냈다.

AIME 2024 정답률 (%) 100 75 50 25 15.6 71.0 86.7 74.4 R1-Zero 학습 전 R1-Zero 학습 후 학습 후 64번 다수결 OpenAI o1-0912

(DeepSeek-R1 논문 arXiv 첫 판(2025년 1월)의 본문과 표 2의 수치로 다시 그렸다. 학습 중의 곡선은 수치가 공개되지 않아 그리지 않았다.)

검증기는 최종 답만 본다. 그런데 정답에 이른 응답을 강화하면 그 안에 담긴 풀이 전체가 함께 강화된다 — 문제를 쪼개는 습관, 중간 결과를 검산하는 습관, 막히면 다른 방법을 시도하는 습관. 그 다리가 CoT(Chain of Thought, 단계별 사고)다. 이 습관들은 수학에만 쓰이지 않는다. 그래서 수학 RLVR이 수학 지식보다 단계적으로 생각하는 방법을 강화했다고 풀이할 수 있다. 논문도 같은 뜻으로, 푸는 법을 가르치지 않고 알맞은 보상만 주었더니 모델이 스스로 풀이 전략을 키웠다고 적었다.

ML에서: R1 이후 몇 달

R1 이후 몇 달 사이에 벌어진 일:

문제 7 — 정답이 없는 곳의 GRPO

고객 상담 챗봇의 말투를 다듬고 싶다. 좋은 말투에는 정답이 없어 검증기를 만들 수 없다. (가) 그래도 GRPO를 쓰려면 RLHF-PPO의 네 모델(정책, 레퍼런스, 보상 모델, 비평가) 가운데 무엇을 다시 들여와야 하는가? (나) 그때 강화학습 동안 메모리에 올려 두는 모델은 몇 개이고, 그 가운데 파라미터가 업데이트되는 것은 몇 개인가? RLHF-PPO와 견주시오.

김민준 (평상)
김민준
(가)는 보상 모델이요. 그런데 보상 모델이 돌아오면 그냥 PPO로 돌아가는 거 아니에요? 비평가도 같이 들여와야 할 것 같은데요.
선생님 (질문)
선생님
민준 학생, 그룹 평균 μG를 계산할 때 보상이 어디서 왔는지가 쓰이나요?
김민준 (생각)
김민준
아뇨. 여덟 개 점수만 있으면 돼요. 검증기가 줬든 보상 모델이 줬든 평균 내고 빼는 건 똑같네요. 비평가는 안 돌아와도 돼요.
선생님 (평상)
선생님
그래요. 실제로 GRPO를 처음 낸 DeepSeekMath도 학습한 보상 모델의 점수로 GRPO를 돌렸고, DeepSeek-R1도 수학·코드 밖의 일반 질문에는 보상 모델을 썼어요. 반대쪽도 있어요. RLVR이라는 이름을 붙인 툴루 3는 검증기 보상을 비평가가 있는 PPO로 학습했죠. (나)는요?
이서연 (평상)
이서연
올려 두는 건 정책, 레퍼런스, 보상 모델, 셋. 업데이트되는 건… 보상 모델도 학습한 모델이니까 정책이랑 둘?
선생님 (짚어주기)
선생님
서연 학생, 보상 모델은 언제 학습했어요?
이서연 (아하)
이서연
강화학습 전에요. 강화학습 동안엔 점수만 매기고 그대로예요. 그럼 업데이트되는 건 정책 하나예요. RLHF-PPO는 넷을 올리고 정책이랑 비평가 둘을 업데이트했고요.
김민준 (평상)
김민준
그 차이가 꽤 크겠네요. 학습하는 모델은 파라미터 말고도 그래디언트랑 옵티마이저 상태까지 들고 있어야 하잖아요. Adam이면 파라미터마다 숫자 두 개를 더 들고 있고요.
김민준 (평상)
김민준
채점 기준표는 학기 전에 만들어 두고 그대로 쓰고, 한 학기 동안 바뀌는 건 공부하는 학생뿐인 거랑 같네요.

정리 (가) 보상 모델. 비평가는 돌아오지 않는다: 그룹 평균은 점수가 어디서 왔든 계산된다. 두 대체(검증기, 그룹 평균)는 서로 독립이다 — DeepSeekMath의 GRPO는 보상 모델과, 툴루 3의 RLVR은 비평가가 있는 PPO와 짝지어졌다. (나) 정책·레퍼런스·보상 모델 셋을 올리고 정책 하나만 업데이트한다. RLHF-PPO는 넷을 올리고 둘(정책, 비평가)을 업데이트한다.