GRPO 목적함수의 어드밴티지 A^i=(Ri−μG)/σG 에서 μG 는 베이스라인(보상에서 빼는 기준값)이다. 비평가(상태마다 앞으로 받을 보상을 예측하는 가치 신경망)를 두는 대신, 같은 프롬프트에 여러 번 답해 본 평균을 기준으로 삼았다. 그런데 그룹 평균만이 베이스라인을 만드는 방법은 아니다. GRPO와 거의 같은 시기에, 같은 문제를 다르게 푼 형제들이 있다.
방법
베이스라인 / 어드밴티지
비고
GRPO
(Ri−μG)/σG — 자기 자신도 평균에 포함
토큰 단위 PPO 클리핑
RLOO (Ahmadian et al., arXiv:2402.14740, 2024년 2월, Cohere)
Ri−G−11∑j=iRj — 자기를 뺀 나머지의 평균
응답 전체를 행동 하나로, 클리핑·σ 없음
ReMax (Li et al., arXiv:2310.10505, 2023년 10월)
R(y)−R(y^greedy) — 그리디 디코딩(매 토큰 가장 확률 높은 것만 고르는 생성) 답의 보상
샘플 하나 + 그리디 답 하나로 충분
REINFORCE++ (Hu et al., arXiv:2501.03262, 2025년 1월)
KL을 보상에 섞은 뒤 배치 전체로 정규화
프롬프트별 정규화는 치우침이 있다고 주장
RLOO의 "자기를 뺀 평균"은 정책 그래디언트의 원칙 — 베이스라인은 그 샘플과 독립이어야 그래디언트가 불편(unbiased, 치우침 없음)이다 — 을 정확히 지킨다. GRPO는 자기 자신을 평균에 넣어서 이 조건을 어긴다. 얼마나 어긋날까? 아래 문제에서 직접 견줘 본다. 이름은 달라도 모두 "비평가 대신 샘플로 베이스라인을 만든다"는 한 가족이다.
비평가의 귀환 — VAPO
샘플로 만든 베이스라인에는 한계가 있다. 응답 하나에 어드밴티지 하나라서 토큰 단위 크레딧 할당(어느 토큰 덕에 점수를 받았는지 나누기)을 포기한 것이다 — 응답 안의 모든 토큰이 같은 어드밴티지를 받는다. VAPO(Yue et al., “VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks”, arXiv:2504.05118, 2025년 4월, ByteDance Seed. 이름은 Value-model-based Augmented PPO, 곧 「가치 모델을 쓰는 PPO를 보강한 것」의 줄임)는 비평가를 다시 들여와 그 대가를 되찾으려 했다. 단, RLHF(사람 선호로 학습한 보상 모델로 하는 RL)의 PPO를 그대로 쓰면 긴 사고 학습에서 잘 안 된다. 같은 설정에서 순수 PPO는 AIME 5점에 그쳤다.
막힌 곳 하나는 GAE(비평가의 예측과 실제 받은 보상을 λ로 섞어 어드밴티지를 추정하는 방법)였다. λ가 0.95로 고정이면, 100토큰 뒤에 받은 보상은 0.95100≈0.006 만큼만 앞 토큰에 전해진다. 정답 여부는 응답 끝에서야 나오는데, 수천 토큰짜리 응답의 앞부분은 그 보상을 거의 듣지 못하고 아직 서툰 비평가의 예측에 기댄다. VAPO는 λ를 응답 길이에 맞춰 바꾼다.