자주 하는 실수와 요약
자주 하는 실수
| 실수 | 나온 문제 | 바로잡는 법 |
|---|---|---|
| 표준화한 어드밴티지는 대개 ±2 안에 든다고 봄 | 2 | ±2는 정규분포의 이야기다. 0/1 보상에서 |
| 0.1점 차이를 크게 미는 것은 손해가 아니라고 봄 | 4 | |
| 분모에 아주 작은 수를 더하면 작은 |
4 | 그 수는 0으로 나누기만 막는다. |
| 마지막 답 하나만 꺼내게 고치면 검증기를 속일 틈이 없다고 봄 | 6 | 판정하는 명제(「마지막에 쓴 답이 정답과 같다」)와 바라는 명제(「옳게 풀었다」)가 아직 다르다. 찍기와 표기 차이가 그 틈이다 |
| 보상 모델을 다시 들이면 비평가도 돌아와야 한다고 봄 | 7 | 그룹 평균은 점수가 어디서 왔든 계산된다. 검증기와 그룹 평균은 서로 독립인 대체다 |
| 보상 모델도 강화학습 동안 업데이트된다고 봄 | 7 | 보상 모델은 강화학습 전에 학습해 얼려 둔다. 강화학습 동안 업데이트되는 것은 정책뿐이다 |
요약
GRPO는 PPO의 비평가를 같은 프롬프트에서 뽑은