21. 이미지·로보틱스의 강화학습 — GRPO가 시각 생성을 만났을 때

자주 하는 실수와 요약

자주 하는 실수
실수 나온 문제 바로잡는 법
논문 하나(DDPO)를 보고 정책 그래디언트 갈래 전체에 비평가가 없다고 봄 1 PPO식으로 구현하면 가치 모델을 붙일 수 있다. 다만 이미지·영상 모델이 커서 드물다
표준점수가 크면 실제 차이도 크다고 봄 2 표준점수는 차이의 크기를 지운다. 0.02점의 잡음도 2점의 실력 차와 같은 표준점수가 된다
보상 모델에 미세한 잡음이 있으면 ODE 그룹에서도 뭔가 배운다고 봄 3 경로가 모두 같으면 ∇log⁡π\nabla \log \textcolor{#1565c0}{\pi}가 하나뿐이고 어드밴티지 합이 0 — 정확히 상쇄된다
평균의 어긋남이 같으면 스텝마다 KL도 같다고 봄 4 KL은 어긋남을 노이즈 폭의 제곱으로 나눈다. 노이즈가 작은 완성 그림 쪽 스텝에서 같은 어긋남이 81배까지 커진다
노이즈가 큰 스텝일수록 레퍼런스에서 멀어져 KL이 크다고 봄 4 흔들림은 두 모델이 똑같이 받는다. 흔들림이 크면 평균의 어긋남이 묻혀 오히려 KL이 작다
조건이 다른 무리끼리 점수를 바로 견줌 (전체 평균과 견줌) 5, 7 모두가 함께 받은 운(주제, 형세)은 같은 무리 안에서 평균을 빼야 지워진다
시작 노이즈를 공유하면 탐색이 줄어 손해라고 봄 6 줄어드는 것은 정책이 원래 배울 수 없는 시작 노이즈 쪽 차이다. 스텝 노이즈의 탐색은 남는다
그룹 평균은 넓은 조건의 기대 보상을 추정할수록 좋다고 봄 6 베이스라인은 같은 상태에 조건을 걸수록 분산이 작다. 다양한 시작 노이즈는 그룹을 여러 개 만들어 얻는다
중간 분기 샘플링을 GRPO 그룹과 같은 것으로 봄 8 GRPO 그룹은 처음부터, 분기는 중간 xt\textcolor{#1c9c60}{x_t}에서 갈라진다 — 중간 상태 가치 V(xt)\textcolor{#00897b}{V}(\textcolor{#1c9c60}{x_t})의 몬테카를로 추정
요약

LLM의 도구는 시각 생성·로보틱스에서 이렇게 모습을 바꾼다.

LLM의 도구 시각 생성·로보틱스에서의 모습
정책 그래디언트 DDPO의 두 추정기, 디노이징 스텝 = 행동
크레딧 할당, 가치 함수 B²-DiffuRL의 역방향 학습과 분기 샘플링
선호 쌍 이미지 쌍비교(Pick-a-Pic), 영상의 모션 품질 쌍비교
길이 편향 디테일·매끈함 편향
레퍼런스 학습 전 디퓨전 모델, Flow-GRPO의 닫힌 형태 KL(노이즈가 작은 스텝에 몰린다)
다차원 보상 DanceGRPO의 보상별 어드밴티지
GRPO Flow-GRPO, DanceGRPO, DiffusionDriveV2 — 그룹을 무엇으로 통제할지가 도메인마다 다르다
RL은 이미 뽑히는 답만 키운다 T2I-R1이 글로 먼저 생각해 기댈 후보를 넓히려는 시도
GRPO 변종 스텝 수 정규화, 학습(10스텝)-생성(40스텝) 샘플러 불일치

시각 생성 RL은 선호 기반·정책 그래디언트·GRPO 기반의 세 갈래로 나뉘고, 둘째·셋째 갈래는 CLIP 점수에서 멀티모달 LLM 심사까지 진화해 온 보상 모델에 기댄다. 요즘의 흐름 매칭 모델은 결정론적 ODE로 샘플링해 로그확률도 탐색도 없으므로, 노이즈가 퍼뜨린 만큼 스코어 쪽으로 되모아 주변분포를 보존하는 SDE로 바꿔 노이즈를 다시 넣어야 GRPO를 쓸 수 있다(Flow-GRPO, DanceGRPO). 그러면 스텝마다 가우시안이라 레퍼런스와의 KL도 닫힌 꼴로 계산되고, 같은 평균 어긋남이라도 노이즈가 작은 스텝에서 KL이 크다. GRPO를 새 도메인에 옮길 때마다 시작 노이즈·앵커처럼 "그룹 안에서 무엇을 같게 두고 비교할지"를 새로 정해야 하고, 보상이 완성본에만 오는 크레딧 할당 문제는 마지막 스텝부터 학습하고 중간에서 갈라 같은 갈래끼리 비교하는 방식으로 다룬다.