21. 이미지·로보틱스의 강화학습 — GRPO가 시각 생성을 만났을 때
자주 하는 실수와 요약
자주 하는 실수
| 실수 | 나온 문제 | 바로잡는 법 |
|---|---|---|
| 논문 하나(DDPO)를 보고 정책 그래디언트 갈래 전체에 비평가가 없다고 봄 | 1 | PPO식으로 구현하면 가치 모델을 붙일 수 있다. 다만 이미지·영상 모델이 커서 드물다 |
| 표준점수가 크면 실제 차이도 크다고 봄 | 2 | 표준점수는 차이의 크기를 지운다. 0.02점의 잡음도 2점의 실력 차와 같은 표준점수가 된다 |
| 보상 모델에 미세한 잡음이 있으면 ODE 그룹에서도 뭔가 배운다고 봄 | 3 | 경로가 모두 같으면 |
| 평균의 어긋남이 같으면 스텝마다 KL도 같다고 봄 | 4 | KL은 어긋남을 노이즈 폭의 제곱으로 나눈다. 노이즈가 작은 완성 그림 쪽 스텝에서 같은 어긋남이 81배까지 커진다 |
| 노이즈가 큰 스텝일수록 레퍼런스에서 멀어져 KL이 크다고 봄 | 4 | 흔들림은 두 모델이 똑같이 받는다. 흔들림이 크면 평균의 어긋남이 묻혀 오히려 KL이 작다 |
| 조건이 다른 무리끼리 점수를 바로 견줌 (전체 평균과 견줌) | 5, 7 | 모두가 함께 받은 운(주제, 형세)은 같은 무리 안에서 평균을 빼야 지워진다 |
| 시작 노이즈를 공유하면 탐색이 줄어 손해라고 봄 | 6 | 줄어드는 것은 정책이 원래 배울 수 없는 시작 노이즈 쪽 차이다. 스텝 노이즈의 탐색은 남는다 |
| 그룹 평균은 넓은 조건의 기대 보상을 추정할수록 좋다고 봄 | 6 | 베이스라인은 같은 상태에 조건을 걸수록 분산이 작다. 다양한 시작 노이즈는 그룹을 여러 개 만들어 얻는다 |
| 중간 분기 샘플링을 GRPO 그룹과 같은 것으로 봄 | 8 | GRPO 그룹은 처음부터, 분기는 중간 |
요약
LLM의 도구는 시각 생성·로보틱스에서 이렇게 모습을 바꾼다.
| LLM의 도구 | 시각 생성·로보틱스에서의 모습 |
|---|---|
| 정책 그래디언트 | DDPO의 두 추정기, 디노이징 스텝 = 행동 |
| 크레딧 할당, 가치 함수 | B²-DiffuRL의 역방향 학습과 분기 샘플링 |
| 선호 쌍 | 이미지 쌍비교(Pick-a-Pic), 영상의 모션 품질 쌍비교 |
| 길이 편향 | 디테일·매끈함 편향 |
| 레퍼런스 | 학습 전 디퓨전 모델, Flow-GRPO의 닫힌 형태 KL(노이즈가 작은 스텝에 몰린다) |
| 다차원 보상 | DanceGRPO의 보상별 어드밴티지 |
| GRPO | Flow-GRPO, DanceGRPO, DiffusionDriveV2 — 그룹을 무엇으로 통제할지가 도메인마다 다르다 |
| RL은 이미 뽑히는 답만 키운다 | T2I-R1이 글로 먼저 생각해 기댈 후보를 넓히려는 시도 |
| GRPO 변종 | 스텝 수 정규화, 학습(10스텝)-생성(40스텝) 샘플러 불일치 |
시각 생성 RL은 선호 기반·정책 그래디언트·GRPO 기반의 세 갈래로 나뉘고, 둘째·셋째 갈래는 CLIP 점수에서 멀티모달 LLM 심사까지 진화해 온 보상 모델에 기댄다. 요즘의 흐름 매칭 모델은 결정론적 ODE로 샘플링해 로그확률도 탐색도 없으므로, 노이즈가 퍼뜨린 만큼 스코어 쪽으로 되모아 주변분포를 보존하는 SDE로 바꿔 노이즈를 다시 넣어야 GRPO를 쓸 수 있다(Flow-GRPO, DanceGRPO). 그러면 스텝마다 가우시안이라 레퍼런스와의 KL도 닫힌 꼴로 계산되고, 같은 평균 어긋남이라도 노이즈가 작은 스텝에서 KL이 크다. GRPO를 새 도메인에 옮길 때마다 시작 노이즈·앵커처럼 "그룹 안에서 무엇을 같게 두고 비교할지"를 새로 정해야 하고, 보상이 완성본에만 오는 크레딧 할당 문제는 마지막 스텝부터 학습하고 중간에서 갈라 같은 갈래끼리 비교하는 방식으로 다룬다.