Chapter 21: 이미지·로보틱스의 강화학습 — GRPO가 시각 생성을 만났을 때

의문

DeepSeek-R1(2025년 1월)이 GRPO로 수학 정답률을 끌어올린 뒤, 여러 팀이 같은 코드를 이미지 모델에 붙여 보려 했다. 하는 일은 LLM과 같아 보인다. 프롬프트 하나에 그림 여덟 장을 뽑고, 보상 모델로 점수를 매기고, 그룹(같은 프롬프트에서 뽑은 샘플 묶음) 평균보다 나은 그림의 확률을 올린다. 뼈대 — 정책 그래디언트(답을 내는 모델, 곧 정책의 확률을 보상 쪽으로 미는 방법), DPO, GRPO와 그 변종 — 는 LLM에서 이미 갖춰져 있다. 그런데 요즘 이미지 모델에 그대로 붙이면 첫 단계부터 막힌다. 같은 시작 노이즈에서 여덟 번 뽑으면 여덟 장이 똑같이 나오는 모델이 많고, 그림 한 장의 로그확률을 바로 꺼낼 수도 없다. 그렇다면 이미지·로봇으로 옮길 때 새로 풀어야 하는 것은 무엇일까? 연속 출력에서 로그확률과 탐색은 어디서 얻고, 그룹 안에서는 무엇과 무엇을 비교해야 할까?

세 갈래 지도: 무엇으로 배우는가

2025년에 쏟아진 방법들을 하나씩 외우기 전에, 무엇으로 배우는지 — 어떤 데이터와 어떤 보상을 쓰는지 — 에 따라 나눠 보면 세 갈래가 된다. 아래 그림은 갈래마다 이 책이 다루는 대표 방법만 두었고, 화살표에는 앞 방법의 무엇이 모자라서 뒤 방법이 나왔는지를 적었다.

graph LR
    subgraph grpo["3. GRPO 기반 (2025년)"]
        R1["Flow-GRPO · DanceGRPO"] -->|"의도가 다른 궤적끼리 비교됨"| R2["DiffusionDriveV2"]
    end
    subgraph pg["2. 정책 그래디언트 (온라인 RL)"]
        G1["DDPO"] -->|"보상이 끝에만 있어 어느 스텝 덕인지 모름"| G2["B²-DiffuRL"]
    end
    subgraph pref["1. 선호 기반 (오프라인 DPO 변형)"]
        P1["Diffusion-DPO"] -->|"나쁜 쪽을 밀면 좋은 쪽도 밀림"| P2["Diffusion-SDPO"]
    end

    class pref m-blue
    class pg m-orange
    class grpo m-green
갈래 데이터 특징 다음 갈래가 메운 것 LLM 쪽 대응
1. 선호 기반 쌍비교, 오프라인(미리 모아 둔 데이터) 안정적이지만 탐색 제한 모아 둔 쌍 밖의 그림은 배울 수 없다 → 모델이 직접 그려 채점받는 온라인 학습 DPO 가계도
2. 정책 그래디언트 보상 모델, 온라인 생성 미분 불가 보상도 처리 작은 프롬프트 모음(100개 미만)을 넘어 키우면 불안정하다는 보고 → 그룹 안에서 비교하는 GRPO REINFORCE·PPO
3. GRPO 기반 보상 모델/검증기, 온라인 그룹 생성 비평가(상태마다 앞으로 받을 보상을 예측하는 가치 모델) 없이 그룹 정규화 — GRPO와 변종
ML에서: 보상 모델의 네 세대

둘째·셋째 갈래는 "좋은 이미지"를 점수로 매겨 줄 무언가가 있어야 돌아간다. 그 점수를 주는 보상 모델을 이 책은 네 세대로 나눠 본다.

세대 예 장점 한계
1. 텍스트-이미지 유사도 CLIP 점수 간단하고 빠르다 "아름다운가"와 "프롬프트에 맞는가"를 구분하지 못하고, 이미지에 프롬프트 단어를 글자로 그려 넣으면 속는다
2. 인간 선호 점수 HPS, ImageReward, PickScore 사람의 쌍비교로 학습 — 미학·품질·정합을 종합 여전히 스칼라 하나
3. 다차원 보상 영상의 축별 보상 모델 축마다 따로 점수 → 트레이드오프를 드러낸다 축을 어떻게 합칠지 정해야 한다
4. 멀티모달 LLM 심사 비전-언어 모델(VLM, 이미지를 보고 글을 쓰는 모델)이 직접 심사 다차원 심사가 자연스럽다 비싸고, 심사 모델 자체의 편향

세대가 올라갈수록 LLM 쪽의 흐름(쌍비교로 학습한 보상 모델 → 다차원 보상 → LLM 심사 모델)을 따라간다.

문제 1 — 세 갈래 정리

세 갈래(선호 기반, 정책 그래디언트, GRPO 기반) 각각에 대해, 필요한 데이터와 "비평가(가치 모델)가 있는가"를 표로 정리하시오.

선생님 (질문)
선생님
세 갈래 중 비평가(가치 모델)가 있는 건 어디일까요?
김민준 (자신만만)
김민준
없어요. DDPO도 비평가 없었고, GRPO는 원래 비평가를 뺀 거고, DPO는 보상도 없으니까요.
이서연 (평상)
이서연
정책 그래디언트 갈래가 DDPO 하나만 있는 건 아니잖아. PPO식으로 구현하면 가치 모델을 붙일 수 있어. 로봇 디퓨전 정책을 PPO로 미세조정하는 작업들이 그렇고.
김민준 (당황)
김민준
논문 하나를 보고 갈래 전체로 일반화했네요. "보통 없음, PPO식이면 있을 수 있음"이 맞겠어요.
선생님 (평상)
선생님
그래요. 그럼 시각 생성에서 비평가가 인기 없는 이유는요?
이서연 (평상)
이서연
모델이 커서요. 이미지·영상 모델만 한 비평가를 하나 더 올리면 메모리가 두 배고, 스텝마다 가치를 맞히는 것도 어렵고요.
김민준 (평상)
김민준
실험 하나 보고 보고서에 "항상 그렇다"고 썼다가 조교님께 반례를 받은 적이 있어요. 딱 그거네요.

정리 선호 기반: 쌍 데이터, 비평가 없음. 정책 그래디언트: 보상 모델 + 온라인 생성, 비평가는 방법에 따라(DDPO 없음, PPO식은 있음). GRPO 기반: 보상 + 그룹 생성, 비평가 없음(그룹 평균이 대신).