21. 이미지·로보틱스의 강화학습 — GRPO가 시각 생성을 만났을 때
그룹 통제: 무엇을 같게 두고 비교할 것인가
GRPO는 그룹 안의 샘플끼리 보상을 비교한다. 이미지 모델에서 한 그룹의 그림 여덟 장은 두 군데에서 갈린다. 처음에 뽑는 시작 노이즈, 그리고 디노이징 스텝마다 섞이는 노이즈다. 그룹 안의 보상 차이가 어느 쪽에서 왔는지에 따라 정책이 배우는 것이 달라질까?
역사: 시작 노이즈가 제각각이면 해킹이 났다
DDPO 같은 앞선 방법은 그룹 안의 샘플마다 서로 다른 시작 노이즈를 썼다. DanceGRPO 팀은 영상 생성에서 같은 프롬프트의 샘플에 서로 다른 시작 노이즈를 주면 언제나 리워드 해킹(보상 모델의 빈틈을 파고들어 점수만 올리는 것)이 일어나고 학습이 불안정해졌다고 보고했다. 그래서 같은 프롬프트에서 나온 샘플은 시작 노이즈 하나를 함께 쓰게 했다.
(가)에서는 네 장의 보상이 다를 때 그 차이가 시작점에서 왔는지 도중의 스텝에서 왔는지 섞여 있다. (나)에서는 출발점이 같고, 넷은 스텝마다 넣은 노이즈로만 갈라진다. 시작 노이즈를 함께 쓰면 그룹 안의 차이는 어디서 오는지, 탐색이 줄어 손해는 아닌지는 아래 문제에서 따져 본다.
ML에서: 로봇과 자율주행 — 앵커로 그룹을 묶는다
디퓨전이 로봇과 자율주행의 정책으로 쓰이는 이유는 다중 모드(좋은 행동 방식이 여러 갈래로 봉우리를 이룬) 행동 분포다 — 왼쪽으로 피할지 오른쪽으로 피할지의 평균은 정면 충돌이다. 여기에 RL을 붙이는 구조는 DDPO와 같다. 디퓨전 정책의 스텝 노이즈가 행동 공간을 탐색하고, 보상(태스크 성공, 충돌 회피)이 좋은 궤적의 디노이징 판단을 강화한다. 로봇은 초당 수십 번 행동을 정해야 해서 디노이징 스텝을 줄이는 연구도 함께 간다. 예를 들어 OneDP(Wang et al., “One-Step Diffusion Policy”, arXiv:2410.21257, ICML 2025)는 미리 학습된 디퓨전 정책을 한 스텝 생성기로 증류(큰 모델의 출력을 작은 모델이 따라 하게 학습시키는 것)해 행동 예측 주기를 1.5Hz에서 62Hz로 끌어올렸다.
자율주행. DiffusionDrive(CVPR 2025)는 주행 의도마다 앵커(직진, 좌회전, 차선 변경 등의 대표 궤적)를 두고, 앵커 근처의 노이즈에서 짧게 디노이징해 궤적을 만든다. 모방 학습만으로는 다양성과 품질 사이에서 딜레마에 빠진다 — 장면마다 정답 궤적이 하나뿐이라 그 궤적과 가장 가까운 앵커만 좋은 쪽으로 배우고, 나머지 앵커가 내는 나쁜 궤적은 바로잡을 신호가 없다. DiffusionDriveV2(arXiv:2512.07745, 2025년 12월)는 RL로 이를 풀었다. 설계에서 GRPO의 그룹을 어떻게 짜는지가 핵심이다.
- 앵커 내부 GRPO: 같은 앵커에서 나온 궤적끼리 어드밴티지를 계산한다. 논문의 예로, 우회전 궤적과 직진 궤적을 한 그룹에 넣고 비교하면 정책이 더 흔한 직진 하나로 무너질 수 있다. 의도(모드)가 다른 것을 품질 차이로 착각해 모드 자체를 없애는 것이다.
- 앵커 간 절단 GRPO: 앵커끼리 완전히 떼어 놓으면 다른 문제가 생긴다. 어떤 앵커에서는 안전하지만 조금 못한 궤적이 음의 어드밴티지를 받고, 다른 앵커에서는 충돌하는 궤적이 그 그룹에서 가장 낫다는 이유로 양의 어드밴티지를 받을 수 있다. 그래서 음의 어드밴티지는 0으로 자르고, 충돌한 궤적에만 −1을 준다. 그룹 안의 상대적인 나아짐은 상을 주되, 벌은 절대적인 실패에만 준다.
- 탐색에는 점마다 노이즈를 더하는 대신 궤적 전체를 앞뒤·좌우로 조금 늘이거나 줄이는 곱셈형 노이즈를 쓴다. 궤적의 가까운 끝과 먼 끝은 크기가 달라, 점마다 더한 노이즈는 매끈한 궤적을 꺾은선처럼 만들기 때문이다.
NAVSIM v1 주행 점수(PDMS) 91.2를 보고했다. 앞의 DanceGRPO가 "같은 시작 노이즈"로 그룹을 묶었듯, 여기서는 "같은 앵커"로 그룹을 묶는다 — 무엇과 무엇을 비교할 것인가가 GRPO를 새 도메인에 옮길 때마다 새로 답해야 하는 질문이다.
모방 학습은 사람 시연에 있는 좋은 모드만 따라 하고, 모델이 스스로 낼 법한 나쁜 궤적은 보지 못한다. RL은 모델이 직접 뽑은 궤적을 채점하므로 나쁜 모드를 억제하고, 탐색으로 시연을 넘어설 수 있다.
문제 5 — 조별 발표의 점수
두 조가 같은 수업에서 발표했다. 가 조는 쉬운 주제를, 나 조는 어려운 주제를 제비로 뽑았다. 조원 넷의 점수는 가 조 82, 88, 85, 81, 나 조 71, 75, 73, 69점이다. (가) 여덟 명 전체 평균과 견준 차이를 구하시오. (나) 각 조의 평균과 견준 차이를 구하시오. (다) 한 사람이 발표를 얼마나 잘했는지 보려면 어느 쪽 차이를 써야 하는가?







정리 (가) 가 조 +4, +10, +7, +3, 나 조 −7, −3, −5, −9. (나) 가 조 −2, +4, +1, −3, 나 조 −1, +3, +1, −3. (다) 조 평균과의 차이. 조원 모두가 함께 받은 운(주제)은 같은 조 안에서 평균을 빼면 지워지고, 남는 것이 개인의 몫이다.
문제 6 — (킬러) 시작 노이즈를 공유하는 이유
DanceGRPO는 한 그룹의 모든 샘플이 같은 시작 노이즈를 공유하게 한다. 민준은 "탐색이 줄어드니 손해"라고 하고, 서연은 "시작 노이즈까지 다르게 해야 그룹 평균이 프롬프트의 기대 보상을 제대로 추정한다"고 한다. (가) 시작 노이즈가 제각각이면 그룹 내 보상 차이의 출처는 무엇과 무엇인가? (나) 정책 그래디언트는 어느 쪽 차이에서만 배울 수 있는가? (다) 두 학생의 주장을 각각 평가하시오.












정리 (가) 시작 노이즈의 차이 + 스텝 행동의 차이. (나) 로그확률은 스텝 전이에만 있으므로 스텝 행동의 차이에서만 배울 수 있다. 시작 노이즈 차이는 어드밴티지에 섞이는 잡음이다. (다) 민준: 줄어드는 탐색은 원래 배울 수 없는 쪽이라 손해가 아니다. 서연: 그룹 평균의 추정 대상은 좁아지지만, 같은 상태에 조건을 건 베이스라인이 분산이 더 작다(
가 보다 나은 베이스라인인 것과 같은 논리). 다양한 시작 노이즈는 여러 그룹으로 확보한다.