네 자리 가운데 ④는 온라인 강화학습이다. 같은 프롬프트에서 영상을 여러 개 굴려 보상을 견준다. 그런데 자기회귀 영상은 청크(프레임 몇 장의 덩어리)를 수십 개 이어 만든 것이고, 보상은 영상을 다 만든 뒤에 한 번 온다. 언어모델과 이미지에서 쓰던 GRPO를 그대로 옮기면 될까?
GRPO를 자기회귀 영상에 올릴 때의 걸림돌
GRPO(그룹 상대 정책 최적화)는 같은 프롬프트에서 G개를 뽑아 보상을 매기고, 그룹 평균보다 얼마나 나은지로 어드밴티지를 정한다.
이미지 흐름 모델에서는 결정론적 ODE 샘플러를 같은 분포를 주는 SDE로 바꿔 스텝마다 노이즈를 넣었다. 그래야 스텝마다 로그확률(가우시안)과 탐색이 생긴다. 그런데 셀프 포싱 계열 학생은 4단계짜리 증류 모델이다. AR-CoPO 논문은 이렇게 짚었다. 단계가 적은 증류 샘플러는 표준 흐름 매칭 ODE와 달라서 SDE로 바꾸기 어색하다. 게다가 짧고 무작위성이 적은 경로라서 결과가 시작 노이즈에 크게 좌우된다. 중간 스텝에 노이즈를 넣어 탐색하는 전략이 잘 먹히지 않는다는 것이다.
AR-CoPO는 대신 무작위로 고른 청크에서 영상을 갈라 여러 후보를 만들고(포크), 영상 전체에 보상을 매긴 뒤, 갈라진 그 부분에 국한해 GRPO 업데이트를 한다. 셀프 포싱 모델에 적용해 사람 선호 정렬(사람이 바라는 방식으로 답하게 맞추기)과 처음 보는 도메인에서의 일반화가 함께 좋아졌고, 리워드 해킹이 아니라 실제 정렬의 증거라고 보고했다.
아래 그림은 갈래 네 개짜리 예다. 보상 값은 설명을 위해 지어낸 것이다.
RAVEN은 다른 길로 갔다. 일관성 모델(노이즈에서 한두 번 만에 깨끗한 결과로 건너뛰도록 학습한 모델)의 한 샘플링 스텝을 조건부 가우시안 전이로 보고, SDE 보조 과정 없이 그 스텝 위에서 바로 GRPO를 돌린다(CM-GRPO).
문제 11 — (킬러) 중간 청크에서 갈라 비교하는 이유
20개 청크로 된 영상을 만드는 자기회귀 모델에 GRPO를 쓴다. 보상은 완성된 영상 전체에 한 번 주어진다. (가) 프롬프트에서부터 G개를 따로 굴려 비교하면, 어드밴티지 A^i가 좋다고 말해 주는 것은 20개 청크 중 어느 것인가? (나) AR-CoPO처럼 c번째 청크까지 같은 과거를 공유하고 거기서 갈라 G개를 만들면, 그룹 안의 보상 차이는 어디서 오는가? (다) 가르는 청크를 늘 첫 청크로 고정하지 않고 무작위로 고르는 이유는?
선생님
(가)부터요. 프롬프트에서 따로 굴린 여덟 개 중 하나가 평균보다 좋았어요. 20개 청크 중 무엇 덕분이죠?
김민준
전부 덕분이죠. 어드밴티지를 20개 청크의 로그확률에 다 곱해서 올리면 되잖아요. 원래 GRPO가 그렇게 하는데요.
선생님
그 영상이 3번째 청크에서 좋은 판단을 하고 15번째 청크에서 떨림을 만들었다면요?
김민준
떨림을 만든 15번째 청크도 같이 올라가네요. 영상 전체가 평균보다 좋았다는 이유로요. 청크가 많을수록 누가 잘했는지 흐려져요.
이서연
(나)는 같은 과거를 공유하니까 c번째 청크 전까지는 차이가 없어. 차이는 전부 c번째 청크부터 뒤에서 와.
선생님
그래요. 과거를 같게 두면 무엇을 통제한 거죠?
이서연
상태요. 같은 상태에서 출발한 그룹이니까 그룹 평균은 그 상태의 가치 V, 곧 거기서 앞으로 기대되는 보상을 샘플로 잰 거고, 어드밴티지는 「이 상태에서 이렇게 이어 간 게 평균보다 나았나」가 돼요. 그래서 업데이트도 갈라진 부분에만 하는 거고요.
이서연
그런데 그러면 첫 청크에서 가르는 게 제일 좋지 않아요? 뒤의 청크 전부가 비교 대상이 되니까요.
선생님
첫 청크에서 가르면 (가)와 무엇이 다르죠?
이서연
거의 같네요. 프롬프트만 공유하는 거니까 크레딧 할당 문제가 그대로예요. 반대로 늘 마지막 청크에서만 가르면 앞 청크들은 한 번도 업데이트를 못 받고요.
이서연
무작위로 고르면 청크마다 돌아가며 「자기부터 갈라진 그룹」의 주인공이 되니까, 여러 번의 업데이트를 거치며 모든 위치가 제 몫의 신호를 받아요.
김민준
조별과제에서 한 사람씩 돌아가며 「여기서부터 네가 다시 써 봐」 하고 결과를 비교하면, 그 사람 몫의 기여가 보이는 거네요. 매번 첫 장부터 다시 쓰면 누가 잘했는지 모르고요.
선생님
그래요. 무엇을 같게 두고 비교하느냐는 GRPO를 새 영역에 옮길 때마다 새로 답해야 하는 질문이에요. 영상에서는 그 답이 「같은 과거」예요.
정리 (가) 영상 전체의 어드밴티지가 모든 청크에 똑같이 붙으므로 어느 청크가 잘했는지 가리지 못한다(청크가 많을수록 흐려진다). (나) 과거를 공유하면 그룹 내 차이는 모두 갈라진 청크 이후에서 온다. AR-CoPO는 갈라진 뒤의 청크들도 모든 갈래가 같은 노이즈로 이어 만들어서, 보상 차이를 갈라진 청크에서 내린 선택 하나로 돌린다. 그룹 평균은 그 상태의 가치를 샘플로 잰 것이 되고, 어드밴티지는 그 뒤의 선택만 평가한다. (다) 첫 청크에서 가르면 (가)와 같아지고, 마지막 청크에서만 가르면 앞 청크가 배우지 못한다. 무작위로 고르면 모든 위치가 돌아가며 학습 신호(시그널)를 받는다.