22. 영상 생성 모델의 학습 — 시퀀스와 디퓨전 사이에서 무엇을 "강제"하는가
영상 모델의 강화학습: 보상이 들어오는 네 자리
셀프 포싱까지 오면서 영상 모델은 이미 자기 롤아웃 위에서 배우게 되었다. 보상 자리에는 「진짜 영상다움」이 앉아 있었다. 그렇다면 그 자리에 사람이 원하는 것 — 움직임이 크고 자연스러운가, 프롬프트와 맞는가, 인물이 끝까지 같은가 — 을 앉히면 어떻게 될까?
보상은 여러 축으로 갈라진다
이미지 한 장은 스칼라 하나로 평가할 수 있지만, 영상은 평가해야 할 축이 많다.
| 축 | 묻는 것 |
|---|---|
| 시각 품질 | 각 프레임이 선명한가? |
| 모션 품질 | 움직임이 자연스러운가? 떨림은 없는가? |
| 텍스트-영상 정합 | 프롬프트와 일치하는가? |
| 시간 일관성 | 프레임 사이의 연속성이 유지되는가? |
| 정체성 보존 | 인물의 얼굴이 처음부터 끝까지 같은가? |
모든 축에서 동시에 이기는 영상은 드물다. 한 축을 올리면 다른 축이 내려가는 파레토 프론티어(어느 축을 올리려면 다른 축을 깎아야 하는 경계)의 문제가 그대로 돌아온다. 전체 시퀀스 영상 모델(HunyuanVideo 등)을 GRPO로 미세조정한 DanceGRPO(2025)가 여러 보상을 더하지 않고 보상별로 어드밴티지를 따로 계산해 합산한 것도 이 문제에 대한 한 가지 답이다. 모션 품질이 181%, 시각 품질이 56% 올랐다고 보고했다.
정체성 보존은 특히 까다롭다. 여러 사람이 등장하는 영상에서 전체 구도는 맞아도 얼굴이 뒤바뀌는 일이 흔하다. Identity-GRPO(arXiv:2510.14256, 2025년 10월, Alibaba)는 이 한 축을 위한 보상 모델부터 만들었다. 다섯 개 영상 생성 모델의 출력에 사람이 매긴 쌍비교 라벨과 합성 왜곡을 더한 약 1만 5천 개 규모의 선호 데이터로 "인물이 일관되게 유지되는가"를 판정하는 비디오 보상 모델을 학습하고(LLM의 보상 모델을 쌍비교로 학습하는 것과 같은 구조), 다중 인물 일관성에 맞춘 GRPO 변형으로 기존 모델(VACE, Phantom)을 미세조정했다. 정체성 일관성 지표에서 기준 모델 대비 최대 18.9%(VACE), 6.5%(Phantom) 향상을 보고했다.
네 자리
포싱 계보의 자기회귀 영상 모델에 보상이 들어오는 자리는 지금까지 네 가지다.
| 자리 | 예 | 어떻게 |
|---|---|---|
| ① 선호 최적화 | SkyReels-V2 (2025.4) | 모션 품질만을 위한 보상 모델을 쌍비교 약 3만 개로 학습하고, 흐름 모델용 DPO(Flow-DPO)로 움직임을 다듬는다 |
| ② 보상으로 증류에 무게 싣기 | Reward Forcing (2025.12), Stream-R1 (2026.5) | DMD 증류에서 보상이 높은 샘플 쪽으로 분포를 기울인다. Reward Forcing은 VLM(이미지를 보고 글을 쓰는 모델)이 매긴 「움직임이 얼마나 역동적인가」를 쓴다(Re-DMD) |
| ③ 미분 가능한 보상 올리기 | Reward-Forcing (2026.1, ②와 다른 논문) | 선생님 증류 대신 미분 가능한 보상 모델의 점수를 샘플을 거쳐 직접 키운다 |
| ④ 자기회귀 영상 위의 GRPO | AR-CoPO (2026.3), RAVEN (2026.5) | 그룹을 만들어 보상을 비교하는 GRPO를 자기회귀 영상 생성에 맞게 고친다 |
①은 오프라인 선호 쌍에서, ②·③은 셀프 포싱의 증류 손실에 보상을 얹는 식으로, ④는 온라인 강화학습으로 들어온다. ②가 흥미롭다. 역방향 KL이 이미 「
문제 10 — 맛과 친절, 눈금이 다른 두 점수
한 동네의 식당 네 곳을 두 축으로 평가했다. 맛은 100점 만점이고, 친절은 5점 만점이다.
| 식당 | 맛 | 친절 |
|---|---|---|
| 가 | 70 | 5 |
| 나 | 90 | 1 |
| 다 | 60 | 4 |
| 라 | 80 | 2 |
(가) 두 점수를 그냥 더해 1등을 고르면 어디인가? 이 순위는 사실상 어느 축이 정하는가? (나) 축마다 점수를 「네 곳의 평균에서 표준편차 몇 개만큼 위인가」로 바꾼 뒤 더하면 1등은 어디인가?








정리 (가) 나(91점). 맛은 30점 폭으로, 친절은 4점 폭으로 퍼져 있어서 그냥 더하면 순위는 거의 맛이 정한다. (나) 축마다 평균을 빼고 표준편차로 나누면 맛 −0.45, 1.34, −1.34, 0.45, 친절 1.26, −1.26, 0.63, −0.63이고, 더하면 가 0.82, 나 0.08, 다 −0.71, 라 −0.19로 가가 1등이다. 축마다 퍼진 정도로 나눠야 눈금이 작은 축도 제 몫을 한다.