부록 A — 강화학습으로 이어지는 다리

대응 사전: 언어모델의 강화학습 낱말을 디퓨전에서 읽기

『생성모델의 강화학습』은 대부분의 방법을 언어모델에서 먼저 세우고, 뒤에서 그림·영상 생성으로 옮긴다. 그 뒷부분을 읽다 보면 언어모델의 낱말로 쓴 생각을 디퓨전의 무엇으로 읽어야 하는지 한 번씩 멈추게 된다. 앞의 세 절에서 세운 것과, 이 책의 다른 장에서 본 것을 한 표로 모은다.

개념 언어모델 디퓨전 · 플로우 모델
한 번의 행동 토큰 하나 걸음 하나 (xt → xt−1)
정책 소프트맥스가 낸 다음 토큰 분포 평균 μθ, 분산 βt(잡음을 다시 넣으면 gt²Δt)인 정규분포
출력의 로그확률 토큰 로그확률의 합. 정확하다 경로 하나는 걸음의 로그확률의 합으로 정확하다. 그림 하나는 ELBO 바닥만
DPO 가 쓰는 로그확률 자리 Σ log π(yᵢ ∣ 앞 토큰들) −(가중 잡음 맞히기 오차), 곧 Diffusion-DPO
탐색의 원천 샘플링 온도 출발 잡음, 그리고 걸음마다 섞는 잡음 gt√Δt ε
결정적인 생성 그리디 디코딩 (온도 0) 오일러, DDIM 다이얼 0, DPM-Solver++ 2M 같은 결정적인 걸음
길이 토큰 수 걸음 수 T
길이 편향 긴 답일수록 로그확률 합이 작다 잡음 맞히기가 어려운 그림일수록 바닥이 낮다. 디테일이 많은 그림이 불리해지는 「매끈함 편향」은 짐작이고 잰 결과는 아직 없다
레퍼런스 모델 학습 전 언어모델 학습 전 디퓨전 모델
정책 그래디언트 REINFORCE, PPO DDPO
그룹 상대 비교 GRPO Flow-GRPO, DanceGRPO
리워드 해킹 보상 모델의 빈틈을 파는 답(장황함, 아첨 등) 보상 모델의 빈틈을 파는 그림
학습과 생성의 불일치 생성 엔진과 학습 엔진이 같은 토큰에 다른 확률을 매김 적은 걸음으로 학습하고 많은 걸음으로 생성 (Flow-GRPO 10걸음 대 40걸음)
자기 출력으로 배우기 모델이 스스로 뽑은 답으로 학습 (온폴리시) 영상 생성 모델이 자기가 만든 앞 프레임에 기대 다음 프레임을 만들며 배우는 셀프 포싱

표의 줄 가운데 몇은 이 책의 다른 장에 집이 있다. 결정적인 걸음과 잡음을 넣는 걸음은 샘플러의 여러 걸음법에서, 바닥과 틈은 VAE 의 ELBO 와 DDPM 의 사슬에서, 속도와 스코어의 다리는 플로우 매칭에서, 자기 출력으로 배우는 영상 모델은 영상 생성의 노출 편향과 셀프 포싱에서 다뤘다. 강화학습 쪽 낱말의 집은 강화학습 책이다.

문제 7. 탐색의 손잡이

잡음 다시 넣기의 장난감(데이터 N(1, 0.5²), 200걸음)에서 손잡이 a를 바꾸며, 같은 출발 잡음 0.3 에서 2만 번 걸은 끝의 표준편차와, 출발 잡음 40만 개로 잰 전체 분포의 표준편차를 쟀다.

a 0.1 0.4 0.7 1.0
같은 출발에서 끝의 표준편차 0.135 0.421 0.496 0.499
전체 분포의 표준편차 0.496 0.499 0.501 0.500

(가) 대응 사전은 언어모델의 샘플링 온도와 디퓨전의 다시 넣는 잡음을 같은 줄에 놓았다. 온도를 올리면 언어모델의 출력 분포는 어떻게 되는가? (나) a를 올리면 디퓨전의 출력 분포는? (다) 그렇다면 두 손잡이는 무엇이 같고 무엇이 다른가?

김민준 M01
김민준

온도를 올리면 답이 다양해지고, a를 올리면 같은 출발에서도 끝이 퍼지니까, 둘은 같은 손잡이 아니에요?

선생님 T02
선생님

둘째 줄을 봐요. a를 0.1 에서 1.0 까지 바꾸는 동안 전체 분포는 얼마나 바뀌었죠?

김민준 M05
김민준

0.496 에서 0.500 … 거의 그대로예요. 같은 출발에서만 퍼지고, 전체로는 데이터 분포 그대로네요.

이서연 S01
이서연

온도는 소프트맥스 안의 로짓을 나누니까, 올리면 분포가 평평해지고 내리면 뾰족해져. 출력 분포 자체가 바뀌어. 그런데 a는 랑주뱅 쌍의 세기라 매 순간의 분포를 지키도록 만든 거잖아. 바뀌는 건 같은 출발에서 얼마나 다른 그림이 나오느냐, 곧 출발 잡음이 끝을 얼마나 정하느냐뿐이야.

선생님 T01
선생님

그럼 보상 학습에서 a를 0.1 로 두면요?

이서연 S08
이서연

같은 출발에서 끝이 0.135 밖에 안 갈리니까, 걸음마다 고를 거리가 거의 없어요. 로그확률은 있어도 탐색이 모자라요. 그렇다고 분포를 망치는 건 아니니까, 온도처럼 「다양성과 품질을 맞바꾸는」 손잡이는 아니에요. 걸음을 잘게 나눌 수 있는 한에서는요.

선생님 T13
선생님

그래요. 같은 줄에 놓인 두 낱말도 무엇이 바뀌는지는 다를 수 있어요. 온도는 분포를 바꾸고, 다시 넣는 잡음은 경로만 바꿔요. 걸음이 적으면 그 약속이 어림으로만 지켜진다는 점도 함께 기억해 두세요.

김민준 M07
김민준

시험 난이도를 바꾸는 거랑, 같은 난이도에서 문제 순서만 섞는 거의 차이네요. 반 평균은 순서를 섞어도 그대로고요.