20. DDPO — 디퓨전의 정책 그래디언트

자주 하는 실수와 요약

자주 하는 실수
실수 나온 문제 바로잡는 법
일어날 가능성이 가장 큰 값(비가 안 온다 → 0mm)을 최선의 예보로 봄 1 제곱 오차의 최선은 평균이다. 0mm는 평균 제곱 오차 30, 3mm는 21
관측이 가까운 쪽 데이터 점만 보고 추정의 부호를 정함 2 원래 흔한 쪽도 함께 본다. −1-1 이 80%면 xt=0.5\textcolor{#1c9c60}{x_t} = 0.5, σ=1\textcolor{#993600}{\sigma} = 1 에서도 추정은 −0.19-0.19
한 번에 회귀한 흐릿한 답을 학습 부족 탓으로 봄 2 순수한 노이즈에는 가를 정보가 없어 평균(−0.6-0.6)이 최선이다. 그래서 조건을 조금씩 바꾸는 스텝을 여러 번 밟는다
편차가 같으면 똑같이 드문 일이라고 봄 3 흔들림으로 나눠 잰다. 같은 6g이 표준편차 10g인 곳에서는 0.6개, 2g인 곳에서는 3개다
노이즈 σ\textcolor{#993600}{\sigma}를 줄여도 벗어난 거리가 함께 줄어 그래디언트는 그대로라고 봄 4 ∂log⁡p/∂μθ=ε/σ\partial \log \textcolor{#1565c0}{p} / \partial \textcolor{#1565c0}{\mu_\theta} = \textcolor{#b8860b}{\varepsilon}/\textcolor{#993600}{\sigma} — ε=0.5\textcolor{#b8860b}{\varepsilon} = 0.5에서 σ=0.5\textcolor{#993600}{\sigma} = 0.5면 1, σ=0.1\textcolor{#993600}{\sigma} = 0.1이면 5
노이즈 없는 샘플러의 경로에 아주 작은 σ\textcolor{#993600}{\sigma}를 가정해 DDPO를 씀 5 그래디언트가 1/σ1/\textcolor{#993600}{\sigma}로 한없이 커지고, 그 경로는 그 분포에서 뽑힌 것도 아니다. 노이즈를 실제로 넣어야 로그확률과 탐색이 생긴다
방금 생성한 경로라 여러 번 업데이트해도 그대로 온폴리시(지금 정책이 뽑은 샘플)라고 봄 6 첫 업데이트 뒤엔 pθ≠pold\textcolor{#1565c0}{p_\theta} \ne \textcolor{#6f6f78}{p_\text{old}} — 비율로 보정하고 클리핑한다(DDPOIS)
보상이 양수인 빈틈이 남아 있으면 정책이 결국 그쪽으로 간다고 봄 7 최적화는 순위 싸움이다. 진짜 최고점의 평균 1이 빈틈의 0.75보다 크다
보상 앙상블이면 해킹이 해결된다고 봄 7 모델마다 다른 빈틈만 지운다. 공유된 빈틈에서는 평균도 1.5 그대로다
요약

디퓨전은 이미지를 한 번에 그리지 않는다. 제곱 오차로 학습한 네트워크의 답은 조건부 평균이라, 순수한 노이즈에서 한 번에 회귀하면 모든 이미지의 흐릿한 평균이 나온다. 그래서 지금까지 그린 결과(내부 조건)를 다음 스텝의 조건으로 넣어 평균을 한 봉우리로 좁혀 간다 — 시간을 축으로 한 자기회귀다. 추정이 스텝마다 바뀌는 것은 조건이 특정되기 때문이고, 처음 추정은 앞으로의 추정들의 평균이다. 한 스텝 생성은 가능하지만 대개 여러 스텝 모델을 압축한 것이고, 교사의 수준에 닿으려면 보고된 예로 4스텝은 걸렸다. 이렇게 생성이 여러 번의 결정이므로, 쌍비교 데이터 없이 점수만 주는 보상 모델이 있을 때 DDPO는 디노이징 T\textcolor{#915a08}{T}스텝을 T\textcolor{#915a08}{T}번의 행동으로 보는 MDP로 디퓨전에 정책 그래디언트를 쓴다. 이미지 전체의 확률은 몰라도 실제로 밟은 경로의 스텝별 가우시안 로그확률은 정확히 계산되고, 스텝 노이즈 σtε\textcolor{#993600}{\sigma_t}\textcolor{#b8860b}{\varepsilon}가 탐색을, μθ\textcolor{#1565c0}{\mu_\theta}가 학습되는 판단을 맡는다. 노이즈가 작을수록 샘플 하나의 그래디언트는 ε/σ\textcolor{#b8860b}{\varepsilon}/\textcolor{#993600}{\sigma}로 예민해지고, 노이즈가 없는 결정론적 샘플러에서는 로그확률도 탐색도 사라진다. 그래디언트는 REINFORCE식(DDPOSF)이나 임포턴스 비율과 클리핑을 쓰는 PPO식(DDPOIS)으로 추정하고, 프롬프트별 보상 정규화가 비평가를 대신한다. 대가는 보상 모델에 대한 전적인 의존이다 — 온라인 탐색이 보상 모델의 빈틈을 찾아내 리워드 해킹이 일어나고, 보상 앙상블은 모델마다 다른 빈틈만 지울 뿐 공유된 편향은 남긴다.