자주 하는 실수와 요약
자주 하는 실수
| 실수 | 나온 문제 | 바로잡는 법 |
|---|---|---|
| 일어날 가능성이 가장 큰 값(비가 안 온다 → 0mm)을 최선의 예보로 봄 | 1 | 제곱 오차의 최선은 평균이다. 0mm는 평균 제곱 오차 30, 3mm는 21 |
| 관측이 가까운 쪽 데이터 점만 보고 추정의 부호를 정함 | 2 | 원래 흔한 쪽도 함께 본다. |
| 한 번에 회귀한 흐릿한 답을 학습 부족 탓으로 봄 | 2 | 순수한 노이즈에는 가를 정보가 없어 평균( |
| 편차가 같으면 똑같이 드문 일이라고 봄 | 3 | 흔들림으로 나눠 잰다. 같은 6g이 표준편차 10g인 곳에서는 0.6개, 2g인 곳에서는 3개다 |
| 노이즈 |
4 | |
| 노이즈 없는 샘플러의 경로에 아주 작은 |
5 | 그래디언트가 |
| 방금 생성한 경로라 여러 번 업데이트해도 그대로 온폴리시(지금 정책이 뽑은 샘플)라고 봄 | 6 | 첫 업데이트 뒤엔 |
| 보상이 양수인 빈틈이 남아 있으면 정책이 결국 그쪽으로 간다고 봄 | 7 | 최적화는 순위 싸움이다. 진짜 최고점의 평균 1이 빈틈의 0.75보다 크다 |
| 보상 앙상블이면 해킹이 해결된다고 봄 | 7 | 모델마다 다른 빈틈만 지운다. 공유된 빈틈에서는 평균도 1.5 그대로다 |
요약
디퓨전은 이미지를 한 번에 그리지 않는다. 제곱 오차로 학습한 네트워크의 답은 조건부 평균이라, 순수한 노이즈에서 한 번에 회귀하면 모든 이미지의 흐릿한 평균이 나온다. 그래서 지금까지 그린 결과(내부 조건)를 다음 스텝의 조건으로 넣어 평균을 한 봉우리로 좁혀 간다 — 시간을 축으로 한 자기회귀다. 추정이 스텝마다 바뀌는 것은 조건이 특정되기 때문이고, 처음 추정은 앞으로의 추정들의 평균이다. 한 스텝 생성은 가능하지만 대개 여러 스텝 모델을 압축한 것이고, 교사의 수준에 닿으려면 보고된 예로 4스텝은 걸렸다. 이렇게 생성이 여러 번의 결정이므로, 쌍비교 데이터 없이 점수만 주는 보상 모델이 있을 때 DDPO는 디노이징