MLP에서 디퓨전 트랜스포머까지

VAE에서 출발해 디퓨전 트랜스포머, 조건 걸기, 영상 생성까지

  1. 머리말
  2. 1장 — MLP로 만든 VAE: 첫 생성 모델
  3. 2장 — 퍼짐: 그림에 잡음을 섞으면
  4. 3장 — 합성곱: 이웃만 보는 MLP
  5. 4장 — 스코어: 퍼지기 전으로 되돌리는 방향
  6. 5장 — 잡음을 맞히는 신경망: DDPM과 잡음 제거 스코어 매칭
  7. 6장 — U-Net: 여러 해상도로 잡음을 읽는다
  8. 7장 — 랑주뱅과 역방향 미분방정식: 샘플을 뽑는 길
  9. 8장 — 플로우 매칭: 길을 통째로 배우기
  10. 9장 — 샘플러: 같은 길을 걷는 여러 걸음법
  11. 10장 — 어텐션과 트랜스포머: 멀리 떨어진 칸끼리 읽기
  12. 11장 — 잠재 디퓨전: 작게 줄여 놓고 퍼뜨리기
  13. 12장 — 디퓨전 트랜스포머: U-Net 자리에 트랜스포머를
  14. 13장 — 가이던스: 조건 쪽으로 더 세게
  15. 14장 — 글을 읽는 인코더: CLIP의 마지막 층에서 언어모델의 여러 층으로
  16. 15장 — 그림으로 조건 걸기: 참조 이미지 여러 장
  17. 16장 — 영상 생성: 시퀀스와 디퓨전 사이
  18. 부록 A — 강화학습으로 이어지는 다리
  19. 에필로그