MLP에서 디퓨전 트랜스포머까지
VAE에서 출발해 디퓨전 트랜스포머, 조건 걸기, 영상 생성까지
- 머리말
- 1장 — MLP로 만든 VAE: 첫 생성 모델
- 2장 — 퍼짐: 그림에 잡음을 섞으면
- 3장 — 합성곱: 이웃만 보는 MLP
- 4장 — 스코어: 퍼지기 전으로 되돌리는 방향
- 5장 — 잡음을 맞히는 신경망: DDPM과 잡음 제거 스코어 매칭
- 6장 — U-Net: 여러 해상도로 잡음을 읽는다
- 7장 — 랑주뱅과 역방향 미분방정식: 샘플을 뽑는 길
- 8장 — 플로우 매칭: 길을 통째로 배우기
- 9장 — 샘플러: 같은 길을 걷는 여러 걸음법
- 10장 — 어텐션과 트랜스포머: 멀리 떨어진 칸끼리 읽기
- 11장 — 잠재 디퓨전: 작게 줄여 놓고 퍼뜨리기
- 12장 — 디퓨전 트랜스포머: U-Net 자리에 트랜스포머를
- 13장 — 가이던스: 조건 쪽으로 더 세게
- 14장 — 글을 읽는 인코더: CLIP의 마지막 층에서 언어모델의 여러 층으로
- 15장 — 그림으로 조건 걸기: 참조 이미지 여러 장
- 16장 — 영상 생성: 시퀀스와 디퓨전 사이
- 부록 A — 강화학습으로 이어지는 다리
- 에필로그