에필로그
이어서 읽을 방향
만든 모델을 다듬기: 『생성모델의 강화학습』
이 책이 그림을 만드는 모델을 지었다면, 짝을 이루는 큰 줄기인 『생성모델의 강화학습』은 만든 모델을 사람의 선호와 보상으로 다듬는다. 그 책의 1~18장은 언어모델에서 정책 그래디언트, PPO, DPO, GRPO 를 세우고, 19~22장이 그것을 디퓨전과 영상 모델로 옮긴다. 부록 A 의 세 절이 그 네 장의 바탕이다.
길잡이 · 『생성모델의 강화학습』 「19. 디퓨전에서 DPO를 쓰려면 — 로그확률의 벽」
그림의 로그확률은 못 재도 한 걸음의 로그확률은 잰다는 데서 출발해, 노이즈 복원 오차를 로그확률 대신 쓰는 Diffusion-DPO 와 그 한계까지. 이어 읽기
길잡이 · 『생성모델의 강화학습』 「20. DDPO — 디퓨전의 정책 그래디언트」
잡음 걷기를 스텝 하나가 행동 하나인 결정 과정으로 옮기고, 그 위에서 REINFORCE·PPO 를 돌리는 법과 보상 모델의 빈틈을 파고드는 리워드 해킹. 이어 읽기
길잡이 · 『생성모델의 강화학습』 「21. 이미지·로보틱스의 강화학습 — GRPO가 시각 생성을 만났을 때」
결정적인 샘플러에 잡음을 다시 넣어 탐색을 되돌리고, 같은 프롬프트로 뽑은 그림 묶음을 견주는 그룹 비교. 무엇을 같게 두고 비교할지, 중간에서 갈라 비교하는 법. 이어 읽기
길잡이 · 『생성모델의 강화학습』 「영상 모델의 강화학습: 보상이 들어오는 네 자리」
셀프 포싱으로 배우는 영상 모델에서 「진짜 영상다움」이 앉아 있던 자리에 사람이 원하는 점수를 앉히는 법. 이어 읽기
이론을 더 깊이: 토대 세 권
이 책은 이론이 처음 나오는 자리에서 결론과 쓰임만 적었다. 유도와 그 이론의 다른 쓰임이 궁금하다면 토대 책으로 간다. 장마다 걸어 둔 길잡이 말고, 책을 다 읽은 뒤에 이어 읽기 좋은 곳을 몇 군데 적는다.
길잡이 · 『ML 입문자를 위한 동역학』 「열 방정식: 이웃 평균을 연속으로 쓰면」
2장 「퍼짐」과 4장 「스코어」가 결론만 빌려 쓴 열 방정식을 이웃 평균에서 끌어내는 과정. 퍼지는 빠르기가 무엇으로 정해지는지, 한 점에 둔 값이 왜 가우시안으로 퍼지는지. 이어 읽기
길잡이 · 『ML 입문자를 위한 동역학』 「경로 공간의 ELBO: ln Z는 아래로 치우친다」
앞으로 간 경로와 거꾸로 밟는 경로의 확률 비로 쓴 ELBO 와, 그 틈이 물리의 「소산된 일」이라는 이야기. 디퓨전 모델의 첫 논문 제목에 왜 「비평형 열역학」이 들어갔는지. 이어 읽기
길잡이 · 『정보기하학』 「최적 수송: 얽히지 않게 짝짓기」
8장 「플로우 매칭」에서 짝의 엇갈림을 줄이려고 쓴 최적 수송 짝짓기의 바탕. 바서슈타인 거리가 KL 발산과 어떻게 다른 물음에 답하는지, 표본을 섞는 길이 왜 그 거리에서 가장 곧은 길인지. 이어 읽기
길잡이 · 『정보기하학』 「두 가지 사영: 같은 분포, 두 개의 답」
걸음을 줄인 학생이 선생의 봉우리를 모두 지킬 수 있는가라는 물음의 바탕. KL 의 어느 쪽에 데이터를 두느냐에 따라 두 봉우리를 넓게 덮는 답과 한 봉우리에 앉는 답이 갈리는 까닭. 이어 읽기
길잡이 · 『미분기하학의 언어들』 「매니폴드: 어디를 확대해도 평면인 공간」
이 책이 여러 번 기댄 매니폴드 가설, 곧 그림들이 넓은 공간의 좁은 면 근처에 모여 있다는 생각에서 「면」이 수학에서 무엇인지. 어디를 확대해도 평면처럼 보이는 공간과, 그것을 좌표 지도 여러 장으로 덮는 법. 이어 읽기
어느 쪽으로 가든 처음 할 일은 이 책에서와 같다. 숫자 하나짜리 장난감을 골라 손으로 계산해 보고, 그 값을 코드로 다시 확인하는 것. 두 값이 맞으면 그다음은 차원을 키울 차례다.