에필로그

이어서 읽을 방향

만든 모델을 다듬기: 『생성모델의 강화학습』

이 책이 그림을 만드는 모델을 지었다면, 짝을 이루는 큰 줄기인 『생성모델의 강화학습』은 만든 모델을 사람의 선호와 보상으로 다듬는다. 그 책의 1~18장은 언어모델에서 정책 그래디언트, PPO, DPO, GRPO 를 세우고, 19~22장이 그것을 디퓨전과 영상 모델로 옮긴다. 부록 A 의 세 절이 그 네 장의 바탕이다.

이론을 더 깊이: 토대 세 권

이 책은 이론이 처음 나오는 자리에서 결론과 쓰임만 적었다. 유도와 그 이론의 다른 쓰임이 궁금하다면 토대 책으로 간다. 장마다 걸어 둔 길잡이 말고, 책을 다 읽은 뒤에 이어 읽기 좋은 곳을 몇 군데 적는다.

어느 쪽으로 가든 처음 할 일은 이 책에서와 같다. 숫자 하나짜리 장난감을 골라 손으로 계산해 보고, 그 값을 코드로 다시 확인하는 것. 두 값이 맞으면 그다음은 차원을 키울 차례다.