머릿말
생각의 보법이 다르다
“생각의 보법이 다르다.”
ML과 AI를 공부하는 연구자들이 유명한 논문들을 읽다 보면, 수학과 물리학의 기반에 대한 이해 수준이 다른 논문을 마주쳤을 때 들게 되는 감상이다. 나도 저런 사람들처럼 생각하고 싶다고 생각해서 필요한 자원들을 파고 내려가다 보면, 한쪽 뿌리의 끝에서 동역학 개념들을 만나게 된다.
그런 논문들의 특징은 어려운 수식을 많이 쓴다는 데 있지 않다. 오히려 다른 논문들이 여러 쪽에 걸쳐 공들여 만드는 장치를, 이들은 "이건 결국 이 계의 자유에너지를 줄이는 일이다"라거나 “여기서 필요한 것은 부피를 보존하는 흐름이다” 같은 한 문장으로 정리해 버린다. 문제를 보자마자 그것이 어떤 오래된 문제의 변형인지 알아보고, 그 문제를 풀기 위해 이미 만들어진 도구를 꺼내 쓰는 것이다. 보법이 다르다는 느낌은 바로 이 차이에서 온다.
이 차이는 재능보다는 어휘의 문제에 가깝다. 물리학자에게 분배함수와 자유에너지, 랑주뱅 방정식과 해밀토니안은 학부 시절부터 손에 익은 도구다. 그들에게는 이 도구들이 정의가 아니라 직관으로 남아 있어서, ML의 새 문제를 보아도 그 직관이 먼저 움직인다. 반대로 이 어휘를 논문에서 처음 만난 사람에게는 새 용어가 나올 때마다 뛰어넘어야 하는 허들이 된다. 이 책은 그 허들을 하나씩 낮춰 보려는 시도다.
뿌리를 따라 내려가면
실제로 어떤 논문들이 그런지 떠올려 보면, 뿌리가 어디로 나 있는지가 쉬게 보인다. 오늘날 이미지 생성의 표준이 된 확산 모델의 출발점인 Sohl-Dickstein 등의 2015년 논문은 제목부터 "비평형 열역학을 이용한 비지도 학습"이었다. 이를 이어받은 Song 등의 점수 기반 모델은 확산을 확률미분방정식으로 쓰고, 그 밀도가 따르는 Fokker–Planck 방정식에서 확률 흐름 ODE를 이끌어 냈다. 두 논문 모두 열과 확산을 다루던 물리학의 언어를 거의 그대로 가져왔다.
샘플링 쪽도 마찬가지다. 해밀턴 몬테카를로(HMC)는 확률분포에서 샘플을 뽑기 위해 가상의 입자를 만들고 운동량을 붙여 굴리는 방법이고, SGLD는 경사하강에 랑주뱅 잡음을 더해 학습을 샘플링으로 바꾼다. 강화학습의 SAC는 보상에 엔트로피를 더해 최대화하고 그 계수를 그대로 "온도"라고 부르며, LLM 정렬에 쓰이는 DPO의 최적 정책은 볼츠만 분포의 모양을 하고 있다. flow matching이 노이즈와 데이터를 직선으로 잇는 이유는 최적 수송을 최소 작용 원리로 다시 쓴 Benamou–Brenier의 결과에서 찾을 수 있다. 더 거슬러 올라가면 Hopfield 네트워크와 볼츠만 머신이 있고, 이 두 연구를 이끈 홉필드와 힌턴이 2024년 노벨 물리학상을 받은 것도 우연이 아니다.
이 뿌리들을 끝까지 따라가 보면 두 갈래로 모인다. 하나는 고전역학으로, 물체 하나가 시간에 따라 어떻게 움직이는지를 라그랑지안과 해밀토니안의 언어로 다룬다. 다른 하나는 통계역학으로, 아주 많은 것이 함께 움직일 때 평균적으로 무엇이 보이는지를 경우의 수와 엔트로피, 온도의 언어로 다룬다.
테렌스 타오는 수학의 핵심 개념을 수, 대수, 기하, 확률, 해석, 동역학의 여섯 갈래로 정리하면서 마지막 자리를 동역학에 내어 주었다. 동역학은 무언가가 시간에 따라 어떻게 변하는가를 다룬다. 학습은 매개변수가 변하는 과정이고, 생성은 분포가 변하는 과정이며, 샘플링은 우리가 일부러 만든 가상의 물리계가 움직이는 과정이다. 현대 ML의 상당 부분이 여섯째 갈래 위에 서 있는 셈이다.
이 책이 하려는 일
이 책은 그 여섯째 갈래를 ML 연구자의 눈으로 따라가는 안내서다. 물리학 교과서처럼 뉴턴의 법칙에서 출발해 차례로 쌓아 올리지 않고, 독자가 코드와 논문에서 이미 만난 현상에서 출발한다. 고차원 가우시안 샘플이 왜 원점이 아니라 얇은 껍질에 모이는지, softmax의 온도는 왜 하필 로짓을 나누는 자리에 있는지, flow matching은 왜 직선 경로를 고르는지 같은 질문을 먼저 던지고, 그 답을 찾는 과정에서 역학의 개념을 하나씩 꺼낸다.
독자로는 미적분과 선형대수, 확률의 기초는 알지만 물리 수업은 거의 듣지 않은 사람을 생각했다. 그래서 용어는 꼭 필요할 때에만 들여오고, 들여올 때는 그것이 하는 역할을 함께 적는다. 증명의 엄밀함보다는 "왜 이 식이 이 모양이어야 하는가"를 먼저 설명하려 했고, 숫자는 모두 직접 계산해 확인한 값만 실었다.
각 장은 비슷한 순서로 진행된다. 먼저 ML에서 만난 현상이 남기는 물음을 세운다. 정의가 아니라 물음이 먼저이고, 답은 독자가 그 답을 원하게 된 뒤에 나온다. 그다음 손으로 세어 볼 수 있는 작은 문제에서 보이는 패턴을 짚고, 그 패턴에 이름을 붙여 정의로 만든 뒤, 그 개념이 ML의 어디에 나타나는지 살핀다. 한 절에는 새 개념을 하나만 두었다. 두 개념이 어떻게 이어지는지 보여도 한 절에 묶지 않았고, 그 연결은 독자가 스스로 알아채도록 남겨 두었다. 장 끝에는 선생님과 두 학생, ML 강의를 몇 개 들은 김민준과 수학과의 이서연이 문제를 풀며 틀리는 대화가 있다. 두 학생이 틀리는 지점은 대개 독자가 처음 이 개념을 만났을 때 틀리는 지점이기도 하다. 그리고 각 장은 "이제 이것은 할 수 있지만 저것은 아직 막혀 있다"는 질문으로 끝난다. 다음 장은 그 막힌 곳에서 출발한다.
이 책은 정보기하학 교재, 『생성모델의 강화학습 — DPO에서 GRPO까지』, 『미분기하학의 언어들』에 이어지는 시리즈의 한 권이다. 앞의 책들이 기하와 확률의 갈래를 따라갔다면, 이 책은 동역학의 갈래를 따라간다. 두 갈래가 어디서 다시 만나는지는 독자가 직접 발견하도록 남겨 두었다.
보법은 타고나는 것이라기보다 익히는 것이라고 믿는다. 이 책을 다 읽은 뒤 어느 논문에서 "자유에너지"나 "해밀토니안"이라는 단어를 만났을 때, 멈춰 서는 대신 그 단어가 가리키는 그림이 먼저 떠오른다면 이 책은 제 역할을 다한 것이다.