DPO가 버린 것: 생성 루프
DPO는 RLHF와 같은 목적함수의 최적해를 겨냥한다. 그렇다면 PPO로 푼 RLHF와 무엇이 같고, 무엇이 다를까? 같은 선호 데이터를 주면 같은 모델이 나올까?
지킨 것과 버린 것
| PPO-RLHF | DPO | |
|---|---|---|
| 목적함수 | 같다 — 그 최적해를 직접 겨냥 | |
| 선호 모델 | Bradley-Terry로 보상 모델 학습 | 같다 — BT를 정책에 바로 적용 |
| 필요한 모델 | 정책·레퍼런스·보상 모델·비평가 (4) | 정책·레퍼런스 (2) |
| 응답은 누가 만드나 | 학습 중인 정책 자신 (온라인·온폴리시: 학습 도중 지금 정책이 새로 만든 데이터) | 미리 만든 데이터셋 (오프라인·오프폴리시: 남이 미리 만든 고정 데이터) |
| 탐색 | 새 응답을 만들어 보며 배운다 | 데이터셋에 있는 응답만 본다 |
| 구현 | 생성·채점·학습 루프 | SFT(정답을 따라 쓰게 하는 지도 미세조정)와 같은 지도학습 루프, 손실만 교체 |
지킨 것은 목적함수와 선호 모델이다. 버린 것은 생성 루프다. 이 선택이 DPO의 장점과 한계를 동시에 만든다. 장점: 지도학습처럼 안정적이고 싸다. 코드 몇 줄로 기존 파이프라인에 붙는다. 한계: 정책 그래디언트는 "지금의 정책이 뽑은 응답"에서만 올바른 그래디언트를 준다. DPO는 남이 만든 응답만 본다. 모델이 지금 실제로 저지르는 실수가 데이터셋에 없다면 그 실수는 교정되지 않는다.
ML에서: PPO와 DPO를 나란히 돌려 보면
같은 목적함수를 겨냥하니 결과도 같을까? 칭화 대학의 쉬(Shusheng Xu)와 동료들은 2024년 ICML에 실린 비교 연구 「Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study」에서 두 방법을 대화 과제부터 코드 경진 문제까지 나란히 돌렸고, 잘 조율한 PPO가 모든 실험에서 DPO를 앞섰다. 차이가 가장 컸던 것은 코드 경진 문제 모음(CodeContests)이다. 340억 파라미터 코드 모델(Code Llama 34B)을 같은 출발점에서 세 가지로 다듬고, 문제마다 코드 1,000개를 뽑아 문제에 딸린 공개 예제로 거른 뒤 10개를 제출해 숨은 시험을 통과한 비율을 쟀다.
| 다듬는 법 | 시험 문제 통과율 |
|---|---|
| SFT만 | 15.2% |
| DPO | 0.0% |
| PPO | 22.4% |
DPO로 다듬은 모델은 한 문제도 풀지 못했고, 저자들은 이 모델이 뜻 없는 코드 조각을 잔뜩 내놓았다고 적었다. PPO 쪽은 410억 파라미터 AlphaCode의 16.4%도 넘었다. 목적함수가 같은데 어디서 이런 차이가 났을까? 아래 두 문제에서 숫자로 따져 본다.
문제 5 — 4배라는 말만 들었을 때
30명인 반에서 반장 선거를 한다. 후보는 민서, 준호, 서아 셋이고, 모두 한 표씩 던진다. 사전 조사 결과는 「민서를 찍겠다는 학생이 준호를 찍겠다는 학생의 4배」라는 말만 전해졌다(준호를 찍겠다는 학생은 한 명 이상). (가) 민서가 받을 수 있는 표는 몇 표에서 몇 표 사이인가? (나) 이 말만으로 민서가 당선된다고 할 수 있는가?






정리 (가) 준호가
표면 민서 표, 서아 표. 이므로 민서는 4표에서 24표 사이다. (나) 할 수 없다. 준호가 4표 이상이면 민서가 이기지만( : 16 대 10), 3표 이하면 서아가 이긴다( : 12 대 15). 두 후보 사이의 비율은 셋째 후보의 몫을 정하지 않는다.
문제 6 — (킬러) 같은 최적해, 같은 모델?
민준: “DPO는 RLHF 목적함수의 최적해를 정확히 유도했으니, 같은 선호 데이터라면 PPO-RLHF와 같은 모델이 나와야 해요.” 서연: “최적해가 같다는 건 끝점이 같다는 뜻이고, 경로만 다를 뿐이야. 충분히 학습하면 결국 같은 데 도착해.” DPO 학습 중에


















정리
— 손실은 줄었다. 그러나 선호 응답의 확률도 떨어졌고, 사라진 확률 0.35는 데이터셋 밖의 응답으로 갔다. 민준: 유도는 맞지만, 유한한 오프라인 쌍만 보는 손실은 데이터 밖을 통제하지 못한다. 서연: 문제는 경로가 아니라 최소점이 유일하지 않다는 것 — 데이터에 없는 응답의 확률은 손실에 나타나지 않는다. PPO는 자기가 뽑은 응답을 채점받으므로 이 빈 곳이 드러난다.