자주 하는 실수와 요약
자주 하는 실수
| 실수 | 나온 문제 | 바로잡는 법 |
|---|---|---|
| 반이 다른 두 학생의 점수표를 그대로 견줌 | 1 | 반마다 다른 가산점이 차이에 섞인다. 같은 반 안의 차이만 가산점과 무관하다 |
| 2 | 보상은 여기에 |
|
| 프롬프트가 다른 두 응답의 비교에도 DPO를 쓸 수 있다고 봄 | 2 | |
| 절대 확률이 낮은 응답은 암묵적 보상도 낮다고 봄 | 3 | 암묵적 보상은 레퍼런스 대비 로그비율 |
| 4 | ||
| 두 후보 사이의 비율만 알면 당선자를 안다고 봄 | 5 | 비율은 셋째 후보의 몫을 정하지 않는다 |
| 손실이 줄었으니 선호 응답의 확률도 올랐다고 봄 | 6 | 둘 다 떨어져도 비선호 응답이 더 떨어지면 마진이 벌어져 손실은 준다 |
| 같은 목적함수의 최적해이니 PPO-RLHF와 같은 모델이 나온다고 봄 | 6 | 유한한 오프라인 데이터에서 DPO의 최소점은 하나가 아니라 집합이다 |
요약
KL로 묶은 보상 최대화의 최적해는 레퍼런스에 보상의 지수 인자를 곱해 다시 맞춘