자주 하는 실수와 요약
자주 하는 실수
| 실수 | 나온 문제 | 바로잡는 법 |
|---|---|---|
| 레퍼런스가 정답을 이미 좋아하면 출발점 손실이 작고 그래디언트도 0에 가깝다고 봄 | 1 | 출발점에서는 |
| 레퍼런스가 틀린 쌍일수록 DPO가 더 세게 바로잡는다고 봄 | 2 | 레퍼런스가 오답을 좋아할수록 |
| 보폭이 크면 끝까지 앞선다고 봄 | 3 | 처음 몇 걸음은 보폭이 정하지만, 오래 걸으면 목줄 길이가 멈추는 곳을 정한다 |
| 큰 |
4 | |
| 손실 0.2를 "모델이 |
5 | |
| 손실이 같으면 |
5 | |
| 참 품질이 같은 후보들 사이에서는 RL이 레퍼런스 비율을 그대로 둔다고 봄 | 6 | 선호 데이터의 전형성 편향 |
| 새로 끼운 시간을 모든 과목에서 똑같이 뺀다고 봄 | 7 | 같은 비율로 줄이면 많이 하던 과목이 많이 깎인다. 목표에 끝이 없으면 모두 0으로 간다 |
| 크로스 엔트로피는 정답 토큰만 올리고 다른 토큰은 건드리지 않는다고 봄 | 8 | 로짓 그래디언트는 |
| 정답 확률이 충분히 크면 크로스 엔트로피가 멈춘다고 봄 | 8 | |
| 옛 모델이 모르던 토큰은 앵커가 신경 쓰지 않는다고 봄 | 9 | 역방향 앵커의 억제는 |
| 앵커와 리플레이는 도착점이 다르다고 봄, 또는 도착점이 같으면 차이가 없다고 봄 | 10 | 순방향 앵커의 최적점은 리플레이 비율 |
요약
DPO 그래디언트는 두 조각이다. 괄호 안
레퍼런스에 묶는 일은 망각과도 이어진다. 크로스 엔트로피는 정답 확률을 1까지 밀며 멈출 곳이 없고, 그 사이 정답이 아닌 토큰을 자기 확률만큼 — 가장 믿던 옛 답부터 — 깎는다. 목표를 옛 모델의 분포로 바꾸면 멈출 곳이 생긴다. 순방향 앵커는 드문 사실까지 지키고 최적점이 리플레이와 같으며, 역방향 앵커는 말투·형식 같은 모드를 지키지만 옛 모델이 모르던 새 지식을 가장 세게 누른다. 망각의 크기는 알고리즘보다 도착점이 원래 모델에서 얼마나 먼가(KL)가 정하고, 자기 답으로 배우는 RL이 덜 잊는 것도 가까운 해로 가기 때문이다. 다만 덜 잊는 성질과 원래 모델이 모르던 것을 못 배우는 성질은 같은 성질이다.