10. 레퍼런스 모델 — 이 목줄은 왜 묶여 있나?

자주 하는 실수와 요약

자주 하는 실수
실수 나온 문제 바로잡는 법
레퍼런스가 정답을 이미 좋아하면 출발점 손실이 작고 그래디언트도 0에 가깝다고 봄 1 출발점에서는 πθ=πref\textcolor{#1565c0}{\pi_\theta} = \textcolor{#6f6f78}{\pi_\text{ref}} 라 z=0\textcolor{#d9670b}{z} = 0 이다. 손실은 레퍼런스와 상관없이 −log⁡σ(0)≈0.693-\log\sigma(0) \approx 0.693 이고, 그래디언트 크기 βσ(0)=β/2\textcolor{#827717}{\beta}\sigma(0) = \textcolor{#827717}{\beta}/2 도 살아 있다
레퍼런스가 틀린 쌍일수록 DPO가 더 세게 바로잡는다고 봄 2 레퍼런스가 오답을 좋아할수록 z=Δθ−Δref\textcolor{#d9670b}{z} = \textcolor{#1565c0}{\Delta_\theta} - \textcolor{#6f6f78}{\Delta_\text{ref}} 가 커져 가중치 σ(−βz)\textcolor{#8e44ad}{\sigma(-\beta z)} 가 작아진다. 방향은 언제나 라벨이 정한 yw\textcolor{#e000a5}{y_w} 쪽이다
보폭이 크면 끝까지 앞선다고 봄 3 처음 몇 걸음은 보폭이 정하지만, 오래 걸으면 목줄 길이가 멈추는 곳을 정한다
큰 β\textcolor{#827717}{\beta} 가 한 걸음이 크니 더 멀리 간다고 봄 4 β\textcolor{#827717}{\beta} 는 멈추는 곳을 정한다. 가중치가 0.1로 떨어지는 곳은 βz=ln⁡9≈2.2\textcolor{#827717}{\beta} \textcolor{#d9670b}{z} = \ln 9 \approx 2.2 이므로 작은 β\textcolor{#827717}{\beta} 가 더 멀리 간다
손실 0.2를 "모델이 yw\textcolor{#e000a5}{y_w} 를 82%로 고른다"로 읽음 5 σ\sigma 안은 β(Δθ−Δref)\textcolor{#827717}{\beta}(\textcolor{#1565c0}{\Delta_\theta} - \textcolor{#6f6f78}{\Delta_\text{ref}}) 다. 손실은 레퍼런스보다 나아진 정도만 말한다
손실이 같으면 β\textcolor{#827717}{\beta} 가 달라도 같은 모델이라고 봄 5 Δθ=Δref+z\textcolor{#1565c0}{\Delta_\theta} = \textcolor{#6f6f78}{\Delta_\text{ref}} + \textcolor{#d9670b}{z} 로 되돌려 보라. 기둥이 틀린 곳에 박혀 있으면 짧은 목줄의 모델은 틀린 채로 남는다
참 품질이 같은 후보들 사이에서는 RL이 레퍼런스 비율을 그대로 둔다고 봄 6 선호 데이터의 전형성 편향 αlog⁡πref\alpha\log\textcolor{#6f6f78}{\pi_\text{ref}} 가 보상에 얹히면 최적 정책은 πref1+α/β\textcolor{#6f6f78}{\pi_\text{ref}}^{1+\alpha/\textcolor{#827717}{\beta}} 다. β\textcolor{#827717}{\beta} 가 작을수록 흔한 답이 독차지한다
새로 끼운 시간을 모든 과목에서 똑같이 뺀다고 봄 7 같은 비율로 줄이면 많이 하던 과목이 많이 깎인다. 목표에 끝이 없으면 모두 0으로 간다
크로스 엔트로피는 정답 토큰만 올리고 다른 토큰은 건드리지 않는다고 봄 8 로짓 그래디언트는 πθ(v)−1[v=y]\textcolor{#1565c0}{\pi_\theta}(v) - \mathbb{1}[v=\textcolor{#1c9c60}{y}]. 정답이 아닌 토큰은 자기 확률만큼 깎이므로 가장 믿던 옛 답이 가장 세게 눌린다
정답 확률이 충분히 크면 크로스 엔트로피가 멈춘다고 봄 8 πθ(y)−1\textcolor{#1565c0}{\pi_\theta}(\textcolor{#1c9c60}{y}) - 1 은 확률 1 전에는 0이 아니다. 멈출 곳은 목표를 분포로 바꿔야 생긴다
옛 모델이 모르던 토큰은 앵커가 신경 쓰지 않는다고 봄 9 역방향 앵커의 억제는 qlog⁡(q/πref)q\log(q/\textcolor{#6f6f78}{\pi_\text{ref}}) 라서 옛 모델이 모르던 새 지식일수록 세다. 순방향 앵커는 q−πrefq - \textcolor{#6f6f78}{\pi_\text{ref}} 로 묶여 있다
앵커와 리플레이는 도착점이 다르다고 봄, 또는 도착점이 같으면 차이가 없다고 봄 10 순방향 앵커의 최적점은 리플레이 비율 β/(1+β)\textcolor{#827717}{\beta}/(1+\textcolor{#827717}{\beta}) 의 혼합이다. 차이는 추정량 — 실제 옛 문장이냐 옛 모델의 분포냐 — 과 어느 문맥에서 당기느냐다
요약

DPO 그래디언트는 두 조각이다. 괄호 안 ∇log⁡πθ(yw)−∇log⁡πθ(yl)\nabla\log\textcolor{#1565c0}{\pi_\theta}(\textcolor{#e000a5}{y_w}) - \nabla\log\textcolor{#1565c0}{\pi_\theta}(\textcolor{#e000a5}{y_l}) 이 방향을 정하고, 거기에는 레퍼런스가 없다 — 방향은 데이터의 라벨이 정한다. 레퍼런스는 앞의 양수 가중치 βσ(−βz)\textcolor{#827717}{\beta}\textcolor{#8e44ad}{\sigma(-\beta z)} 안에만 들어가 크기를 정한다. 그래서 레퍼런스가 오답을 좋아해도 방향은 뒤집히지 않고, 바뀌는 것은 "얼마나 벌려야 충분한가"라는 기준 Δref\textcolor{#6f6f78}{\Delta_\text{ref}} 뿐이다. 레퍼런스가 틀린 쌍은 기준이 낮아 오히려 덜 밀린다. β\textcolor{#827717}{\beta} 는 목줄을 짧게 감는 강도다. 한 걸음의 크기가 아니라 멈추는 곳을 정하며, 작을수록(목줄이 길수록) 레퍼런스에서 멀리 간다. 목줄은 자기 출력으로 계속 학습하는 설정에서 리워드 해킹을 막아 주지만, 기둥이 틀린 곳에 박혀 있으면 손실이 낮아도 모델은 틀린 채로 남는다. 그래서 DPO 전에 SFT로 좋은 출발점을 만든다. 목줄은 다양성도 정한다. 선호 데이터가 익숙한 답을 조금씩 더 좋아하면 최적 정책은 레퍼런스를 1+α/β1+\alpha/\textcolor{#827717}{\beta} 제곱한 분포가 되어, 목줄이 길수록 흔한 답이 자리를 독차지한다.

레퍼런스에 묶는 일은 망각과도 이어진다. 크로스 엔트로피는 정답 확률을 1까지 밀며 멈출 곳이 없고, 그 사이 정답이 아닌 토큰을 자기 확률만큼 — 가장 믿던 옛 답부터 — 깎는다. 목표를 옛 모델의 분포로 바꾸면 멈출 곳이 생긴다. 순방향 앵커는 드문 사실까지 지키고 최적점이 리플레이와 같으며, 역방향 앵커는 말투·형식 같은 모드를 지키지만 옛 모델이 모르던 새 지식을 가장 세게 누른다. 망각의 크기는 알고리즘보다 도착점이 원래 모델에서 얼마나 먼가(KL)가 정하고, 자기 답으로 배우는 RL이 덜 잊는 것도 가까운 해로 가기 때문이다. 다만 덜 잊는 성질과 원래 모델이 모르던 것을 못 배우는 성질은 같은 성질이다.