14. 온라인과 오프라인 — 이상과 현실 사이에서

자주 하는 실수와 요약

자주 하는 실수
실수 나온 문제 바로잡는 법
같은 규칙으로 오래 따라 쓰면 고정된 본보기에서도 말버릇이 똑같이 불어난다고 봄 1 불어나는 것은 자기 출력이 다음 본보기가 될 때뿐이다. 본보기가 고정이면 한 번 늘고 멈춘다
온라인이 해킹에 빠른 이유를 업데이트 횟수로 봄 2 오프라인도 에폭을 늘리면 스텝 수는 늘어난다. 차이는 데이터의 출처 — 온라인에서는 해킹된 출력이 다음 학습 데이터가 된다
기록해 둔 온라인 응답은 점수만 다시 매기면 다시 쓸 수 있다고 봄 3 온라인 응답은 그것을 뽑은 순간의 모델에 묶여 있다. 틀린 점수로 배운 모델이 뽑은 응답은 그 자체가 쏠려 있다
버그 점수로 배우기 전날의 온라인 데이터는 깨끗하다고 봄 3 같은 날에도 첫 배치 뒤의 모델은 이미 틀린 점수로 학습했다. 깨끗한 것은 맨 처음 배치뿐이다
새로 산 날에만 확인해 지도가 늘 맞는다고 봄 4 새로 사기 직전에 가장 낡는다. 사이사이의 값을 봐야 한다
반복 학습의 신선도를 라운드 끝점 하나로 판단 5 라운드 안에서는 데이터가 여전히 낡는다. 각 라운드가 끝날 무렵의 값을 봐야 한다
라운드를 늘릴수록 무조건 좋다고 봄 6 신선도만 좋아진다. 고정된 채점자는 과최적화되고, 라운드마다 옮겨지는 레퍼런스 때문에 처음 모델에서의 이탈은 누적된다
토큰 보상이 음수면 그 토큰은 내려간다고 봄 7 방향은 부호가 아니라 평균(−DKL-\textcolor{#8c564b}{D_\text{KL}})보다 나은지로 정해진다. 로짓 그래디언트 πθ(j)[log⁡(πθ(j)/πT(j))−DKL]\textcolor{#1565c0}{\pi_\theta}(j)[\log(\textcolor{#1565c0}{\pi_\theta}(j)/\textcolor{#2e7d32}{\pi_\text{T}}(j)) - \textcolor{#8c564b}{D_\text{KL}}] 로 확인한다
학생이 교사보다 확률을 더 준 칸은 바로 깎인다고 봄 7 확률의 합이 1이다. 크게 빠지는 칸의 몫이 다른 칸들로 나뉘므로, 한 칸씩 따로 비교하지 말고 전체를 본다
교사 없이도 역방향 KL로 조이면 새 조합(일본어 × 의학)을 정확히 말하게 된다고 봄 8 역방향은 데이터가 없는 빈칸에서 도망간다. 빈칸으로 가는 통로는 순방향의 넓게 덮기뿐이고, 정확성은 교사 같은 정답 신호가 있어야 생긴다
교사만 있으면 처음부터 온폴리시 증류로 충분하다고 봄 8 학생이 확률을 거의 0으로 둔 토큰은 뽑히지 않아 채점받지 못한다(그래디언트가 πθ(j)\textcolor{#1565c0}{\pi_\theta}(j) 에 비례). 초벌 SFT로 서포트를 먼저 깐다. 상한은 교사의 정확도다
요약

이론은 지금의 정책이 뽑은 데이터로 배우는 온라인 학습을 가리키지만, 온라인은 생성·평가·학습을 매 배치 직렬로 돌려야 하고, 매 배치 새 판정이 필요하며, 해킹된 출력이 다음 데이터가 되는 드리프트 위험을 안는다. 오프라인은 시간 제약 없이 데이터를 여러 번 걸러 낼 수 있고, 패스마다 결과가 남아 고칠 수 있으며, 일반 미세조정처럼 돌아가 재현성이 높다 — DPO가 널리 퍼진 이유다. 대신 데이터는 옛 정책에서 나왔으므로 학습이 진행될수록 낡는다. 정규분포 장난감에서 유효 표본 비율은 e−Δ2e^{-\textcolor{#cc00ff}{\Delta}^2} 로 빠르게 떨어진다. 반복 DPO는 라운드마다 데이터를 새로 만들어 이 비율을 되살리는 절충안이며, 오프라인과 온라인 사이는 라운드 수라는 연속적인 다이얼이다. 다만 라운드를 늘려도 채점자와 누적 이탈의 문제는 남아, 적정 라운드 수가 존재한다. 채점자를 큰 교사 모델로 바꾸면 온폴리시 증류가 된다. 문장은 학생이 쓰고, 교사는 토큰마다 확률만 매겨 토큰 보상 log⁡πT−log⁡πθ\log\textcolor{#2e7d32}{\pi_\text{T}} - \log\textcolor{#1565c0}{\pi_\theta} 를 준다. 역방향 KL을 줄이는 이 학습은 토큰마다 보상이 오는 REINFORCE이고, 학생이 실제로 미끄러지는 자리에서 신호를 받는다. 역방향 KL은 학생의 서포트 밖으로 나가지 못하므로 SFT로 먼저 확률을 깔고 온폴리시 증류로 다듬으며, 학생의 상한은 교사다.