자주 하는 실수와 요약
자주 하는 실수
| 실수 | 나온 문제 | 바로잡는 법 |
|---|---|---|
| 같은 규칙으로 오래 따라 쓰면 고정된 본보기에서도 말버릇이 똑같이 불어난다고 봄 | 1 | 불어나는 것은 자기 출력이 다음 본보기가 될 때뿐이다. 본보기가 고정이면 한 번 늘고 멈춘다 |
| 온라인이 해킹에 빠른 이유를 업데이트 횟수로 봄 | 2 | 오프라인도 에폭을 늘리면 스텝 수는 늘어난다. 차이는 데이터의 출처 — 온라인에서는 해킹된 출력이 다음 학습 데이터가 된다 |
| 기록해 둔 온라인 응답은 점수만 다시 매기면 다시 쓸 수 있다고 봄 | 3 | 온라인 응답은 그것을 뽑은 순간의 모델에 묶여 있다. 틀린 점수로 배운 모델이 뽑은 응답은 그 자체가 쏠려 있다 |
| 버그 점수로 배우기 전날의 온라인 데이터는 깨끗하다고 봄 | 3 | 같은 날에도 첫 배치 뒤의 모델은 이미 틀린 점수로 학습했다. 깨끗한 것은 맨 처음 배치뿐이다 |
| 새로 산 날에만 확인해 지도가 늘 맞는다고 봄 | 4 | 새로 사기 직전에 가장 낡는다. 사이사이의 값을 봐야 한다 |
| 반복 학습의 신선도를 라운드 끝점 하나로 판단 | 5 | 라운드 안에서는 데이터가 여전히 낡는다. 각 라운드가 끝날 무렵의 값을 봐야 한다 |
| 라운드를 늘릴수록 무조건 좋다고 봄 | 6 | 신선도만 좋아진다. 고정된 채점자는 과최적화되고, 라운드마다 옮겨지는 레퍼런스 때문에 처음 모델에서의 이탈은 누적된다 |
| 토큰 보상이 음수면 그 토큰은 내려간다고 봄 | 7 | 방향은 부호가 아니라 평균( |
| 학생이 교사보다 확률을 더 준 칸은 바로 깎인다고 봄 | 7 | 확률의 합이 1이다. 크게 빠지는 칸의 몫이 다른 칸들로 나뉘므로, 한 칸씩 따로 비교하지 말고 전체를 본다 |
| 교사 없이도 역방향 KL로 조이면 새 조합(일본어 × 의학)을 정확히 말하게 된다고 봄 | 8 | 역방향은 데이터가 없는 빈칸에서 도망간다. 빈칸으로 가는 통로는 순방향의 넓게 덮기뿐이고, 정확성은 교사 같은 정답 신호가 있어야 생긴다 |
| 교사만 있으면 처음부터 온폴리시 증류로 충분하다고 봄 | 8 | 학생이 확률을 거의 0으로 둔 토큰은 뽑히지 않아 채점받지 못한다(그래디언트가 |
요약
이론은 지금의 정책이 뽑은 데이터로 배우는 온라인 학습을 가리키지만, 온라인은 생성·평가·학습을 매 배치 직렬로 돌려야 하고, 매 배치 새 판정이 필요하며, 해킹된 출력이 다음 데이터가 되는 드리프트 위험을 안는다. 오프라인은 시간 제약 없이 데이터를 여러 번 걸러 낼 수 있고, 패스마다 결과가 남아 고칠 수 있으며, 일반 미세조정처럼 돌아가 재현성이 높다 — DPO가 널리 퍼진 이유다. 대신 데이터는 옛 정책에서 나왔으므로 학습이 진행될수록 낡는다. 정규분포 장난감에서 유효 표본 비율은