10. 레퍼런스 모델 — 이 목줄은 왜 묶여 있나?

전형성 편향: 익숙한 답에 얹힌 보상이 다양성을 깎는다

정렬된 채팅 모델에게 같은 부탁을 여러 번 하면 답이 비슷비슷해지는 일이 흔하다. 베이스 모델(프리트레인만 마친 모델)과 견주면 정렬을 거친 모델의 출력 다양성이 크게 줄었다는 관찰이 여럿 있고, 이것을 모드 붕괴(mode collapse — 모드는 분포의 봉우리, 붕괴는 확률이 봉우리 하나로 몰리는 것)라 부른다. 2025년 10월의 「Verbalized Sampling」(arXiv:2510.01171) 논문은 첫 그림에서 「커피에 관한 농담 하나 해 줘」를 다섯 번 물으면 다섯 번 모두 같은 농담이 나오는 모습을 예로 든다. 모델은 농담을 여러 개 알고 있을 텐데 왜 하나만 고를까? 목줄 β\beta 는 이 좁아짐과 무슨 관계일까?

사람이 매긴 선호 데이터에는 숨은 버릇이 있다. 두 응답의 내용이 똑같이 좋으면, 더 익숙한 쪽 — 베이스 모델이 더 높은 확률을 주는 흔한 표현 — 을 고르는 경향이다. 이 논문은 그 버릇을 전형성 편향(익숙한 답 쪽으로 기우는 버릇 / typicality bias)이라 부르고, 보상을 참 품질과 익숙함의 합 R=Rtrue+αlog⁡πrefR = R_\text{true} + \alpha\log\pi_\text{ref} 로 두어 크기를 쟀다. 익숙함은 베이스 모델이 그 응답에 주는 로그확률로 쟀다. HelpSteer(응답마다 정답성 같은 항목별 점수가 사람 손으로 매겨진 데이터셋)에서 정답성 점수가 같은 응답 쌍 6,874개를 골라, 공개된 대형 베이스 모델 Llama-3.1-405B(4,050억 파라미터)와 GLM-4.5를 레퍼런스로 써 보니 α\alpha 는 각각 0.57 ± 0.07, 0.65 ± 0.07이었다. 정답성이 같아도 사람은 베이스 모델에게 더 익숙한 쪽을 골랐다는 뜻이다. 이 보상을 KL로 묶은 RL의 최적 정책 π∗∝πref eR/β\pi^* \propto \pi_\text{ref}\, e^{R/\beta} 에 넣으면 레퍼런스가 두 번 곱해진다.

π∗(y)  ∝  πref(y)γ  eRtrue(y)/β,γ=1+αβ\textcolor{#2e7d32}{\pi^*}(\textcolor{#1c9c60}{y}) \;\propto\; \textcolor{#6f6f78}{\pi_\text{ref}}(\textcolor{#1c9c60}{y})^{\textcolor{#993600}{\gamma}}\; e^{\textcolor{#d9670b}{R_\text{true}}(\textcolor{#1c9c60}{y})/\textcolor{#827717}{\beta}}, \qquad \textcolor{#993600}{\gamma} = 1 + \frac{\textcolor{#cc00ff}{\alpha}}{\textcolor{#827717}{\beta}}
π∗KL로 묶은 RL의 최적 정책πref레퍼런스 모델y응답Rtrue참 품질 (익숙함을 뺀 보상)α전형성 편향의 크기: 익숙한 응답에 보상이 얹히는 정도βKL 강도γ레퍼런스에 걸리는 지수: α>0 이면 1보다 크다 \small\begin{array}{ll} \textcolor{#2e7d32}{\pi^*} & \text{KL로 묶은 RL의 최적 정책} \\ \textcolor{#6f6f78}{\pi_\text{ref}} & \text{레퍼런스 모델} \\ \textcolor{#1c9c60}{y} & \text{응답} \\ \textcolor{#d9670b}{R_\text{true}} & \text{참 품질 (익숙함을 뺀 보상)} \\ \textcolor{#cc00ff}{\alpha} & \text{전형성 편향의 크기: 익숙한 응답에 보상이 얹히는 정도} \\ \textcolor{#827717}{\beta} & \text{KL 강도} \\ \textcolor{#993600}{\gamma} & \text{레퍼런스에 걸리는 지수: } \textcolor{#cc00ff}{\alpha} > 0 \text{ 이면 1보다 크다} \end{array}

참 품질이 같은 후보들끼리는 Rtrue\textcolor{#d9670b}{R_\text{true}} 가 같으니 레퍼런스를 γ\textcolor{#993600}{\gamma} 제곱한 분포만 남는다. 레퍼런스가 똑같이 좋은 두 답을 0.6 대 0.4로 고른다고 하자. γ=2\textcolor{#993600}{\gamma} = 2 면 0.62:0.420.6^2 : 0.4^2 를 합이 1이 되게 맞춰 0.69 대 0.31, γ=3\textcolor{#993600}{\gamma} = 3 이면 0.77 대 0.23이다. 조금 더 흔했을 뿐인 답이 몫을 점점 가져간다.

0.60 답 가 0.40 답 나 γ = 1 (레퍼런스) 0.69 답 가 0.31 답 나 γ = 2 0.77 답 가 0.23 답 나 γ = 3

확률을 γ\textcolor{#993600}{\gamma} 제곱해 다시 합이 1이 되게 맞추는 것은 샘플링 온도를 1/γ1/\textcolor{#993600}{\gamma} 로 낮춰 뽑는 것과 같다. β\textcolor{#827717}{\beta} 가 작을수록(목줄이 길수록) 지수가 커져, 원래 조금 더 흔했던 답이 자리를 독차지한다. 이야기의 등장인물 이름처럼 여러 답이 다 옳은 곳에서, 정렬된 모델들이 비슷한 이름을 되풀이하는 이유 중 하나다.

문제 6 — 모두가 같은 이름을 짓는 이유

이야기의 주인공 이름으로 세 후보가 있다. 셋 다 똑같이 좋은 이름이라 Rtrue\textcolor{#d9670b}{R_\text{true}} 가 같고, 레퍼런스는 셋만 놓고 보면 0.5, 0.4, 0.1 의 확률로 고른다. 선호 데이터의 전형성 편향은 α=0.57\textcolor{#cc00ff}{\alpha} = 0.57 이다. (가) β=0.1\textcolor{#827717}{\beta} = 0.1 일 때 최적 정책은 세 이름을 각각 몇 %로 고르는가? (나) β=0.5\textcolor{#827717}{\beta} = 0.5 이면? (다) 다양한 이름을 지키려면 β\textcolor{#827717}{\beta} 를 어느 쪽으로 움직여야 하는가? β\textcolor{#827717}{\beta} 를 한없이 키우거나 0에 가깝게 줄이면 각각 어떤 분포가 되는가?

김민준 (자신만만)
김민준
세 이름의 참 품질이 같잖아요. 보상에 차이가 없으면 RL은 밀 게 없으니 레퍼런스 그대로 50%, 40%, 10%예요.
선생님 (질문)
선생님
민준 학생, 보상 식에서 Rtrue\textcolor{#d9670b}{R_\text{true}} 말고 남은 항은 세 이름에 똑같은가요?
김민준 (난처함)
김민준
αlog⁡πref\textcolor{#cc00ff}{\alpha}\log\textcolor{#6f6f78}{\pi_\text{ref}} 는… 레퍼런스가 좋아하는 이름일수록 커요. 참 품질은 같아도 보상은 달랐네요.
이서연 (평상)
이서연
그럼 지수로 풀면 돼. γ=1+0.57/0.1=6.7\textcolor{#993600}{\gamma} = 1 + 0.57/0.1 = 6.7. 0.56.7:0.46.7:0.16.70.5^{6.7} : 0.4^{6.7} : 0.1^{6.7} 을 합이 1이 되게 나누면 81.7%, 18.3%, 0.002%.
김민준 (평상)
김민준
[x**6.7 for x in (0.5, 0.4, 0.1)] 돌려 봐도 같아요. 세 번째 이름은 사실상 사라지고, 1.25배였던 두 이름 사이가 1.256.7≈4.51.25^{6.7} \approx 4.5 배로 벌어졌어요.
이서연 (평상)
이서연
(나)는 γ=1+0.57/0.5=2.14\textcolor{#993600}{\gamma} = 1 + 0.57/0.5 = 2.14 라서 60.5%, 37.5%, 1.9%. 셋 다 살아 있어요.
선생님 (평상)
선생님
그래요. 그럼 (다)는요?
이서연 (평상)
이서연
목줄을 짧게, β\textcolor{#827717}{\beta} 를 키워야 해요. β→∞\textcolor{#827717}{\beta} \to \infty 면 γ→1\textcolor{#993600}{\gamma} \to 1 이라 레퍼런스 그대로, β→0\textcolor{#827717}{\beta} \to 0 이면 γ→∞\textcolor{#993600}{\gamma} \to \infty 라 가장 흔한 이름 하나만 남아요.
이서연 (아하)
이서연
해석학에서 (∑ixip)1/p\big(\sum_i x_i^p\big)^{1/p} 이 p→∞p \to \infty 에서 최댓값 하나로 가는 것과 같은 그림이네요. 지수가 커질수록 제일 큰 항만 남아요.
김민준 (평상)
김민준
조교님이 "익숙한 양식"으로 쓴 보고서에 조금씩 가산점을 주면, 학기 말엔 모든 조가 같은 양식으로 내는 거랑 같아요.

정리 γ=1+α/β\textcolor{#993600}{\gamma} = 1 + \textcolor{#cc00ff}{\alpha}/\textcolor{#827717}{\beta}. (가) β=0.1⇒γ=6.7\textcolor{#827717}{\beta} = 0.1 \Rightarrow \textcolor{#993600}{\gamma} = 6.7: 81.7%, 18.3%, 0.002%. (나) β=0.5⇒γ=2.14\textcolor{#827717}{\beta} = 0.5 \Rightarrow \textcolor{#993600}{\gamma} = 2.14: 60.5%, 37.5%, 1.9%. (다) β\textcolor{#827717}{\beta} 를 키운다(짧은 목줄). β→∞\textcolor{#827717}{\beta} \to \infty 면 레퍼런스 그대로, β→0\textcolor{#827717}{\beta} \to 0 이면 가장 흔한 답 하나. 참 품질이 같아도 익숙함에 얹힌 보상이 레퍼런스를 거듭제곱해 다양성을 깎는다.