정렬된 채팅 모델에게 같은 부탁을 여러 번 하면 답이 비슷비슷해지는 일이 흔하다. 베이스 모델(프리트레인만 마친 모델)과 견주면 정렬을 거친 모델의 출력 다양성이 크게 줄었다는 관찰이 여럿 있고, 이것을 모드 붕괴(mode collapse — 모드는 분포의 봉우리, 붕괴는 확률이 봉우리 하나로 몰리는 것)라 부른다. 2025년 10월의 「Verbalized Sampling」(arXiv:2510.01171) 논문은 첫 그림에서 「커피에 관한 농담 하나 해 줘」를 다섯 번 물으면 다섯 번 모두 같은 농담이 나오는 모습을 예로 든다. 모델은 농담을 여러 개 알고 있을 텐데 왜 하나만 고를까? 목줄 β 는 이 좁아짐과 무슨 관계일까?
사람이 매긴 선호 데이터에는 숨은 버릇이 있다. 두 응답의 내용이 똑같이 좋으면, 더 익숙한 쪽 — 베이스 모델이 더 높은 확률을 주는 흔한 표현 — 을 고르는 경향이다. 이 논문은 그 버릇을 전형성 편향(익숙한 답 쪽으로 기우는 버릇 / typicality bias)이라 부르고, 보상을 참 품질과 익숙함의 합 R=Rtrue+αlogπref 로 두어 크기를 쟀다. 익숙함은 베이스 모델이 그 응답에 주는 로그확률로 쟀다. HelpSteer(응답마다 정답성 같은 항목별 점수가 사람 손으로 매겨진 데이터셋)에서 정답성 점수가 같은 응답 쌍 6,874개를 골라, 공개된 대형 베이스 모델 Llama-3.1-405B(4,050억 파라미터)와 GLM-4.5를 레퍼런스로 써 보니 α 는 각각 0.57 ± 0.07, 0.65 ± 0.07이었다. 정답성이 같아도 사람은 베이스 모델에게 더 익숙한 쪽을 골랐다는 뜻이다. 이 보상을 KL로 묶은 RL의 최적 정책 π∗∝πrefeR/β 에 넣으면 레퍼런스가 두 번 곱해진다.
참 품질이 같은 후보들끼리는 Rtrue 가 같으니 레퍼런스를 γ 제곱한 분포만 남는다. 레퍼런스가 똑같이 좋은 두 답을 0.6 대 0.4로 고른다고 하자. γ=2 면 0.62:0.42 를 합이 1이 되게 맞춰 0.69 대 0.31, γ=3 이면 0.77 대 0.23이다. 조금 더 흔했을 뿐인 답이 몫을 점점 가져간다.
확률을 γ 제곱해 다시 합이 1이 되게 맞추는 것은 샘플링 온도를 1/γ 로 낮춰 뽑는 것과 같다. β 가 작을수록(목줄이 길수록) 지수가 커져, 원래 조금 더 흔했던 답이 자리를 독차지한다. 이야기의 등장인물 이름처럼 여러 답이 다 옳은 곳에서, 정렬된 모델들이 비슷한 이름을 되풀이하는 이유 중 하나다.
문제 6 — 모두가 같은 이름을 짓는 이유
이야기의 주인공 이름으로 세 후보가 있다. 셋 다 똑같이 좋은 이름이라 Rtrue 가 같고, 레퍼런스는 셋만 놓고 보면 0.5, 0.4, 0.1 의 확률로 고른다. 선호 데이터의 전형성 편향은 α=0.57 이다. (가) β=0.1 일 때 최적 정책은 세 이름을 각각 몇 %로 고르는가? (나) β=0.5 이면? (다) 다양한 이름을 지키려면 β 를 어느 쪽으로 움직여야 하는가? β 를 한없이 키우거나 0에 가깝게 줄이면 각각 어떤 분포가 되는가?
김민준
세 이름의 참 품질이 같잖아요. 보상에 차이가 없으면 RL은 밀 게 없으니 레퍼런스 그대로 50%, 40%, 10%예요.