11. Bradley-Terry — 시그모이드는 왜 거기 있는가?

자주 하는 실수와 요약

자주 하는 실수
실수 나온 문제 바로잡는 법
같은 점수 차라도 고수끼리는 승률 차가 더 크다고 봄 1 BT의 승률은 점수 차이에만 의존한다. 모든 점수에 같은 상수를 더해도 승률은 그대로다
기준별 순위를 더한 점수가 같으면 선호가 없다고 봄 2 둘씩 붙이면 매번 확실히 고르는데 X > Y > Z > X 로 돈다. 합계가 도는 구조를 지운 것이다
순환하는 선호도 BT가 적당히 타협해 맞춘다고 봄 3 세 점수 차의 합은 늘 0이다. 최적 점수는 셋이 같아지고, 예측은 모두 50%가 된다
실제 일어난 일에 준 확률을 평균 내어 예보를 견줌 4 기록 전체에 준 확률은 곱이고, 그 −log⁡-\log 가 날마다 벌점의 합이다. 확신하고 크게 틀린 하루가 합을 좌우한다
가운데서 거의 겹치는 곡선이면 σ\sigma 자리에 무엇을 넣어도 학습은 같다고 봄 5 가운데서 같은 곡선도 끝에서 다르다. σ\sigma 대신 정규분포 곡선을 쓰면 크게 틀린 쌍(z=−6\textcolor{#d9670b}{z} = -6)을 0.998 대신 2.22의 힘으로 당긴다. σ\sigma 는 선호 가정이다
승수 차를 실력 차로 봄 6 승수 차는 경기 수와 함께 커진다. BT 최대우도에서는 σ(Δ)\sigma(\Delta) 가 관측 승률과 같아져서, 7승 5패면 Δ=ln⁡(7/5)≈0.34\Delta = \ln(7/5) \approx 0.34 다
추정값의 부호만 보고 누가 더 강한지 결론 냄 6 실력이 같아도 12경기 중 7승 이상은 39% 확률로 나온다. 분산을 봐야 한다
요약

사람의 선호 라벨은 "A가 B보다 낫다"는 사건이고, 이를 설명하려면 점수 차를 확률로 바꾸는 함수가 필요하다. Bradley-Terry 모델은 대상마다 점수 r\textcolor{#d9670b}{r} 하나를 주고 승률을 점수 차의 시그모이드로 둔다. 시그모이드는 "이길 확률은 힘의 비율"이라는 가정에서 나오며, 이때 로그 오즈가 곧 점수 차다. 체스의 Elo와 LLM 순위표가 모두 이 모델이다. 점수가 하나뿐이므로 선호는 전이적이어야 하고, 가위바위보처럼 순환하는 선호는 "선호 없음"으로 뭉개진다. 보상 모델 손실과 DPO 손실은 같은 모양이다. σ\sigma 는 BT 가정에서, −log⁡-\log 는 최대우도에서 나오며, 둘 다 쌍에 대한 로지스틱 회귀다. σ\sigma 를 다른 곡선으로 바꾸면 틀린 라벨을 대하는 학습이 달라진다. 선호 쌍 하나는 "1승 0패"여서 최대우도 실력 차가 무한대다. 그래서 DPO는 마진을 끝없이 벌리려 하고, IPO의 목표 마진이나 힌지 손실, 레퍼런스와 β\textcolor{#827717}{\beta} 가 그 무한대를 막는다.