11. Bradley-Terry — 시그모이드는 왜 거기 있는가?

순환 선호: 점수 하나로는 가위바위보를 담지 못한다

BT는 대상마다 실력 점수 r\textcolor{#d9670b}{r} 하나를 주고, 두 점수의 차로 승률을 정한다. 그런데 가위바위보에는 "가장 센 손"이 없다. 사람의 선호도 이렇게 물고 물린다면, 점수 하나로 줄을 세우는 BT는 무엇을 배울까? 그런 선호가 실제로 있기는 할까?

역사: 결혼 상대 셋을 둘씩 보여 준 실험

셋을 둘씩 붙이면 돌고 도는 결과가 나올 수 있다는 것은 투표에서 먼저 알려졌다. 유권자 한 사람 한 사람은 후보를 한 줄로 세우는데도, 다수결로 둘씩 붙이면 집단의 선택이 돌 수 있다. 그렇다면 한 사람의 머릿속에서도 같은 일이 생길까? 1954년 미국의 케네스 메이(Kenneth May)는 경제학 학술지 Econometrica 에 실은 글에서 이것을 작은 실험으로 확인했다.

그는 대학생 62명에게 가상의 결혼 상대 세 명을 둘씩만 보여 주고 고르게 했다. x는 아주 똑똑하고 외모는 수수하며 형편이 넉넉했다. y는 똑똑하고 아주 잘생겼지만 가난했다. z는 그럭저럭 똑똑하고 잘생겼으며 부자였다. 셋 모두 결혼 상대로 받아들일 만하다고 설명했고, 셋을 한꺼번에 보여 주지는 않았다. 일부 비교는 되풀이해 변덕으로 고른 것인지도 확인했는데, 학생들의 고르기는 거의 흔들리지 않았다. 결과는 62명 가운데 17명이 x > y, y > z, z > x 로 도는 선택이었다. 메이는 이것이 세 기준 가운데 두 기준에서 앞서는 쪽을 고른 결과로 쉽게 설명된다고 적었다. 반 전체를 다수결로 모아도 x가 y를 39 대 23, y가 z를 57 대 5, z가 x를 33 대 29로 이겨 돌았다.

1차원의 한계

BT는 각 대상에 스칼라 하나를 준다. 이 순간 전이성이 강제된다. rA>rB\textcolor{#d9670b}{r_A} > \textcolor{#d9670b}{r_B} 이고 rB>rC\textcolor{#d9670b}{r_B} > \textcolor{#d9670b}{r_C} 이면 반드시 rA>rC\textcolor{#d9670b}{r_A} > \textcolor{#d9670b}{r_C} 다. 숫자는 한 줄로 세울 수 있기 때문이다.

그런데 LLM 응답의 선호는 여러 차원(정확성, 간결성, 친절함…)이 섞여 있다. 차원마다 이기는 쪽이 다르면 상성이 생길 수 있다 — 메이의 결혼 상대처럼, 가위바위보처럼.

BT가 담을 수 있는 것 C B A 점수 r 하나로 한 줄 A > B, B > C 이면 반드시 A > C 담을 수 없는 것 (상성) A B C A > B 70% B > C 70% C > A 70%

오른쪽처럼 선호가 순환하면 BT는 어떤 점수로도 맞출 수 없다. 그럼 BT는 이 데이터에서 무엇을 배울까? 아래 두 문제에서 직접 셈해 본다.

ML에서: 여러 기준이 섞인 선호

응답을 비교하는 사람은 정확성, 간결성, 친절함을 한꺼번에 저울질한다. 기준마다 이기는 쪽이 다른 쌍이 많을수록 선호는 한 줄에서 멀어진다. 사람 대신 LLM 심사 모델(응답을 채점하는 다른 LLM)에게 맡겨도 마찬가지다. 2025년 쉬(Yi Xu)와 동료들은 AlpacaEval(모델마다 기준 모델 하나와 답을 비교시켜 이긴 비율로 순위를 매기는 평가)에서 심사 모델의 선호가 물고 물리는 것을 보였다. 그래서 기준 모델을 무엇으로 두느냐에 따라 두 모델의 순위가 뒤바뀌었다. 그들은 모든 모델을 서로 붙인 뒤 BT로 점수를 맞추는 쪽이 사람 투표로 만든 순위와 더 잘 맞는다고 보고했다. 점수 하나로 줄을 세우면 순위는 안정되지만, 물고 물리는 구조는 그 점수 속에 접혀 들어간다. 이 구조를 살리려면 보상을 기준별로 따로 매겨야 한다.

문제 2 — 식당 셋, 기준 셋

세 식당 X, Y, Z를 맛·가격·거리로 줄 세우면 X는 1·2·3위, Y는 2·3·1위, Z는 3·1·2위다. 어떤 사람은 두 식당을 견줄 때 세 기준 가운데 두 기준 이상에서 앞서는 곳을 고른다. (가) X와 Y, Y와 Z, Z와 X를 붙이면 각각 어디를 고르는가? (나) 기준마다 1위 3점, 2위 2점, 3위 1점을 주고 더해 식당마다 점수 하나를 매기면 얼마인가? 이 점수로 이 사람의 고르기를 설명할 수 있는가? (다) 맛 점수만 두 배로 쳐서 더하면 어떻게 되는가?

김민준 (자신만만)
김민준
(나)부터 하면 되죠. X는 3 + 2 + 1 = 6, Y는 2 + 1 + 3 = 6, Z는 1 + 3 + 2 = 6. 셋 다 6점이니까 이 사람은 세 식당을 똑같이 좋아하는 거예요.
선생님 (질문)
선생님
민준 학생, 똑같이 좋아한다면 X와 Y를 붙였을 때 이 사람은 동전을 던져야겠네요. (가)를 먼저 해 볼까요?
김민준 (평상)
김민준
X 대 Y는 맛 X, 가격 X, 거리 Y — X요. Y 대 Z는 맛 Y, 가격 Z, 거리 Y — Y. Z 대 X는 맛 X, 가격 Z, 거리 Z — Z.
김민준 (당황)
김민준
매번 망설임 없이 고르는데, X > Y > Z > X 로 돌아요. 동점이 아니었네요.
이서연 (평상)
이서연
점수 하나로 설명하려면 X > Y, Y > Z 에서 X > Z 가 나와야 하는데 실제로는 Z > X 야. 어떤 점수를 매겨도 이 고르기는 못 담아. 합이 모두 6인 건 좋아하는 게 없어서가 아니라, 돌고 도는 구조가 더하는 사이에 지워진 거고.
선생님 (평상)
선생님
그래요. 그럼 맛을 두 배로 치면 줄이 설까요, 여전히 돌까요?
이서연 (평상)
이서연
X는 6 + 2 + 1 = 9, Y는 4 + 1 + 3 = 8, Z는 2 + 3 + 2 = 7. X > Y > Z 로 줄이 서요. 한 기준이 확실히 무거우면 도는 구조가 사라지네요.
김민준 (평상)
김민준
조별 과제 동료 평가에서 기획·발표·코딩 가운데 두 개 이상 잘한 사람을 고르면 돌고 도는데, 총점만 보면 셋 다 똑같이 나오는 거랑 같네요.

정리 (가) X, Y, Z. X > Y > Z > X 로 돈다. (나) 셋 다 6점. 점수 하나로는 설명할 수 없다 — 동점이면 반반이어야 하는데 이 사람은 매번 확실히 고른다. (다) 9, 8, 7 로 X > Y > Z. 한 기준이 무거우면 줄이 선다.

문제 3 — 가위바위보를 한 줄로

세 응답의 선호가 A > B, B > C, C > A 로 각각 70%씩 관측되었다(각 쌍 100번씩 비교). BT로 가장 잘 맞추면 세 쌍의 예측 승률은 얼마가 되는가?

김민준 (자신만만)
김민준
경사하강법으로 돌리면 어딘가 타협점을 찾겠죠. 셋 다 70%는 못 맞춰도 60%쯤은 맞추지 않을까요?
이서연 (평상)
이서연
BT의 점수를 rA,rB,rC\textcolor{#d9670b}{r_A}, \textcolor{#d9670b}{r_B}, \textcolor{#d9670b}{r_C} 라 하자. 대칭이니까 최적해에서… 셋 중 하나가 가장 크다고 해 봐. 예를 들어 rA\textcolor{#d9670b}{r_A} 가 제일 크면 C > A 를 50% 이상으로 맞출 수 없어.
선생님 (질문)
선생님
그럼 손실을 최소로 만드는 점수는요?
이서연 (평상)
이서연
세 쌍의 손실 합이 rA−rB\textcolor{#d9670b}{r_A} - \textcolor{#d9670b}{r_B}, rB−rC\textcolor{#d9670b}{r_B} - \textcolor{#d9670b}{r_C}, rC−rA\textcolor{#d9670b}{r_C} - \textcolor{#d9670b}{r_A} 에 대칭이고 볼록이니까, 최소점은 셋 다 같은 점이에요. 세 차이의 합이 항상 0이라서, 셋을 동시에 양수로 만들 수 없거든요.
김민준 (놀람)
김민준
그럼 예측이 셋 다 50%? 70%짜리 선호가 분명히 있었는데 전부 동전 던지기가 되네요.
선생님 (평상)
선생님
그래요. BT는 순환하는 선호를 "선호가 없다"로 뭉개요. 데이터에 분명한 구조가 있어도요.
김민준 (평상)
김민준
아까 식당 문제랑 같네요. 기준마다 순위를 더했더니 셋 다 6점이었던 것처럼, 점수 하나로 매기면 다 똑같이 나와요.

정리 세 점수 차의 합은 항상 00 이라 셋을 동시에 양수로 만들 수 없다. 볼록·대칭인 손실의 최소점은 rA=rB=rC\textcolor{#d9670b}{r_A} = \textcolor{#d9670b}{r_B} = \textcolor{#d9670b}{r_C}, 예측은 모두 50%. BT는 순환 선호를 노이즈로 취급한다.